Las dos versiones están alineadas bloque a bloque, en el orden del texto: titular, lo esencial y después párrafo a párrafo. Cuando la traducción ha fusionado o dividido un párrafo, la casilla correspondiente queda vacía — nunca emparejamos dos pasajes a ojo.
双手伸向工件,短暂被遮住;重新回到镜头时,系统还要接得上刚才的动作。这正是第一视角操作视频最容易丢失信息的地方。大晓机器人联合香港中文大学多媒体实验室、南洋理工大学和上海交通大学开源了ACE-Ego-Hand,可对整段视频一次分析,直接输出双手姿态、形状、可见性和3D位置,团队已产出约5000小时训练数据。
Las dos manos se acercan a una pieza y quedan ocultas durante un instante; cuando vuelven al encuadre, el sistema aún debe enlazar el movimiento que estaban realizando. Ese es precisamente el punto en el que los vídeos de operaciones en primera persona pierden información con mayor facilidad. Daxiao Robotics, en colaboración con el Laboratorio Multimedia de la Universidad China de Hong Kong, la Universidad Tecnológica de Nanyang y la Universidad Jiao Tong de Shanghái, ha liberado ACE-Ego-Hand. El modelo analiza un vídeo completo de una sola vez y genera directamente la postura, la forma, la visibilidad y la posición 3D de ambas manos. El equipo ya ha producido unos 5.000 horas de datos de entrenamiento.
它与传统路径不同。过去的模型通常逐帧检测,或按视频窗口做时序回归,也有模型依靠多步扩散采样,逐步生成中间视频或像素结果,再估计手部姿态。ACE-Ego-Hand把视频扩散模型改造成几何编码器:输入先经过VAE压缩,模型在潜变量上进行一次前向传播,再从视频扩散Transformer模块读取时空特征,交给双向时空解码器完成输出。
Su enfoque difiere del de las rutas tradicionales. Los modelos anteriores solían detectar las manos fotograma a fotograma o realizar una regresión temporal por ventanas de vídeo. Otros dependían de múltiples pasos de muestreo por difusión para generar gradualmente vídeos o resultados de píxeles intermedios y, a continuación, estimar la postura de las manos. ACE-Ego-Hand convierte el modelo de difusión de vídeo en un codificador geométrico: primero comprime la entrada mediante un VAE, después realiza una sola propagación hacia delante sobre las variables latentes y, por último, extrae las características espacio-temporales del módulo Transformer de difusión de vídeo para entregárselas a un decodificador espacio-temporal bidireccional que genera la salida.
这套双向推理机制专门处理手部消失的片段。模型不使用因果掩码,不只依赖已经发生的画面,而是同时查看手部离开视野前和重新出现后的信息;前者提供运动起点、速度与方向,后者提供终点和姿态约束。相比离开画面后单向外推,这种方式旨在减少轨迹漂移,保持手部身份和运动连续。
Este mecanismo de inferencia bidireccional está diseñado específicamente para procesar los fragmentos en los que desaparecen las manos. El modelo no utiliza una máscara causal ni depende únicamente de las imágenes ya ocurridas, sino que observa simultáneamente la información anterior a la salida de la mano del campo visual y la posterior a su reaparición. La primera aporta el punto de partida, la velocidad y la dirección del movimiento; la segunda, el punto final y restricciones sobre la postura. Frente a una extrapolación unidireccional después de que la mano salga del encuadre, este método pretende reducir la deriva de la trayectoria y mantener la identidad y la continuidad del movimiento.
相机变化也被纳入设计。测试时,ACE-Ego-Hand无需显式输入相机内参,也就是相机自身的几何参数;面对原生鱼眼超广角视频,它无需提前标定或做图像去畸变,而是直接从畸变画面预测像素到三维空间的观测射线,恢复手部在相机坐标系下的度量3D位置。
Los cambios de cámara también forman parte del diseño. Durante las pruebas, ACE-Ego-Hand no necesita introducir explícitamente los parámetros intrínsecos de la cámara, es decir, sus propios parámetros geométricos. Ante vídeos nativos de ultra gran angular con ojo de pez, no requiere calibración previa ni corrección de la distorsión de la imagen: predice directamente, a partir de la imagen distorsionada, los rayos de observación que conectan los píxeles con el espacio tridimensional y recupera la posición 3D métrica de las manos en el sistema de coordenadas de la cámara.
按团队给出的测试结果,模型在单张A100 GPU(图形处理器)上达到约63.1 fps,约为ViDiHand高精度配置的33倍;它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建。
Según los resultados de prueba facilitados por el equipo, el modelo alcanza aproximadamente 63,1 fps en una sola GPU A100 (procesador gráfico), unas 33 veces la velocidad de la configuración de alta precisión de ViDiHand. Puede utilizarse para recopilar datos de operaciones en líneas de producción, enseñar a robots, analizar procesos de ensamblaje manual, redirigir movimientos de manos diestras y construir datos para el aprendizaje por imitación.