Viernes, 4 de septiembre de 2026Apoyar

Aube.

Las noticias del progreso
LaboratorioFuente única

Daxiao Robotics abre modelo 3D de dos manos en primera persona

Idiomas de este artículo

Traducido por IA del chino — ver el texto original. 6 idiomas disponibles, el tuyo se añade con un clic.

Las dos manos se acercan a una pieza y quedan ocultas durante un instante; cuando vuelven al encuadre, el sistema aún debe enlazar el movimiento que estaban realizando. Ese es precisamente el punto en el que los vídeos de operaciones en primera persona pierden información con mayor facilidad. Daxiao Robotics, en colaboración con el Laboratorio Multimedia de la Universidad China de Hong Kong, la Universidad Tecnológica de Nanyang y la Universidad Jiao Tong de Shanghái, ha liberado ACE-Ego-Hand. El modelo analiza un vídeo completo de una sola vez y genera directamente la postura, la forma, la visibilidad y la posición 3D de ambas manos. El equipo ya ha producido unos 5.000 horas de datos de entrenamiento.

Su enfoque difiere del de las rutas tradicionales. Los modelos anteriores solían detectar las manos fotograma a fotograma o realizar una regresión temporal por ventanas de vídeo. Otros dependían de múltiples pasos de muestreo por difusión para generar gradualmente vídeos o resultados de píxeles intermedios y, a continuación, estimar la postura de las manos. ACE-Ego-Hand convierte el modelo de difusión de vídeo en un codificador geométrico: primero comprime la entrada mediante un VAE, después realiza una sola propagación hacia delante sobre las variables latentes y, por último, extrae las características espacio-temporales del módulo Transformer de difusión de vídeo para entregárselas a un decodificador espacio-temporal bidireccional que genera la salida.

Este mecanismo de inferencia bidireccional está diseñado específicamente para procesar los fragmentos en los que desaparecen las manos. El modelo no utiliza una máscara causal ni depende únicamente de las imágenes ya ocurridas, sino que observa simultáneamente la información anterior a la salida de la mano del campo visual y la posterior a su reaparición. La primera aporta el punto de partida, la velocidad y la dirección del movimiento; la segunda, el punto final y restricciones sobre la postura. Frente a una extrapolación unidireccional después de que la mano salga del encuadre, este método pretende reducir la deriva de la trayectoria y mantener la identidad y la continuidad del movimiento.

Los cambios de cámara también forman parte del diseño. Durante las pruebas, ACE-Ego-Hand no necesita introducir explícitamente los parámetros intrínsecos de la cámara, es decir, sus propios parámetros geométricos. Ante vídeos nativos de ultra gran angular con ojo de pez, no requiere calibración previa ni corrección de la distorsión de la imagen: predice directamente, a partir de la imagen distorsionada, los rayos de observación que conectan los píxeles con el espacio tridimensional y recupera la posición 3D métrica de las manos en el sistema de coordenadas de la cámara.

Según los resultados de prueba facilitados por el equipo, el modelo alcanza aproximadamente 63,1 fps en una sola GPU A100 (procesador gráfico), unas 33 veces la velocidad de la configuración de alta precisión de ViDiHand. Puede utilizarse para recopilar datos de operaciones en líneas de producción, enseñar a robots, analizar procesos de ensamblaje manual, redirigir movimientos de manos diestras y construir datos para el aprendizaje por imitación.

aproximadamente 63,1 fpsVelocidad de procesamiento en una sola GPU A100

Fuentes — leer los originales(hora de París)

第一电动网ZH
0000

Para leer a continuación

Comentarios

Cargando el hilo…

Inicia sesión para escribir un comentario. Iniciar sesión