Vendredi 4 septembre 2026Soutenir

Aube.

Les nouvelles du progrès
LaboSource unique

Daxiao Robotics ouvre un modèle 3D mains en vue subjective

Langues de cet article

Traduit par IA, langue d’origine : chinois — voir le texte original. 6 langues disponibles, la vôtre s’ajoute en un clic.

Les deux mains se tendent vers une pièce, puis disparaissent brièvement derrière un obstacle. Lorsqu’elles réapparaissent dans l’image, le système doit encore pouvoir reprendre le fil du mouvement. C’est précisément à cet endroit que les vidéos d’opérations en vue subjective perdent le plus facilement des informations. Daxiao Robotics, le laboratoire multimédia de l’Université chinoise de Hong Kong, l’Université technologique de Nanyang et l’Université Jiao Tong de Shanghai ont mis ACE-Ego-Hand en open source. Le modèle peut analyser une séquence entière en une fois et restituer directement la pose, la forme, la visibilité et la position 3D des deux mains. L’équipe a déjà produit environ 5 000 heures de données d’entraînement.

Son approche diffère des méthodes traditionnelles. Les anciens modèles détectaient généralement les mains image par image, effectuaient une régression temporelle par fenêtres vidéo ou s’appuyaient sur plusieurs étapes d’échantillonnage par diffusion pour générer progressivement une vidéo intermédiaire ou des résultats au niveau des pixels, avant d’estimer la pose des mains. ACE-Ego-Hand transforme un modèle de diffusion vidéo en encodeur géométrique : l’entrée est d’abord compressée par un VAE, puis le modèle réalise une propagation avant unique dans l’espace latent. Il extrait ensuite les caractéristiques spatio-temporelles du module vidéo Transformer de diffusion et les transmet à un décodeur spatio-temporel bidirectionnel pour produire les résultats.

Ce mécanisme de raisonnement bidirectionnel est spécialement conçu pour traiter les séquences durant lesquelles les mains disparaissent. Le modèle n’utilise pas de masque causal et ne dépend pas uniquement des images déjà observées : il examine simultanément les informations précédant la sortie des mains du champ de vision et celles suivant leur réapparition. Les premières fournissent le point de départ, la vitesse et la direction du mouvement ; les secondes apportent le point d’arrivée et les contraintes de pose. Par rapport à une extrapolation unidirectionnelle après la sortie du cadre, cette méthode vise à réduire la dérive de la trajectoire et à préserver l’identité des mains ainsi que la continuité du mouvement.

Les changements de caméra sont également pris en compte dans la conception. Lors des tests, ACE-Ego-Hand n’a pas besoin de recevoir explicitement les paramètres intrinsèques de la caméra, c’est-à-dire ses propres paramètres géométriques. Avec des vidéos ultra grand-angle natives issues d’une caméra fish-eye, il n’est pas nécessaire de procéder au préalable à un étalonnage ou à une correction de la distorsion de l’image : le modèle prédit directement, à partir des images déformées, les rayons d’observation reliant les pixels à l’espace tridimensionnel, puis restitue la position 3D métrique des mains dans le repère de la caméra.

Selon les résultats de test fournis par l’équipe, le modèle atteint environ 63,1 fps sur un seul GPU A100 (processeur graphique), soit environ 33 fois la vitesse de la configuration haute précision de ViDiHand. Il peut servir à la collecte de données d’opérations sur les chaînes de production, à l’apprentissage par démonstration robotique, à l’analyse des processus d’assemblage manuel, à la réaffectation des mouvements de mains robotisées agiles et à la constitution de données pour l’apprentissage par imitation.

environ 63,1 fpsVitesse de traitement sur un seul GPU A100

Sources — lire les originaux(heure de Paris)

第一电动网ZH
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter