Vendredi 4 septembre 2026Soutenir

Aube.

Les nouvelles du progrès
Original et traduction

Daxiao Robotics ouvre un modèle 3D mains en vue subjective

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · chinois
大晓机器人开源第一视角3D双手重建模型
Traduction · français
Daxiao Robotics ouvre un modèle 3D mains en vue subjective
Original · chinois
ACE-Ego-Hand面向头戴式第一视角视频,可一次分析整段视频,输出双手姿态、形状和度量3D位置。
Traduction · français
ACE-Ego-Hand est conçu pour les vidéos en vue subjective filmées par un casque : il analyse une séquence entière en une fois et restitue la pose, la forme et la position 3D métrique des deux mains.
Original · chinois
模型在单张A100 GPU上达到约63.1 fps,约为ViDiHand高精度配置的33倍。
Traduction · français
Le modèle atteint environ 63,1 fps sur un seul GPU A100, soit environ 33 fois les performances de la configuration haute précision de ViDiHand.
Original · chinois
双向时空推理可补全遮挡或暂时离开画面的手部轨迹,面向产线、示教和模仿学习。
Traduction · français
Le raisonnement spatio-temporel bidirectionnel reconstitue les trajectoires des mains masquées ou momentanément sorties du cadre, pour les chaînes de production, l’apprentissage par démonstration et l’apprentissage par imitation.
Original · chinois

双手伸向工件,短暂被遮住;重新回到镜头时,系统还要接得上刚才的动作。这正是第一视角操作视频最容易丢失信息的地方。大晓机器人联合香港中文大学多媒体实验室、南洋理工大学和上海交通大学开源了ACE-Ego-Hand,可对整段视频一次分析,直接输出双手姿态、形状、可见性和3D位置,团队已产出约5000小时训练数据。

Traduction · français

Les deux mains se tendent vers une pièce, puis disparaissent brièvement derrière un obstacle. Lorsqu’elles réapparaissent dans l’image, le système doit encore pouvoir reprendre le fil du mouvement. C’est précisément à cet endroit que les vidéos d’opérations en vue subjective perdent le plus facilement des informations. Daxiao Robotics, le laboratoire multimédia de l’Université chinoise de Hong Kong, l’Université technologique de Nanyang et l’Université Jiao Tong de Shanghai ont mis ACE-Ego-Hand en open source. Le modèle peut analyser une séquence entière en une fois et restituer directement la pose, la forme, la visibilité et la position 3D des deux mains. L’équipe a déjà produit environ 5 000 heures de données d’entraînement.

Original · chinois

它与传统路径不同。过去的模型通常逐帧检测,或按视频窗口做时序回归,也有模型依靠多步扩散采样,逐步生成中间视频或像素结果,再估计手部姿态。ACE-Ego-Hand把视频扩散模型改造成几何编码器:输入先经过VAE压缩,模型在潜变量上进行一次前向传播,再从视频扩散Transformer模块读取时空特征,交给双向时空解码器完成输出。

Traduction · français

Son approche diffère des méthodes traditionnelles. Les anciens modèles détectaient généralement les mains image par image, effectuaient une régression temporelle par fenêtres vidéo ou s’appuyaient sur plusieurs étapes d’échantillonnage par diffusion pour générer progressivement une vidéo intermédiaire ou des résultats au niveau des pixels, avant d’estimer la pose des mains. ACE-Ego-Hand transforme un modèle de diffusion vidéo en encodeur géométrique : l’entrée est d’abord compressée par un VAE, puis le modèle réalise une propagation avant unique dans l’espace latent. Il extrait ensuite les caractéristiques spatio-temporelles du module vidéo Transformer de diffusion et les transmet à un décodeur spatio-temporel bidirectionnel pour produire les résultats.

Original · chinois

这套双向推理机制专门处理手部消失的片段。模型不使用因果掩码,不只依赖已经发生的画面,而是同时查看手部离开视野前和重新出现后的信息;前者提供运动起点、速度与方向,后者提供终点和姿态约束。相比离开画面后单向外推,这种方式旨在减少轨迹漂移,保持手部身份和运动连续。

Traduction · français

Ce mécanisme de raisonnement bidirectionnel est spécialement conçu pour traiter les séquences durant lesquelles les mains disparaissent. Le modèle n’utilise pas de masque causal et ne dépend pas uniquement des images déjà observées : il examine simultanément les informations précédant la sortie des mains du champ de vision et celles suivant leur réapparition. Les premières fournissent le point de départ, la vitesse et la direction du mouvement ; les secondes apportent le point d’arrivée et les contraintes de pose. Par rapport à une extrapolation unidirectionnelle après la sortie du cadre, cette méthode vise à réduire la dérive de la trajectoire et à préserver l’identité des mains ainsi que la continuité du mouvement.

Original · chinois

相机变化也被纳入设计。测试时,ACE-Ego-Hand无需显式输入相机内参,也就是相机自身的几何参数;面对原生鱼眼超广角视频,它无需提前标定或做图像去畸变,而是直接从畸变画面预测像素到三维空间的观测射线,恢复手部在相机坐标系下的度量3D位置。

Traduction · français

Les changements de caméra sont également pris en compte dans la conception. Lors des tests, ACE-Ego-Hand n’a pas besoin de recevoir explicitement les paramètres intrinsèques de la caméra, c’est-à-dire ses propres paramètres géométriques. Avec des vidéos ultra grand-angle natives issues d’une caméra fish-eye, il n’est pas nécessaire de procéder au préalable à un étalonnage ou à une correction de la distorsion de l’image : le modèle prédit directement, à partir des images déformées, les rayons d’observation reliant les pixels à l’espace tridimensionnel, puis restitue la position 3D métrique des mains dans le repère de la caméra.

Original · chinois

按团队给出的测试结果,模型在单张A100 GPU(图形处理器)上达到约63.1 fps,约为ViDiHand高精度配置的33倍;它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建。

Traduction · français

Selon les résultats de test fournis par l’équipe, le modèle atteint environ 63,1 fps sur un seul GPU A100 (processeur graphique), soit environ 33 fois la vitesse de la configuration haute précision de ViDiHand. Il peut servir à la collecte de données d’opérations sur les chaînes de production, à l’apprentissage par démonstration robotique, à l’analyse des processus d’assemblage manuel, à la réaffectation des mouvements de mains robotisées agiles et à la constitution de données pour l’apprentissage par imitation.

Revenir à l’article