Friday, 4 September 2026Support us

Aube.

News of progress
LabSingle source

大晓机器人开源第一视角3D双手重建模型

Languages for this article
Original · 中文ENESFRITPT

Originally written in Chinese. 6 languages available; yours is one click away.

双手伸向工件,短暂被遮住;重新回到镜头时,系统还要接得上刚才的动作。这正是第一视角操作视频最容易丢失信息的地方。大晓机器人联合香港中文大学多媒体实验室、南洋理工大学和上海交通大学开源了ACE-Ego-Hand,可对整段视频一次分析,直接输出双手姿态、形状、可见性和3D位置,团队已产出约5000小时训练数据。

它与传统路径不同。过去的模型通常逐帧检测,或按视频窗口做时序回归,也有模型依靠多步扩散采样,逐步生成中间视频或像素结果,再估计手部姿态。ACE-Ego-Hand把视频扩散模型改造成几何编码器:输入先经过VAE压缩,模型在潜变量上进行一次前向传播,再从视频扩散Transformer模块读取时空特征,交给双向时空解码器完成输出。

这套双向推理机制专门处理手部消失的片段。模型不使用因果掩码,不只依赖已经发生的画面,而是同时查看手部离开视野前和重新出现后的信息;前者提供运动起点、速度与方向,后者提供终点和姿态约束。相比离开画面后单向外推,这种方式旨在减少轨迹漂移,保持手部身份和运动连续。

相机变化也被纳入设计。测试时,ACE-Ego-Hand无需显式输入相机内参,也就是相机自身的几何参数;面对原生鱼眼超广角视频,它无需提前标定或做图像去畸变,而是直接从畸变画面预测像素到三维空间的观测射线,恢复手部在相机坐标系下的度量3D位置。

按团队给出的测试结果,模型在单张A100 GPU(图形处理器)上达到约63.1 fps,约为ViDiHand高精度配置的33倍;它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建。

约63.1 fps单张A100 GPU上的处理速度

Sources — read the originals(Paris time)

第一电动网ZH
0000

Read next

Comments

Loading the thread…

Sign in to leave a comment. Sign in