Le due versioni sono allineate blocco per blocco, nell’ordine del testo: titolo, l’essenziale, poi paragrafo per paragrafo. Quando la traduzione ha fuso o diviso un paragrafo, la casella corrispondente resta vuota — non accostiamo mai due passaggi a occhio.
双手伸向工件,短暂被遮住;重新回到镜头时,系统还要接得上刚才的动作。这正是第一视角操作视频最容易丢失信息的地方。大晓机器人联合香港中文大学多媒体实验室、南洋理工大学和上海交通大学开源了ACE-Ego-Hand,可对整段视频一次分析,直接输出双手姿态、形状、可见性和3D位置,团队已产出约5000小时训练数据。
Le due mani si allungano verso un pezzo, poi vengono coperte per un breve istante; quando tornano nell’inquadratura, il sistema deve riuscire a collegarsi al movimento appena osservato. È proprio questo il punto in cui i video operativi in prima persona rischiano più facilmente di perdere informazioni. Daxiao Robotics, insieme al Laboratorio multimediale dell’Università cinese di Hong Kong, alla Nanyang Technological University e alla Shanghai Jiao Tong University, ha reso open source ACE-Ego-Hand, capace di analizzare l’intero video in un’unica operazione e di restituire direttamente posa, forma, visibilità e posizione 3D delle due mani. Il team ha già prodotto circa 5.000 ore di dati di addestramento.
它与传统路径不同。过去的模型通常逐帧检测,或按视频窗口做时序回归,也有模型依靠多步扩散采样,逐步生成中间视频或像素结果,再估计手部姿态。ACE-Ego-Hand把视频扩散模型改造成几何编码器:输入先经过VAE压缩,模型在潜变量上进行一次前向传播,再从视频扩散Transformer模块读取时空特征,交给双向时空解码器完成输出。
Il suo approccio differisce da quello tradizionale. In passato, i modelli rilevavano generalmente le mani fotogramma per fotogramma oppure eseguivano una regressione temporale su finestre video; altri si affidavano a molteplici passaggi di campionamento della diffusione per generare gradualmente video o risultati a livello di pixel intermedi, prima di stimare la posa delle mani. ACE-Ego-Hand trasforma un modello di diffusione video in un encoder geometrico: l’input viene prima compresso attraverso una VAE, quindi il modello esegue un’unica propagazione in avanti nello spazio latente. Le caratteristiche spazio-temporali vengono poi estratte dal modulo Video Diffusion Transformer e affidate a un decoder spazio-temporale bidirezionale per produrre l’output.
这套双向推理机制专门处理手部消失的片段。模型不使用因果掩码,不只依赖已经发生的画面,而是同时查看手部离开视野前和重新出现后的信息;前者提供运动起点、速度与方向,后者提供终点和姿态约束。相比离开画面后单向外推,这种方式旨在减少轨迹漂移,保持手部身份和运动连续。
Questo meccanismo di inferenza bidirezionale è pensato per gestire i segmenti in cui la mano scompare. Il modello non utilizza una maschera causale e non si basa soltanto sui fotogrammi già osservati: considera contemporaneamente le informazioni precedenti all’uscita della mano dal campo visivo e quelle successive alla sua ricomparsa. Le prime forniscono il punto di partenza del movimento, la velocità e la direzione; le seconde forniscono il punto di arrivo e i vincoli sulla posa. Rispetto all’estrapolazione unidirezionale dopo l’uscita dall’inquadratura, questo approccio mira a ridurre la deriva della traiettoria e a mantenere la continuità dell’identità e del movimento della mano.
相机变化也被纳入设计。测试时,ACE-Ego-Hand无需显式输入相机内参,也就是相机自身的几何参数;面对原生鱼眼超广角视频,它无需提前标定或做图像去畸变,而是直接从畸变画面预测像素到三维空间的观测射线,恢复手部在相机坐标系下的度量3D位置。
Anche i cambiamenti della fotocamera sono inclusi nella progettazione. In fase di test, ACE-Ego-Hand non richiede l’inserimento esplicito dei parametri intrinseci della fotocamera, cioè dei suoi parametri geometrici; con video fisheye ultra-grandangolari nativi, non è necessario calibrare in anticipo o correggere la distorsione dell’immagine. Il modello prevede direttamente, dalle immagini distorte, i raggi di osservazione dai pixel allo spazio tridimensionale e ricostruisce la posizione 3D metrica della mano nel sistema di coordinate della fotocamera.
按团队给出的测试结果,模型在单张A100 GPU(图形处理器)上达到约63.1 fps,约为ViDiHand高精度配置的33倍;它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建。
Secondo i risultati dei test forniti dal team, il modello raggiunge circa 63,1 fps su una singola GPU A100 (unità di elaborazione grafica), circa 33 volte la velocità della configurazione ad alta precisione di ViDiHand; può essere utilizzato per la raccolta di dati sulle operazioni nelle linee di produzione, l’insegnamento ai robot, l’analisi dei processi di assemblaggio manuale, il retargeting dei movimenti delle mani robotiche e la costruzione di dati per l’apprendimento per imitazione.