Sexta-feira, 4 de setembro de 2026Apoiar

Aube.

As notícias do progresso
Original e tradução

Daxiao Robotics abre modelo 3D de reconstrução bimanual

Sair da comparação

As duas versões estão alinhadas bloco a bloco, pela ordem do texto: título, o essencial e depois parágrafo a parágrafo. Quando a tradução fundiu ou dividiu um parágrafo, a casa correspondente fica vazia — nunca aproximamos duas passagens a olho.

Original · chinês
大晓机器人开源第一视角3D双手重建模型
Tradução · português
Daxiao Robotics abre modelo 3D de reconstrução bimanual
Original · chinês
ACE-Ego-Hand面向头戴式第一视角视频,可一次分析整段视频,输出双手姿态、形状和度量3D位置。
Tradução · português
O ACE-Ego-Hand destina-se a vídeos em primeira pessoa captados por câmaras montadas na cabeça; analisa um vídeo completo de uma só vez e produz a pose, a forma e a posição 3D métrica das duas mãos.
Original · chinês
模型在单张A100 GPU上达到约63.1 fps,约为ViDiHand高精度配置的33倍。
Tradução · português
O modelo atinge cerca de 63,1 fps numa única GPU A100, aproximadamente 33 vezes mais do que a configuração de alta precisão do ViDiHand.
Original · chinês
双向时空推理可补全遮挡或暂时离开画面的手部轨迹,面向产线、示教和模仿学习。
Tradução · português
A inferência espaço-temporal bidirecional completa as trajectórias das mãos quando estas ficam oclusas ou saem temporariamente do enquadramento, com aplicações em linhas de produção, ensino de robôs e aprendizagem por imitação.
Original · chinês

双手伸向工件,短暂被遮住;重新回到镜头时,系统还要接得上刚才的动作。这正是第一视角操作视频最容易丢失信息的地方。大晓机器人联合香港中文大学多媒体实验室、南洋理工大学和上海交通大学开源了ACE-Ego-Hand,可对整段视频一次分析,直接输出双手姿态、形状、可见性和3D位置,团队已产出约5000小时训练数据。

Tradução · português

As duas mãos estendem-se em direcção à peça e ficam brevemente ocultas; quando regressam ao enquadramento, o sistema tem ainda de retomar o movimento iniciado. É precisamente aqui que os vídeos de operações em primeira pessoa mais facilmente perdem informação. A Daxiao Robotics, em colaboração com o Laboratório Multimédia da Universidade Chinesa de Hong Kong, a Universidade Tecnológica de Nanyang e a Universidade Jiao Tong de Xangai, disponibilizou em código aberto o ACE-Ego-Hand. O modelo analisa um vídeo completo de uma só vez e produz directamente a pose, a forma, a visibilidade e a posição 3D das duas mãos. A equipa já produziu cerca de 5 000 horas de dados de treino.

Original · chinês

它与传统路径不同。过去的模型通常逐帧检测,或按视频窗口做时序回归,也有模型依靠多步扩散采样,逐步生成中间视频或像素结果,再估计手部姿态。ACE-Ego-Hand把视频扩散模型改造成几何编码器:输入先经过VAE压缩,模型在潜变量上进行一次前向传播,再从视频扩散Transformer模块读取时空特征,交给双向时空解码器完成输出。

Tradução · português

A abordagem é diferente da dos métodos tradicionais. Os modelos anteriores costumavam detectar as mãos fotograma a fotograma ou efectuar uma regressão temporal por janelas de vídeo. Outros dependiam de várias etapas de amostragem por difusão, gerando gradualmente vídeos ou resultados em píxeis intermédios antes de estimar a pose das mãos. O ACE-Ego-Hand transforma um modelo de difusão de vídeo num codificador geométrico: a entrada começa por ser comprimida através de um VAE, o modelo efectua uma única passagem para a frente sobre as variáveis latentes e, em seguida, extrai características espaço-temporais do módulo Transformer de difusão de vídeo, entregando-as a um descodificador espaço-temporal bidireccional para gerar a saída.

Original · chinês

这套双向推理机制专门处理手部消失的片段。模型不使用因果掩码,不只依赖已经发生的画面,而是同时查看手部离开视野前和重新出现后的信息;前者提供运动起点、速度与方向,后者提供终点和姿态约束。相比离开画面后单向外推,这种方式旨在减少轨迹漂移,保持手部身份和运动连续。

Tradução · português

Este mecanismo de inferência bidireccional foi concebido para tratar os segmentos em que as mãos desaparecem. O modelo não utiliza uma máscara causal nem depende apenas dos fotogramas já ocorridos: observa simultaneamente a informação anterior à saída das mãos do campo de visão e posterior ao seu reaparecimento. A primeira fornece o ponto de partida do movimento, a velocidade e a direcção; a segunda fornece o ponto final e restrições relativas à pose. Em comparação com a extrapolação unidireccional depois de as mãos saírem do enquadramento, o método procura reduzir o desvio da trajectória e manter a identidade e a continuidade do movimento das mãos.

Original · chinês

相机变化也被纳入设计。测试时,ACE-Ego-Hand无需显式输入相机内参,也就是相机自身的几何参数;面对原生鱼眼超广角视频,它无需提前标定或做图像去畸变,而是直接从畸变画面预测像素到三维空间的观测射线,恢复手部在相机坐标系下的度量3D位置。

Tradução · português

As alterações da câmara também foram contempladas no desenho do sistema. Durante os testes, o ACE-Ego-Hand não precisa de receber explicitamente os parâmetros intrínsecos da câmara, ou seja, os parâmetros geométricos da própria câmara. Perante vídeos nativos de grande angular ultra-ampla com olho de peixe, não necessita de calibração prévia nem de correcção da distorção da imagem: prevê directamente, a partir da imagem distorcida, os raios observados que ligam os píxeis ao espaço tridimensional e recupera a posição 3D métrica das mãos no sistema de coordenadas da câmara.

Original · chinês

按团队给出的测试结果,模型在单张A100 GPU(图形处理器)上达到约63.1 fps,约为ViDiHand高精度配置的33倍;它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建。

Tradução · português

De acordo com os resultados de teste apresentados pela equipa, o modelo atinge cerca de 63,1 fps numa única GPU A100 (unidade de processamento gráfico), aproximadamente 33 vezes a velocidade da configuração de alta precisão do ViDiHand. Pode ser utilizado na recolha de dados de operações em linhas de produção, no ensino de robôs, na análise de processos de montagem manual, no redireccionamento de movimentos de mãos hábeis e na criação de dados para aprendizagem por imitação.

Voltar ao artigo