Sexta-feira, 4 de setembro de 2026Apoiar

Aube.

As notícias do progresso
LaboratórioFonte única

Daxiao Robotics abre modelo 3D de reconstrução bimanual

Idiomas deste artigo

Traduzido por IA a partir do chinês — ver o texto original. 6 idiomas disponíveis, o seu acrescenta-se com um clique.

As duas mãos estendem-se em direcção à peça e ficam brevemente ocultas; quando regressam ao enquadramento, o sistema tem ainda de retomar o movimento iniciado. É precisamente aqui que os vídeos de operações em primeira pessoa mais facilmente perdem informação. A Daxiao Robotics, em colaboração com o Laboratório Multimédia da Universidade Chinesa de Hong Kong, a Universidade Tecnológica de Nanyang e a Universidade Jiao Tong de Xangai, disponibilizou em código aberto o ACE-Ego-Hand. O modelo analisa um vídeo completo de uma só vez e produz directamente a pose, a forma, a visibilidade e a posição 3D das duas mãos. A equipa já produziu cerca de 5 000 horas de dados de treino.

A abordagem é diferente da dos métodos tradicionais. Os modelos anteriores costumavam detectar as mãos fotograma a fotograma ou efectuar uma regressão temporal por janelas de vídeo. Outros dependiam de várias etapas de amostragem por difusão, gerando gradualmente vídeos ou resultados em píxeis intermédios antes de estimar a pose das mãos. O ACE-Ego-Hand transforma um modelo de difusão de vídeo num codificador geométrico: a entrada começa por ser comprimida através de um VAE, o modelo efectua uma única passagem para a frente sobre as variáveis latentes e, em seguida, extrai características espaço-temporais do módulo Transformer de difusão de vídeo, entregando-as a um descodificador espaço-temporal bidireccional para gerar a saída.

Este mecanismo de inferência bidireccional foi concebido para tratar os segmentos em que as mãos desaparecem. O modelo não utiliza uma máscara causal nem depende apenas dos fotogramas já ocorridos: observa simultaneamente a informação anterior à saída das mãos do campo de visão e posterior ao seu reaparecimento. A primeira fornece o ponto de partida do movimento, a velocidade e a direcção; a segunda fornece o ponto final e restrições relativas à pose. Em comparação com a extrapolação unidireccional depois de as mãos saírem do enquadramento, o método procura reduzir o desvio da trajectória e manter a identidade e a continuidade do movimento das mãos.

As alterações da câmara também foram contempladas no desenho do sistema. Durante os testes, o ACE-Ego-Hand não precisa de receber explicitamente os parâmetros intrínsecos da câmara, ou seja, os parâmetros geométricos da própria câmara. Perante vídeos nativos de grande angular ultra-ampla com olho de peixe, não necessita de calibração prévia nem de correcção da distorção da imagem: prevê directamente, a partir da imagem distorcida, os raios observados que ligam os píxeis ao espaço tridimensional e recupera a posição 3D métrica das mãos no sistema de coordenadas da câmara.

De acordo com os resultados de teste apresentados pela equipa, o modelo atinge cerca de 63,1 fps numa única GPU A100 (unidade de processamento gráfico), aproximadamente 33 vezes a velocidade da configuração de alta precisão do ViDiHand. Pode ser utilizado na recolha de dados de operações em linhas de produção, no ensino de robôs, na análise de processos de montagem manual, no redireccionamento de movimentos de mãos hábeis e na criação de dados para aprendizagem por imitação.

cerca de 63,1 fpsVelocidade de processamento numa única GPU A100

Fontes — ler os originais(hora de Paris)

第一电动网ZH
0000

Para ler a seguir

Comentários

A carregar a conversa…

Inicie sessão para escrever um comentário. Iniciar sessão