Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A humanoid robot walks, looks and works at the same time. That is the job Omega-0 was built to learn, and its creators report 81.8 percent success on 11 real-world home tasks—ahead of pi-0.5, EgoVLA, GR00T-N1.7 and psi-0. Researchers came from Nanyang Technological University, Peking University, HKUST (Guangzhou) and the Beijing Academy of Artificial Intelligence, or BAAI.
Un robot humanoïde marche, regarde et travaille en même temps. C’est ce qu’Omega-0 a été conçu pour apprendre, et ses créateurs annoncent 81,8 % de réussite sur 11 tâches domestiques réelles — devant pi-0.5, EgoVLA, GR00T-N1.7 et psi-0. Les chercheurs viennent de l’Université technologique de Nanyang, de l’Université de Pékin, de HKUST (Canton) et de la Beijing Academy of Artificial Intelligence, ou BAAI.
The model's central choice is what it predicts. Instead of forecasting future pixels, Omega-0 forecasts future visual features—information about what the robot is likely to see—then feeds those features into a diffusion transformer, which generates coordinated actions for the whole body. The system combines vision, language and proprioception, the robot's own measurements of its body, so an instruction and a changing environment can shape the same action plan.
Le choix central du modèle concerne ce qu’il prédit. Au lieu de prévoir les pixels futurs, Omega-0 prévoit des caractéristiques visuelles futures — des informations sur ce que le robot devrait probablement voir — puis transmet ces caractéristiques à un transformer de diffusion, qui génère des actions coordonnées pour l’ensemble du corps. Le système combine vision, langage et proprioception, c’est-à-dire les propres mesures corporelles du robot, afin qu’une instruction et un environnement changeant puissent influencer le même plan d’action.
The training base is Omega-HOME: 40.3 hours of real-environment data, 4,827 trajectories and 24 task types. The demonstrations include first-person and third-person video, language instructions, proprioception and full-body motion. They cover eight household categories, including fetching objects, cleaning surfaces, using appliances and tidying; the trajectories were tele-operated and turned into training signals.
La base d’entraînement est Omega-HOME : 40,3 heures de données recueillies dans des environnements réels, 4 827 trajectoires et 24 types de tâches. Les démonstrations comprennent des vidéos à la première et à la troisième personne, des instructions en langage naturel, des données de proprioception et des mouvements du corps entier. Elles couvrent huit catégories de tâches domestiques, notamment aller chercher des objets, nettoyer des surfaces, utiliser des appareils et ranger ; les trajectoires ont été téléopérées puis converties en signaux d’entraînement.
The researchers also designed the evaluation to address a basic concern in robot learning: whether the test tasks have already appeared in training. They removed the 11 fine-tuning tasks from Omega-HOME and combined the remaining data with public human demonstrations for an earlier training stage. That makes the reported comparison more meaningful, while the result remains a research benchmark rather than proof of reliable domestic autonomy.
Les chercheurs ont également conçu l’évaluation pour répondre à une préoccupation fondamentale de l’apprentissage robotique : les tâches de test sont-elles déjà apparues pendant l’entraînement ? Ils ont retiré les 11 tâches de fine-tuning d’Omega-HOME, puis combiné les données restantes avec des démonstrations publiques réalisées par des humains pour une étape d’entraînement antérieure. La comparaison ainsi obtenue est plus significative, même si le résultat reste un benchmark de recherche et ne constitue pas la preuve d’une autonomie domestique fiable.
So what changes in practice? Omega-0 offers a clearer recipe for robots that must continuously sense a home and coordinate their entire body, not just move one arm toward a known target. It could help researchers test household abilities such as fetching, cleaning and appliance use with a common training setup. But long-horizon autonomy, safe interaction, generalizing to new tasks and adapting to complex environments are still open, and the team describes reliable laundry-folding as a distant goal.
Qu’est-ce que cela change en pratique ? Omega-0 propose une méthode plus claire pour concevoir des robots qui doivent percevoir en continu leur environnement domestique et coordonner tout leur corps, plutôt que de simplement déplacer un bras vers une cible connue. Le modèle pourrait aider les chercheurs à tester des capacités domestiques comme aller chercher des objets, nettoyer et utiliser des appareils dans le cadre d’un dispositif d’entraînement commun. Mais l’autonomie sur de longues séquences, les interactions sûres, la généralisation à de nouvelles tâches et l’adaptation à des environnements complexes restent des problèmes ouverts, et l’équipe présente le pliage fiable du linge comme un objectif encore lointain.