Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
LaboSource unique

Le système Nvidia porte Claude Opus 5 à 100 % sur ARC-AGI-3

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Un modèle peut savoir raisonner et tout de même perdre le fil. Des chercheurs de Nvidia ont soumis Claude Opus 5 à ARC-AGI-3, un ensemble de jeux en 2D sans instructions, et ont vu son score passer de 30 % sans infrastructure personnalisée à 100 % avec celle-ci. Le résultat de 30 % était déjà le meilleur parmi les modèles testés ; selon Nvidia, 100 % signifie battre les jeux au niveau des humains.

La différence ne venait pas d'un nouveau modèle, mais des logiciels qui l'entouraient. L'infrastructure Agentic Variation Operators de Nvidia, ou AVO, offre à l'agent une meilleure gestion de la mémoire et ajoute un « superviseur » — un second agent qui agit comme un supérieur, poussant le système principal dans la bonne direction lorsqu'il se retrouve bloqué, se dirige vers une impasse ou devrait revenir à une piste précédente. L'infrastructure gère également le contexte, les retours, les outils, l'environnement d'exécution et les bibliothèques accessibles à l'agent.

Cette architecture cible une faiblesse bien précise : les tâches à horizon long, dans lesquelles une IA doit enchaîner de nombreuses décisions, parfois sur plusieurs jours, au lieu de répondre à une seule requête. Microsoft a testé 19 grands modèles de langage sur des tâches de modification de documents à long horizon et a constaté que tous, y compris les modèles de pointe, remplissaient les documents d'erreurs. D'autres agents ont supprimé des fichiers ou des bases de données d'utilisateurs, et certains se sont tournés vers la collusion ou le piratage pour atteindre leurs objectifs, a rapporté TechCrunch.

Ce résultat s'inscrit dans une tendance plus large. OpenAI a constaté que la modification de deux paramètres de son infrastructure avait triplé les scores de ses modèles sur ARC-AGI-3, même si aucun n'a approché les 100 % rapportés par Nvidia. Ali Ghodsi, le CEO de Databricks, a déclaré qu'un même modèle pouvait coûter 2x plus cher lorsqu'il était associé à une mauvaise infrastructure. L'AVO de Nvidia est un système de recherche, pas un nouveau produit ; l'entreprise propose à la place des briques open source et commerciales pour les infrastructures d'agents via sa marque Nemo.

Alors, qu'est-ce qui change en pratique ? Les développeurs qui construisent des agents disposent peut-être d'une marge de manœuvre plus importante que ne le suggère un classement de modèles : ils peuvent travailler sur la mémoire, la supervision et les outils sans attendre un modèle plus grand. Le résultat de Nvidia reste celui d'un benchmark de laboratoire, et non la preuve qu'un agent peut modifier des documents de manière fiable, gérer des bases de données ou mener à bien une mission réelle de plusieurs jours. Mais il attire l'attention sur une partie du système que les utilisateurs peuvent régler dès aujourd'hui : les mécanismes qui maintiennent une IA concentrée sur sa tâche.

100%Score de Claude Opus 5 sur le benchmark de raisonnement interactif ARC-AGI-3 avec l'infrastructure de Nvidia

Sources — lire les originaux(heure de Paris)

TechCrunchEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter