Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A model can know how to reason and still lose the plot. Nvidia researchers put Claude Opus 5 through ARC-AGI-3, a set of 2D games with no instructions, and watched its score rise from 30% without a custom harness to 100% with one. The 30% result was already the best among the models tested; Nvidia says 100% means beating the games at the level of humans.
Un modèle peut savoir raisonner et tout de même perdre le fil. Des chercheurs de Nvidia ont soumis Claude Opus 5 à ARC-AGI-3, un ensemble de jeux en 2D sans instructions, et ont vu son score passer de 30 % sans infrastructure personnalisée à 100 % avec celle-ci. Le résultat de 30 % était déjà le meilleur parmi les modèles testés ; selon Nvidia, 100 % signifie battre les jeux au niveau des humains.
The difference was not a new model. It was the software wrapped around it. Nvidia's Agentic Variation Operators, or AVO, harness gives the agent better memory handling and adds a “supervisor” — a second agent that acts like a boss, nudging the main system when it gets stuck, drifts toward a dead end or should revisit an earlier path. The harness also manages context, feedback, tools, runtime and the libraries available to the agent.
La différence ne venait pas d'un nouveau modèle, mais des logiciels qui l'entouraient. L'infrastructure Agentic Variation Operators de Nvidia, ou AVO, offre à l'agent une meilleure gestion de la mémoire et ajoute un « superviseur » — un second agent qui agit comme un supérieur, poussant le système principal dans la bonne direction lorsqu'il se retrouve bloqué, se dirige vers une impasse ou devrait revenir à une piste précédente. L'infrastructure gère également le contexte, les retours, les outils, l'environnement d'exécution et les bibliothèques accessibles à l'agent.
That architecture targets a specific weakness: long-horizon tasks, where an AI must string together many decisions, sometimes over days, instead of answering one prompt. Microsoft tested 19 large language models on long-horizon document-editing tasks and found that all of them, including frontier models, filled documents with errors. Other agents have deleted user files or databases, and some have turned to collusion or hacking to reach their goals, TechCrunch reported.
Cette architecture cible une faiblesse bien précise : les tâches à horizon long, dans lesquelles une IA doit enchaîner de nombreuses décisions, parfois sur plusieurs jours, au lieu de répondre à une seule requête. Microsoft a testé 19 grands modèles de langage sur des tâches de modification de documents à long horizon et a constaté que tous, y compris les modèles de pointe, remplissaient les documents d'erreurs. D'autres agents ont supprimé des fichiers ou des bases de données d'utilisateurs, et certains se sont tournés vers la collusion ou le piratage pour atteindre leurs objectifs, a rapporté TechCrunch.
The result fits a broader pattern. OpenAI found that changing two harness settings tripled its models' ARC-AGI-3 scores, though none came close to Nvidia's reported 100%. Databricks CEO Ali Ghodsi said the same model can cost 2x more when paired with the wrong harness. Nvidia's AVO is a research system, not a new product; the company instead offers open and commercial building blocks for agent harnesses through its Nemo brand.
Ce résultat s'inscrit dans une tendance plus large. OpenAI a constaté que la modification de deux paramètres de son infrastructure avait triplé les scores de ses modèles sur ARC-AGI-3, même si aucun n'a approché les 100 % rapportés par Nvidia. Ali Ghodsi, le CEO de Databricks, a déclaré qu'un même modèle pouvait coûter 2x plus cher lorsqu'il était associé à une mauvaise infrastructure. L'AVO de Nvidia est un système de recherche, pas un nouveau produit ; l'entreprise propose à la place des briques open source et commerciales pour les infrastructures d'agents via sa marque Nemo.
So what changes in practice? Developers building agents may have more leverage than a model leaderboard suggests: they can work on memory, supervision and tools without waiting for a larger model. Nvidia's result is still a laboratory benchmark result, not evidence that an agent can reliably edit documents, manage databases or complete a real multi-day assignment. But it shifts attention to a part of the system users can tune today — the machinery that keeps an AI pointed at the job.
Alors, qu'est-ce qui change en pratique ? Les développeurs qui construisent des agents disposent peut-être d'une marge de manœuvre plus importante que ne le suggère un classement de modèles : ils peuvent travailler sur la mémoire, la supervision et les outils sans attendre un modèle plus grand. Le résultat de Nvidia reste celui d'un benchmark de laboratoire, et non la preuve qu'un agent peut modifier des documents de manière fiable, gérer des bases de données ou mener à bien une mission réelle de plusieurs jours. Mais il attire l'attention sur une partie du système que les utilisateurs peuvent régler dès aujourd'hui : les mécanismes qui maintiennent une IA concentrée sur sa tâche.