Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A handful of colored grids sits between the machine and its answer: extend a line, copy a shape, find the hidden rule. Pathway’s 150-million-parameter BDH-CQ model solved 29.5% of the ARC-AGI-1 puzzles it faced with two attempts per task, at a reported cost of $0.00070 per task.
Quelques grilles colorées se dressent entre la machine et sa réponse : prolonger une ligne, copier une forme, trouver la règle cachée. Le modèle BDH-CQ de Pathway, doté de 150 millions de paramètres, a résolu 29,5 % des problèmes d’ARC-AGI-1 auxquels il a été confronté, avec deux tentatives par tâche, pour un coût annoncé de 0,00070 dollar par tâche.
ARC-AGI-1 is a benchmark built around visual pattern recognition. The model receives a few completed examples on colored grids and must infer the rule for a new one. Unlike familiar chatbots that can work through a problem by generating a visible chain of written words, BDH-CQ updates an internal memory step by step and reasons in an internal workspace before producing its answer.
ARC-AGI-1 est un benchmark consacré à la reconnaissance de motifs visuels. Le modèle reçoit quelques exemples résolus sur des grilles colorées et doit déduire la règle applicable à une nouvelle grille. Contrairement aux chatbots courants, qui peuvent résoudre un problème en générant une chaîne visible de mots écrits, BDH-CQ met à jour une mémoire interne étape par étape et raisonne dans un espace de travail interne avant de produire sa réponse.
That smaller footprint is the point. Parameters are the internal values an AI adjusts while learning patterns; some of today’s largest models use hundreds of billions of them, while BDH-CQ uses 150 million. Pathway’s team says the model sets a new cost-efficiency record on ARC-AGI-1, and an independent team from Bielik AI and New York University separately confirmed the reported results.
C’est cette empreinte réduite qui constitue l’intérêt de l’approche. Les paramètres sont les valeurs internes qu’une IA ajuste lorsqu’elle apprend des motifs ; certains des plus grands modèles actuels en utilisent plusieurs centaines de milliards, tandis que BDH-CQ en utilise 150 millions. L’équipe de Pathway affirme que le modèle établit un nouveau record d’efficacité des coûts sur ARC-AGI-1, et une équipe indépendante de Bielik AI et de New York University a confirmé séparément les résultats rapportés.
The boundary is visible in the same test. BDH-CQ handled basic visual operations, including copying shapes and extending lines, but struggled with tasks involving larger sets of objects or several steps of visual reasoning. The work is presented in a 2026 arXiv preprint, and the researchers say they plan to train larger versions on mathematical, linguistic and visual problems.
Les limites apparaissent dans ce même test. BDH-CQ a traité des opérations visuelles de base, notamment la copie de formes et le prolongement de lignes, mais a peiné face aux tâches impliquant de grands ensembles d’objets ou plusieurs étapes de raisonnement visuel. Ces travaux sont présentés dans une prépublication arXiv de 2026, et les chercheurs indiquent prévoir l’entraînement de versions plus grandes sur des problèmes mathématiques, linguistiques et visuels.
The practical consequence is narrower and clearer than a wholesale replacement for large language models: if the approach scales, some small, repetitive reasoning jobs could require less computation and cost less to run. For now, that remains a possibility grounded in one benchmark.
La conséquence pratique est plus restreinte et plus claire qu’un remplacement complet des grands modèles de langage : si l’approche passe à l’échelle, certaines tâches de raisonnement répétitives et de petite taille pourraient nécessiter moins de calcul et coûter moins cher à exécuter. Pour l’instant, cela reste une possibilité fondée sur un seul benchmark.