Mardi 1 septembre 2026

Aube.

Les nouvelles du progrès
Source unique

Le Harness Floatboat bat Claude Opus 4.8 sur cinq benchmarks

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Un modèle bon marché était au centre du test d’AOE Tech Labs, mais ce n’est pas le modèle qui a changé. L’équipe chinoise a d’abord exécuté DeepSeek-V4-Flash-0731 avec le Harness minimaliste de DeepSeek, puis a placé la même version dans le Harness de Floatboat. Seul le système d’exécution a changé, et AOE a indiqué que la configuration Floatboat avait battu Claude Opus 4.8 sur les cinq benchmarks d’agents testés.

La comparaison s’appuyait sur cinq classements publics tiers, dont BrowseComp, conçu par OpenAI. AOE affirme que la configuration Floatboat fonctionnait dans des environnements physiques isolés en bac à sable, avec des paramètres d’entrée identiques, tandis que le contrôle utilisait la version officielle du fournisseur plutôt qu’un checkpoint de prévisualisation. La portée de l’affirmation est donc plus limitée que celle d’un « meilleur modèle » : il s’agit de mesurer ce que le système environnant peut extraire du même modèle.

L’écart s’est creusé avec la longueur du travail. En classant les tâches de la plus courte à la plus longue, AOE a rapporté des gains de 1,9 %, 9,6 %, 12,6 %, 19,9 % et 23,6 %. Les tâches courtes ressemblent à des questions auxquelles il faut répondre en une seule étape, où la qualité du modèle pèse davantage. Les tâches plus longues nécessitent un accès aux fichiers, des appels répétés aux outils, la conservation de l’état, l’autocorrection et la restauration — autant de mécanismes qui permettent à un agent de continuer à avancer lorsque sa première réponse est erronée ou incomplète.

La comparaison des prix renforce le résultat. Claude Opus 4.8 est affiché à 5 dollars par million de tokens d’entrée et 25 dollars par million de tokens de sortie. Avec un ratio de 3:1 entre les tokens d’entrée et de sortie, AOE a calculé le coût combiné de Floatboat à 0,175 dollar par million de tokens, contre 10 dollars pour Opus 4.8 — soit un écart annoncé de 57,1 fois. AOE a également introduit le Harness Leverage Ratio, ou HLR, qui compare le gain obtenu en changeant de Harness à celui obtenu en passant à un modèle de référence plus puissant. Sur DeepSWE, le HLR s’élevait à 3,57.

Qu’est-ce que cela change en pratique ? Les équipes qui développent des agents utilisés quotidiennement disposent peut-être d’un autre levier que l’achat d’un modèle plus grand : améliorer le système qui gère les outils, les fichiers, la mémoire et la récupération. AOE Tech Labs a lancé Floatboat Desktop, FloatIM et FloatSchedule, mais ces résultats de benchmark restent l’évaluation par l’entreprise de son Harness dans des environnements contrôlés. Ils plaident fortement en faveur d’un investissement dans la conception du système d’exécution ; ils n’établissent pas que tous les flux de travail du monde réel reproduiront le même classement ou les mêmes économies.

57,1 foisÉcart de coût annoncé entre la configuration combinée de Floatboat et Claude Opus 4.8

Sources — lire les originaux(heure de Paris)

PandailyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter