Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A cheap model sat at the center of AOE Tech Labs’ test, but the model was not the variable that moved. The Chinese team ran DeepSeek-V4-Flash-0731 first on DeepSeek’s own minimalist Harness, then placed the same release inside Floatboat’s Harness. Only the execution system changed, and AOE reported that the Floatboat setup beat Claude Opus 4.8 on all five tested agent benchmarks.
Un modèle bon marché était au centre du test d’AOE Tech Labs, mais ce n’est pas le modèle qui a changé. L’équipe chinoise a d’abord exécuté DeepSeek-V4-Flash-0731 avec le Harness minimaliste de DeepSeek, puis a placé la même version dans le Harness de Floatboat. Seul le système d’exécution a changé, et AOE a indiqué que la configuration Floatboat avait battu Claude Opus 4.8 sur les cinq benchmarks d’agents testés.
The comparison used five third-party public leaderboards, including OpenAI-built BrowseComp. AOE says the Floatboat side ran in isolated physical sandbox environments with identical input parameters, while the control used the provider’s official release rather than a preview checkpoint. The claim is therefore narrower than “a better model”: it is a test of how much the surrounding system can extract from the same model.
La comparaison s’appuyait sur cinq classements publics tiers, dont BrowseComp, conçu par OpenAI. AOE affirme que la configuration Floatboat fonctionnait dans des environnements physiques isolés en bac à sable, avec des paramètres d’entrée identiques, tandis que le contrôle utilisait la version officielle du fournisseur plutôt qu’un checkpoint de prévisualisation. La portée de l’affirmation est donc plus limitée que celle d’un « meilleur modèle » : il s’agit de mesurer ce que le système environnant peut extraire du même modèle.
The gap widened with the length of the work. Ordered from short to long tasks, AOE reported gains of 1.9%, 9.6%, 12.6%, 19.9% and 23.6%. Short tasks resemble one-shot question answering, where model quality carries more weight. Longer tasks require file access, repeated tool calls, preserved state, self-correction and rollback—the machinery that keeps an agent moving after its first answer is wrong or incomplete.
L’écart s’est creusé avec la longueur du travail. En classant les tâches de la plus courte à la plus longue, AOE a rapporté des gains de 1,9 %, 9,6 %, 12,6 %, 19,9 % et 23,6 %. Les tâches courtes ressemblent à des questions auxquelles il faut répondre en une seule étape, où la qualité du modèle pèse davantage. Les tâches plus longues nécessitent un accès aux fichiers, des appels répétés aux outils, la conservation de l’état, l’autocorrection et la restauration — autant de mécanismes qui permettent à un agent de continuer à avancer lorsque sa première réponse est erronée ou incomplète.
The price comparison sharpens the result. Claude Opus 4.8 lists at $5 per million input tokens and $25 per million output tokens. At a 3:1 input-output ratio, AOE calculated Floatboat’s blended cost at $0.175 per million tokens, against $10 for Opus 4.8—a reported 57.1 times gap. AOE also introduced the Harness Leverage Ratio, or HLR, which compares the gain from changing the Harness with the gain from moving to a stronger reference model. On DeepSWE, the HLR was 3.57.
La comparaison des prix renforce le résultat. Claude Opus 4.8 est affiché à 5 dollars par million de tokens d’entrée et 25 dollars par million de tokens de sortie. Avec un ratio de 3:1 entre les tokens d’entrée et de sortie, AOE a calculé le coût combiné de Floatboat à 0,175 dollar par million de tokens, contre 10 dollars pour Opus 4.8 — soit un écart annoncé de 57,1 fois. AOE a également introduit le Harness Leverage Ratio, ou HLR, qui compare le gain obtenu en changeant de Harness à celui obtenu en passant à un modèle de référence plus puissant. Sur DeepSWE, le HLR s’élevait à 3,57.
So what changes in practice? Teams building daily-use agents may have another lever besides buying a larger model: improve the system that handles tools, files, memory and recovery. AOE Tech Labs has shipped Floatboat Desktop, FloatIM and FloatSchedule, but these benchmark results remain the company’s evaluation of its Harness in controlled environments. They show a strong case for investing in execution design; they do not establish that every real-world workflow will reproduce the same ranking or savings.
Qu’est-ce que cela change en pratique ? Les équipes qui développent des agents utilisés quotidiennement disposent peut-être d’un autre levier que l’achat d’un modèle plus grand : améliorer le système qui gère les outils, les fichiers, la mémoire et la récupération. AOE Tech Labs a lancé Floatboat Desktop, FloatIM et FloatSchedule, mais ces résultats de benchmark restent l’évaluation par l’entreprise de son Harness dans des environnements contrôlés. Ils plaident fortement en faveur d’un investissement dans la conception du système d’exécution ; ils n’établissent pas que tous les flux de travail du monde réel reproduiront le même classement ou les mêmes économies.