Mercredi 2 septembre 2026

Aube.

Les nouvelles du progrès
Original et traduction

Claude Fable 5.1 en tête des benchmarks d’agents

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · allemand
Claude Fable 5.1 führt bei Agenten-Benchmarks
Traduction · français
Claude Fable 5.1 en tête des benchmarks d’agents
Original · allemand
Das allgemein verfügbare Modell verbessert sich bei Terminal-Bench-Science von 24,7 auf 52,6 Prozent.
Traduction · français
Le modèle désormais disponible pour tous progresse de 24,7 à 52,6 % sur Terminal-Bench-Science.
Original · allemand
Artificial Analysis misst 66 Punkte und damit den höchsten Wert im Intelligence Index.
Traduction · français
Artificial Analysis lui attribue 66 points, soit le meilleur score de l’Intelligence Index.
Original · allemand
Cache Reads werden günstiger, doch mehr Ausgabe-Token können die Ersparnis übertreffen.
Traduction · français
Les lectures de cache coûtent moins cher, mais l’augmentation des jetons de sortie peut annuler l’économie.
Original · allemand

Im Terminal-Bench-Science, einem Test für komplexe wissenschaftliche Arbeitsabläufe, springt Claude Fable 5.1 von 24,7 auf 52,6 Prozent. Anthropic hat das Modell gemeinsam mit Claude Mythos 5.1 veröffentlicht; Fable 5.1 ist allgemein verfügbar und soll vor allem lang laufende Agentenaufgaben, Programmieraufgaben und Wissensarbeit besser bewältigen.

Traduction · français

Sur Terminal-Bench-Science, un test consacré aux processus scientifiques complexes, Claude Fable 5.1 passe de 24,7 à 52,6 %. Anthropic a publié le modèle en même temps que Claude Mythos 5.1 ; Fable 5.1 est désormais disponible pour tous et doit surtout mieux gérer les tâches agentiques de longue durée, la programmation et le travail de connaissance.

Original · allemand

Der Zuwachs zeigt sich auch in anderen Prüfungen. Bei Terminal-Bench 4.0, das agentische Programmieraufgaben in einer Terminal-Umgebung prüft, steigt Fable 5.1 von 42,0 auf 55,8 Prozent. AutomationBench simuliert mehrstufige Büroaufgaben über verschiedene Anwendungen hinweg und verzeichnet einen Anstieg von 17,1 auf 31,4 Prozent. Artificial Analysis misst bei maximaler Denkleistung 66 Punkte im Intelligence Index – mehr als Fable 5 mit 62, Opus 5 mit 63 und GPT-5.6 Sol mit 61 Punkten. Bei anderer agentischer Wissensarbeit liegt Fable 5.1 allerdings praktisch gleichauf mit Opus 5.

Traduction · français

Cette progression se manifeste également dans d’autres évaluations. Sur Terminal-Bench 4.0, qui évalue des tâches de programmation agentique dans un environnement de terminal, Fable 5.1 progresse de 42,0 à 55,8 %. AutomationBench simule des tâches de bureau en plusieurs étapes dans différentes applications et enregistre une hausse de 17,1 à 31,4 %. Avec une puissance de raisonnement maximale, Artificial Analysis lui attribue 66 points dans l’Intelligence Index, contre 62 pour Fable 5, 63 pour Opus 5 et 61 pour GPT-5.6 Sol. Dans d’autres tâches de connaissance agentique, Fable 5.1 fait toutefois pratiquement jeu égal avec Opus 5.

Original · allemand

Für Entwickler bleibt die Rechenzeit ein harter Kostenfaktor. Die regulären Preise der Programmierschnittstelle (API) ändern sich nicht: 10 Dollar pro Million Eingabe-Token und 50 Dollar pro Million Ausgabe-Token. Günstiger werden Cache Reads, also das erneute Abrufen bereits verarbeiteter Inhalte: Sie fallen von 1 auf 0,25 Dollar pro Million Token. Anthropic schätzt dadurch rund 25 Prozent niedrigere Gesamtkosten bei typischen und bis zu etwa 45 Prozent niedrigere Kosten bei stark agentischen Arbeitslasten. Artificial Analysis stellt jedoch fest, dass Fable 5.1 rund 1,7-mal so viele Ausgabe-Token wie Fable 5 erzeugt; eine Aufgabe kostete dadurch im Schnitt 3,76 Dollar.

Traduction · français

Pour les développeurs, le temps de calcul reste un facteur de coût important. Les tarifs habituels de l’interface de programmation (API) ne changent pas : 10 dollars par million de jetons d’entrée et 50 dollars par million de jetons de sortie. Les lectures de cache, c’est-à-dire la récupération de contenus déjà traités, deviennent moins chères : leur tarif passe de 1 à 0,25 dollar par million de jetons. Anthropic estime que cela permettra de réduire les coûts totaux d’environ 25 % dans les charges de travail typiques, et jusqu’à environ 45 % dans les charges fortement agentiques. Artificial Analysis constate toutefois que Fable 5.1 produit environ 1,7 fois plus de jetons de sortie que Fable 5 ; une tâche a ainsi coûté en moyenne 3,76 dollars.

Original · allemand

Anthropic hat außerdem die Schutzmechanismen für Cyberaufgaben präziser gefasst. Fable 5.1 darf Schwachstellen in Quellcode identifizieren, während Penetrationstests, die Erzeugung von Exploits und das Scannen binärer Schwachstellen weiterhin eingeschränkt bleiben. In Claude Code greifen die Schutzmaßnahmen laut Anthropic im Schnitt rund 60 Prozent seltener ein als bei Fable 5. Mythos 5.1 ist nur für geprüfte Nutzer und Organisationen zugänglich und verfügt über weniger strikte Schutzmechanismen; beide neuen Modelle tragen erstmals ein Text-Wasserzeichen.

Traduction · français

Anthropic a également défini plus précisément les mécanismes de protection pour les tâches de cybersécurité. Fable 5.1 peut identifier des vulnérabilités dans du code source, tandis que les tests d’intrusion, la création d’exploits et l’analyse de vulnérabilités binaires restent soumis à des restrictions. Dans Claude Code, les mesures de protection interviennent en moyenne environ 60 % moins souvent qu’avec Fable 5, selon Anthropic. Mythos 5.1 n’est accessible qu’aux utilisateurs et organisations vérifiés et dispose de mécanismes de protection moins stricts ; les deux nouveaux modèles portent pour la première fois un filigrane textuel.

Original · allemand

Konkret bekommen Teams mit langen, mehrstufigen Programmier- oder Wissensaufgaben ein allgemein verfügbares Modell, das in mehreren Agenten-Benchmarks deutlich zulegt. Der Preis dafür ist nicht automatisch niedriger: Die günstigeren Cache-Zugriffe helfen vor allem bei wiederverwendetem Kontext, während ein höherer Ausgabe-Tokenverbrauch den Vorteil schmälern kann. Für die meisten Anwendungen empfiehlt Anthropic weiterhin Opus 5; Anthropic empfiehlt Fable 5.1 vor allem für besonders anspruchsvolle und langwierige Aufgaben.

Traduction · français

Concrètement, les équipes qui réalisent de longues tâches de programmation ou de connaissance en plusieurs étapes disposent d’un modèle accessible à tous, qui progresse nettement dans plusieurs benchmarks d’agents. Cette avancée ne se traduit pas automatiquement par une baisse des coûts : les lectures de cache moins chères sont surtout utiles lorsque le contexte est réutilisé, tandis qu’une consommation accrue de jetons de sortie peut réduire l’avantage. Anthropic continue de recommander Opus 5 pour la plupart des applications et conseille Fable 5.1 avant tout pour les tâches particulièrement exigeantes et longues.

Revenir à l’article