Miércoles, 2 de septiembre de 2026

Aube.

Las noticias del progreso
Original y traducción

Claude Fable 5.1 lidera los benchmarks de agentes

Salir de la comparación

Las dos versiones están alineadas bloque a bloque, en el orden del texto: titular, lo esencial y después párrafo a párrafo. Cuando la traducción ha fusionado o dividido un párrafo, la casilla correspondiente queda vacía — nunca emparejamos dos pasajes a ojo.

Original · alemán
Claude Fable 5.1 führt bei Agenten-Benchmarks
Traducción · español
Claude Fable 5.1 lidera los benchmarks de agentes
Original · alemán
Das allgemein verfügbare Modell verbessert sich bei Terminal-Bench-Science von 24,7 auf 52,6 Prozent.
Traducción · español
El modelo, ya disponible para todos, mejora en Terminal-Bench-Science del 24,7 al 52,6 %.
Original · alemán
Artificial Analysis misst 66 Punkte und damit den höchsten Wert im Intelligence Index.
Traducción · español
Artificial Analysis le otorga 66 puntos, la cifra más alta del Intelligence Index.
Original · alemán
Cache Reads werden günstiger, doch mehr Ausgabe-Token können die Ersparnis übertreffen.
Traducción · español
Los cache reads son más baratos, pero un mayor número de tokens de salida puede superar el ahorro.
Original · alemán

Im Terminal-Bench-Science, einem Test für komplexe wissenschaftliche Arbeitsabläufe, springt Claude Fable 5.1 von 24,7 auf 52,6 Prozent. Anthropic hat das Modell gemeinsam mit Claude Mythos 5.1 veröffentlicht; Fable 5.1 ist allgemein verfügbar und soll vor allem lang laufende Agentenaufgaben, Programmieraufgaben und Wissensarbeit besser bewältigen.

Traducción · español

En Terminal-Bench-Science, una prueba para flujos de trabajo científicos complejos, Claude Fable 5.1 pasa del 24,7 al 52,6 %. Anthropic ha publicado el modelo junto con Claude Mythos 5.1; Fable 5.1 ya está disponible para todos y pretende mejorar sobre todo en tareas de agentes de larga duración, programación y trabajo de conocimiento.

Original · alemán

Der Zuwachs zeigt sich auch in anderen Prüfungen. Bei Terminal-Bench 4.0, das agentische Programmieraufgaben in einer Terminal-Umgebung prüft, steigt Fable 5.1 von 42,0 auf 55,8 Prozent. AutomationBench simuliert mehrstufige Büroaufgaben über verschiedene Anwendungen hinweg und verzeichnet einen Anstieg von 17,1 auf 31,4 Prozent. Artificial Analysis misst bei maximaler Denkleistung 66 Punkte im Intelligence Index – mehr als Fable 5 mit 62, Opus 5 mit 63 und GPT-5.6 Sol mit 61 Punkten. Bei anderer agentischer Wissensarbeit liegt Fable 5.1 allerdings praktisch gleichauf mit Opus 5.

Traducción · español

El aumento también se observa en otras pruebas. En Terminal-Bench 4.0, que evalúa tareas de programación realizadas por agentes en un entorno de terminal, Fable 5.1 sube del 42,0 al 55,8 %. AutomationBench simula tareas de oficina de varias etapas en distintas aplicaciones y registra un aumento del 17,1 al 31,4 %. Artificial Analysis le otorga, con la máxima capacidad de razonamiento, 66 puntos en el Intelligence Index: más que los 62 de Fable 5, los 63 de Opus 5 y los 61 de GPT-5.6 Sol. Sin embargo, en otros trabajos de conocimiento realizados por agentes, Fable 5.1 queda prácticamente empatado con Opus 5.

Original · alemán

Für Entwickler bleibt die Rechenzeit ein harter Kostenfaktor. Die regulären Preise der Programmierschnittstelle (API) ändern sich nicht: 10 Dollar pro Million Eingabe-Token und 50 Dollar pro Million Ausgabe-Token. Günstiger werden Cache Reads, also das erneute Abrufen bereits verarbeiteter Inhalte: Sie fallen von 1 auf 0,25 Dollar pro Million Token. Anthropic schätzt dadurch rund 25 Prozent niedrigere Gesamtkosten bei typischen und bis zu etwa 45 Prozent niedrigere Kosten bei stark agentischen Arbeitslasten. Artificial Analysis stellt jedoch fest, dass Fable 5.1 rund 1,7-mal so viele Ausgabe-Token wie Fable 5 erzeugt; eine Aufgabe kostete dadurch im Schnitt 3,76 Dollar.

Traducción · español

Para los desarrolladores, el tiempo de cálculo sigue siendo un factor de coste importante. Los precios ordinarios de la interfaz de programación de aplicaciones (API) no cambian: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. Los cache reads, es decir, la recuperación de contenidos ya procesados, sí son más baratos: bajan de 1 a 0,25 dólares por millón de tokens. Anthropic calcula que esto reduce los costes totales alrededor de un 25 % en las cargas de trabajo habituales y hasta aproximadamente un 45 % en las cargas con un uso intensivo de agentes. Sin embargo, Artificial Analysis constata que Fable 5.1 genera aproximadamente 1,7 veces más tokens de salida que Fable 5; por ello, una tarea costó de media 3,76 dólares.

Original · alemán

Anthropic hat außerdem die Schutzmechanismen für Cyberaufgaben präziser gefasst. Fable 5.1 darf Schwachstellen in Quellcode identifizieren, während Penetrationstests, die Erzeugung von Exploits und das Scannen binärer Schwachstellen weiterhin eingeschränkt bleiben. In Claude Code greifen die Schutzmaßnahmen laut Anthropic im Schnitt rund 60 Prozent seltener ein als bei Fable 5. Mythos 5.1 ist nur für geprüfte Nutzer und Organisationen zugänglich und verfügt über weniger strikte Schutzmechanismen; beide neuen Modelle tragen erstmals ein Text-Wasserzeichen.

Traducción · español

Anthropic también ha definido con mayor precisión los mecanismos de protección para tareas de ciberseguridad. Fable 5.1 puede identificar vulnerabilidades en el código fuente, mientras que las pruebas de penetración, la creación de exploits y el escaneo de vulnerabilidades binarias siguen estando restringidos. Según Anthropic, en Claude Code las medidas de protección se activan de media alrededor de un 60 % menos que con Fable 5. Mythos 5.1 solo está disponible para usuarios y organizaciones verificados y cuenta con mecanismos de protección menos estrictos; ambos modelos nuevos incorporan por primera vez una marca de agua de texto.

Original · alemán

Konkret bekommen Teams mit langen, mehrstufigen Programmier- oder Wissensaufgaben ein allgemein verfügbares Modell, das in mehreren Agenten-Benchmarks deutlich zulegt. Der Preis dafür ist nicht automatisch niedriger: Die günstigeren Cache-Zugriffe helfen vor allem bei wiederverwendetem Kontext, während ein höherer Ausgabe-Tokenverbrauch den Vorteil schmälern kann. Für die meisten Anwendungen empfiehlt Anthropic weiterhin Opus 5; Anthropic empfiehlt Fable 5.1 vor allem für besonders anspruchsvolle und langwierige Aufgaben.

Traducción · español

En concreto, los equipos con tareas de programación o de conocimiento largas y de varias etapas disponen de un modelo ya disponible para todos que mejora notablemente en varios benchmarks de agentes. Sin embargo, el precio no es automáticamente inferior: los accesos a caché más baratos ayudan sobre todo cuando se reutiliza el contexto, mientras que un mayor consumo de tokens de salida puede reducir la ventaja. Anthropic sigue recomendando Opus 5 para la mayoría de las aplicaciones y recomienda Fable 5.1 sobre todo para tareas especialmente exigentes y prolongadas.

Volver al artículo