Miércoles, 2 de septiembre de 2026

Aube.

Las noticias del progreso
DesplegadoFuente única

Claude Fable 5.1 lidera los benchmarks de agentes

Idiomas de este artículoComparar con el original

Traducido por IA del alemán — ver el texto original. 6 idiomas disponibles, el tuyo se añade con un clic.

En Terminal-Bench-Science, una prueba para flujos de trabajo científicos complejos, Claude Fable 5.1 pasa del 24,7 al 52,6 %. Anthropic ha publicado el modelo junto con Claude Mythos 5.1; Fable 5.1 ya está disponible para todos y pretende mejorar sobre todo en tareas de agentes de larga duración, programación y trabajo de conocimiento.

El aumento también se observa en otras pruebas. En Terminal-Bench 4.0, que evalúa tareas de programación realizadas por agentes en un entorno de terminal, Fable 5.1 sube del 42,0 al 55,8 %. AutomationBench simula tareas de oficina de varias etapas en distintas aplicaciones y registra un aumento del 17,1 al 31,4 %. Artificial Analysis le otorga, con la máxima capacidad de razonamiento, 66 puntos en el Intelligence Index: más que los 62 de Fable 5, los 63 de Opus 5 y los 61 de GPT-5.6 Sol. Sin embargo, en otros trabajos de conocimiento realizados por agentes, Fable 5.1 queda prácticamente empatado con Opus 5.

Para los desarrolladores, el tiempo de cálculo sigue siendo un factor de coste importante. Los precios ordinarios de la interfaz de programación de aplicaciones (API) no cambian: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. Los cache reads, es decir, la recuperación de contenidos ya procesados, sí son más baratos: bajan de 1 a 0,25 dólares por millón de tokens. Anthropic calcula que esto reduce los costes totales alrededor de un 25 % en las cargas de trabajo habituales y hasta aproximadamente un 45 % en las cargas con un uso intensivo de agentes. Sin embargo, Artificial Analysis constata que Fable 5.1 genera aproximadamente 1,7 veces más tokens de salida que Fable 5; por ello, una tarea costó de media 3,76 dólares.

Anthropic también ha definido con mayor precisión los mecanismos de protección para tareas de ciberseguridad. Fable 5.1 puede identificar vulnerabilidades en el código fuente, mientras que las pruebas de penetración, la creación de exploits y el escaneo de vulnerabilidades binarias siguen estando restringidos. Según Anthropic, en Claude Code las medidas de protección se activan de media alrededor de un 60 % menos que con Fable 5. Mythos 5.1 solo está disponible para usuarios y organizaciones verificados y cuenta con mecanismos de protección menos estrictos; ambos modelos nuevos incorporan por primera vez una marca de agua de texto.

En concreto, los equipos con tareas de programación o de conocimiento largas y de varias etapas disponen de un modelo ya disponible para todos que mejora notablemente en varios benchmarks de agentes. Sin embargo, el precio no es automáticamente inferior: los accesos a caché más baratos ayudan sobre todo cuando se reutiliza el contexto, mientras que un mayor consumo de tokens de salida puede reducir la ventaja. Anthropic sigue recomendando Opus 5 para la mayoría de las aplicaciones y recomienda Fable 5.1 sobre todo para tareas especialmente exigentes y prolongadas.

66 puntosPuntuación de Fable 5.1 en el Intelligence Index de Artificial Analysis

Fuentes — leer los originales(hora de París)

heise onlineDE
0000

Para leer a continuación

Comentarios

Cargando el hilo…

Inicia sesión para escribir un comentario. Iniciar sesión

Claude Fable 5.1 lidera los benchmarks de agentes · Aube.