Mercoledì 2 settembre 2026

Aube.

Le notizie del progresso
In esercizioFonte unica

Claude Fable 5.1 in testa ai benchmark degli agenti

Lingue di questo articoloConfronta con l’originale

Tradotto dall’IA, lingua originale tedesco — vedi il testo originale. 6 lingue disponibili, la tua si aggiunge con un clic.

In Terminal-Bench-Science, un test per flussi di lavoro scientifici complessi, Claude Fable 5.1 passa dal 24,7% al 52,6%. Anthropic ha pubblicato il modello insieme a Claude Mythos 5.1; Fable 5.1 è ora disponibile a tutti e dovrebbe gestire meglio soprattutto le attività agentiche di lunga durata, i compiti di programmazione e i lavori basati sulla conoscenza.

La crescita emerge anche in altre valutazioni. In Terminal-Bench 4.0, che esamina attività di programmazione agentica in un ambiente terminale, Fable 5.1 sale dal 42,0% al 55,8%. AutomationBench simula attività d'ufficio articolate in più fasi e distribuite su diverse applicazioni, registrando un aumento dal 17,1% al 31,4%. Artificial Analysis assegna al modello, con la massima potenza di ragionamento, 66 punti nell'Intelligence Index: più di Fable 5, a quota 62, Opus 5, a 63, e GPT-5.6 Sol, a 61 punti. Negli altri test sui lavori agentici basati sulla conoscenza, tuttavia, Fable 5.1 è praticamente alla pari con Opus 5.

Per gli sviluppatori, il tempo di calcolo resta un fattore di costo rilevante. I prezzi ordinari dell'interfaccia di programmazione (API) non cambiano: 10 dollari per milione di token in input e 50 dollari per milione di token in output. Diventano più economici i Cache Reads, cioè il recupero di contenuti già elaborati: il costo scende da 1 a 0,25 dollari per milione di token. Anthropic stima una riduzione dei costi complessivi di circa il 25% nei carichi di lavoro tipici e fino a circa il 45% in quelli fortemente agentici. Artificial Analysis rileva però che Fable 5.1 genera circa 1,7 volte più token in output rispetto a Fable 5; di conseguenza, un'attività è costata in media 3,76 dollari.

Anthropic ha inoltre definito con maggiore precisione i meccanismi di protezione per le attività di cybersicurezza. Fable 5.1 può identificare vulnerabilità nel codice sorgente, mentre i test di penetrazione, la generazione di exploit e la scansione delle vulnerabilità binarie restano soggetti a restrizioni. Secondo Anthropic, in Claude Code le misure di protezione intervengono in media circa il 60% meno spesso rispetto a Fable 5. Mythos 5.1 è accessibile solo a utenti e organizzazioni verificati e dispone di meccanismi di protezione meno rigidi; entrambi i nuovi modelli presentano per la prima volta una filigrana testuale.

In concreto, i team impegnati in attività di programmazione o di elaborazione della conoscenza lunghe e articolate in più fasi ricevono un modello disponibile a tutti, che migliora nettamente in diversi benchmark sugli agenti. Il prezzo, però, non è automaticamente più basso: gli accessi alla cache più economici aiutano soprattutto quando si riutilizza il contesto, mentre un consumo maggiore di token in output può ridurre il vantaggio. Per la maggior parte degli impieghi Anthropic continua a raccomandare Opus 5; Fable 5.1 è indicato soprattutto per le attività particolarmente impegnative e di lunga durata.

66 puntiPunteggio di Fable 5.1 nell'Intelligence Index di Artificial Analysis

Fonti — leggere gli originali(ora di Parigi)

heise onlineDE
0000

Da leggere dopo

Commenti

Caricamento della discussione…

Accedi per scrivere un commento. Accedi