Claude Fable 5.1 en tête des benchmarks d’agents
Sur Terminal-Bench-Science, un test consacré aux processus scientifiques complexes, Claude Fable 5.1 passe de 24,7 à 52,6 %. Anthropic a publié le modèle en même temps que Claude Mythos 5.1 ; Fable 5.1 est désormais disponible pour tous et doit surtout mieux gérer les tâches agentiques de longue durée, la programmation et le travail de connaissance.
Cette progression se manifeste également dans d’autres évaluations. Sur Terminal-Bench 4.0, qui évalue des tâches de programmation agentique dans un environnement de terminal, Fable 5.1 progresse de 42,0 à 55,8 %. AutomationBench simule des tâches de bureau en plusieurs étapes dans différentes applications et enregistre une hausse de 17,1 à 31,4 %. Avec une puissance de raisonnement maximale, Artificial Analysis lui attribue 66 points dans l’Intelligence Index, contre 62 pour Fable 5, 63 pour Opus 5 et 61 pour GPT-5.6 Sol. Dans d’autres tâches de connaissance agentique, Fable 5.1 fait toutefois pratiquement jeu égal avec Opus 5.
Pour les développeurs, le temps de calcul reste un facteur de coût important. Les tarifs habituels de l’interface de programmation (API) ne changent pas : 10 dollars par million de jetons d’entrée et 50 dollars par million de jetons de sortie. Les lectures de cache, c’est-à-dire la récupération de contenus déjà traités, deviennent moins chères : leur tarif passe de 1 à 0,25 dollar par million de jetons. Anthropic estime que cela permettra de réduire les coûts totaux d’environ 25 % dans les charges de travail typiques, et jusqu’à environ 45 % dans les charges fortement agentiques. Artificial Analysis constate toutefois que Fable 5.1 produit environ 1,7 fois plus de jetons de sortie que Fable 5 ; une tâche a ainsi coûté en moyenne 3,76 dollars.
Anthropic a également défini plus précisément les mécanismes de protection pour les tâches de cybersécurité. Fable 5.1 peut identifier des vulnérabilités dans du code source, tandis que les tests d’intrusion, la création d’exploits et l’analyse de vulnérabilités binaires restent soumis à des restrictions. Dans Claude Code, les mesures de protection interviennent en moyenne environ 60 % moins souvent qu’avec Fable 5, selon Anthropic. Mythos 5.1 n’est accessible qu’aux utilisateurs et organisations vérifiés et dispose de mécanismes de protection moins stricts ; les deux nouveaux modèles portent pour la première fois un filigrane textuel.
Concrètement, les équipes qui réalisent de longues tâches de programmation ou de connaissance en plusieurs étapes disposent d’un modèle accessible à tous, qui progresse nettement dans plusieurs benchmarks d’agents. Cette avancée ne se traduit pas automatiquement par une baisse des coûts : les lectures de cache moins chères sont surtout utiles lorsque le contexte est réutilisé, tandis qu’une consommation accrue de jetons de sortie peut réduire l’avantage. Anthropic continue de recommander Opus 5 pour la plupart des applications et conseille Fable 5.1 avant tout pour les tâches particulièrement exigeantes et longues.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter