Anthropic : le dernier théorème de Fermat formalisé dans Lean
La démonstration comprend 13 millions de lignes de code Lean et environ 29 500 théorèmes intermédiaires.
Modèles, agents, applications : l’intelligence artificielle mise au travail sur des problèmes réels.
Ici, l’intelligence artificielle est jugée sur pièces : ce qu’elle fait, pour qui, à quel coût. La rubrique suit les modèles et leurs progrès mesurables, les agents qui exécutent de vraies tâches, et surtout les déploiements — un hôpital qui dépiste plus de patients, un réseau électrique mieux piloté, une administration qui répond plus vite. L’IA spectacle, les levées de fonds sans produit et les prophéties n’y ont pas leur place.
Nous privilégions les cas d’usage documentés, chiffres à l’appui : combien d’examens, quel taux d’erreur, quelle économie. Les acteurs non occidentaux — laboratoires chinois, indiens, émiratis — y sont traités au même titre que les américains, parce que c’est là que se joue une bonne part du déploiement réel. Chaque article cite ses sources et distingue le prototype du service en production.
La démonstration comprend 13 millions de lignes de code Lean et environ 29 500 théorèmes intermédiaires.
Le modèle désormais disponible pour tous progresse de 24,7 à 52,6 % sur Terminal-Bench-Science.
AOE Tech Labs n’a modifié que le Harness autour de DeepSeek-V4-Flash-0731 dans sa comparaison contrôlée.
Le contrôleur développé avec Claude a rétabli le verrouillage lors de 695 des 700 essais sur un banc de test d’atomes neutres de QuEra.
Le neuroscientifique de Janelia Arco Bast a créé le Model Hardware Standard avec Anthropic et Claude Code.
L'extension démarre avec 37 fonctions prédéfinies pour l'analyse commerciale et la préparation de réunions.
Claude pourra bientôt lire des sites web dans un panneau latéral séparé, cliquer et remplir des formulaires.
La mise à jour d’Anthropic permet à Claude de transférer dans Cowork les détails d’un projet évoqués dans les conversations, sans nouveau briefing.
La version v0.1.0-rc.8 ajoute les requêtes d'images natives et les tâches mêlant texte et images.
L'infrastructure personnalisée a fait passer Claude Opus 5 de 30 % à 100 % sur un benchmark de raisonnement interactif.
Avec toujours 700 milliards de paramètres, GLM-5.3 mise principalement sur le post-entraînement pour améliorer ses capacités de codage et d’agent.