Claude Fable 5.1 führt bei Agenten-Benchmarks
Das allgemein verfügbare Modell verbessert sich bei Terminal-Bench-Science von 24,7 auf 52,6 Prozent.
Modelle, Agenten, Anwendungen: künstliche Intelligenz, die an echten Problemen arbeitet.
Hier wird künstliche Intelligenz an Belegen gemessen: was sie leistet, für wen, zu welchen Kosten. Die Rubrik verfolgt Modelle und ihre messbaren Fortschritte, Agenten, die echte Aufgaben erledigen, und vor allem den Einsatz in der Praxis — ein Krankenhaus, das mehr Patienten untersucht, ein besser gesteuertes Stromnetz, eine Verwaltung, die schneller antwortet. KI als Spektakel, Finanzierungsrunden ohne Produkt und Prophezeiungen finden hier nicht statt.
Wir bevorzugen dokumentierte Anwendungsfälle mit Zahlen: wie viele Untersuchungen, welche Fehlerquote, welche Ersparnis. Nichtwestliche Akteure — Labore aus China, Indien, den Emiraten — werden wie die amerikanischen behandelt, weil ein Großteil des realen Einsatzes dort stattfindet. Jeder Artikel nennt seine Quellen und trennt den Prototyp vom Dienst in Produktion.
Das allgemein verfügbare Modell verbessert sich bei Terminal-Bench-Science von 24,7 auf 52,6 Prozent.
AOE Tech Labs changed only the Harness around DeepSeek-V4-Flash-0731 in its controlled comparison.
Janelia neuroscientist Arco Bast built the Model Hardware Standard with Anthropic and Claude Code.
Die Erweiterung startet mit 37 vorgefertigten Funktionen für Vertriebsanalysen und Besprechungsvorbereitung.
Claude kann Websites künftig in einem separaten Seitenpanel lesen, anklicken und Formulare ausfüllen.
Anthropic’s update lets Claude carry project details from conversations into Cowork without a fresh briefing.
Version v0.1.0-rc.8 adds native image requests and mixed text-image tasks.
The custom harness raised Claude Opus 5 from 30% to 100% on an interactive reasoning benchmark.
Maintaining its 700-billion-parameter scale, GLM-5.3 relies primarily on post-training to improve coding and agent capabilities.