Secondo Anthropic, il teorema di Fermat formalizzato in Lean
La dimostrazione comprende 13 milioni di righe di codice Lean e circa 29.500 teoremi intermedi.
Modelli, agenti, applicazioni: l’intelligenza artificiale messa al lavoro su problemi reali.
Qui l’intelligenza artificiale si giudica sulle prove: che cosa fa, per chi, a quale costo. La rubrica segue i modelli e i loro progressi misurabili, gli agenti che eseguono compiti reali e soprattutto le adozioni sul campo — un ospedale che esamina più pazienti, una rete elettrica gestita meglio, un’amministrazione che risponde più in fretta. L’IA spettacolo, i round di finanziamento senza prodotto e le profezie non trovano posto.
Preferiamo i casi d’uso documentati, numeri alla mano: quanti esami, quale tasso d’errore, quale risparmio. Gli attori non occidentali — laboratori cinesi, indiani, emiratini — sono trattati come quelli americani, perché buona parte dell’adozione reale avviene lì. Ogni articolo cita le sue fonti e distingue il prototipo dal servizio in produzione.
La dimostrazione comprende 13 milioni di righe di codice Lean e circa 29.500 teoremi intermedi.
Il modello, ora disponibile a tutti, passa dal 24,7% al 52,6% in Terminal-Bench-Science.
AOE Tech Labs changed only the Harness around DeepSeek-V4-Flash-0731 in its controlled comparison.
Janelia neuroscientist Arco Bast built the Model Hardware Standard with Anthropic and Claude Code.
The expansion launches with 37 preconfigured features for sales analysis and meeting preparation.
Claude will soon be able to read websites, click through them and fill out forms in a separate side panel.
Anthropic’s update lets Claude carry project details from conversations into Cowork without a fresh briefing.
Version v0.1.0-rc.8 adds native image requests and mixed text-image tasks.
The custom harness raised Claude Opus 5 from 30% to 100% on an interactive reasoning benchmark.
Maintaining its 700-billion-parameter scale, GLM-5.3 relies primarily on post-training to improve coding and agent capabilities.