Segundo a Anthropic: Último Teorema de Fermat formalizado em Lean
A demonstração inclui 13 milhões de linhas de código Lean e cerca de 29 500 teoremas intermédios.
Modelos, agentes, aplicações: a inteligência artificial posta a trabalhar em problemas reais.
Aqui, a inteligência artificial é julgada pelas provas: o que faz, para quem, a que custo. A secção segue os modelos e os seus progressos mensuráveis, os agentes que executam tarefas reais e, sobretudo, as implantações — um hospital que rastreia mais doentes, uma rede elétrica mais bem gerida, uma administração que responde mais depressa. A IA-espetáculo, as rondas de financiamento sem produto e as profecias não têm aqui lugar.
Preferimos os casos de uso documentados, com os números à vista: quantos exames, que taxa de erro, que poupança. Os atores não ocidentais — laboratórios chineses, indianos, dos Emirados — são tratados como os americanos, porque boa parte da implantação real acontece aí. Cada artigo cita as suas fontes e distingue o protótipo do serviço em produção.
A demonstração inclui 13 milhões de linhas de código Lean e cerca de 29 500 teoremas intermédios.
O modelo geralmente disponível melhora no Terminal-Bench-Science, passando de 24,7 para 52,6 %.
AOE Tech Labs changed only the Harness around DeepSeek-V4-Flash-0731 in its controlled comparison.
Janelia neuroscientist Arco Bast built the Model Hardware Standard with Anthropic and Claude Code.
The expansion launches with 37 preconfigured features for sales analysis and meeting preparation.
Claude will soon be able to read websites, click through them and fill out forms in a separate side panel.
Anthropic’s update lets Claude carry project details from conversations into Cowork without a fresh briefing.
Version v0.1.0-rc.8 adds native image requests and mixed text-image tasks.
The custom harness raised Claude Opus 5 from 30% to 100% on an interactive reasoning benchmark.
Maintaining its 700-billion-parameter scale, GLM-5.3 relies primarily on post-training to improve coding and agent capabilities.