Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

DeepSeek publie en open source Harness, son environnement de travail pour agents basé sur des plugins

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · anglais
DeepSeek open-sources Harness, its plugin-based agent workbench
Traduction · français
DeepSeek publie en open source Harness, son environnement de travail pour agents basé sur des plugins
Original · anglais
- DeepSeek has open-sourced a developer preview of Harness under the MIT license.
Traduction · français
- DeepSeek a publié en open source une preview développeur de Harness sous licence MIT.
Original · anglais
- Tests found the same model completed between 14 and 20 tasks across eight harnesses.
Traduction · français
- Les tests ont montré que le même modèle réalisait entre 14 et 20 tâches avec huit harness différents.
Original · anglais
- Harness records agent actions and lets developers swap models, tools, rules and interfaces.
Traduction · français
- Harness enregistre les actions des agents et permet aux développeurs de remplacer les modèles, les outils, les règles et les interfaces.
Original · anglais

The same AI model can look brilliant in one setup and unreliable in another. On August 6 and 11, Composio placed DeepSeek V4-Flash inside eight agent harnesses — the execution systems wrapped around models — and asked each one to complete 30 multi-step tasks in Gmail, Google Calendar, GitHub and Slack. The best harness passed 20 tasks; the worst passed 14. Across 240 runs, only 129 succeeded, while just six tasks were completed by all eight systems.

Traduction · français

Le même modèle d’IA peut sembler brillant dans une configuration et peu fiable dans une autre. Les 6 et 11 août, Composio a intégré DeepSeek V4-Flash à huit harness d’agents — les systèmes d’exécution qui enveloppent les modèles — et a demandé à chacun de réaliser 30 tâches en plusieurs étapes dans Gmail, Google Calendar, GitHub et Slack. Le meilleur harness a réussi 20 tâches, contre 14 pour le moins performant. Sur 240 exécutions, seules 129 ont réussi, tandis que six tâches seulement ont été réalisées par les huit systèmes.

Original · anglais

DeepSeek’s black-whale team has surfaced Harness, a developer preview released under the MIT license on August 13. The project is designed as a workbench for putting models to work in real software environments, rather than as a finished agent sold as a single package. DeepSeek also released DeepSeek V4 Pro that evening.

Traduction · français

L’équipe black-whale de DeepSeek a dévoilé Harness, une preview développeur publiée sous licence MIT le 13 août. Le projet est conçu comme un environnement de travail permettant d’utiliser des modèles dans de vrais environnements logiciels, plutôt que comme un agent finalisé vendu sous la forme d’un produit unique. DeepSeek a également publié DeepSeek V4 Pro ce soir-là.

Original · anglais

The core design is that everything is a plugin. Models, tools, skills, sessions, sandboxes, storage, loops, scheduling and the interface can all be replaced or recombined through the Cordis plugin system. During its internal preview, developers reportedly created hundreds of plugins within days, including one that adds cross-session long-term memory with background self-evolution. Harness defaults to supporting nearly 40 large models, including Kimi, OpenAI, Anthropic and Google systems.

Traduction · français

L’idée centrale est que tout est un plugin. Les modèles, les outils, les compétences, les sessions, les sandbox, le stockage, les boucles, la planification et l’interface peuvent tous être remplacés ou recombinés grâce au système de plugins Cordis. Pendant sa preview interne, les développeurs auraient créé des centaines de plugins en quelques jours, dont un ajoutant une mémoire à long terme intersessions avec une auto-évolution en arrière-plan. Harness prend par défaut en charge près de 40 grands modèles, notamment les systèmes de Kimi, OpenAI, Anthropic et Google.

Original · anglais

The other major feature is a paper trail for autonomous work. Harness uses append-only session logs, recording what the model sees, system prompts, chain-of-thought, tool calls and results, sub-agent scheduling and every context injection. Compression does not erase the original history. In its Trajectory view, developers can restore, fork, retrieve and replay a run instead of trying to reconstruct why an agent failed from a final answer alone.

Traduction · français

L’autre fonctionnalité majeure est la conservation d’une trace du travail autonome. Harness utilise des journaux de session en ajout uniquement, qui enregistrent ce que voit le modèle, les prompts système, le chain-of-thought, les appels d’outils et leurs résultats, la planification des sous-agents et chaque injection de contexte. La compression n’efface pas l’historique d’origine. Dans sa vue Trajectory, les développeurs peuvent restaurer, dupliquer, récupérer et rejouer une exécution, au lieu d’essayer de reconstituer la raison de l’échec d’un agent à partir de sa seule réponse finale.

Original · anglais

So what changes in practice? Developers can inspect the full path behind a success or failure, while models, tools, rules and interfaces can be swapped or recombined through plugins. Composio’s test put the stakes in concrete terms: Claude Code, Codex and DeepAgents each completed 16 tasks, but the cost was about $0.195, $0.081 and $0.045 per successful task. Harness is still marked v0.1, and the figures come from reported tests rather than an independent evaluation.

Traduction · français

Qu’est-ce que cela change en pratique ? Les développeurs peuvent examiner le parcours complet derrière une réussite ou un échec, tandis que les modèles, les outils, les règles et les interfaces peuvent être remplacés ou recombinés via des plugins. Le test de Composio a concrètement illustré les enjeux : Claude Code, Codex et DeepAgents ont chacun réalisé 16 tâches, mais pour un coût d’environ 0,195 $, 0,081 $ et 0,045 $ par tâche réussie. Harness est toujours indiqué comme étant en v0.1, et ces chiffres proviennent de tests rapportés, et non d’une évaluation indépendante.

Revenir à l’article