Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
PrototypeSource unique

DeepSeek publie en open source Harness, son environnement de travail pour agents basé sur des plugins

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Le même modèle d’IA peut sembler brillant dans une configuration et peu fiable dans une autre. Les 6 et 11 août, Composio a intégré DeepSeek V4-Flash à huit harness d’agents — les systèmes d’exécution qui enveloppent les modèles — et a demandé à chacun de réaliser 30 tâches en plusieurs étapes dans Gmail, Google Calendar, GitHub et Slack. Le meilleur harness a réussi 20 tâches, contre 14 pour le moins performant. Sur 240 exécutions, seules 129 ont réussi, tandis que six tâches seulement ont été réalisées par les huit systèmes.

L’équipe black-whale de DeepSeek a dévoilé Harness, une preview développeur publiée sous licence MIT le 13 août. Le projet est conçu comme un environnement de travail permettant d’utiliser des modèles dans de vrais environnements logiciels, plutôt que comme un agent finalisé vendu sous la forme d’un produit unique. DeepSeek a également publié DeepSeek V4 Pro ce soir-là.

L’idée centrale est que tout est un plugin. Les modèles, les outils, les compétences, les sessions, les sandbox, le stockage, les boucles, la planification et l’interface peuvent tous être remplacés ou recombinés grâce au système de plugins Cordis. Pendant sa preview interne, les développeurs auraient créé des centaines de plugins en quelques jours, dont un ajoutant une mémoire à long terme intersessions avec une auto-évolution en arrière-plan. Harness prend par défaut en charge près de 40 grands modèles, notamment les systèmes de Kimi, OpenAI, Anthropic et Google.

L’autre fonctionnalité majeure est la conservation d’une trace du travail autonome. Harness utilise des journaux de session en ajout uniquement, qui enregistrent ce que voit le modèle, les prompts système, le chain-of-thought, les appels d’outils et leurs résultats, la planification des sous-agents et chaque injection de contexte. La compression n’efface pas l’historique d’origine. Dans sa vue Trajectory, les développeurs peuvent restaurer, dupliquer, récupérer et rejouer une exécution, au lieu d’essayer de reconstituer la raison de l’échec d’un agent à partir de sa seule réponse finale.

Qu’est-ce que cela change en pratique ? Les développeurs peuvent examiner le parcours complet derrière une réussite ou un échec, tandis que les modèles, les outils, les règles et les interfaces peuvent être remplacés ou recombinés via des plugins. Le test de Composio a concrètement illustré les enjeux : Claude Code, Codex et DeepAgents ont chacun réalisé 16 tâches, mais pour un coût d’environ 0,195 $, 0,081 $ et 0,045 $ par tâche réussie. Harness est toujours indiqué comme étant en v0.1, et ces chiffres proviennent de tests rapportés, et non d’une évaluation indépendante.

129Exécutions réussies sur 240 tests avec le même modèle

Sources — lire les originaux(heure de Paris)

PandailyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter