Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A screenshot lands in a developer's task, and the model has no vision capability. In DeepSeek Harness v0.1.0-rc.8, the job no longer has to stop there: the first major update since the public beta adds image input, subagent upgrades and 14 changes across the agent workflow.
Une capture d'écran arrive dans la tâche d'un développeur, mais le modèle ne dispose d'aucune capacité de vision. Avec DeepSeek Harness v0.1.0-rc.8, le travail ne doit plus forcément s'arrêter là : la première mise à jour majeure depuis la bêta publique ajoute l'entrée d'images, des améliorations pour les sous-agents et 14 changements dans le workflow de l'agent.
The release arrived less than a week after DeepSeek Harness opened its public beta and open source on August 13. On beta night, developer Zhidx pulled the code, translated an 88-page paper and built a Snake game. Now models with vision can receive images directly, while the /goal and /plan commands accept text and images together.
Cette version est arrivée moins d'une semaine après l'ouverture de la bêta publique et de l'open source de DeepSeek Harness, le 13 août. Le soir du lancement de la bêta, le développeur Zhidx a récupéré le code, traduit un article de 88 pages et créé un jeu de Snake. Désormais, les modèles dotés de la vision peuvent recevoir directement des images, tandis que les commandes /goal et /plan acceptent simultanément du texte et des images.
The mechanism is more interesting when the underlying model cannot see. Developer Yinsen found that a failed direct read_image call can trigger a fallback using optical character recognition, color-ratio statistics, pixel-row scanning, image dimensions and color-mode metadata. Harness passes those structured clues to a text model, which can reconstruct useful information from presentation slides, flowcharts and interface screenshots. Real photos are less reliably recovered.
Le mécanisme est plus intéressant lorsque le modèle sous-jacent ne peut pas voir. Le développeur Yinsen a découvert qu'un appel direct read_image qui échoue peut déclencher une solution de repli utilisant la reconnaissance optique de caractères, des statistiques de ratio de couleurs, l'analyse des lignes de pixels, les dimensions de l'image et les métadonnées du mode colorimétrique. Harness transmet ces indices structurés à un modèle textuel, qui peut reconstituer des informations utiles à partir de diapositives de présentation, d'organigrammes et de captures d'écran d'interfaces. Les photographies réelles sont récupérées de manière moins fiable.
The same update widens the team around the main model. Claude Code and Codex can be installed as Profile Bundles and used as subagents; Codex adds a non-interactive permission mode and multiple named instances. Windows users get persistent PowerShell sessions in the PTY terminal, while fixes address failed image requests, interrupted streaming and custom OpenAI-compatible gateways that used different request formats.
La même mise à jour élargit l'équipe autour du modèle principal. Claude Code et Codex peuvent être installés comme Profile Bundles et utilisés comme sous-agents ; Codex ajoute un mode d'autorisation non interactif et plusieurs instances nommées. Les utilisateurs de Windows bénéficient de sessions PowerShell persistantes dans le terminal PTY, tandis que des correctifs s'attaquent aux requêtes d'images échouées, aux flux interrompus et aux passerelles personnalisées compatibles avec OpenAI qui utilisaient des formats de requête différents.
So what changes in practice? A developer can bring a screenshot, local file or previous session into one task, ask an image-capable model to inspect it, or let a text-only model work from extracted visual signals. That makes the harness useful across more models without requiring every base model to support vision. The limits are visible: the software is still a public beta release candidate, and the fallback works best on clear, structured images rather than photographs.
Qu'est-ce que cela change en pratique ? Un développeur peut intégrer une capture d'écran, un fichier local ou une session précédente dans une même tâche, demander à un modèle capable de traiter les images de l'inspecter, ou laisser un modèle uniquement textuel travailler à partir de signaux visuels extraits. Le harness devient ainsi utile avec davantage de modèles, sans exiger que chaque modèle de base prenne en charge la vision. Les limites sont visibles : le logiciel reste une release candidate en bêta publique, et la solution de repli fonctionne surtout avec des images claires et structurées plutôt qu'avec des photographies.