DeepSeek Harness ajoute l'entrée d'images après sa bêta
Une capture d'écran arrive dans la tâche d'un développeur, mais le modèle ne dispose d'aucune capacité de vision. Avec DeepSeek Harness v0.1.0-rc.8, le travail ne doit plus forcément s'arrêter là : la première mise à jour majeure depuis la bêta publique ajoute l'entrée d'images, des améliorations pour les sous-agents et 14 changements dans le workflow de l'agent.
Cette version est arrivée moins d'une semaine après l'ouverture de la bêta publique et de l'open source de DeepSeek Harness, le 13 août. Le soir du lancement de la bêta, le développeur Zhidx a récupéré le code, traduit un article de 88 pages et créé un jeu de Snake. Désormais, les modèles dotés de la vision peuvent recevoir directement des images, tandis que les commandes /goal et /plan acceptent simultanément du texte et des images.
Le mécanisme est plus intéressant lorsque le modèle sous-jacent ne peut pas voir. Le développeur Yinsen a découvert qu'un appel direct read_image qui échoue peut déclencher une solution de repli utilisant la reconnaissance optique de caractères, des statistiques de ratio de couleurs, l'analyse des lignes de pixels, les dimensions de l'image et les métadonnées du mode colorimétrique. Harness transmet ces indices structurés à un modèle textuel, qui peut reconstituer des informations utiles à partir de diapositives de présentation, d'organigrammes et de captures d'écran d'interfaces. Les photographies réelles sont récupérées de manière moins fiable.
La même mise à jour élargit l'équipe autour du modèle principal. Claude Code et Codex peuvent être installés comme Profile Bundles et utilisés comme sous-agents ; Codex ajoute un mode d'autorisation non interactif et plusieurs instances nommées. Les utilisateurs de Windows bénéficient de sessions PowerShell persistantes dans le terminal PTY, tandis que des correctifs s'attaquent aux requêtes d'images échouées, aux flux interrompus et aux passerelles personnalisées compatibles avec OpenAI qui utilisaient des formats de requête différents.
Qu'est-ce que cela change en pratique ? Un développeur peut intégrer une capture d'écran, un fichier local ou une session précédente dans une même tâche, demander à un modèle capable de traiter les images de l'inspecter, ou laisser un modèle uniquement textuel travailler à partir de signaux visuels extraits. Le harness devient ainsi utile avec davantage de modèles, sans exiger que chaque modèle de base prenne en charge la vision. Les limites sont visibles : le logiciel reste une release candidate en bêta publique, et la solution de repli fonctionne surtout avec des images claires et structurées plutôt qu'avec des photographies.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter