Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

DeepSeek lance un modèle de vision expérimental

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · chinois
DeepSeek上线实验性视觉模型
Traduction · français
DeepSeek lance un modèle de vision expérimental
Original · chinois
模型可读取图片,并接入办公、开发和内容生产等Agent工作流。
Traduction · français
Le modèle peut lire des images et s’intégrer aux workflows d’agents pour la bureautique, le développement et la production de contenus.
Original · chinois
每张图片最高换算为384 tokens,沿用V4-Flash的计费体系。
Traduction · français
Chaque image est convertie en 384 tokens au maximum, selon la grille tarifaire de V4-Flash.
Original · chinois
Files API支持复用图片文件,单个文件最大64 MiB。
Traduction · français
Files API permet de réutiliser des fichiers image, avec une taille maximale de 64 MiB par fichier.
Original · chinois

当一个Agent不再只读文字,它才开始碰到真实工作的入口:截图、文档页面、表格和错误信息。DeepSeek近日在API平台上线实验性多模态模型 deepseek-v4-flash-vision-exp,让现有Agent工作流可以接收图片;DeepSeek Harness 0.1.1也已加入原生支持。

Traduction · français

Lorsqu’un agent ne se contente plus de lire du texte, il commence à entrer dans le monde du travail réel : captures d’écran, pages de documents, tableaux et messages d’erreur. DeepSeek a récemment lancé sur sa plateforme API le modèle multimodal expérimental deepseek-v4-flash-vision-exp, afin de permettre aux workflows d’agents existants de recevoir des images. DeepSeek Harness 0.1.1 prend également désormais le modèle en charge nativement.

Original · chinois

这款模型沿用了DeepSeek-V4-Flash的文本能力,同时增加视觉理解。开发者可以通过Chat Completions、Messages和Responses API提交混合的文字与图片,图片则可用Base64、外部URL或Files API提供。办公Agent可以分析页面和表格,开发Agent可以识别界面问题与错误信息,内容生产工具也能根据图片素材辅助生成内容。

Traduction · français

Ce modèle reprend les capacités textuelles de DeepSeek-V4-Flash et y ajoute la compréhension visuelle. Les développeurs peuvent soumettre du texte et des images conjointement via les API Chat Completions, Messages et Responses. Les images peuvent être fournies en Base64, via une URL externe ou avec Files API. Un agent bureautique peut analyser des pages et des tableaux, un agent de développement identifier des problèmes d’interface et des messages d’erreur, tandis qu’un outil de production de contenus peut s’appuyer sur des images pour contribuer à générer du contenu.

Original · chinois

成本仍按token计算,图片会先根据尺寸换算为token,每张最高 384 tokens。输入价格在缓存命中时,闲时为每百万tokens 0.05元、繁忙时段为0.10元;缓存未命中时分别为1.5元3元。输出价格分别为4.5元9元。繁忙时段是北京时间每天9:00至12:00、14:00至18:00,其余时间按闲时价格计算。

Traduction · français

Le coût reste calculé en tokens : les images sont d’abord converties en tokens selon leur taille, à hauteur de 384 tokens au maximum par image. Lorsque le cache est utilisé, le prix d’entrée est de 0,05 yuan par million de tokens pendant les périodes creuses et de 0,10 yuan pendant les périodes chargées ; lorsque le cache n’est pas utilisé, il s’élève respectivement à 1,5 yuan et 3 yuans. Les prix de sortie sont respectivement de 4,5 yuans et 9 yuans. Les périodes chargées correspondent à chaque jour, heure de Pékin, aux créneaux de 9 h à 12 h et de 14 h à 18 h ; le reste du temps est facturé au tarif des périodes creuses.

Original · chinois

重复传图是多轮Agent任务中的实际负担。新推出的Files API允许开发者先上传图片,再用file_id在不同请求中引用同一文件,无需反复上传;它支持JPEG、PNG、GIF和WebP,单个文件最大 64 MiB,单用户最多保存25 GiB10000个文件

Traduction · français

Le renvoi répété d’images constitue une contrainte concrète dans les tâches d’agents en plusieurs étapes. Le nouveau service Files API permet aux développeurs de téléverser d’abord une image, puis de référencer le même fichier dans différentes requêtes avec son file_id, sans devoir le téléverser à nouveau. Il prend en charge les formats JPEG, PNG, GIF et WebP, avec une taille maximale de 64 MiB par fichier, et permet à un utilisateur de conserver au maximum 25 GiB et 10 000 fichiers.

Original · chinois

具体来说,开发者现在可以把图片理解接到已有的办公、开发和内容生产流程里,而不用为每一轮任务重新传输相同素材。官方称,这款模型在多模态Agent基准测试中相比V4-Flash有明显提升,表现接近Opus-4.8等高端模型;但它仍被定义为实验性质模型。

Traduction · français

Concrètement, les développeurs peuvent désormais intégrer la compréhension des images à leurs workflows existants de bureautique, de développement et de production de contenus, sans devoir retransmettre les mêmes éléments à chaque étape. Selon DeepSeek, ce modèle affiche une nette progression par rapport à V4-Flash sur les benchmarks d’agents multimodaux et offre des performances proches de celles de modèles haut de gamme comme Opus-4.8. Il reste toutefois défini comme un modèle expérimental.

Revenir à l’article