Thursday, 27 August 2026

Aube.

News of progress
PrototypeSingle source

DeepSeek上线实验性视觉模型

Languages for this article
Original · 中文ENFR

Originally written in Chinese. 3 languages available; yours is one click away.

当一个Agent不再只读文字,它才开始碰到真实工作的入口:截图、文档页面、表格和错误信息。DeepSeek近日在API平台上线实验性多模态模型 deepseek-v4-flash-vision-exp,让现有Agent工作流可以接收图片;DeepSeek Harness 0.1.1也已加入原生支持。

这款模型沿用了DeepSeek-V4-Flash的文本能力,同时增加视觉理解。开发者可以通过Chat Completions、Messages和Responses API提交混合的文字与图片,图片则可用Base64、外部URL或Files API提供。办公Agent可以分析页面和表格,开发Agent可以识别界面问题与错误信息,内容生产工具也能根据图片素材辅助生成内容。

成本仍按token计算,图片会先根据尺寸换算为token,每张最高 384 tokens。输入价格在缓存命中时,闲时为每百万tokens 0.05元、繁忙时段为0.10元;缓存未命中时分别为1.5元3元。输出价格分别为4.5元9元。繁忙时段是北京时间每天9:00至12:00、14:00至18:00,其余时间按闲时价格计算。

重复传图是多轮Agent任务中的实际负担。新推出的Files API允许开发者先上传图片,再用file_id在不同请求中引用同一文件,无需反复上传;它支持JPEG、PNG、GIF和WebP,单个文件最大 64 MiB,单用户最多保存25 GiB10000个文件

具体来说,开发者现在可以把图片理解接到已有的办公、开发和内容生产流程里,而不用为每一轮任务重新传输相同素材。官方称,这款模型在多模态Agent基准测试中相比V4-Flash有明显提升,表现接近Opus-4.8等高端模型;但它仍被定义为实验性质模型。

384 tokens单张图片最高换算的计费token数量

Sources — read the originals(Paris time)

爱范儿ZH
0000

Read next

Comments

Loading the thread…

Sign in to leave a comment. Sign in