8月21日,DeepSeek正式为V4-Flash补上了“眼睛”:多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp已上线并开放API。不过,目前该模型仍处于实验版本阶段,用户在调用时需要手动指定模型名称(deepseek-v4-flash-vision-exp)才能访问。本次最新发布暂未提及网页端和App端何时开放。
这款新模型能够识别截图中的文字内容、理解图表信息和页面布局,还可以在同一次任务中同时处理图片与文本指令。这意味着,智能体不再需要依赖人工“用文字描述图片”来完成任务。对于需要浏览网页、解析界面、整理图文资料的Agent应用来说,这次更新补齐了关键的多模态能力。
与Opus 4.8互有胜负
DeepSeek公布的对比测试数据显示,V4-Flash-Vision-Exp在多个Agent基准测试(benchmark)中,与Anthropic旗下Claude Opus 4.8整体表现接近、各有优势:
领先项目:DeepSWE(59.3 vs 58.0)、Agents' Last Exam(27.3 vs 25.7)、ZeroBench(35.0 vs 34.0)追平项目:Terminal Bench 2.1(83.9 vs 85.0)、Toolathlon-Verified(75.9 vs 76.2)、Chartography(64.3 vs 65.0)落后项目:NL2Repo(57.7 vs 69.7)、DSBench-Hard(63.6 vs 71.7),分差约为8-12分
如果与自家的文本版DeepSeek V4-Flash-0731相比,视觉版在纯文本任务上的表现基本持平,但在需要图像理解的多模态测试中优势明显:ApexBench从26.2提升至36.5,Agents' Last Exam从25.2提升到27.3。也就是说,视觉能力的加入并未削弱原有文本能力,这正是此次实验版最值得关注的核心信号。
视觉不是用来“看图说话”
这次发布的三个官方演示,并不是简单的识图问答或基础视觉任务:第一个案例是为高净值客户制作西藏自驾游PPT,要求整体风格呈现野性、粗粝且具备真实拍摄质感;第二个案例是围绕黑蓝深海、玻璃UI、ASCII像素等视觉元素,对DeepSeek Harness进行正式重构;第三个案例则是生成带有黏土怪物动态效果的网页Demo。

这三个案例的共同点在于:模型不仅要先看懂图片内容、页面结构和设计意图,还要进一步调用工具生成PPT或代码。DeepSeek想展示的重点,并不是单纯“能看图”,而是将多模态视觉理解能力真正嵌入完整的Agent工作流之中。
API与计费
在API层面,DeepSeek-V4-Flash-Vision-Exp支持三种主流调用格式(Chat Completions、Messages、Responses),图片可通过链接、Base64编码,或先上传后引用的方式传入。系统会将图片转换为token进行计费,单张图片最多折算384 tokens,并与文字输入采用统一定价,整体价格与文本版V4-Flash保持一致。
与此同时,Files API也已同步上线。用户可以先将图片上传到平台,随后在多次请求中通过file_id重复调用,从而避免反复上传相同文件。该接口本身免费,但模型在每次处理图片时产生的token费用仍会正常计费。对于需要反复分析同一批截图、图表的工作流来说,这项功能节省的主要是带宽与传输成本,而不是模型推理成本。(易句)
(本文由AI撰文,网易编辑负责校对)
