8 月 21 日消息,深度求索官方刚刚宣布,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已正式上线 DeepSeek API 平台。

该模型在文本输入之外还支持图片输入,能够实现图片内容描述、截图文字识别、图表分析等视觉理解任务。当前支持的图片格式包括 JPEG、PNG、GIF 和 WebP。
深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架中展现出出色的多模态适配能力,可有效帮助开发者结合多样化的 Agent 工具,拓展更多实际应用场景与工作流程。
需要注意的是,这是一款实验性质的模型,用户可通过设置 model='deepseek-v4-flash-vision-exp' 来访问并调用该模型。
平衡文本与多模态能力
据了解,在纯文本能力方面,包括 Agent、推理、世界知识等维度,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版整体表现相当。不过,在需要视觉理解能力的 Agent Benchmark 测试中,DeepSeek-V4-Flash-Vision-Exp 实现了明显提升,其多模态 Agent 能力已接近 Opus-4.8。
API 支持
如果要访问 V4-Flash-Vision-Exp 模型 API,用户只需将 model 参数设置为 'deepseek-v4-flash-vision-exp'。在这项 API 服务中,图片会被转换为 token,并根据 token 数量计费。需要注意的是,单张图片最多占用 384 个 tokens,且计费价格与 V4-Flash 模型保持一致。
多模态 API 支持 Chat Completions、Messages、Responses 三种调用格式,可便捷接入各类 Agent 工具使用,支持图文混合输入,并提供 base64 内联、外部 URL、Files API 三种图片传入方式。
Files API 上线
Files API 现已开放使用,该 API 本身不收费。用户可以先将图片上传至平台,再在请求中通过 file_id 进行引用,从而节省请求带宽;同一张图片在多个请求场景下也无需重复上传。
