8月21日消息,今日,全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。该模型目前为实验版本,开发者和用户可通过设置 model='deepseek-v4-flash-vision-exp' 来调用和体验这一模型能力。
兼顾文本处理与多模态视觉理解能力
官方介绍显示,在纯文本能力方面,例如 Agent、逻辑推理、世界知识等场景,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版表现基本持平;而在需要图像识别与视觉理解的 Agent Benchmark 测试中,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了明显提升,其多模态 Agent 综合能力已接近 Opus-4.8。

API 功能支持

如需访问 V4-Flash-Vision-Exp 模型的 API,用户可直接设置 model='deepseek-v4-flash-vision-exp'。在 API 服务中,图片内容会被转换为 token,并按照 token 数量进行计费;单张图片最多占用 384 个 tokens,计费标准与 V4-Flash 模型保持一致。
目前,多模态 API 支持 Chat Completions、Messages、Responses 三种调用格式,便于快速接入各类 Agent 工具与应用场景。与此同时,该接口支持图文混合输入,并兼容 base64 内联、外部 URL、Files API 三种图片传输方式,满足不同开发需求。
Files API 正式上线

Files API 现已开放使用,且该 API 本身不额外收费。用户可以先将图片上传至平台,再在后续请求中通过 file_id 进行引用,从而有效节省请求带宽;对于同一张图片在多个请求中重复使用的场景,也无需反复上传,能够提升调用效率。
