2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。
一、模型速览
核心能力定位:在纯文本能力(Agent、推理、世界知识等)上与 DeepSeek-V4-Flash 正式版完全持平;在需要视觉理解的 Agent Benchmark 上实现大幅跃升,多模态 Agent 能力已接近 Claude Opus 4.8。
简单来说:DeepSeek 不再只是"别人负责看、DeepSeek 负责想",而是变成了"自己看、自己理解、自己推理、自己调用工具完成任务"的完整 Agent 闭环。
二、如何调用 API
2.1 调用入口
只需将 model 参数设置为 deepseek-v4-flash-vision-exp,即可通过 DeepSeek API 调用视觉理解能力。
# 最简调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com",
api_key="YOUR_API_KEY"
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片的内容"},
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
]
}
]
)
print(response.choices[0].message.content)
2.2 三种 API 调用格式
本次多模态 API 同时兼容三种格式,方便接入各类 Agent 工具:
三种格式均支持图文混合输入,在用户消息中同时包含文本和图片即可。
注意:图片只能出现在用户消息中。如果图片出现在 system 或 assistant 消息中,会返回 400 错误。
2.3 三种图片传入方式
方式一:Base64 内联
import base64
with open("screenshot.png", "rb") as f:
img_b64 = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "分析这张截图中的错误信息"},
{"type": "image_url", "image_url": {
"url": f"data:image/png;base64,{img_b64}"
}}
]
}]
)
方式二:外部 URL
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这个图表说明了什么?"},
{"type": "image_url", "image_url": {
"url": "https://cdn.example.com/report-chart.png"
}}
]
}]
)
方式三:Files API(推荐,完全免费)
# 第一步:上传图片,获取 file_id
upload_response = client.files.create(
file=open("report-chart.png", "rb"),
purpose="vision"
)
file_id = upload_response.id # 例如: "file_abc123"
# 第二步:在请求中引用 file_id
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "分析这张图表的趋势"},
{"type": "image_url", "image_url": {
"url": f"file://{file_id}"
}}
]
}]
)
# 第三步:同一张图片可反复使用,无需重复上传
# 适用于多轮 Agent 工作流中持续处理同一批视觉素材
2.4 支持的文件格式
格式检测基于文件的实际内容而非扩展名或 MIME 类型。
2.5 图片输入限制
重要提示:所有图片会被自动缩放到约 800×800 像素等效分辨率,超过该有效分辨率的细节会被丢弃——这是 384 token 固定预算的直接结果。
三、调用效果:基准测试全面对比
3.1 核心结论
在 11 项基准测试中,DeepSeek-V4-Flash-Vision-Exp 的表现可以概括为:
赢下 3 项(vs Opus 4.8):DeepSWE(+1.3)、Agents' Last Exam(+1.6)、ZeroBench(+1.0)
多项差距在 1-2 分以内:Terminal Bench、Toolathlon-Verified、Chartography、AutomationBench
差距最大的 2 项:NL2Repo(差 12 分)、DSBench-Hard(差 8.1 分)
3.2 完整基准测试数据
文本型 Agent 评估
多模态 Agent 评估
** Flash-0731 在这两项多模态基准上是"无视其中包含的多模态元素"进行评分的(纯文本模型盲测),对比不完全对等。
3.3 实际应用场景
官方展示了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力:
商业 PPT 制作:模型可以理解真实摄影图片风格、"野性""原始""探索感"等抽象风格化要求
网站视觉重构:对 DeepSeek Harness 官网进行二次创作
前端 Mini Demo:制作黏土怪物风格动态特效的前端 Mini Demo
图片内容描述:自然语言描述图片内容
截图文字识别(OCR):识别截图中的文字
图表分析:解析图表数据并给出洞察
四、中间层架构详解:DeepSeek Harness 0.1.1
多模态 API 的上线并非孤立事件,DeepSeek 同日发布了 Harness v0.1.1-rc.1 版本更新,这是整个多模态生态的"中间层"——连接开发者与模型能力的关键桥梁。
4.1 版本迭代历程
自开发者预览版 v0.1.0-rc.6 首日发布以来,DeepSeek Harness 已连续完成三次版本更新:
4.2 多模态能力增强
4.3 子代理与插件架构
4.4 稳定性与性能优化
4.5 架构关系图

五、价格:一张图不到 1 分钱
5.1 计费方式
图片会转换为 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 DeepSeek-V4-Flash 完全一致。
5.2 价格表(每百万 tokens)
高峰时段:UTC 时间 01:00–04:00 和 06:00–10:00
5.3 换算成"每张图"
5.4 Files API
六、注意事项
实验性质:该模型为实验性版本,能力可能随后续迭代调整
权重未开源:不同于 V4-Flash-0731 和 V4-Pro 0813,Vision-Exp 权重未公开
图片分辨率:所有图片会被自动缩放到约 800×800 像素等效,超过此分辨率的细节会丢失
基准测试:所有对比数据来自 DeepSeek 内部跑分(DeepSeek Harness Minimal Mode),尚无独立实验室复现
费率变动:非高峰费率较 7 月 31 日 V4-Flash-0731 发布时($0.14/$0.28)有所上涨
七、总结
DeepSeek-V4-Flash-Vision-Exp 的上线标志着 DeepSeek 正式进入多模态 Agent 赛道。核心亮点可以概括为三句话:
能力:文本能力不降级,视觉能力逼近 Opus 4.8
价格:一张图不到 1 分钱,Files API 免费
生态:Harness 中间层同步更新,Agent 框架开箱即用
对于开发者来说,现在就可以用 model="deepseek-v4-flash-vision-exp" 开始接入多模态能力,无需等待正式版。