DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透

DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透

2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。


一、模型速览

项目

详情

模型名称

DeepSeek-V4-Flash-Vision-Exp

性质

实验性模型

上线日期

2026年8月21日

基于

DeepSeek-V4-Flash 正式版

总参数量

2840 亿(284B),激活参数 130 亿(13B/每 token)

架构

Mixture-of-Experts (MoE)

上下文窗口

1,048,576 tokens(约 100 万)

最大输出

384,000 tokens

默认并发限制

2,500 请求

是否开源

权重未开源

核心能力定位:在纯文本能力(Agent、推理、世界知识等)上与 DeepSeek-V4-Flash 正式版完全持平;在需要视觉理解的 Agent Benchmark 上实现大幅跃升,多模态 Agent 能力已接近 Claude Opus 4.8

简单来说:DeepSeek 不再只是"别人负责看、DeepSeek 负责想",而是变成了"自己看、自己理解、自己推理、自己调用工具完成任务"的完整 Agent 闭环。


二、如何调用 API

2.1 调用入口

只需将 model 参数设置为 deepseek-v4-flash-vision-exp,即可通过 DeepSeek API 调用视觉理解能力。

# 最简调用示例
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_API_KEY"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "请描述这张图片的内容"},
                {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
            ]
        }
    ]
)

print(response.choices[0].message.content)

2.2 三种 API 调用格式

本次多模态 API 同时兼容三种格式,方便接入各类 Agent 工具:

格式

说明

Chat Completions

标准 OpenAI 兼容格式,支持图文混合输入

Messages

Anthropic 兼容格式

Responses

DeepSeek 原生格式

三种格式均支持图文混合输入,在用户消息中同时包含文本和图片即可。

注意:图片只能出现在用户消息中。如果图片出现在 system 或 assistant 消息中,会返回 400 错误。

2.3 三种图片传入方式

方式

说明

适用场景

Base64 内联

将图片编码为 Base64 字符串直接嵌入请求体

小图片、离线环境

外部 URL

提供图片的 HTTP/HTTPS 链接

图片已托管在服务器

Files API

先上传图片获取 file_id,后续请求中引用

同一图片反复使用、省带宽

方式一:Base64 内联

import base64

with open("screenshot.png", "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "分析这张截图中的错误信息"},
            {"type": "image_url", "image_url": {
                "url": f"data:image/png;base64,{img_b64}"
            }}
        ]
    }]
)

方式二:外部 URL

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这个图表说明了什么?"},
            {"type": "image_url", "image_url": {
                "url": "https://cdn.example.com/report-chart.png"
            }}
        ]
    }]
)

方式三:Files API(推荐,完全免费)

# 第一步:上传图片,获取 file_id
upload_response = client.files.create(
    file=open("report-chart.png", "rb"),
    purpose="vision"
)
file_id = upload_response.id  # 例如: "file_abc123"

# 第二步:在请求中引用 file_id
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "分析这张图表的趋势"},
            {"type": "image_url", "image_url": {
                "url": f"file://{file_id}"
            }}
        ]
    }]
)

# 第三步:同一张图片可反复使用,无需重复上传
# 适用于多轮 Agent 工作流中持续处理同一批视觉素材

2.4 支持的文件格式

格式

支持

JPEG

PNG

GIF

WebP

格式检测基于文件的实际内容而非扩展名或 MIME 类型。

2.5 图片输入限制

限制项

内联(Base64/URL)

Files API

单文件大小上限

32 MiB

64 MiB

最大图片边长

8,192 px(≥15 张图时降至 4,096 px)

单请求最多图片数

600 张

请求体大小上限

48 MiB

200 MiB

图片 token 预算

最多 384 tokens/张

同样

重要提示:所有图片会被自动缩放到约 800×800 像素等效分辨率,超过该有效分辨率的细节会被丢弃——这是 384 token 固定预算的直接结果。


三、调用效果:基准测试全面对比

3.1 核心结论

在 11 项基准测试中,DeepSeek-V4-Flash-Vision-Exp 的表现可以概括为:

  • 赢下 3 项(vs Opus 4.8):DeepSWE(+1.3)、Agents' Last Exam(+1.6)、ZeroBench(+1.0)

  • 多项差距在 1-2 分以内:Terminal Bench、Toolathlon-Verified、Chartography、AutomationBench

  • 差距最大的 2 项:NL2Repo(差 12 分)、DSBench-Hard(差 8.1 分)

3.2 完整基准测试数据

文本型 Agent 评估

基准测试

Vision-Exp

Flash-0731

Opus 4.8

Terminal Bench 2.1

83.9

82.7

85.0

NL2Repo

57.7

54.2

69.7

Cybergym

75.3

76.7

78.3

DeepSWE

59.3

54.4

58.0

Toolathlon-Verified

75.9

70.3

76.2

DSBench-Hard

63.6

59.6

71.7

AutomationBench (Public)

25.7

25.1

27.2

多模态 Agent 评估

基准测试

Vision-Exp

Flash-0731

Opus 4.8

ApexBench (Pass@1)

36.5

26.2**

39.4

Agents' Last Exam

27.3

25.2**

25.7

Chartography

64.3

65.0

ZeroBench (Pass@5)

35.0

34.0

** Flash-0731 在这两项多模态基准上是"无视其中包含的多模态元素"进行评分的(纯文本模型盲测),对比不完全对等。

3.3 实际应用场景

官方展示了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力:

  • 商业 PPT 制作:模型可以理解真实摄影图片风格、"野性""原始""探索感"等抽象风格化要求

  • 网站视觉重构:对 DeepSeek Harness 官网进行二次创作

  • 前端 Mini Demo:制作黏土怪物风格动态特效的前端 Mini Demo

  • 图片内容描述:自然语言描述图片内容

  • 截图文字识别(OCR):识别截图中的文字

  • 图表分析:解析图表数据并给出洞察


四、中间层架构详解:DeepSeek Harness 0.1.1

多模态 API 的上线并非孤立事件,DeepSeek 同日发布了 Harness v0.1.1-rc.1 版本更新,这是整个多模态生态的"中间层"——连接开发者与模型能力的关键桥梁。

4.1 版本迭代历程

自开发者预览版 v0.1.0-rc.6 首日发布以来,DeepSeek Harness 已连续完成三次版本更新

版本

核心内容

v0.1.0-rc.7

多模态核心能力开放

v0.1.0-rc.8

多模态基础支持

v0.1.1-rc.1

原生图片请求、多模态模型选项、持久化附件

4.2 多模态能力增强

功能

说明

模型适配器

新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,支持配置原生图片请求

/goal、/plan 命令

从纯文本升级为支持图文混合输入

@ 菜单

从仅引用文件扩展为可引用文件和历史会话

MCP/ACP 附件持久化

图片附件在多次调用间保持,不会随单次调用结束而消失

PTC Mode

支持转发嵌套图片

4.3 子代理与插件架构

功能

说明

Codex 与 Claude Code

从捆绑分发改为按需安装的 Profile Bundle

Codex 非交互权限模式

支持在无人值守流程中运行

Codex 多命名实例

允许同时运行多个配置不同、名称各异的子智能体

回报路径优化

reportDelivery 及时反馈并唤醒父任务,消除盲目等待

插件注册

插件可自行注册设置卡片,能力扩展与任务管理更便捷

4.4 稳定性与性能优化

项目

说明

web_search

支持并发查询

Windows PTY

正式加入持久 PowerShell 会话支持,极简模式默认开启

SQLite 后端

读写和分叉性能显著提升,存储体积降低

修复项

长会话、终端兼容、模型请求、沙箱权限等问题

交互细节

提问卡片、Markdown 表格、多行输入、会话切换优化

4.5 架构关系图


五、价格:一张图不到 1 分钱

5.1 计费方式

图片会转换为 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 DeepSeek-V4-Flash 完全一致。

5.2 价格表(每百万 tokens)

费率

非高峰时段

高峰时段

输入(缓存未命中)

$0.22

$0.44

输入(缓存命中)

$0.007

$0.014

输出

$0.66

$1.32

高峰时段:UTC 时间 01:00–04:00 和 06:00–10:00

5.3 换算成"每张图"

场景

单张图片成本

非高峰,缓存未命中

$0.000084(不到 1 美分)

高峰时段最高

0.001152 元(不到 0.002 元)

5.4 Files API

项目

详情

费用

完全免费

单文件上限

64 MiB

总存储容量

约 25 GiB

核心价值

同一张图片无需重复上传,省带宽


六、注意事项

  1. 实验性质:该模型为实验性版本,能力可能随后续迭代调整

  2. 权重未开源:不同于 V4-Flash-0731 和 V4-Pro 0813,Vision-Exp 权重未公开

  3. 图片分辨率:所有图片会被自动缩放到约 800×800 像素等效,超过此分辨率的细节会丢失

  4. 基准测试:所有对比数据来自 DeepSeek 内部跑分(DeepSeek Harness Minimal Mode),尚无独立实验室复现

  5. 费率变动:非高峰费率较 7 月 31 日 V4-Flash-0731 发布时($0.14/$0.28)有所上涨


七、总结

DeepSeek-V4-Flash-Vision-Exp 的上线标志着 DeepSeek 正式进入多模态 Agent 赛道。核心亮点可以概括为三句话:

  • 能力:文本能力不降级,视觉能力逼近 Opus 4.8

  • 价格:一张图不到 1 分钱,Files API 免费

  • 生态:Harness 中间层同步更新,Agent 框架开箱即用

对于开发者来说,现在就可以用 model="deepseek-v4-flash-vision-exp" 开始接入多模态能力,无需等待正式版。

阿里云通义千问正式开源 Qwen3.8-27B:性能与成本的黄金平衡点 2026-08-16
Agent 安全新范式——从权限到Authority:当权限不再是终点,"能不能发生"成为新命题 2026-08-23

评论区