DeepSeek-V4-Flash-Vision-Exp API 指南 2026
**DeepSeek 于 2026 年 8 月 21 日上线首个官方多模态 API 模型 deepseek-v4-flash-vision-exp。**它在 DeepSeek V4 Flash 的文本、推理与 Agent 能力上增加图片理解,提供 1M 上下文、最大 384K 输出,单张图片最高计入 384 Tokens,官方直连 API 与 deepseek-v4-flash 同价。
模型名中的 exp 代表 experimental。它已经可通过 DeepSeek 官方 API 调用,但仍是实验型路由,不应被写成长期稳定版。本文将 DeepSeek 官方规格与厂商跑分、第三方案例 和 本站路由状态 分开说明:截至 2026 年 8 月 22 日复核时,本站公开价格目录尚未列出该新 ID,因此本文不猜测本站倍率。
**先看实时路由:**请在模型价格确认
deepseek-v4-flash-vision-exp是否已出现,再从API 购买页开通小额余额。模型可用性与扣费以请求当时的实时目录和账单为准。
DeepSeek-V4-Flash-Vision-Exp 核心数据
| 项目 | 官方已公布信息 |
|---|---|
| 发布日期 | 2026 年 8 月 21 日 |
| 准确模型 ID | deepseek-v4-flash-vision-exp |
| 发布状态 | 实验型多模态 API 模型 |
| 上下文窗口 | 1M Tokens |
| 最大输出 | 384K Tokens |
| 图片 Token | 按尺寸换算,每张最高 384 Tokens |
| 单次最多图片 | 600 张 |
| 输入格式 | 文本 + 图片;base64、外部 URL、Files API file_id |
| API 格式 | Chat Completions、Anthropic Messages、Responses API |
| 工具调用 | 支持 |
| 思考模式 | 支持非思考与思考模式,默认思考 |
| FIM 补全 | 不支持 |
| 官方并发上限 | 2500 |

图源:DeepSeek 官方 2026-08-21 发布稿。表中成绩是厂商公布的评测结果,不是本站独立复测。
跑分怎么看:接近 Opus-4.8,但不是“全面超越”
DeepSeek 官方称,V4-Flash-Vision-Exp 在多模态 Agent 基准上相比 V4 Flash 明显跃升,整体表现接近 Opus-4.8。这一定位有官方跑分支撑,但逐项数据显示的是“互有胜负”,不是全项领先。
| 基准 | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp 在 DeepSWE、Agents' Last Exam 和 ZeroBench 这三项高于图中的 Opus-4.8,在 Terminal Bench、NL2Repo、DSBench-Hard 等项目仍落后。它在上表 9 个可与 V4-Flash-0731 直接对比的项目中有 8 项更高,只有 Cybergym 更低。
需要注意评测条件:DeepSeek 系列的公开 Code Agent 文本任务使用 DeepSeek Harness Minimal Mode,将最大输出设到上限,top_p=0.95、temperature=1.0。ApexBench 和 Agents' Last Exam 中,纯文本 V4 Flash 会忽略测试中的多模态元素,因此两者并不是完全同等条件下的视觉模型对比。
384 Tokens 一张图,真实成本是多少?
DeepSeek 会根据图片尺寸进行缩放和分块,然后将图片换算为输入 Tokens。单张图片的上限是 384 Tokens;多图请求中每张图独立计算,没有共享的总 Token 封顶。
官方人民币价格表中,Vision-Exp 与 V4 Flash 同价:
| 官方直连 API | 空闲时段 | 高峰时段 |
|---|---|---|
| 缓存命中输入 / 百万 Tokens | ¥0.05 | ¥0.10 |
| 缓存未命中输入 / 百万 Tokens | ¥1.50 | ¥3.00 |
| 输出 / 百万 Tokens | ¥4.50 | ¥9.00 |
按“单图达到 384 Tokens,且作为缓存未命中输入”的保守方式计算,1000 张图片的纯图片输入成本约为:
- 空闲时段:
384 × 1000 × ¥1.50 / 1,000,000 = ¥0.576 - 高峰时段:
384 × 1000 × ¥3.00 / 1,000,000 = ¥1.152
这只是图片输入部分,不包含文本输入、模型输出、工具循环和重试。“一千张图约一元”只在每张都达到上限、高峰期缓存未命中、且只计图片输入时成立。本文不沿用未经同口径复核的“比其他模型便宜 25 倍或 50 倍”说法。
DeepSeek 英文官方价格页同时列出美元口径:缓存未命中输入为 $0.22/M(空闲)和 $0.44/M(高峰),输出为 $0.66/M 和 $1.32/M。美元与人民币页是不同计费地区的官方标价,不应当成实时汇率换算。
**用真实账单验证:**如果本站实时目录已出现新模型,可以为现有 Key 小额充值,用一张低风险测试图片核对输入 Tokens、输出 Tokens 和实际扣费。
三种图片输入方式
1. Base64 内联
将 JPEG、PNG、GIF 或 WebP 编码成 data URL,适合小图和不能对外公开的临时图片。内联请求体总上限为 48 MiB,单图上限 32 MiB。
2. 外部 URL
传入可公开下载的 HTTP(S) 图片 URL。官方要求单图不超过 32 MiB,且在 60 秒内完成下载。不要使用需要 Cookie、内网登录或短时效签名的 URL,除非你已验证实际路由能稳定读取。
3. Files API file_id
先上传图片,再在多次请求中复用 file_id。官方 Files API 免费,支持单文件最大 64 MiB,可设置 1 小时到 30 天的过期时间,也可不设自动过期。对需要反复检查同一张设计稿、报表或页面截图的 Agent,这能减少每轮重复上传的请求带宽;图片 Tokens 仍会按官方规则计费。
Chat Completions 图片调用示例
以下是直连 DeepSeek 官方 OpenAI 兼容接口的最小示例:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "读取这张页面截图,列出主要区块、颜色和响应式风险。"},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
图片可以与文本混合,也可同时传入多张图。在 Responses API 中使用 input_image,Anthropic Messages 格式则可以通过 https://api.deepseek.com/anthropic 调用。不同协议的内容块字段不同,不要把 Chat 请求体原样复制到 Responses 或 Messages。
如果通过本站网关调用,必须先在实时模型目录确认该 ID 已开放,再将 Base URL 和认证方式替换为本站说明。不要仅因为 DeepSeek 官方已上线,就假设所有第三方网关已同步路由、图片转发和计费。
从素材中提炼的实用场景
你提供的中文案例主要展示了两类工作流:把网页截图还原为可运行的 HTML,以及把模糊商业需求整理为一份 B 端提案。这些属于第三方展示,不是本站独立复测;但它们能很好地说明多模态 Agent 的实用价值。
截图到 HTML
模型需要先识别布局、层级、色值、字号、间距和图片位置,再结合代码工具生成 HTML/CSS/JS。评估时应比较像素级差异、375px 窄屏、键盘焦点、hover 和动画降级,而不是只看一张最终截图。
报表、演示文稿与设计稿分析
它可以读取图表、OCR 文字、视觉风格和页面结构,再交给文档、幻灯片或编程工具生成产物。实际质量仍取决于 Agent 框架、可用工具、图片素材和验收流程,不能把“模型能看图”等同于“自动产出可交付 PPT”。
视觉化 Agent 验收
对网页、桌面软件和工作流自动化,可让 Agent 在关键步骤读取截图,将界面状态与预期状态对照。单图 Token 上限降低了重复视觉检查的输入成本,但每轮的模型输出和工具调用仍需计入总预算。
如果任务不需要图片,可先对比DeepSeek V4 Flash 与 Responses API 指南;对更高难度的纯文本推理和代码任务,也可参考 DeepSeek-V4-Pro-0813 API 指南。不要仅因为 Vision-Exp 是新模型,就将所有纯文本流量全量切换。
不要混淆:看图不等于生图
deepseek-v4-flash-vision-exp 的官方文档定位是“接收文本与图片,描述图片、读取截图文字、分析图表”。它不是官方文档中的图像生成模型。
当 Agent 复刻网页或制作 PPT 时,页面中的图片可能来自输入素材、外部图库、代码绘制、另一个图像生成工具,或 Agent 运行环境中的文件。不能仅根据最终作品里“有图”,就推断 Vision-Exp 自己生成了图片。
生产接入检查清单
- 使用准确 ID
deepseek-v4-flash-vision-exp,不自行缩写或猜测日期别名。 - 确认当前供应商或网关的实时目录已出现该 ID。
- 分别测试 base64、外部 URL 和 Files API,不假设三种输入在每个网关都已打通。
- 使用不含个人隐私、密钥、内网地址和客户数据的小图做 Smoke Test。
- 记录输入图片数、图片 Tokens、文本 Tokens、输出 Tokens、延迟和扣费。
- 对 OCR、图表、布局和小文字分别建立可评分的验收集,不只看“大概说对了”。
- 为工具调用、外部网络、写文件、删除、发布和付款保留权限边界。
- 为实验型路由准备回退到
deepseek-v4-flash、deepseek-v4-pro或其他视觉模型的方案。
关键结论
deepseek-v4-flash-vision-exp是 DeepSeek 已上线的实验型多模态 API 模型,不是生图模型。- 它提供 1M 上下文和最大 384K 输出,单图最高换算为 384 Tokens。
- 它支持 Chat Completions、Anthropic Messages 和 Responses API,可用 base64、URL 或 Files API 传图。
- DeepSeek 官方称多模态 Agent 表现接近 Opus-4.8;逐项数据显示它有三项领先、也有多项落后。
- 官方直连 API 与 V4 Flash 同价,但第三方网关的倍率和能力必须单独验证。
- 它是 experimental 路由,不建议在没有验收、限额与回退方案的情况下直接替换生产默认模型。
常见问题
DeepSeek-V4-Flash-Vision-Exp 正式上线了吗?
是。DeepSeek 于 2026 年 8 月 21 日将它上线官方 API 平台。它的状态是 experimental,不等于已经成为长期稳定版。
准确的模型 ID 是什么?
使用 deepseek-v4-flash-vision-exp。不要使用文章标题里的大写展示名称代替 API ID。
一张图片固定是 384 Tokens 吗?
不是。384 是单张图片的上限。实际 Tokens 由图片尺寸和官方缩放、分块规则决定;多张图会逐张计算。
Vision-Exp 会生成图片吗?
官方文档只确认图片理解、OCR、截图和图表分析等输入能力,没有将它列为图像生成模型。复刻网页中出现图片,也可能来自素材、绘图代码或其他工具。
它比 DeepSeek V4 Flash 强多少?
官方图表的 9 个可直接对比项目中,Vision-Exp 有 8 项高于 V4-Flash-0731,Cybergym 一项更低。这只代表官方评测集,不代表每个文本或仓库任务都会变强。
可以用 Files API 重复使用同一张图吗?
可以。上传后可以在多次请求中引用 file_id,避免重复上传文件。Files API 本身免费,但图片进入模型时仍按图片 Tokens 计费。
它可以直接接入 Codex 吗?
官方确认它支持 Responses API,但 Codex 或其他 Agent 能否传递图片,还取决于客户端版本、内容块格式和网关能力。请分别验证纯文本、图片输入和工具回传。
本站的 Vision-Exp 倍率是多少?
截至 2026 年 8 月 22 日本文复核时,本站公开价格目录还没有列出该 ID,因此不应推断其与本站 deepseek-v4-flash 的倍率相同。请查看实时模型价格。
主要来源
- DeepSeek:Vision-Exp 正式发布:发布日期、模型 ID、多模态定位、官方跑分、API 格式和 Harness 0.1.1
- DeepSeek:图片理解指南:图片输入方式、Token 换算、格式、尺寸与数量限制
- DeepSeek:模型与价格:1M 上下文、384K 输出、分时价格、2500 并发与功能表
- DeepSeek:Files API:上传、
file_id、文件大小与过期设置 - DeepSeek 官方 X 公告:发布公告原始链接