返回博客列表

DeepSeek-V4-Flash-Vision-Exp API 指南 2026

DeepSeek V4 Flash VisionDeepSeek API多模态 AgentVision APIResponses API

**DeepSeek 于 2026 年 8 月 21 日上线首个官方多模态 API 模型 deepseek-v4-flash-vision-exp。**它在 DeepSeek V4 Flash 的文本、推理与 Agent 能力上增加图片理解,提供 1M 上下文、最大 384K 输出,单张图片最高计入 384 Tokens,官方直连 API 与 deepseek-v4-flash 同价。

模型名中的 exp 代表 experimental。它已经可通过 DeepSeek 官方 API 调用,但仍是实验型路由,不应被写成长期稳定版。本文将 DeepSeek 官方规格与厂商跑分第三方案例本站路由状态 分开说明:截至 2026 年 8 月 22 日复核时,本站公开价格目录尚未列出该新 ID,因此本文不猜测本站倍率。

**先看实时路由:**请在模型价格确认 deepseek-v4-flash-vision-exp 是否已出现,再从API 购买页开通小额余额。模型可用性与扣费以请求当时的实时目录和账单为准。

DeepSeek-V4-Flash-Vision-Exp 核心数据

项目 官方已公布信息
发布日期 2026 年 8 月 21 日
准确模型 ID deepseek-v4-flash-vision-exp
发布状态 实验型多模态 API 模型
上下文窗口 1M Tokens
最大输出 384K Tokens
图片 Token 按尺寸换算,每张最高 384 Tokens
单次最多图片 600 张
输入格式 文本 + 图片;base64、外部 URL、Files API file_id
API 格式 Chat Completions、Anthropic Messages、Responses API
工具调用 支持
思考模式 支持非思考与思考模式,默认思考
FIM 补全 不支持
官方并发上限 2500

DeepSeek 官方 DeepSeek-V4-Flash-Vision-Exp 与 V4 Flash、Opus-4.8 基准对比

图源:DeepSeek 官方 2026-08-21 发布稿。表中成绩是厂商公布的评测结果,不是本站独立复测。

跑分怎么看:接近 Opus-4.8,但不是“全面超越”

DeepSeek 官方称,V4-Flash-Vision-Exp 在多模态 Agent 基准上相比 V4 Flash 明显跃升,整体表现接近 Opus-4.8。这一定位有官方跑分支撑,但逐项数据显示的是“互有胜负”,不是全项领先。

基准 Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83.9 82.7 85.0
NL2Repo 57.7 54.2 69.7
Cybergym 75.3 76.7 78.3
DeepSWE 59.3 54.4 58.0
Toolathlon-Verified 75.9 70.3 76.2
DSBench-Hard 63.6 59.6 71.7
AutomationBench (Public) 25.7 25.1 27.2
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 65.0
ZeroBench (Pass@5) 35.0 34.0

Vision-Exp 在 DeepSWE、Agents' Last Exam 和 ZeroBench 这三项高于图中的 Opus-4.8,在 Terminal Bench、NL2Repo、DSBench-Hard 等项目仍落后。它在上表 9 个可与 V4-Flash-0731 直接对比的项目中有 8 项更高,只有 Cybergym 更低。

需要注意评测条件:DeepSeek 系列的公开 Code Agent 文本任务使用 DeepSeek Harness Minimal Mode,将最大输出设到上限,top_p=0.95temperature=1.0。ApexBench 和 Agents' Last Exam 中,纯文本 V4 Flash 会忽略测试中的多模态元素,因此两者并不是完全同等条件下的视觉模型对比。

384 Tokens 一张图,真实成本是多少?

DeepSeek 会根据图片尺寸进行缩放和分块,然后将图片换算为输入 Tokens。单张图片的上限是 384 Tokens;多图请求中每张图独立计算,没有共享的总 Token 封顶。

官方人民币价格表中,Vision-Exp 与 V4 Flash 同价:

官方直连 API 空闲时段 高峰时段
缓存命中输入 / 百万 Tokens ¥0.05 ¥0.10
缓存未命中输入 / 百万 Tokens ¥1.50 ¥3.00
输出 / 百万 Tokens ¥4.50 ¥9.00

按“单图达到 384 Tokens,且作为缓存未命中输入”的保守方式计算,1000 张图片的纯图片输入成本约为:

  • 空闲时段:384 × 1000 × ¥1.50 / 1,000,000 = ¥0.576
  • 高峰时段:384 × 1000 × ¥3.00 / 1,000,000 = ¥1.152

这只是图片输入部分,不包含文本输入、模型输出、工具循环和重试。“一千张图约一元”只在每张都达到上限、高峰期缓存未命中、且只计图片输入时成立。本文不沿用未经同口径复核的“比其他模型便宜 25 倍或 50 倍”说法。

DeepSeek 英文官方价格页同时列出美元口径:缓存未命中输入为 $0.22/M(空闲)和 $0.44/M(高峰),输出为 $0.66/M 和 $1.32/M。美元与人民币页是不同计费地区的官方标价,不应当成实时汇率换算。

**用真实账单验证:**如果本站实时目录已出现新模型,可以为现有 Key 小额充值,用一张低风险测试图片核对输入 Tokens、输出 Tokens 和实际扣费。

三种图片输入方式

1. Base64 内联

将 JPEG、PNG、GIF 或 WebP 编码成 data URL,适合小图和不能对外公开的临时图片。内联请求体总上限为 48 MiB,单图上限 32 MiB。

2. 外部 URL

传入可公开下载的 HTTP(S) 图片 URL。官方要求单图不超过 32 MiB,且在 60 秒内完成下载。不要使用需要 Cookie、内网登录或短时效签名的 URL,除非你已验证实际路由能稳定读取。

3. Files API file_id

先上传图片,再在多次请求中复用 file_id。官方 Files API 免费,支持单文件最大 64 MiB,可设置 1 小时到 30 天的过期时间,也可不设自动过期。对需要反复检查同一张设计稿、报表或页面截图的 Agent,这能减少每轮重复上传的请求带宽;图片 Tokens 仍会按官方规则计费。

Chat Completions 图片调用示例

以下是直连 DeepSeek 官方 OpenAI 兼容接口的最小示例:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "读取这张页面截图,列出主要区块、颜色和响应式风险。"},
        {"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
      ]
    }]
  }'

图片可以与文本混合,也可同时传入多张图。在 Responses API 中使用 input_image,Anthropic Messages 格式则可以通过 https://api.deepseek.com/anthropic 调用。不同协议的内容块字段不同,不要把 Chat 请求体原样复制到 Responses 或 Messages。

如果通过本站网关调用,必须先在实时模型目录确认该 ID 已开放,再将 Base URL 和认证方式替换为本站说明。不要仅因为 DeepSeek 官方已上线,就假设所有第三方网关已同步路由、图片转发和计费。

从素材中提炼的实用场景

你提供的中文案例主要展示了两类工作流:把网页截图还原为可运行的 HTML,以及把模糊商业需求整理为一份 B 端提案。这些属于第三方展示,不是本站独立复测;但它们能很好地说明多模态 Agent 的实用价值。

截图到 HTML

模型需要先识别布局、层级、色值、字号、间距和图片位置,再结合代码工具生成 HTML/CSS/JS。评估时应比较像素级差异、375px 窄屏、键盘焦点、hover 和动画降级,而不是只看一张最终截图。

报表、演示文稿与设计稿分析

它可以读取图表、OCR 文字、视觉风格和页面结构,再交给文档、幻灯片或编程工具生成产物。实际质量仍取决于 Agent 框架、可用工具、图片素材和验收流程,不能把“模型能看图”等同于“自动产出可交付 PPT”。

视觉化 Agent 验收

对网页、桌面软件和工作流自动化,可让 Agent 在关键步骤读取截图,将界面状态与预期状态对照。单图 Token 上限降低了重复视觉检查的输入成本,但每轮的模型输出和工具调用仍需计入总预算。

如果任务不需要图片,可先对比DeepSeek V4 Flash 与 Responses API 指南;对更高难度的纯文本推理和代码任务,也可参考 DeepSeek-V4-Pro-0813 API 指南。不要仅因为 Vision-Exp 是新模型,就将所有纯文本流量全量切换。

不要混淆:看图不等于生图

deepseek-v4-flash-vision-exp 的官方文档定位是“接收文本与图片,描述图片、读取截图文字、分析图表”。它不是官方文档中的图像生成模型。

当 Agent 复刻网页或制作 PPT 时,页面中的图片可能来自输入素材、外部图库、代码绘制、另一个图像生成工具,或 Agent 运行环境中的文件。不能仅根据最终作品里“有图”,就推断 Vision-Exp 自己生成了图片。

生产接入检查清单

  1. 使用准确 ID deepseek-v4-flash-vision-exp,不自行缩写或猜测日期别名。
  2. 确认当前供应商或网关的实时目录已出现该 ID。
  3. 分别测试 base64、外部 URL 和 Files API,不假设三种输入在每个网关都已打通。
  4. 使用不含个人隐私、密钥、内网地址和客户数据的小图做 Smoke Test。
  5. 记录输入图片数、图片 Tokens、文本 Tokens、输出 Tokens、延迟和扣费。
  6. 对 OCR、图表、布局和小文字分别建立可评分的验收集,不只看“大概说对了”。
  7. 为工具调用、外部网络、写文件、删除、发布和付款保留权限边界。
  8. 为实验型路由准备回退到 deepseek-v4-flashdeepseek-v4-pro 或其他视觉模型的方案。

关键结论

  • deepseek-v4-flash-vision-exp 是 DeepSeek 已上线的实验型多模态 API 模型,不是生图模型。
  • 它提供 1M 上下文和最大 384K 输出,单图最高换算为 384 Tokens。
  • 它支持 Chat Completions、Anthropic Messages 和 Responses API,可用 base64、URL 或 Files API 传图。
  • DeepSeek 官方称多模态 Agent 表现接近 Opus-4.8;逐项数据显示它有三项领先、也有多项落后。
  • 官方直连 API 与 V4 Flash 同价,但第三方网关的倍率和能力必须单独验证。
  • 它是 experimental 路由,不建议在没有验收、限额与回退方案的情况下直接替换生产默认模型。

常见问题

DeepSeek-V4-Flash-Vision-Exp 正式上线了吗?

是。DeepSeek 于 2026 年 8 月 21 日将它上线官方 API 平台。它的状态是 experimental,不等于已经成为长期稳定版。

准确的模型 ID 是什么?

使用 deepseek-v4-flash-vision-exp。不要使用文章标题里的大写展示名称代替 API ID。

一张图片固定是 384 Tokens 吗?

不是。384 是单张图片的上限。实际 Tokens 由图片尺寸和官方缩放、分块规则决定;多张图会逐张计算。

Vision-Exp 会生成图片吗?

官方文档只确认图片理解、OCR、截图和图表分析等输入能力,没有将它列为图像生成模型。复刻网页中出现图片,也可能来自素材、绘图代码或其他工具。

它比 DeepSeek V4 Flash 强多少?

官方图表的 9 个可直接对比项目中,Vision-Exp 有 8 项高于 V4-Flash-0731,Cybergym 一项更低。这只代表官方评测集,不代表每个文本或仓库任务都会变强。

可以用 Files API 重复使用同一张图吗?

可以。上传后可以在多次请求中引用 file_id,避免重复上传文件。Files API 本身免费,但图片进入模型时仍按图片 Tokens 计费。

它可以直接接入 Codex 吗?

官方确认它支持 Responses API,但 Codex 或其他 Agent 能否传递图片,还取决于客户端版本、内容块格式和网关能力。请分别验证纯文本、图片输入和工具回传。

本站的 Vision-Exp 倍率是多少?

截至 2026 年 8 月 22 日本文复核时,本站公开价格目录还没有列出该 ID,因此不应推断其与本站 deepseek-v4-flash 的倍率相同。请查看实时模型价格

主要来源