DeepSeek V4.1 Flash 开源:552B 架构、API 价格与迁移指南
**DeepSeek V4.1 Flash 已于 2026 年 9 月 10 日发布并开放模型权重,官方 API 调用名为 deepseek-flash。**它原生支持文本和图片输入,采用新的非对称结构:主干参数量为 552B,处理输入时每个 Token 激活约 8B 参数,生成输出时激活约 16B 参数。官方发布说明
这次升级最值得开发者关注的,不只是跑分提升,而是三件会直接影响接入的事:Agent 任务能力增强、长会话缓存单价下降,以及旧模型名称背后的实际模型发生变化。尤其是 deepseek-v4-pro,官方已公布 **9 月 14 日 12:00(北京时间)**之后的路由切换安排。
本文配图采用 DeepSeek 官方发布原图;下文跑分来自厂商公布结果,未经本站独立复测。
DeepSeek V4.1 Flash 是什么?先看关键规格
| 项目 | 已公布信息 |
|---|---|
| 发布日期 | 2026 年 9 月 10 日 |
| 官方 API 模型名 | deepseek-flash |
| 模型类型 | 原生多模态 MoE,接收文本与图片、生成文本 |
| 主干参数量 | 552B,约 5520 亿参数 |
| 输入 / 输出激活参数 | 8B / 16B(prefill / decode) |
| 核心结构 | Causal Encoder-Decoder,简称 CED |
| 上下文窗口 | 1M Tokens |
| API 最大输出 | 384K Tokens |
| 全局 KV Cache | 890 bytes / Token,约为上一代 V4 Flash 的四分之一 |
| 权重与仓库许可证 | MIT |
参数与结构以 DeepSeek 官方模型卡为准;上下文、输出上限及接口功能以官方 API 规格页为准。部分发布转述将参数量约写为 550B,本文采用官方的 552B 口径。
如果你准备通过本站接入,可先查看实时模型价格。官方发布与第三方网关同步是两件事:请按目录中的实际模型 ID 配置,本站价格和可用性以当前目录、调用结果及账单为准。
552B、8B、16B 分别意味着什么?
MoE 模型并不是每生成一个 Token 都调用全部参数。552B 是模型主干的参数规模,8B 和 16B 则是相应计算阶段每个 Token 的激活规模,不能把它们当成三个可互换的“模型大小”。
V4.1 Flash 的 CED 主干共有 40 层,由 20 层因果编码器和 20 层解码器组成。官方模型卡说明,解码器的全局 KV Cache 从编码器最终隐藏状态投影得到,而非由每一层解码器各自产生。这使处理输入与生成输出可以采用不同的计算规模。
对代码库分析、长资料阅读、多轮工具调用等“输入多、反复读取上下文”的任务,这种设计的意义是减少输入处理负担。它不意味着输入和输出的质量可以只靠激活参数量判断,也不意味着下载或部署时只需要装载 8B 的权重。
Agent 跑分提升在哪里?与 V4 Pro 对比
下表摘录自本次发布的官方模型卡对比表,各项保留原评测名称;变化列是分数差,不是相对百分比。
| 评测 | V4 Pro | V4.1 Flash | 分数变化 |
|---|---|---|---|
| DeepSWE v1.1 | 62.7 | 74.2 | +11.5 |
| Terminal-Bench 3.0 | 11.8 | 30.0 | +18.2 |
| AutomationBench | 43.2 | 54.8 | +11.6 |
| CyberGym | 83.3 | 88.1 | +4.8 |
| GPQA Diamond | 92.4 | 90.9 | −1.5 |
前四项说明,V4.1 Flash 在多个代码、终端和自动化任务基准上超过上一代 Pro;但 GPQA Diamond 仍低于 V4 Pro。因此,更准确的结论是 Agent 能力有明显进步,而不是每项能力都全面领先。官方评测表与测试条件
同样重要的是运行环境。官方模型卡中的 Instruct 对比采用最高推理强度,temperature=1.0、top_p=0.95;DeepSWE v1.1 的 74.2 对应 mini-SWE 环境,同一模型在 DSH Minimal 下为 72.6。模型版本、任务集、Agent 框架和推理预算共同影响结果,换一个客户端不能保证复现同一分数。
选型时可以从自己的任务中抽取三个小样本:一个已有测试的代码修复、一个需要多轮命令的终端任务、一个包含截图或图表的资料任务。比较完成率、总耗时和账单,比只比较单个榜单分数更接近实际收益。
API 价格:闲时输入 1 元、输出 4 元 / 百万 Token
本次价格自 2026 年 9 月 10 日 12:00(北京时间)生效。以下均为 DeepSeek 官方人民币直连价格,单位是元 / 百万 Tokens,不是本站网关报价。官方价格页
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入:缓存命中 | ¥0.02 | ¥0.04 |
| 输入:缓存未命中 | ¥1.00 | ¥2.00 |
| 输出 | ¥4.00 | ¥8.00 |
高峰时段是北京时间周一至周五 09:00—12:00、14:00—18:00;其余时间为空闲时段,包括周末。应按这个明确时段判断,不自行套用节假日调休的“工作日”口径。

图源:DeepSeek 官方发布稿,原图未改动。价格可能调整,第三方服务商独立计费。
一个可复算的 Agent 账单示例
假设一批任务累计使用 800 万缓存命中输入 Tokens、200 万缓存未命中输入 Tokens,以及 50 万输出 Tokens,且全部在同一档时段计费:
总费用 = 命中输入百万数 × 命中单价
+ 未命中输入百万数 × 未命中单价
+ 输出百万数 × 输出单价
空闲时段:8 × 0.02 + 2 × 1 + 0.5 × 4 = 4.16 元
高峰时段:8 × 0.04 + 2 × 2 + 0.5 × 8 = 8.32 元
两种输入单价确实相差 50 倍,但这不等于整项任务便宜 50 倍。这个例子中,闲时缓存命中部分只花 0.16 元,未命中输入和输出却分别花 2 元。优化时既要关注缓存,也要看模型是否反复调用工具、生成过多输出或发生重试。
KV Cache 缩小,为什么对长会话更重要?
KV Cache 用于保存上下文的中间计算结果。对重复读取同一代码库、系统说明和历史对话的 Agent,复用相同前缀可以减少重复计算。V4.1 Flash 将全局 KV Cache 压缩至 890 bytes / Token,约为 V4 Flash 的四分之一。官方模型卡架构说明

图源:DeepSeek 官方发布稿,原图未改动。图中比较的是每 Token 全局 KV Cache,不是模型部署总显存。
需要分清两个存储口径:官方公布的缓存相关 HBM 需求约降至 1/4,SSD 需求约降至 1/8。这里描述的是缓存资源,不是整个模型权重、全部运行内存或部署集群都按同一比例缩小。
对于接入方,可优先保持可复用的资料前缀稳定,避免每轮在前缀中加入不断变化的时间戳、随机编号或重排后的工具列表;然后通过实际用量字段检查命中情况。不要仅因为“内容差不多”就预估为缓存命中。
怎么调用 DeepSeek V4.1 Flash API?
新接入直接使用官方模型名 deepseek-flash。下面是官方直连 Chat Completions 接口的文本示例;先在终端环境中设置 DEEPSEEK_API_KEY,再执行请求。示例没有进行本站付费调用验证。
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "请为一个 Markdown 文件批量重命名工具列出实现步骤、边界情况和验收方法。"
}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
"max_tokens": 2048,
"stream": false
}'
预期返回 JSON,回答文本位于 choices[0].message.content。验证时同时检查 HTTP 状态、返回内容与 usage,不要只看请求是否成功发出。官方首次调用说明
原生视觉表示模型可以理解图片,而不是生成图片。处理截图时,可按官方图像理解指南在消息中加入图片内容块。一次纯文本请求成功,也不能代替图片输入、工具调用和流式返回的分别验证。
如果通过第三方网关调用,应一起核对 Base URL、模型 ID、认证方式及协议支持;不能只把官方地址换掉,就默认所有能力和计费行为一致。
旧模型还能用吗?V4 Pro 什么时候切换?
| 你当前配置的模型名 | 官方处理方式 |
|---|---|
deepseek-flash |
新接入推荐名称,调用 V4.1 Flash |
deepseek-v4-flash |
旧模型已下线,名称暂时兼容并路由到 V4.1 Flash |
deepseek-v4-flash-vision-exp |
旧模型已下线,名称暂时兼容并路由到 V4.1 Flash |
deepseek-v4-pro |
北京时间 2026-09-14 12:00 之后,至未来 V4.1 Pro 上线之前,全部路由到 V4.1 Flash,并按新 Flash 价格计费 |
上述是 DeepSeek 官方接口安排,第三方网关可能使用不同别名或迁移节奏。保留旧名称不等于锁定旧模型,也不适合作为回退到旧权重的方案。
迁移可按三个步骤进行:先导出当前模型名与关键请求样本;再用新名称检查文本、图片、工具和缓存用量;最后核对客户端默认模型、任务模板与账单记录。需要严格可复现的任务,应记录调用日期、实际供应商和返回信息,而不只记录一个旧别名。
DeepSeek Harness v0.1.5 更新了什么?
模型负责理解和推理,Harness 则负责连接文件、命令和工具,把模型输出转成可执行任务。随本次模型发布,DeepSeek Harness 更新至 v0.1.5,模型针对标准模式、程序化工具调用(PTC)模式和极简模式进行了适配。
按本次发布材料,新版支持图片与 PDF 上传、工作区文件树和产物预览,改进长会话恢复及导航,并增强父子 Agent 双向通信、排队消息和任务干预。实验性 Agent Teams 可以通过共享任务列表分工协作,但默认关闭,启用后也需要计入额外 Token 消耗。
已安装 Node.js 的系统可按官方仓库说明启动:
npx @deepseek-ai/dsh web
启动后,在 Web 界面填写 DeepSeek API Key,选择工作区,再提交任务。该命令获取的是执行时可用的包版本,并不固定安装 v0.1.5;需要复现历史环境时,应另外记录实际版本。
可以从一个可验收的小任务开始:
读取当前工作区的项目说明,生成一份 Markdown 上手指南。
请写清启动命令、必要配置和一个最小验证步骤。
只新增 docs/getting-started-draft.md,不改业务代码。
完成后检查文档中的路径是否存在,并列出无法确认的信息。
预期结果是一份可打开的 Markdown 文件,而不只是聊天中的“已完成”。检查文件是否真实生成、路径是否正确、启动命令是否有来源,再逐步扩大任务。更多客户端配置可参考本站接入教程。
开源后,可以直接在普通电脑上部署吗?
不能从“输入只激活 8B”推出“8B 级硬件就能部署”。V4.1 Flash 的主干规模仍然是 552B,实际部署还取决于权重精度、运行时适配、缓存、并发和存储方案。
模型及权重采用 MIT 许可证,入口见官方模型仓库与技术报告。发布稿提到面向具备约 2000 张 GPU 与存储集群资源的团队开展大规模部署合作;这是一项合作条件,不是公布的最低部署配置。
对主要目标是做应用、跑 Agent 或验证业务效果的团队,先用 API 得到自己的质量和成本数据,再评估自部署,通常更容易做出有依据的选择。
常见问题
DeepSeek V4.1 Flash 是 550B 还是 552B?
官方发布页和模型卡使用 552B,模型卡明确称为主干参数量。550B 是部分转述中的近似表述;做规格表或部署评估时应使用官方口径。
V4.1 Flash 的 API 模型 ID 是什么?
DeepSeek 官方推荐使用 deepseek-flash。不要根据展示名称自行拼写 deepseek-v4.1-flash;某个第三方平台即使使用这个别名,也不代表它是官方接口名称。
0.02 元能买到 100 万个任意 Token 吗?
不能。0.02 元 / 百万 Tokens 只对应空闲时段的缓存命中输入。未命中输入、输出以及高峰时段分别有不同价格。
V4.1 Flash 支持视觉理解和生图吗?
它原生支持文本与图片输入并生成文本,可用于截图理解、图表分析等任务。官方模型卡没有将其定义为图像生成模型。
V4 Pro 是否已经全部下线?
截至本文发布日 2026 年 9 月 10 日,官方公布的是 9 月 14 日 12:00 之后的切换安排,不能提前写成已经全部切换。两个旧 Flash 模型则已下线,旧名称暂时兼容。
本站调用也按官方峰谷价格结算吗?
不应直接这样推断。本文价格表介绍 DeepSeek 官方直连 API,本站模型 ID、可用性与计费以实时模型价格和实际账单为准。确认目标模型后,可从购买入口开始小额验证。
小结:这次升级,先看任务总成本,再看迁移窗口
DeepSeek V4.1 Flash 把原生视觉、非对称计算与更紧凑的上下文缓存结合在一起。对长输入、多轮工具调用的 Agent,这是值得用真实任务验证的一次更新;对已有 API 应用,最紧迫的则是确认旧别名的路由变化和 9 月 14 日的 Pro 切换时间。
实用的顺序是:确认模型 ID → 用自己的任务验收 → 核对缓存与输出账单 → 更新配置。这样才能把“模型发布”转成实际可用、可衡量的应用升级。
参考来源
- DeepSeek V4.1 Flash 官方发布页:发布日期、552B 结构、价格生效时间与迁移安排。
- DeepSeek V4.1 Flash 官方模型卡:CED 结构、评测表、测试环境、KV Cache 与 MIT 许可证。
- DeepSeek 官方模型与价格:人民币峰谷单价、上下文与输出上限。
- DeepSeek 官方首次调用指南:当前模型 ID、请求样例和兼容名称说明。
- DeepSeek 官方图像理解指南:图片输入能力及格式。
- DeepSeek Harness 官方仓库:启动方法与开发者预览状态。
- 本次发布补充材料:微信文章一、微信文章二。Harness v0.1.5 功能段落依据随文提供的发布内容整理。
资料核对日期:2026 年 9 月 10 日。本文为发布信息解读与接入指南,不是独立性能测评。