返回博客列表

DeepSeek V4.1 Flash 开源:552B 架构、API 价格与迁移指南

DeepSeek V4.1 FlashDeepSeek APIAPI 价格多模态 Agent开源模型

**DeepSeek V4.1 Flash 已于 2026 年 9 月 10 日发布并开放模型权重,官方 API 调用名为 deepseek-flash。**它原生支持文本和图片输入,采用新的非对称结构:主干参数量为 552B,处理输入时每个 Token 激活约 8B 参数,生成输出时激活约 16B 参数。官方发布说明

这次升级最值得开发者关注的,不只是跑分提升,而是三件会直接影响接入的事:Agent 任务能力增强、长会话缓存单价下降,以及旧模型名称背后的实际模型发生变化。尤其是 deepseek-v4-pro,官方已公布 **9 月 14 日 12:00(北京时间)**之后的路由切换安排。

本文配图采用 DeepSeek 官方发布原图;下文跑分来自厂商公布结果,未经本站独立复测。

DeepSeek V4.1 Flash 是什么?先看关键规格

项目 已公布信息
发布日期 2026 年 9 月 10 日
官方 API 模型名 deepseek-flash
模型类型 原生多模态 MoE,接收文本与图片、生成文本
主干参数量 552B,约 5520 亿参数
输入 / 输出激活参数 8B / 16B(prefill / decode)
核心结构 Causal Encoder-Decoder,简称 CED
上下文窗口 1M Tokens
API 最大输出 384K Tokens
全局 KV Cache 890 bytes / Token,约为上一代 V4 Flash 的四分之一
权重与仓库许可证 MIT

参数与结构以 DeepSeek 官方模型卡为准;上下文、输出上限及接口功能以官方 API 规格页为准。部分发布转述将参数量约写为 550B,本文采用官方的 552B 口径。

如果你准备通过本站接入,可先查看实时模型价格。官方发布与第三方网关同步是两件事:请按目录中的实际模型 ID 配置,本站价格和可用性以当前目录、调用结果及账单为准。

552B、8B、16B 分别意味着什么?

MoE 模型并不是每生成一个 Token 都调用全部参数。552B 是模型主干的参数规模,8B 和 16B 则是相应计算阶段每个 Token 的激活规模,不能把它们当成三个可互换的“模型大小”。

V4.1 Flash 的 CED 主干共有 40 层,由 20 层因果编码器和 20 层解码器组成。官方模型卡说明,解码器的全局 KV Cache 从编码器最终隐藏状态投影得到,而非由每一层解码器各自产生。这使处理输入与生成输出可以采用不同的计算规模。

对代码库分析、长资料阅读、多轮工具调用等“输入多、反复读取上下文”的任务,这种设计的意义是减少输入处理负担。它不意味着输入和输出的质量可以只靠激活参数量判断,也不意味着下载或部署时只需要装载 8B 的权重。

Agent 跑分提升在哪里?与 V4 Pro 对比

下表摘录自本次发布的官方模型卡对比表,各项保留原评测名称;变化列是分数差,不是相对百分比。

评测 V4 Pro V4.1 Flash 分数变化
DeepSWE v1.1 62.7 74.2 +11.5
Terminal-Bench 3.0 11.8 30.0 +18.2
AutomationBench 43.2 54.8 +11.6
CyberGym 83.3 88.1 +4.8
GPQA Diamond 92.4 90.9 −1.5

前四项说明,V4.1 Flash 在多个代码、终端和自动化任务基准上超过上一代 Pro;但 GPQA Diamond 仍低于 V4 Pro。因此,更准确的结论是 Agent 能力有明显进步,而不是每项能力都全面领先官方评测表与测试条件

同样重要的是运行环境。官方模型卡中的 Instruct 对比采用最高推理强度,temperature=1.0top_p=0.95;DeepSWE v1.1 的 74.2 对应 mini-SWE 环境,同一模型在 DSH Minimal 下为 72.6。模型版本、任务集、Agent 框架和推理预算共同影响结果,换一个客户端不能保证复现同一分数。

选型时可以从自己的任务中抽取三个小样本:一个已有测试的代码修复、一个需要多轮命令的终端任务、一个包含截图或图表的资料任务。比较完成率、总耗时和账单,比只比较单个榜单分数更接近实际收益。

API 价格:闲时输入 1 元、输出 4 元 / 百万 Token

本次价格自 2026 年 9 月 10 日 12:00(北京时间)生效。以下均为 DeepSeek 官方人民币直连价格,单位是元 / 百万 Tokens,不是本站网关报价。官方价格页

计费项 空闲时段 高峰时段
输入:缓存命中 ¥0.02 ¥0.04
输入:缓存未命中 ¥1.00 ¥2.00
输出 ¥4.00 ¥8.00

高峰时段是北京时间周一至周五 09:00—12:00、14:00—18:00;其余时间为空闲时段,包括周末。应按这个明确时段判断,不自行套用节假日调休的“工作日”口径。

DeepSeek V4.1 Flash 官方人民币 API 价格图:闲时缓存命中 0.02 元、未命中 1 元、输出 4 元,峰时分别为 0.04、2、8 元每百万 Tokens

图源:DeepSeek 官方发布稿,原图未改动。价格可能调整,第三方服务商独立计费。

一个可复算的 Agent 账单示例

假设一批任务累计使用 800 万缓存命中输入 Tokens、200 万缓存未命中输入 Tokens,以及 50 万输出 Tokens,且全部在同一档时段计费:

总费用 = 命中输入百万数 × 命中单价
       + 未命中输入百万数 × 未命中单价
       + 输出百万数 × 输出单价

空闲时段:8 × 0.02 + 2 × 1 + 0.5 × 4 = 4.16 元
高峰时段:8 × 0.04 + 2 × 2 + 0.5 × 8 = 8.32 元

两种输入单价确实相差 50 倍,但这不等于整项任务便宜 50 倍。这个例子中,闲时缓存命中部分只花 0.16 元,未命中输入和输出却分别花 2 元。优化时既要关注缓存,也要看模型是否反复调用工具、生成过多输出或发生重试。

KV Cache 缩小,为什么对长会话更重要?

KV Cache 用于保存上下文的中间计算结果。对重复读取同一代码库、系统说明和历史对话的 Agent,复用相同前缀可以减少重复计算。V4.1 Flash 将全局 KV Cache 压缩至 890 bytes / Token,约为 V4 Flash 的四分之一。官方模型卡架构说明

DeepSeek 官方历代每 Token 全局 KV Cache 对比:V4 Flash 为 3514 字节,V4.1 Flash 为 890 字节

图源:DeepSeek 官方发布稿,原图未改动。图中比较的是每 Token 全局 KV Cache,不是模型部署总显存。

需要分清两个存储口径:官方公布的缓存相关 HBM 需求约降至 1/4,SSD 需求约降至 1/8。这里描述的是缓存资源,不是整个模型权重、全部运行内存或部署集群都按同一比例缩小。

对于接入方,可优先保持可复用的资料前缀稳定,避免每轮在前缀中加入不断变化的时间戳、随机编号或重排后的工具列表;然后通过实际用量字段检查命中情况。不要仅因为“内容差不多”就预估为缓存命中。

怎么调用 DeepSeek V4.1 Flash API?

新接入直接使用官方模型名 deepseek-flash。下面是官方直连 Chat Completions 接口的文本示例;先在终端环境中设置 DEEPSEEK_API_KEY,再执行请求。示例没有进行本站付费调用验证。

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "请为一个 Markdown 文件批量重命名工具列出实现步骤、边界情况和验收方法。"
      }
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high",
    "max_tokens": 2048,
    "stream": false
  }'

预期返回 JSON,回答文本位于 choices[0].message.content。验证时同时检查 HTTP 状态、返回内容与 usage,不要只看请求是否成功发出。官方首次调用说明

原生视觉表示模型可以理解图片,而不是生成图片。处理截图时,可按官方图像理解指南在消息中加入图片内容块。一次纯文本请求成功,也不能代替图片输入、工具调用和流式返回的分别验证。

如果通过第三方网关调用,应一起核对 Base URL、模型 ID、认证方式及协议支持;不能只把官方地址换掉,就默认所有能力和计费行为一致。

旧模型还能用吗?V4 Pro 什么时候切换?

你当前配置的模型名 官方处理方式
deepseek-flash 新接入推荐名称,调用 V4.1 Flash
deepseek-v4-flash 旧模型已下线,名称暂时兼容并路由到 V4.1 Flash
deepseek-v4-flash-vision-exp 旧模型已下线,名称暂时兼容并路由到 V4.1 Flash
deepseek-v4-pro 北京时间 2026-09-14 12:00 之后,至未来 V4.1 Pro 上线之前,全部路由到 V4.1 Flash,并按新 Flash 价格计费

上述是 DeepSeek 官方接口安排,第三方网关可能使用不同别名或迁移节奏。保留旧名称不等于锁定旧模型,也不适合作为回退到旧权重的方案。

迁移可按三个步骤进行:先导出当前模型名与关键请求样本;再用新名称检查文本、图片、工具和缓存用量;最后核对客户端默认模型、任务模板与账单记录。需要严格可复现的任务,应记录调用日期、实际供应商和返回信息,而不只记录一个旧别名。

DeepSeek Harness v0.1.5 更新了什么?

模型负责理解和推理,Harness 则负责连接文件、命令和工具,把模型输出转成可执行任务。随本次模型发布,DeepSeek Harness 更新至 v0.1.5,模型针对标准模式、程序化工具调用(PTC)模式和极简模式进行了适配。

按本次发布材料,新版支持图片与 PDF 上传、工作区文件树和产物预览,改进长会话恢复及导航,并增强父子 Agent 双向通信、排队消息和任务干预。实验性 Agent Teams 可以通过共享任务列表分工协作,但默认关闭,启用后也需要计入额外 Token 消耗。

已安装 Node.js 的系统可按官方仓库说明启动:

npx @deepseek-ai/dsh web

启动后,在 Web 界面填写 DeepSeek API Key,选择工作区,再提交任务。该命令获取的是执行时可用的包版本,并不固定安装 v0.1.5;需要复现历史环境时,应另外记录实际版本。

可以从一个可验收的小任务开始:

读取当前工作区的项目说明,生成一份 Markdown 上手指南。
请写清启动命令、必要配置和一个最小验证步骤。
只新增 docs/getting-started-draft.md,不改业务代码。
完成后检查文档中的路径是否存在,并列出无法确认的信息。

预期结果是一份可打开的 Markdown 文件,而不只是聊天中的“已完成”。检查文件是否真实生成、路径是否正确、启动命令是否有来源,再逐步扩大任务。更多客户端配置可参考本站接入教程

开源后,可以直接在普通电脑上部署吗?

不能从“输入只激活 8B”推出“8B 级硬件就能部署”。V4.1 Flash 的主干规模仍然是 552B,实际部署还取决于权重精度、运行时适配、缓存、并发和存储方案。

模型及权重采用 MIT 许可证,入口见官方模型仓库技术报告。发布稿提到面向具备约 2000 张 GPU 与存储集群资源的团队开展大规模部署合作;这是一项合作条件,不是公布的最低部署配置

对主要目标是做应用、跑 Agent 或验证业务效果的团队,先用 API 得到自己的质量和成本数据,再评估自部署,通常更容易做出有依据的选择。

常见问题

DeepSeek V4.1 Flash 是 550B 还是 552B?

官方发布页和模型卡使用 552B,模型卡明确称为主干参数量。550B 是部分转述中的近似表述;做规格表或部署评估时应使用官方口径。

V4.1 Flash 的 API 模型 ID 是什么?

DeepSeek 官方推荐使用 deepseek-flash。不要根据展示名称自行拼写 deepseek-v4.1-flash;某个第三方平台即使使用这个别名,也不代表它是官方接口名称。

0.02 元能买到 100 万个任意 Token 吗?

不能。0.02 元 / 百万 Tokens 只对应空闲时段的缓存命中输入。未命中输入、输出以及高峰时段分别有不同价格。

V4.1 Flash 支持视觉理解和生图吗?

它原生支持文本与图片输入并生成文本,可用于截图理解、图表分析等任务。官方模型卡没有将其定义为图像生成模型。

V4 Pro 是否已经全部下线?

截至本文发布日 2026 年 9 月 10 日,官方公布的是 9 月 14 日 12:00 之后的切换安排,不能提前写成已经全部切换。两个旧 Flash 模型则已下线,旧名称暂时兼容。

本站调用也按官方峰谷价格结算吗?

不应直接这样推断。本文价格表介绍 DeepSeek 官方直连 API,本站模型 ID、可用性与计费以实时模型价格和实际账单为准。确认目标模型后,可从购买入口开始小额验证。

小结:这次升级,先看任务总成本,再看迁移窗口

DeepSeek V4.1 Flash 把原生视觉、非对称计算与更紧凑的上下文缓存结合在一起。对长输入、多轮工具调用的 Agent,这是值得用真实任务验证的一次更新;对已有 API 应用,最紧迫的则是确认旧别名的路由变化和 9 月 14 日的 Pro 切换时间。

实用的顺序是:确认模型 ID → 用自己的任务验收 → 核对缓存与输出账单 → 更新配置。这样才能把“模型发布”转成实际可用、可衡量的应用升级。

参考来源

资料核对日期:2026 年 9 月 10 日。本文为发布信息解读与接入指南,不是独立性能测评。