返回部落格列表

DeepSeek V4.1 Flash 開放權重:552B 架構、API 價格與遷移指南

DeepSeek V4.1 FlashDeepSeek APIAPI 價格多模態 Agent開源模型

**DeepSeek V4.1 Flash 已於 2026 年 9 月 10 日發布並開放模型權重,官方 API 呼叫名稱為 deepseek-flash。**它原生支援文字與圖片輸入,採用新的非對稱結構:主幹參數量為 552B,處理輸入時每個 Token 約啟用 8B 參數,生成輸出時約啟用 16B 參數。官方發布說明

這次升級值得開發者關注的,不只是評測分數提升,還有三件會直接影響串接的事:Agent 任務能力增強、長對話快取單價下降,以及舊模型名稱背後的實際模型發生變化。尤其是 deepseek-v4-pro,官方已公布 **2026 年 9 月 14 日 12:00(北京時間)**之後的路由切換安排。

本文配圖採用 DeepSeek 官方發布原圖,未做修改;文中的評測數字來自供應商公開結果,不是本站獨立複測。

DeepSeek V4.1 Flash 是什麼?先看關鍵規格

項目 已公布資訊
發布日期 2026 年 9 月 10 日
官方 API 模型名稱 deepseek-flash
模型類型 原生多模態 MoE,接收文字與圖片、生成文字
主幹參數量 552B,約 5520 億參數
輸入/輸出啟用參數 8B/16B(prefill/decode)
核心結構 Causal Encoder-Decoder,簡稱 CED
上下文視窗 1M Tokens
API 最大輸出 384K Tokens
全域 KV Cache 890 bytes/Token,約為上一代 V4 Flash 的四分之一
權重與儲存庫授權 MIT

參數與結構以 DeepSeek 官方模型卡為準;上下文、輸出上限與介面功能以官方 API 規格頁為準。部分發布轉述將參數量約寫為 550B,本文採用官方的 552B 口徑。

如果你準備透過本站接入,可以先查看即時模型價格。官方發布與第三方閘道同步是兩件事:請按目錄中的實際模型 ID 設定,本站價格與可用性則以目前目錄、呼叫結果及帳單為準。

552B、8B、16B 分別代表什麼?

MoE 模型並不是每生成一個 Token 都呼叫全部參數。552B 是模型主幹的參數規模,8B 與 16B 則是相應計算階段每個 Token 的啟用規模,不能把它們當成三個可以互換的「模型大小」。

V4.1 Flash 的 CED 主幹共有 40 層,由 20 層因果編碼器與 20 層解碼器組成。官方模型卡說明,解碼器的全域 KV Cache 是從編碼器最終隱藏狀態投影得到,而不是由每一層解碼器各自產生。因此,處理輸入與生成輸出可以採用不同的計算規模。

對程式碼庫分析、長資料閱讀及多輪工具呼叫等「輸入多、反覆讀取上下文」的任務來說,這種設計有助於減少輸入處理負擔。但它不代表輸入與輸出品質可以只靠啟用參數量判斷,也不代表下載或部署時只需要載入 8B 等級的權重。

Agent 評測提升在哪裡?與 V4 Pro 比較

下表摘錄自官方模型卡的比較表,各項保留原評測名稱;變化欄是分數差,不是相對百分比。

評測 V4 Pro V4.1 Flash 分數變化
DeepSWE v1.1 62.7 74.2 +11.5
Terminal-Bench 3.0 11.8 30.0 +18.2
AutomationBench 43.2 54.8 +11.6
CyberGym 83.3 88.1 +4.8
GPQA Diamond 92.4 90.9 −1.5

前四項顯示,V4.1 Flash 在多個程式碼、終端機與自動化任務基準上超過上一代 Pro;但 GPQA Diamond 仍低於 V4 Pro。因此,更準確的結論是 Agent 能力有明顯進步,而不是每一項能力都全面領先官方評測表與測試條件

執行環境同樣重要。官方模型卡中的 Instruct 比較採用最高推理強度、temperature=1.0top_p=0.95;DeepSWE v1.1 的 74.2 對應 mini-SWE 環境,同一模型在 DSH Minimal 中則是 72.6。模型版本、任務集、Agent 框架與推理預算會共同影響結果。

選型時可以從自己的工作中抽取三個小樣本:一個已有測試的程式碼修復、一個需要多輪指令的終端機任務,以及一個包含截圖或圖表的資料任務。比較完成率、總耗時和帳單,比只比較單一榜單分數更接近實際收益。

API 價格:閒時輸入 1 元、輸出 4 元/百萬 Token

本次價格自 2026 年 9 月 10 日 12:00(北京時間)生效。以下均為 DeepSeek 官方人民幣直連價格,單位是元/百萬 Tokens,不是本站閘道報價。官方價格頁

計費項目 閒時 尖峰時段
輸入:快取命中 ¥0.02 ¥0.04
輸入:快取未命中 ¥1.00 ¥2.00
輸出 ¥4.00 ¥8.00

尖峰時段是北京時間週一至週五 09:00—12:00、14:00—18:00;其餘時間為閒時,包括週末。應按這個明確時段判斷,不要自行套用節假日調休的「工作日」口徑。

DeepSeek V4.1 Flash 官方人民幣 API 價格圖:閒時快取命中 0.02 元、未命中 1 元、輸出 4 元;尖峰時段分別為 0.04、2、8 元/百萬 Tokens

圖源:DeepSeek 官方發布稿,原圖未修改。價格可能調整,第三方服務商獨立計費。

一個可複算的 Agent 帳單示例

假設一批任務累計使用 800 萬快取命中輸入 Tokens、200 萬快取未命中輸入 Tokens,以及 50 萬輸出 Tokens,且全部在同一檔時段計費:

總費用 = 命中輸入百萬數 × 命中單價
       + 未命中輸入百萬數 × 未命中單價
       + 輸出百萬數 × 輸出單價

閒時:8 × 0.02 + 2 × 1 + 0.5 × 4 = 4.16 元
尖峰:8 × 0.04 + 2 × 2 + 0.5 × 8 = 8.32 元

兩種輸入單價確實相差 50 倍,但這不等於整項任務便宜 50 倍。在這個例子中,閒時快取命中部分只花 0.16 元,未命中輸入與輸出卻分別花 2 元。最佳化時除了快取,也要看是否反覆呼叫工具、產生過多輸出或發生重試。

KV Cache 變小,為什麼對長對話更重要?

KV Cache 用於保存上下文的中間計算結果。對反覆讀取同一個程式碼庫、系統說明與歷史對話的 Agent,重用相同前綴可以減少重複計算。V4.1 Flash 將全域 KV Cache 壓縮至 890 bytes/Token,約為 V4 Flash 的四分之一。官方模型卡架構說明

DeepSeek 官方歷代每 Token 全域 KV Cache 比較:V4 Flash 為 3514 位元組,V4.1 Flash 為 890 位元組

圖源:DeepSeek 官方發布稿,原圖未修改。圖中比較的是每 Token 全域 KV Cache,不是模型部署的總顯存。

需要分清兩種儲存口徑:官方公布的快取相關 HBM 需求約降至 1/4,SSD 需求約降至 1/8。這裡描述的是快取資源,不是整個模型權重、全部執行記憶體或部署叢集都按同一比例縮小。

對接入方來說,可以先保持可重用的資料前綴穩定,避免每輪在前綴中加入不斷變化的時間戳、隨機編號或重新排序的工具列表;然後透過實際用量欄位檢查命中情況。不要只因為「內容差不多」就預估為快取命中。

如何呼叫 DeepSeek V4.1 Flash API?

新接入直接使用官方模型名稱 deepseek-flash。下面是官方直連 Chat Completions 介面的文字範例;先在終端機環境中設定 DEEPSEEK_API_KEY,再執行請求。此範例沒有進行本站付費呼叫驗證。

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "請為一個 Markdown 檔案批次重新命名工具列出實作步驟、邊界情況與驗收方法。"
      }
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high",
    "max_tokens": 2048,
    "stream": false
  }'

預期返回 JSON,回答文字位於 choices[0].message.content。驗證時要同時檢查 HTTP 狀態、返回內容與 usage,不要只看請求是否成功送出。官方首次呼叫說明

原生視覺表示模型可以理解圖片,而不是生成圖片。處理截圖時,可按官方圖像理解指南在訊息中加入圖片內容區塊。一次純文字請求成功,也不能代替圖片輸入、工具呼叫和串流返回的分別驗證。

如果透過第三方閘道呼叫,應一起核對 Base URL、模型 ID、認證方式及協定支援;不能只把官方地址換掉,就預設所有能力和計費行為一致。

舊模型還能用嗎?V4 Pro 何時切換?

目前設定的模型名稱 官方處理方式
deepseek-flash 新接入推薦名稱,呼叫 V4.1 Flash
deepseek-v4-flash 舊模型已下線,名稱暫時相容並路由到 V4.1 Flash
deepseek-v4-flash-vision-exp 舊模型已下線,名稱暫時相容並路由到 V4.1 Flash
deepseek-v4-pro 北京時間 2026-09-14 12:00 之後、未來 V4.1 Pro 上線前,全部路由到 V4.1 Flash,並按新的 Flash 價格計費

上述是 DeepSeek 官方介面安排,第三方閘道可能使用不同別名或遷移節奏。保留舊名稱不等於鎖定舊模型,也不適合作為回退到舊權重的方案。

遷移可以分成三個步驟:先匯出目前的模型名稱與關鍵請求樣本;再用新名稱檢查文字、圖片、工具和快取用量;最後核對客戶端預設模型、任務範本與帳單記錄。需要嚴格可重現的任務,應記錄呼叫日期、實際供應商與返回資訊,而不只記錄舊別名。

DeepSeek Harness v0.1.5 更新了什麼?

模型負責理解和推理,Harness 則負責連接檔案、命令和工具,把模型輸出轉成可執行任務。隨本次模型發布,DeepSeek Harness 更新至 v0.1.5,並針對標準模式、程式化工具呼叫(PTC)模式和極簡模式進行適配。

按本次發布材料,新版支援圖片與 PDF 上傳、工作區檔案樹與產物預覽,改善長對話恢復及導覽,並增強父子 Agent 雙向通訊、排隊訊息和任務介入。實驗性的 Agent Teams 可以透過共用任務清單分工協作,但預設關閉,啟用後也需要計入額外 Token 消耗。

已安裝 Node.js 的系統可按官方儲存庫說明啟動:

npx @deepseek-ai/dsh web

啟動後,在 Web 介面填寫 DeepSeek API Key,選擇工作區,再提交任務。該命令取得的是執行時可用的套件版本,並不固定安裝 v0.1.5;需要重現歷史環境時,應另外記錄實際版本。

可以從一個可驗收的小任務開始:

讀取目前工作區的專案說明,產生一份 Markdown 入門指南。
請寫清啟動命令、必要設定和一個最小驗證步驟。
只新增 docs/getting-started-draft.md,不修改業務程式碼。
完成後檢查文件中的路徑是否存在,並列出無法確認的資訊。

預期結果是一份可開啟的 Markdown 檔案,而不只是聊天中的「已完成」。檢查檔案是否真正生成、路徑是否正確、啟動命令是否有來源,再逐步擴大任務。更多客戶端設定可參考本站接入教學

開放權重後,可以直接在普通電腦上部署嗎?

不能從「輸入只啟用 8B」推出「8B 級硬體就能部署」。V4.1 Flash 的主幹規模仍然是 552B,實際部署還取決於權重精度、執行環境適配、快取、並發與儲存方案。

模型及權重採用 MIT 授權,入口見官方模型儲存庫技術報告。發布稿提到面向具備約 2000 張 GPU 與儲存叢集資源的團隊開展大規模部署合作;這是一項合作條件,不是公布的最低部署配置

對主要目標是做應用、跑 Agent 或驗證業務效果的團隊,先用 API 得到自己的品質和成本數據,再評估自部署,通常更容易做出有依據的選擇。

常見問題

DeepSeek V4.1 Flash 是 550B 還是 552B?

官方發布頁和模型卡使用 552B,並明確指向主幹參數量。550B 是部分轉述中的近似表述;做規格表或部署評估時應使用官方口徑。

V4.1 Flash 的 API 模型 ID 是什麼?

DeepSeek 官方推薦使用 deepseek-flash。不要根據展示名稱自行拼寫 deepseek-v4.1-flash;某個第三方平台即使使用這個別名,也不代表它是官方介面名稱。

0.02 元能買到 100 萬個任意 Token 嗎?

不能。0.02 元/百萬 Tokens 只對應閒時的快取命中輸入。未命中輸入、輸出以及尖峰時段分別有不同價格。

V4.1 Flash 支援視覺理解和生圖嗎?

它原生支援文字與圖片輸入並生成文字,可用於截圖理解、圖表分析等任務。官方模型卡沒有將其定義為圖像生成模型。

V4 Pro 是否已經全部下線?

截至本文發布日 2026 年 9 月 10 日,官方公布的是 9 月 14 日 12:00 之後的切換安排,不能提前寫成已經全部切換。兩個舊 Flash 模型則已下線,舊名稱暫時相容。

本站呼叫也按官方尖峰/閒時價格結算嗎?

不應直接這樣推斷。本文價格表介紹 DeepSeek 官方直連 API,本站模型 ID、可用性與計費以即時模型價格和實際帳單為準。確認目標模型後,可從購買入口開始小額驗證。

小結:先看任務總成本,再看遷移窗口

DeepSeek V4.1 Flash 將原生視覺、非對稱計算與更緊湊的上下文快取結合在一起。對長輸入、多輪工具呼叫的 Agent,這是值得用真實任務驗證的一次更新;對已有 API 應用,最緊迫的是確認舊別名的路由變化和 9 月 14 日的 Pro 切換時間。

實用的順序是:確認模型 ID → 用自己的任務驗收 → 核對快取與輸出帳單 → 更新設定。這樣才能把「模型發布」轉成實際可用、可衡量的應用升級。

參考來源

資料核對日期:2026 年 9 月 10 日。本文為發布資訊解讀與接入指南,不是獨立效能評測。