返回部落格列表

Qwen3.8-Flash API 價格與程式設計指南 2026:1M 多模態

Qwen3.8-FlashQwen API千問 FlashCoding Agent1M 上下文

2026 年 8 月 27 日,也就是 Qwen3.8-Flash-Next 開源的隔天,我們為本站新開放的 qwen3.8-flash 路由整理接入資料。最容易踩到的坑就在名稱裡:開源權重與正式環境 API 並不是同一個 Model ID。

Qwen3.8-Flash-Next 是用來預覽 Qwen4 架構的開源多模態 MoE;qwen3.8-flash 則是 Alibaba Cloud Model Studio 與 QwenCloud 提供的正式環境 API 模型,預設支援 1M 上下文、圖片/文字/影片輸入、Function Calling 和結構化輸出。 本站已開放 qwen3.8-flash 路由;本站倍率與實際扣費請查看即時價格頁和帳務紀錄。

本文會把開源模型架構、Alibaba Cloud 官方 API 能力、官方直連價格與本站路由分開說明。Qwen 團隊公布的基準不是本站獨立重測結果,Alibaba Cloud 的區域價格也不能直接換算成本站倍率。

Qwen3.8-Flash 核心資料

項目 已核實資訊
官方發布時間 2026 年 8 月 26 日
本站/Model Studio API ID qwen3.8-flash
開源權重 ID Qwen/Qwen3.8-Flash-Next
參數結構 125B 主模型 + 51B N-gram Embedding,6B 啟用參數
上下文 正式 API 預設 1M;開源版原生 262,144,可透過 YaRN 擴展至 1M
輸入/輸出模態 圖片、文字與影片輸入;文字輸出
API 能力 Function Calling、結構化輸出、Web Search、上下文快取
公開定位 Coding Agent、辦公自動化、視覺理解、高並發工作流程
本站倍率 本文不寫死,以即時價格頁與實際帳務紀錄為準

資料最後核驗於 2026 年 8 月 27 日。正式上線前,請重新檢查模型列表、Alibaba Cloud 區域文件和實際回應中的用量欄位。

Qwen3.8-Flash 與 Qwen3.8-Flash-Next 是什麼關係?

Qwen 團隊先發布 Qwen3.8-Flash-Next 權重,讓社群可以提前研究 Qwen4 將採用的架構;正式環境版本則以 Qwen3.8-Flash 的名稱提供服務。兩者共享技術方向,但呼叫方式不同。

名稱 用途 準確 ID 上下文
Qwen3.8-Flash-Next 自託管、架構研究、開源評估 Qwen/Qwen3.8-Flash-Next 原生 262,144,可用 YaRN 擴展至 1M
Qwen3.8-Flash 託管正式環境 API qwen3.8-flash 預設 1M
Qwen3.8-Max 追求更高能力的託管旗艦模型 qwen3.8-max 1M

透過本站或 Alibaba Cloud 相容介面呼叫時,不要把 Hugging Face 儲存庫名稱填入 model 參數。反過來,自託管時也不能只寫託管 API ID,期待框架自動下載權重。

Qwen3.8-Flash-Next 的新架構是什麼?

Qwen3.8-Flash-Next 以 Gated DeltaNet(GDN)和 Qwen Sparse Attention(QSA)組成混合注意力。GDN 把歷史壓縮進固定狀態,QSA 則用輕量索引器按微區塊選擇重要上下文,降低長序列中的注意力計算與 KV Cache 存取成本。

它還加入 Gated Residual(GR),把殘差流擴展為四個分支,並用動態閘門控制讀寫;N-gram Embedding 會查找局部上下文,在幾乎不增加每 Token 矩陣計算的情況下擴展模型容量。訓練使用改進版 Muon Optimizer,並重新擬合 Scaling Law。

官方公布的規模是 125B 主模型、額外 51B N-gram Embedding,以及每個 Token 啟用 6B 參數。Qwen 團隊稱其訓練成本約為 Qwen3.7-Plus 的九分之一;這是廠商的訓練成本比較,不是本站推理成本實測。

1M 上下文與多模態能力有哪些邊界?

Alibaba Cloud Qwen3.8-Flash 模型頁列出的上下文長度為 1,000,000 Tokens:普通模式最大輸入 991,808、思考模式最大輸入 983,616、最大輸出 131,072、最大思考鏈長度 262,144。圖片、文字和影片可作為輸入,輸出則是文字。

1M 不代表每次都應該提交接近 1M Tokens。系統提示詞、工具 Schema、圖片/影片編碼、歷史訊息和輸出預留都會佔用視窗;超長請求也會增加延遲和費用。正式環境應先按 32K、128K、256K 和長上下文分檔測試。

官方能力表也列出 Function Calling、結構化輸出、Web Search 和上下文快取。Batch 在北京區域支援,在新加坡區域標示為不支援;部署前必須單獨核對區域差異。

如何解讀 Qwen 官方程式設計與 Agent 基準?

Qwen 團隊將 Qwen3.8-Flash-Next 與 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 等模型比較。以下摘錄四項:

廠商發布評測 Qwen3.7-Plus Qwen3.8-Flash-Next 任務類型
DeepSWE 1.1 16.5 58.7 Agentic coding
SWE-bench Multilingual 75.8 81.0 多語言軟體工程
CoWorkBench 65.1 73.9 長週期辦公任務
Toolathlon Verified 50.6 73.5 真實工具呼叫

**這些分數來自 Qwen 官方發布,不是本站獨立重測。**模型版本、推理預算、工具環境和評分器都會顯著影響結果。尤其不能把開源 Flash-Next 的分數直接當作你的用戶端、區域與配額下託管 API 的端到端表現。

Qwen3.8-Flash 官方價格與本站價格如何區分?

Qwen 發布稿在首發時寫明,QwenCloud 正式版本的參考價格為每百萬輸入 Tokens 0.16 美元、每百萬輸出 Tokens 0.47 美元;同一發布稿當時還註明 API 即將開放。之後 Alibaba Cloud Model Studio 頁面已列出 qwen3.8-flash 呼叫 ID,並按北京、新加坡等區域提供不同的 CNY 價格與能力表。

這兩套數字都是官方直連口徑,而且可能隨區域、快取、Batch 和活動變動。**本站不會把官方美元價格或 Model Studio 區域價格直接換算成閘道倍率。**本站 qwen3.8-flash 的倍率、快取和實際扣費,以即時價格頁和請求帳務紀錄為準。

新使用者可從API 購買頁小額開通;已有 Key 的使用者可在儲值頁補充餘額。先固定 Prompt 和上下文長度,記錄輸入、輸出與快取 Tokens,再比較實際成本。

如何呼叫 Qwen3.8-Flash API

本站提供 OpenAI 相容的 Chat Completions 介面,準確模型 ID 是 qwen3.8-flash

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {
        "role": "user",
        "content": "Summarize the failing tests, then propose the smallest safe patch."
      }
    ]
  }'

Qwen3.8-Flash 支援思考與非思考模式,但不同相容層對 enable_thinkingreasoning_effort、工具串流參數與內建工具的映射可能不同。先從最小的文字請求開始,再逐項加入思考、圖片、影片、工具與長上下文;不要在第一個請求一次帶上所有擴充參數。

Qwen3.8-Flash 適合哪些任務?

  • 高並發 Coding Agent、程式碼審查與測試失敗分析
  • 跨語言程式庫與 SWE-bench 類型的軟體工程任務
  • 電子郵件、試算表、文件與會議資料的長週期辦公自動化
  • 圖片、圖表與長影片理解
  • Function Calling、結構化輸出與 Web Search 工作流程
  • 需要 1M 上下文但重視成本的長文件與大型程式庫
  • 自託管 Qwen4 預覽架構的研究與推理框架適配

複雜架構決策、關鍵安全稽核或高價值的一次性任務,仍應與 Qwen3.8-Max、GLM-5.3、Claude 或其他強模型比較。Flash 的價值是性價比與吞吐量,不是用一個型號取代所有評估。

Qwen3.8-Flash 與 Qwen3.8-Max 怎麼選?

如果任務量大、需要多模態、工具呼叫和 1M 上下文,優先從 Qwen3.8-Flash 開始做小流量驗證;如果任務更看重複雜推理上限、容錯能力和關鍵輸出品質,再將相同測試切換到 Qwen3.8-Max。

不要只比較一個答案。至少統計任務通過率、首 Token 延遲、總時長、工具呼叫成功率、輸入/輸出 Tokens、快取命中與返工次數。模型單價低,但需要更多輪重試時,整體成本未必更低。

正式環境評估檢查表

  1. 託管 API 使用 qwen3.8-flash,自託管使用 Qwen/Qwen3.8-Flash-Next
  2. 固定程式庫、Prompt、工具版本、逾時和驗收指令後再比較模型。
  3. 分別驗證思考與非思考模式,記錄回應格式差異。
  4. 分別測試文字、圖片、影片、Function Calling 與結構化輸出。
  5. 按 32K、128K、256K 和長上下文分檔測量延遲與帳務成本。
  6. 核對所選區域是否支援 Batch、快取和所需的內建工具。
  7. 為工具次數、最大輸出、總預算和外部操作設定上限。
  8. 為容量不足、限流或協定不相容保留備用路由。

重點結論

  • qwen3.8-flash 是本站和 Alibaba Cloud 託管 API 的準確模型 ID。
  • Qwen/Qwen3.8-Flash-Next 是開源權重名稱,不應填入託管 API 的 model 參數。
  • 託管版本預設 1M 上下文,支援圖片、文字、影片輸入以及 Function Calling。
  • 它由 125B 主模型、51B N-gram Embedding 組成,每個 Token 啟用 6B 參數。
  • 官方基準和區域價格必須與本站路由表現、倍率和帳務紀錄分開看待。
  • 正式環境選型要同時考慮通過率、延遲、用量、工具成功率與返工成本。

常見問題

Qwen3.8-Flash 正式上線了嗎?

是。Qwen 團隊於 2026 年 8 月 26 日發布 Flash-Next 權重,Alibaba Cloud 官方模型頁已列出正式環境呼叫 ID qwen3.8-flash;本站也已開放同名路由。

Qwen3.8-Flash 的上下文長度是多少?

託管正式 API 預設支援 1M 上下文。開源 Flash-Next 原生支援 262,144 Tokens,可透過 YaRN 擴展到 1,000,000 Tokens。

Qwen3.8-Flash 支援圖片和影片嗎?

支援。Alibaba Cloud 官方能力表列出圖片、文字和影片輸入、文字輸出,以及 Function Calling 與結構化輸出。

Qwen3.8-Flash-Next 與 Qwen3.8-Flash 是同一個 ID 嗎?

不是。前者是開源儲存庫與自託管權重名稱,後者是正式 API 的 model 參數值。

Qwen3.8-Flash 支援思考模式嗎?

支援思考和非思考模式。不同相容介面對擴充參數的映射可能不同,應先驗證最小請求,再加入思考設定。

Qwen3.8-Flash 可以用於 Claude Code 或 Codex 嗎?

Alibaba Cloud 說明它相容於 OpenAI 和 Anthropic 協定,並點名 Claude Code 與 Codex。實際接入仍需要測試工具呼叫、串流輸出、逾時和用量回傳。

Qwen3.8-Flash 官方價格是多少?

QwenCloud 首發稿給出每百萬輸入 Tokens 0.16 美元、每百萬輸出 Tokens 0.47 美元;Alibaba Cloud Model Studio 按區域另有 CNY 價格。本站倍率與帳務是獨立口徑,請查看即時價格頁。

在哪裡購買或儲值 Qwen3.8-Flash API?

新使用者可前往API 購買頁,已有 Key 的使用者可使用儲值頁

主要來源