Qwen3.8-Flash API 價格與程式設計指南 2026:1M 多模態
2026 年 8 月 27 日,也就是 Qwen3.8-Flash-Next 開源的隔天,我們為本站新開放的 qwen3.8-flash 路由整理接入資料。最容易踩到的坑就在名稱裡:開源權重與正式環境 API 並不是同一個 Model ID。
Qwen3.8-Flash-Next 是用來預覽 Qwen4 架構的開源多模態 MoE;qwen3.8-flash 則是 Alibaba Cloud Model Studio 與 QwenCloud 提供的正式環境 API 模型,預設支援 1M 上下文、圖片/文字/影片輸入、Function Calling 和結構化輸出。 本站已開放 qwen3.8-flash 路由;本站倍率與實際扣費請查看即時價格頁和帳務紀錄。
本文會把開源模型架構、Alibaba Cloud 官方 API 能力、官方直連價格與本站路由分開說明。Qwen 團隊公布的基準不是本站獨立重測結果,Alibaba Cloud 的區域價格也不能直接換算成本站倍率。
Qwen3.8-Flash 核心資料
| 項目 | 已核實資訊 |
|---|---|
| 官方發布時間 | 2026 年 8 月 26 日 |
| 本站/Model Studio API ID | qwen3.8-flash |
| 開源權重 ID | Qwen/Qwen3.8-Flash-Next |
| 參數結構 | 125B 主模型 + 51B N-gram Embedding,6B 啟用參數 |
| 上下文 | 正式 API 預設 1M;開源版原生 262,144,可透過 YaRN 擴展至 1M |
| 輸入/輸出模態 | 圖片、文字與影片輸入;文字輸出 |
| API 能力 | Function Calling、結構化輸出、Web Search、上下文快取 |
| 公開定位 | Coding Agent、辦公自動化、視覺理解、高並發工作流程 |
| 本站倍率 | 本文不寫死,以即時價格頁與實際帳務紀錄為準 |
資料最後核驗於 2026 年 8 月 27 日。正式上線前,請重新檢查模型列表、Alibaba Cloud 區域文件和實際回應中的用量欄位。
Qwen3.8-Flash 與 Qwen3.8-Flash-Next 是什麼關係?
Qwen 團隊先發布 Qwen3.8-Flash-Next 權重,讓社群可以提前研究 Qwen4 將採用的架構;正式環境版本則以 Qwen3.8-Flash 的名稱提供服務。兩者共享技術方向,但呼叫方式不同。
| 名稱 | 用途 | 準確 ID | 上下文 |
|---|---|---|---|
| Qwen3.8-Flash-Next | 自託管、架構研究、開源評估 | Qwen/Qwen3.8-Flash-Next |
原生 262,144,可用 YaRN 擴展至 1M |
| Qwen3.8-Flash | 託管正式環境 API | qwen3.8-flash |
預設 1M |
| Qwen3.8-Max | 追求更高能力的託管旗艦模型 | qwen3.8-max |
1M |
透過本站或 Alibaba Cloud 相容介面呼叫時,不要把 Hugging Face 儲存庫名稱填入 model 參數。反過來,自託管時也不能只寫託管 API ID,期待框架自動下載權重。
Qwen3.8-Flash-Next 的新架構是什麼?
Qwen3.8-Flash-Next 以 Gated DeltaNet(GDN)和 Qwen Sparse Attention(QSA)組成混合注意力。GDN 把歷史壓縮進固定狀態,QSA 則用輕量索引器按微區塊選擇重要上下文,降低長序列中的注意力計算與 KV Cache 存取成本。
它還加入 Gated Residual(GR),把殘差流擴展為四個分支,並用動態閘門控制讀寫;N-gram Embedding 會查找局部上下文,在幾乎不增加每 Token 矩陣計算的情況下擴展模型容量。訓練使用改進版 Muon Optimizer,並重新擬合 Scaling Law。
官方公布的規模是 125B 主模型、額外 51B N-gram Embedding,以及每個 Token 啟用 6B 參數。Qwen 團隊稱其訓練成本約為 Qwen3.7-Plus 的九分之一;這是廠商的訓練成本比較,不是本站推理成本實測。
1M 上下文與多模態能力有哪些邊界?
Alibaba Cloud Qwen3.8-Flash 模型頁列出的上下文長度為 1,000,000 Tokens:普通模式最大輸入 991,808、思考模式最大輸入 983,616、最大輸出 131,072、最大思考鏈長度 262,144。圖片、文字和影片可作為輸入,輸出則是文字。
1M 不代表每次都應該提交接近 1M Tokens。系統提示詞、工具 Schema、圖片/影片編碼、歷史訊息和輸出預留都會佔用視窗;超長請求也會增加延遲和費用。正式環境應先按 32K、128K、256K 和長上下文分檔測試。
官方能力表也列出 Function Calling、結構化輸出、Web Search 和上下文快取。Batch 在北京區域支援,在新加坡區域標示為不支援;部署前必須單獨核對區域差異。
如何解讀 Qwen 官方程式設計與 Agent 基準?
Qwen 團隊將 Qwen3.8-Flash-Next 與 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 等模型比較。以下摘錄四項:
| 廠商發布評測 | Qwen3.7-Plus | Qwen3.8-Flash-Next | 任務類型 |
|---|---|---|---|
| DeepSWE 1.1 | 16.5 | 58.7 | Agentic coding |
| SWE-bench Multilingual | 75.8 | 81.0 | 多語言軟體工程 |
| CoWorkBench | 65.1 | 73.9 | 長週期辦公任務 |
| Toolathlon Verified | 50.6 | 73.5 | 真實工具呼叫 |
**這些分數來自 Qwen 官方發布,不是本站獨立重測。**模型版本、推理預算、工具環境和評分器都會顯著影響結果。尤其不能把開源 Flash-Next 的分數直接當作你的用戶端、區域與配額下託管 API 的端到端表現。
Qwen3.8-Flash 官方價格與本站價格如何區分?
Qwen 發布稿在首發時寫明,QwenCloud 正式版本的參考價格為每百萬輸入 Tokens 0.16 美元、每百萬輸出 Tokens 0.47 美元;同一發布稿當時還註明 API 即將開放。之後 Alibaba Cloud Model Studio 頁面已列出 qwen3.8-flash 呼叫 ID,並按北京、新加坡等區域提供不同的 CNY 價格與能力表。
這兩套數字都是官方直連口徑,而且可能隨區域、快取、Batch 和活動變動。**本站不會把官方美元價格或 Model Studio 區域價格直接換算成閘道倍率。**本站 qwen3.8-flash 的倍率、快取和實際扣費,以即時價格頁和請求帳務紀錄為準。
新使用者可從API 購買頁小額開通;已有 Key 的使用者可在儲值頁補充餘額。先固定 Prompt 和上下文長度,記錄輸入、輸出與快取 Tokens,再比較實際成本。
如何呼叫 Qwen3.8-Flash API
本站提供 OpenAI 相容的 Chat Completions 介面,準確模型 ID 是 qwen3.8-flash:
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{
"role": "user",
"content": "Summarize the failing tests, then propose the smallest safe patch."
}
]
}'
Qwen3.8-Flash 支援思考與非思考模式,但不同相容層對 enable_thinking、reasoning_effort、工具串流參數與內建工具的映射可能不同。先從最小的文字請求開始,再逐項加入思考、圖片、影片、工具與長上下文;不要在第一個請求一次帶上所有擴充參數。
Qwen3.8-Flash 適合哪些任務?
- 高並發 Coding Agent、程式碼審查與測試失敗分析
- 跨語言程式庫與 SWE-bench 類型的軟體工程任務
- 電子郵件、試算表、文件與會議資料的長週期辦公自動化
- 圖片、圖表與長影片理解
- Function Calling、結構化輸出與 Web Search 工作流程
- 需要 1M 上下文但重視成本的長文件與大型程式庫
- 自託管 Qwen4 預覽架構的研究與推理框架適配
複雜架構決策、關鍵安全稽核或高價值的一次性任務,仍應與 Qwen3.8-Max、GLM-5.3、Claude 或其他強模型比較。Flash 的價值是性價比與吞吐量,不是用一個型號取代所有評估。
Qwen3.8-Flash 與 Qwen3.8-Max 怎麼選?
如果任務量大、需要多模態、工具呼叫和 1M 上下文,優先從 Qwen3.8-Flash 開始做小流量驗證;如果任務更看重複雜推理上限、容錯能力和關鍵輸出品質,再將相同測試切換到 Qwen3.8-Max。
不要只比較一個答案。至少統計任務通過率、首 Token 延遲、總時長、工具呼叫成功率、輸入/輸出 Tokens、快取命中與返工次數。模型單價低,但需要更多輪重試時,整體成本未必更低。
正式環境評估檢查表
- 託管 API 使用
qwen3.8-flash,自託管使用Qwen/Qwen3.8-Flash-Next。 - 固定程式庫、Prompt、工具版本、逾時和驗收指令後再比較模型。
- 分別驗證思考與非思考模式,記錄回應格式差異。
- 分別測試文字、圖片、影片、Function Calling 與結構化輸出。
- 按 32K、128K、256K 和長上下文分檔測量延遲與帳務成本。
- 核對所選區域是否支援 Batch、快取和所需的內建工具。
- 為工具次數、最大輸出、總預算和外部操作設定上限。
- 為容量不足、限流或協定不相容保留備用路由。
重點結論
qwen3.8-flash是本站和 Alibaba Cloud 託管 API 的準確模型 ID。Qwen/Qwen3.8-Flash-Next是開源權重名稱,不應填入託管 API 的model參數。- 託管版本預設 1M 上下文,支援圖片、文字、影片輸入以及 Function Calling。
- 它由 125B 主模型、51B N-gram Embedding 組成,每個 Token 啟用 6B 參數。
- 官方基準和區域價格必須與本站路由表現、倍率和帳務紀錄分開看待。
- 正式環境選型要同時考慮通過率、延遲、用量、工具成功率與返工成本。
常見問題
Qwen3.8-Flash 正式上線了嗎?
是。Qwen 團隊於 2026 年 8 月 26 日發布 Flash-Next 權重,Alibaba Cloud 官方模型頁已列出正式環境呼叫 ID qwen3.8-flash;本站也已開放同名路由。
Qwen3.8-Flash 的上下文長度是多少?
託管正式 API 預設支援 1M 上下文。開源 Flash-Next 原生支援 262,144 Tokens,可透過 YaRN 擴展到 1,000,000 Tokens。
Qwen3.8-Flash 支援圖片和影片嗎?
支援。Alibaba Cloud 官方能力表列出圖片、文字和影片輸入、文字輸出,以及 Function Calling 與結構化輸出。
Qwen3.8-Flash-Next 與 Qwen3.8-Flash 是同一個 ID 嗎?
不是。前者是開源儲存庫與自託管權重名稱,後者是正式 API 的 model 參數值。
Qwen3.8-Flash 支援思考模式嗎?
支援思考和非思考模式。不同相容介面對擴充參數的映射可能不同,應先驗證最小請求,再加入思考設定。
Qwen3.8-Flash 可以用於 Claude Code 或 Codex 嗎?
Alibaba Cloud 說明它相容於 OpenAI 和 Anthropic 協定,並點名 Claude Code 與 Codex。實際接入仍需要測試工具呼叫、串流輸出、逾時和用量回傳。
Qwen3.8-Flash 官方價格是多少?
QwenCloud 首發稿給出每百萬輸入 Tokens 0.16 美元、每百萬輸出 Tokens 0.47 美元;Alibaba Cloud Model Studio 按區域另有 CNY 價格。本站倍率與帳務是獨立口徑,請查看即時價格頁。
在哪裡購買或儲值 Qwen3.8-Flash API?
新使用者可前往API 購買頁,已有 Key 的使用者可使用儲值頁。
主要來源
- Qwen:Qwen3.8-Flash-Next — A New Architecture, Towards Ultimate Cost-Efficiency:架構、參數、上下文、廠商基準、開源與 QwenCloud 定價口徑
- Alibaba Cloud Model Studio:Qwen3.8-Flash 模型資訊:正式模型 ID、模態、上下文、Function Calling、結構化輸出與區域能力
- Qwen 官方 GitHub:Qwen3.8-Flash-Next:開源權重命名、技術報告與版本紀錄
- 本站模型列表:目前路由與接入入口;價格和可用性仍以即時頁面為準