Qwen3.8-Flash API 价格与接入指南 2026:1M 多模态
2026 年 8 月 27 日,Qwen3.8-Flash-Next 开源后的第二天,我们为本站刚开放的 qwen3.8-flash 路由整理接入资料。第一处最容易踩的坑就在名字里:开源权重与生产 API 不是同一个 Model ID。
**Qwen3.8-Flash-Next 是用于预览 Qwen4 架构的开源多模态 MoE;qwen3.8-flash 是阿里云百炼与 QwenCloud 提供的生产 API 模型,默认支持 1M 上下文、图片/文本/视频输入、Function Calling 和结构化输出。**本站已开放 qwen3.8-flash 路由;本站倍率和实际扣费以实时价格页与账单为准。
本文将开源模型架构、阿里云官方 API 能力、官方直连价格和本站路由分开说明。Qwen 团队公布的基准不是本站独立复测,阿里云区域价格也不能直接换算为本站倍率。
Qwen3.8-Flash 核心数据
| 项目 | 已核实信息 |
|---|---|
| 官方发布时间 | 2026 年 8 月 26 日 |
| 本站 / 百炼 API ID | qwen3.8-flash |
| 开源权重 ID | Qwen/Qwen3.8-Flash-Next |
| 参数结构 | 125B 主模型 + 51B N-gram Embedding,6B 激活参数 |
| 上下文 | 生产 API 默认 1M;开源版原生 262,144,可通过 YaRN 扩展到 1M |
| 输入 / 输出模态 | 图片、文本、视频输入;文本输出 |
| API 能力 | Function Calling、结构化输出、Web Search、上下文缓存 |
| 公开定位 | Coding Agent、办公自动化、视觉理解、高并发工作流 |
| 本站倍率 | 不在文章中写死,以实时价格页与实际账单为准 |
资料最后核验于 2026 年 8 月 27 日。生产上线前请再次检查模型列表、百炼区域文档和实际响应中的用量字段。
Qwen3.8-Flash 与 Qwen3.8-Flash-Next 是什么关系?
Qwen 团队先公开 Qwen3.8-Flash-Next 权重,让社区提前研究 Qwen4 将采用的架构;生产版本则以 Qwen3.8-Flash 名称提供服务。两者共享技术方向,但调用方式不同。
| 名称 | 用途 | 准确 ID | 上下文 |
|---|---|---|---|
| Qwen3.8-Flash-Next | 自托管、架构研究、开源评估 | Qwen/Qwen3.8-Flash-Next |
原生 262,144,YaRN 可扩至 1M |
| Qwen3.8-Flash | 托管生产 API | qwen3.8-flash |
默认 1M |
| Qwen3.8-Max | 高能力旗舰托管模型 | qwen3.8-max |
1M |
如果通过本站或阿里云兼容接口调用,不要把 Hugging Face 仓库名填进 model 参数。反过来,自托管时也不能只写托管 API ID 并期待框架自动下载权重。
Qwen3.8-Flash-Next 的新架构是什么?
Qwen3.8-Flash-Next 以 Gated DeltaNet(GDN)和 Qwen Sparse Attention(QSA)组成混合注意力。GDN 将历史压缩进固定状态,QSA 用轻量索引器按微块选择重要上下文,降低长序列中的注意力计算与 KV Cache 访问成本。
它还加入 Gated Residual(GR),把残差流扩展为四个分支并用动态门控制读写;N-gram Embedding 用局部上下文查表,在很少增加每 Token 矩阵计算的情况下扩展模型容量。训练使用改进后的 Muon Optimizer,并重新拟合 Scaling Law。
官方公布的规模是 125B 主模型、额外 51B N-gram Embedding、每 Token 激活 6B 参数。Qwen 团队称,其训练成本约为 Qwen3.7-Plus 的九分之一;这是厂商的训练对比,不是本站推理成本实测。
1M 上下文与多模态能力有哪些边界?
阿里云 Qwen3.8-Flash 模型页给出的上下文长度为 1,000,000 Tokens:普通模式最大输入 991,808、思考模式最大输入 983,616,最大输出 131,072,最大思考链长度 262,144。图片、文本和视频可以作为输入,输出为文本。
1M 不等于每次都应该提交接近 1M Tokens。系统提示词、工具 Schema、图片/视频编码、历史消息和输出预留都会占用窗口;超长请求还会增加延迟和费用。生产系统应先做 32K、128K、256K 和长上下文分档测试。
官方能力表还列出 Function Calling、结构化输出、Web Search 和上下文缓存。Batch 在北京区域支持、在新加坡区域标为不支持——区域差异必须在部署前单独核对。
Qwen 官方编程与 Agent 基准怎么看?
Qwen 团队发布了 Qwen3.8-Flash-Next 与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 等模型的对比。下面摘录四项:
| 厂商发布评测 | Qwen3.7-Plus | Qwen3.8-Flash-Next | 任务类型 |
|---|---|---|---|
| DeepSWE 1.1 | 16.5 | 58.7 | Agentic coding |
| SWE-bench Multilingual | 75.8 | 81.0 | 多语言软件工程 |
| CoWorkBench | 65.1 | 73.9 | 长周期办公任务 |
| Toolathlon Verified | 50.6 | 73.5 | 真实工具调用 |
**这些分数来自 Qwen 官方发布,不是本站独立复测。**模型版本、推理预算、工具环境和评分器会显著影响结果。尤其不能把开源 Flash-Next 的分数直接当作托管 API 在你的客户端、地区与配额下的端到端表现。
Qwen3.8-Flash 官方价格与本站价格如何区分?
Qwen 发布稿在首发时写明,QwenCloud 生产版本的参考价格为每百万输入 Tokens 0.16 美元、每百万输出 Tokens 0.47 美元;同一发布稿当时还注明 API 即将开放。随后阿里云百炼模型页已列出 qwen3.8-flash 调用 ID,并按北京、新加坡等区域提供不同的 CNY 价格与能力表。
这两套数字都是官方直连口径,而且可能随区域、缓存、Batch 和活动变化。**本站不把官方美元价或百炼区域价直接换算成网关倍率。**本站 qwen3.8-flash 的倍率、缓存和实际扣费,以实时价格页及请求账单为准。
新用户可从API 购买页小额开通;已有 Key 可在充值页补充余额。先固定 Prompt 与上下文长度,记录输入、输出和缓存 Tokens,再比较真实成本。
如何调用 Qwen3.8-Flash API
本站提供 OpenAI-compatible Chat Completions 接口,准确模型 ID 是 qwen3.8-flash:
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{
"role": "user",
"content": "Summarize the failing tests, then propose the smallest safe patch."
}
]
}'
Qwen3.8-Flash 支持思考与非思考模式,但不同兼容层对 enable_thinking、reasoning_effort、工具流式参数和内置工具的映射可能不同。先从最小文本请求开始,再逐项增加思考、图片、视频、工具与长上下文,不要一次把所有扩展参数都带上。
Qwen3.8-Flash 适合哪些任务?
- 高并发 Coding Agent、代码审查与测试失败分析
- 跨语言代码仓库和 SWE-bench 类软件工程任务
- 邮件、表格、文档与会议材料的长周期办公自动化
- 图片、图表和长视频理解
- Function Calling、结构化输出与 Web Search 工作流
- 需要 1M 上下文但对成本敏感的长文档与大型代码库
- 自托管 Qwen4 预览架构的研究与推理框架适配
复杂架构决策、关键安全审计或高价值一次性任务仍应与 Qwen3.8-Max、GLM-5.3、Claude 或其他强模型对照。Flash 的价值是性价比与吞吐,不是用一个型号替代所有评估。
Qwen3.8-Flash 与 Qwen3.8-Max 怎么选?
如果任务量大、需要多模态、工具调用和 1M 上下文,优先从 Qwen3.8-Flash 做小流量验证;如果任务更看重复杂推理上限、容错与关键输出质量,再将相同测试切到 Qwen3.8-Max。
不要只比较一条答案。至少统计任务通过率、首 Token 延迟、总时长、工具调用成功率、输入/输出 Tokens、缓存命中与返工次数。模型单价低但需要更多轮重试时,整体成本未必更低。
生产评估清单
- 托管 API 使用
qwen3.8-flash,自托管使用Qwen/Qwen3.8-Flash-Next。 - 固定仓库、Prompt、工具版本、超时和验收命令后再比较模型。
- 分别验证思考与非思考模式,记录响应格式差异。
- 分别测试文本、图片、视频、Function Calling 与结构化输出。
- 按 32K、128K、256K 和长上下文分档测延迟与账单。
- 核验所选区域是否支持 Batch、缓存和所需内置工具。
- 给工具次数、最大输出、总预算和外部操作设置上限。
- 保留容量不足、限流或协议不兼容时的备用路由。
关键结论
qwen3.8-flash是本站与阿里云托管 API 的准确模型 ID。Qwen/Qwen3.8-Flash-Next是开源权重名,不应填入托管 API 的model参数。- 托管版本默认 1M 上下文,支持图片、文本、视频输入以及 Function Calling。
- 125B 主模型 + 51B N-gram Embedding,每 Token 激活 6B 参数。
- 官方基准和官方区域价格必须与本站路由表现、倍率和账单分开。
- 生产选型要同时看通过率、延迟、用量、工具成功率与返工成本。
常见问题
Qwen3.8-Flash 正式上线了吗?
是。Qwen 团队于 2026 年 8 月 26 日发布 Flash-Next 权重,阿里云官方模型页已列出生产调用 ID qwen3.8-flash;本站也已开放同名路由。
Qwen3.8-Flash 的上下文是多少?
托管生产 API 默认支持 1M 上下文。开源 Flash-Next 原生支持 262,144 Tokens,可通过 YaRN 扩展到 1,000,000 Tokens。
Qwen3.8-Flash 支持图片和视频吗?
支持。阿里云官方能力表列出图片、文本和视频输入,输出为文本,同时支持 Function Calling 与结构化输出。
Qwen3.8-Flash-Next 与 Qwen3.8-Flash 是同一个 ID 吗?
不是。前者是开源仓库与自托管权重名,后者是生产 API 的 model 参数值。
Qwen3.8-Flash 支持思考模式吗?
支持思考和非思考模式。不同兼容接口对扩展参数的映射可能不同,应先验证最小请求,再增加思考配置。
Qwen3.8-Flash 可以用于 Claude Code 或 Codex 吗?
阿里云官方将其列为兼容 OpenAI 与 Anthropic 协议,并点名 Claude Code 与 Codex。实际接入仍要测试工具调用、流式输出、超时和用量返回。
Qwen3.8-Flash 官方价格是多少?
QwenCloud 首发稿给出每百万输入 0.16 美元、输出 0.47 美元;阿里云百炼按区域另有 CNY 价格。本站倍率与账单是独立口径,请查看实时价格页。
在哪里购买或充值 Qwen3.8-Flash API?
主要来源
- Qwen:Qwen3.8-Flash-Next — A New Architecture, Towards Ultimate Cost-Efficiency:架构、参数、上下文、厂商基准、开源与 QwenCloud 定价口径
- Alibaba Cloud Model Studio:Qwen3.8-Flash 模型信息:生产模型 ID、模态、上下文、Function Calling、结构化输出与区域能力
- Qwen 官方 GitHub:Qwen3.8-Flash-Next:开源权重命名、技术报告与版本记录
- 本站模型列表:当前路由与接入入口;价格和可用性仍以实时页面为准