小米 MiMo-V2.6 Pro / Flash 发布:开源第一、价格与 CodeMidas 解读
**小米 MiMo-V2.6 这次最值得关注的,是 Pro 和 Flash 两个全模态模型在大规模强化学习之后的能力提升,以及延续上一代的官方 API 定价。**Pro 面向复杂、长程任务;Flash 更适合先拿来评估高频办公、代码辅助和批量处理。两者官方规格均为 1M 上下文、128K 最大输出,支持文本、图片、音频、视频输入,输出为文本。Pro 官方规格、Flash 官方规格
至于“小米 MiMo 为何登顶开源第一”,更准确的说法是:**在本次发布时,小米以 MiMo-V2.6-Pro 的 Artificial Analysis 综合智能指数 46 分,报告其位居开源模型首位。**截至 2026 年 9 月 22 日,AA 模型页也显示 46 分;这不是所有真实任务的冠军证明。本文结合官方文档、CodeMidas 论文与发布资料展开分析,没有把第三方体验改写成本站实测。AA 模型页、小米发布说明
MiMo-V2.6 Pro 和 Flash 有什么区别?
先把共同规格和使用定位分开看。下表的模态与长度来自小米官方接口资料,选型建议则需要用自己的任务验证。
| 对比项 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| API 模型 ID | mimo-v2.6-pro |
mimo-v2.6-flash |
| 官方定位 | 复杂工作流、长程推理与专业任务 | 高频调用、规模化任务与成本控制 |
| 输入 / 输出 | 文本、图像、音频、视频输入;文本输出 | 文本、图像、音频、视频输入;文本输出 |
| 上下文 / 最大输出 | 1M / 128K Tokens | 1M / 128K Tokens |
| 优先评估的任务 | 跨文件修改、多步骤研究、复杂规划 | 信息提取、摘要、日常代码辅助、批量办公 |
如果还没有自己的评测集,可以先用 Flash 建立成本和质量基线,再把它处理不好的任务交给 Pro。对于一次错误就会造成较多返工的工作,直接比较两者的最终交付质量更有意义。不要只凭“Flash”这个名字推断它在所有网络、客户端和输出长度下都更快。
本文涉及本站接入时,仅使用 Pro 与 Flash 两个 ID。小米另有 UltraSpeed 产品,本站未提供该路由。
AA 46 分意味着什么,“开源第一”又不意味着什么?
Artificial Analysis 的综合智能指数将多项评测合并为一个分数,适合用来缩小候选范围。它不能直接回答“哪个模型最会改我的仓库”,也不能替代对文件处理、浏览器工具、重试和交付物的检查。
还要留意榜单的比较范围:AA 模型页顶部的名次按同类模型分组,页面明确说明开放权重模型还会按参数规模分类。因此,不能拿一个分组的“第 1 名”推导出“超过所有闭源模型”。文章中的排名均限定为发布时的说法和核验日期,后续应以AA 当前模型页及方法说明为准。
对于开发者,更实用的判断是:**46 分让 MiMo-V2.6-Pro 值得进入候选清单,真实任务的验收结果才决定是否迁移。**例如代码任务要能通过测试,数据整理要能回查原始单元格,研究报告要能逐条打开引用。
编程与 Agent 跑分:两组 DeepSWE 数据不要混用
下面的发布资料截图包含 Pro、Flash、上一代模型和其他模型的比较。它属于发布方披露的评测材料,不是本站独立横评。

图:MiMo-V2.6 发布资料原始截图。以下将与本文选型相关的数字整理为可读文本。
| 发布对比表中的项目 | Pro | Flash | 能帮助判断什么 |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 软件工程问题修复 |
| ProgramBench | 26.5 | 26.0 | 完整程序构建 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 终端任务与工具使用 |
| MiMo Visual Coding | 72.3 | 71.5 | 视觉输入下的编程任务 |
这几项中 Flash 与 Pro 的分差有限,可以作为“是否先试 Flash”的依据,但不能推导出多数生产任务表现相同。尤其是多轮任务,前面一个小错误可能在后续步骤放大。
另一个容易误读的地方,是官方 Live RL 训练过程披露的 DeepSWE v1.1 变化:Pro 为 58.4 → 72.6,Flash 为 48.8 → 65.7。这与上面的发布对比表不是同一组数值。当前资料没有充分解释二者在检查点和评测设置上的全部差别,本文保留各自来源,不拼成一张“统一排名表”。Live RL 过程说明
347 万美元的 Live RL,究竟投入了什么?
小米披露,不到六天的这轮训练中,Pro 成本约 262 万美元,Flash 约 85 万美元,合计约 347 万美元;两款各完成 30 步。这是所披露的这一轮 RL 训练成本,不能写成研发、预训练、数据与基础设施在内的模型总成本。官方训练说明
从提供的训练资料看,扩展主要围绕三件事:增加每次更新的样本与 Token 吞吐;混合代码、通用 Agent、视觉、网络安全任务及不同运行环境;投入更多计算来评价结果与提供奖励。公开训练过程的价值,在于让外界看到性能如何随训练推进变化,而不只看到最终一张分数表。
Flash 的这一轮训练费用更低,不代表它在每个业务任务上的投入产出一定更好。对使用者而言,采购决策最终仍应落到每个验收通过任务的成本,而不是模型厂商花了多少训练费。
CodeMidas:把现成代码变成可验证的 RL 训练任务
和这次发布一起值得读的,是小米团队的 CodeMidas 论文。它讨论一个很具体的问题:怎样持续生产带可靠判分器的编程任务,而不完全依赖现成 issue 或提交记录?
可以用一个数据处理函数来理解:项目里本来已经有一份可工作的实现,系统先描述它应该完成的行为,再删除需要模型重建的核心代码,保留合理的接口、项目结构和依赖。原始实现单独保留,用它运行输入、生成预期结果,随后验证模型提交的代码是否满足需求。

图:CodeMidas 论文流程图;对应论文 Figure 1 与方法章节。
这里的重点不只是“把代码挖掉”。流程还要检查环境能否运行、编译产物或缓存有没有泄露答案,以及验证器有没有错判。参考代码提供行为依据,但正确解法可以有不同的内部实现。
论文报告最终构建了 5,545 个任务,来自 3,185 个代码库,覆盖 23 种编程语言。还应注意:论文中的主要训练实验使用的是 MiMo-V2.5,这些实验结果不能直接当成 V2.6 的整轮训练结果,任务数也不能与发布稿另一套 RL 环境数量直接相加。
对工程团队的启发是:评价编程 Agent,应提前准备可执行的验收条件。如果评估只有“看起来差不多”,就很难区分模型是解决了问题、绕过了问题,还是迎合了一个不完整的测试。
MiMo-V2.6 API 价格:官方缓存价和本站倍率分别看
小米表示 V2.6 延续 V2.5 系列 API 定价。核验日的官方人民币实时 API 价格如下,单位全部为 元 / 百万 Tokens,不是单次请求价格。Pro 定价、Flash 定价
| 小米官方直连 API | 缓存命中输入 | 未命中输入 | 输出 |
|---|---|---|---|
| MiMo-V2.6-Pro | ¥0.025 | ¥3 | ¥6 |
| MiMo-V2.6-Flash | ¥0.02 | ¥1 | ¥2 |
小米的 Batch API 文档另列离线批量推理价格,适合不要求立即响应的任务;这项服务不等同于客户端同时发送多个普通请求,也不代表本站提供同样的批量接口。
本站公开价格资料采用另一套倍率口径,2026 年 9 月 22 日核对的快照为:
| 本站模型 ID | 公开倍率 | 公开表百万 Tokens 参考价 |
|---|---|---|
mimo-v2.6-pro |
4 倍率 | ¥1.6 |
mimo-v2.6-flash |
2 倍率 | ¥0.8 |
来源:本站公开价格文档。这两行不应与上表的缓存、输入、输出三栏混算;下单或扩大调用前,查看实时模型价格,以当前配置和实际账单确认费用。
为什么缓存命中率会影响长任务成本?
按小米直连实时 API 的三项费率,若各类 Token 用量以百万为单位,Token 费用可以写成:
费用 = 缓存命中输入量 × 缓存价 + 未命中输入量 × 输入价 + 输出量 × 输出价
例如,假设 Pro 的 100 万输入 Tokens 中有 90% 命中缓存,另产生 10 万输出 Tokens,按上面的官方直连价格计算:0.9 × 0.025 + 0.1 × 3 + 0.1 × 6 = 0.9225 元。如果同样的输入完全没有缓存命中,则为 1 × 3 + 0.1 × 6 = 3.6 元。这是计算示例,不是实测账单,也不适用于直接估算本站倍率计费。
参考材料中出现的“95.7% 缓存命中率”“五个任务约九元”等数字属于特定第三方体验记录。本文没有复现其客户端、上下文或账单,因此不把它们当作每位用户都能得到的效果。实际评估时,应记录命中量、重试、思考输出和最终交付质量。
真实任务怎么测:五个比一句话演示更有用的题目
本文所据的第三方体验资料涉及 3D 建模、前端设计、真实 issue、办公数据和长程研究。下面将这些方向转化为可重复的验收方法;它们是测试建议,不是本站已经完成的模型成绩。
| 任务 | 建议提供的输入 | 验收重点 |
|---|---|---|
| 3D 建模 | 有来源的尺寸、参考图片、指定交付格式 | 比例正确,资产可打开,渲染后能发现并修正问题 |
| 前端设计 | 品牌限制、信息层级、移动端要求 | 页面可运行,响应式正常,按钮有行为,视觉方案满足要求 |
| 仓库修复 | 固定代码版本、issue 描述、可复现步骤 | 原问题消失,回归测试通过,没有修改无关行为 |
| 办公数据 | 原始页面或表格、字段定义、预期行数 | 每行可回溯,漏项可发现,修正过程留有记录 |
| 长程研究 | 具体问题、时间范围、允许使用的来源 | 引用能打开,事实与推断分开,缺证据时明确空缺 |
对 Pro 与 Flash 使用同一任务、同一工具权限和同一验收标准,记录首次通过率、总耗时、人工修正时间和最终费用。可以用“总调用费用 ÷ 验收通过任务数”观察有效成本,避免只比较 Token 单价。
MiMo Desktop 可以作为评估入口,但客户端还包含系统提示、工具和上下文管理。更换成自己的 Agent 框架后,表现可能不同,不能把某个客户端的成功案例直接等同于任意 API 集成的效果。
MiMo-V2.6 Pro / Flash API 接入示例
本站两个模型 ID 均采用全小写。先用简单文本验证连接和返回,再逐步加入图片与工具调用。以下示例使用本站公开 Base URL,API_KEY 从自己的运行环境读取:
curl "https://api.llm-token.cn/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "为一个 CSV 导入功能列出三项可执行的验收标准,包含编码、空值和重复行。"
}
],
"stream": false
}'
比较 Pro 时,仅将 model 改为 mimo-v2.6-pro,保留相同输入。记录返回的模型名、用量和账单。音频、视频与工具参数需按所用服务的接口说明配置,模型具备某种能力并不意味着客户端已实现对应输入格式。
接入前可查看 Pro 模型指南和 Flash 模型指南。需要开通或补充额度时,分别使用购买入口与充值入口。
常见问题
MiMo-V2.6-Pro 真的是最强开源模型吗?
应限定为发布时所说的 AA 综合智能指数排名,分数为 46。这个表述不代表它在所有代码库、研究任务、语言和客户端中都优于其他模型;榜单版本和日期也会影响比较。
MiMo-V2.6 Flash 能替代 Pro 吗?
可以先在摘要、提取、日常编码等任务上评估 Flash。遇到多步骤依赖、复杂推理或较高返工成本时,再比较 Pro。发布表中的部分项目分数接近,不足以证明二者可以在所有任务中互换。
全模态是否意味着能直接输出图片、音频或视频?
不意味着。这里两款模型的官方输出模态是文本。生成网页、3D 资产或视频的案例,通常涉及模型编写代码并调用外部工具完成交付。
开源了哪些内容?
小米发布说明列出 Pro / Flash 权重、技术报告及配套 RL 研究资源;官方 MiMo-V2.6 开源合集是检查具体资源的入口。实际复现还要核对各仓库的许可证、依赖和算力需求,开放权重不等于普通电脑就能完整复现训练。
CodeMidas 与这次模型发布是什么关系?
它是理解小米编程 RL 任务构建思路的一项相关研究,展示了如何从已有功能构造可执行、可判分的任务。论文以 MiMo-V2.5 开展的实验,应与 V2.6 发布成绩分别引用,不能把两者视作同一实验。
如何理解官方缓存价与本站价格?
小米官方直连将缓存输入、普通输入和输出分别计价;本站公开资料按平台倍率列出参考价格。先确定自己使用的 Base URL、Key 和服务商,再查询相应价格与账单,不要跨平台混用费率。
资料与核验说明
本文由本站编辑整理,核验日期为 2026 年 9 月 22 日。内容为发布资料分析与接入指南,未执行模型对比实测。配图为 CodeMidas 流程图与 MiMo 发布截图;第三方体验摘录未附可核对的原文链接,仅用于设计评估问题,未沿用原文作者的第一人称叙述。
- 小米 MiMo-V2.6 发布说明:发布定位、Live RL 过程与开源说明。
- MiMo-V2.6-Pro 官方模型页、MiMo-V2.6-Flash 官方模型页:规格与官方直连价格。
- Artificial Analysis 模型页:AA 分数、比较分组与方法入口。
- CodeMidas 论文、论文全文:任务构建与验证流程,实验使用 MiMo-V2.5。
- 本站公开价格文档:本站 Pro / Flash 倍率快照;实时配置见模型价格页。