MiniMax M3.1 Flash:1M 上下文、API 接入与 M3 迁移指南

MiniMax 最新的 M 系列路由是 MiniMax-M3.1-flash。它面向 Agent 推理、工具调用、代码和长上下文任务,支持最多 1,000,000 Tokens 上下文、文本图片视频输入,以及可调的思考深度。
这次更新最容易被忽略的地方是模型 ID:本站当前模型目录使用新的 MiniMax-M3.1-flash,不要继续把早期资料里的 Preview 后缀当作请求 ID。准备接入前,先确认账号权限、实际模型列表和当前价格,再把代码切过去。
本文依据 MiniMax 官方模型调用文档整理,官方跑分、第三方延迟和本文站点的可用性不混在一起。本站的模型 ID、路由和计费以实时模型价格及实际调用结果为准。
MiniMax M3.1 Flash 的关键规格
| 项目 | 官方信息 |
|---|---|
| 精确模型 ID | MiniMax-M3.1-flash |
| 上下文窗口 | 1,000,000 Tokens |
| 输入 | 文本、图片、视频 |
| 输出 | 文本 |
| 思考模式 | 始终开启,不能关闭 |
| 思考深度 | low、medium、high、xhigh、max |
| 默认思考深度 | max |
| 推荐协议 | Anthropic-compatible |
| OpenAI 兼容端点 | https://api.minimax.io/v1 |
| Anthropic 兼容端点 | https://api.minimax.io/anthropic |
| 当前本站路由 | 模型目录已登记 MiniMax-M3.1-flash |
1M 上下文适合长文档、完整代码仓库和多轮 Agent 会话,但不代表每次请求都应该塞满上下文。输入越长,延迟、输出预算和实际消耗都可能上升,应先用自己的任务测量。
M3.1 和 MiniMax M3 有什么不同?
两者都面向长上下文、多模态和代码工作流,但迁移时不能只替换 model 字符串:
| 能力 | M3.1 Flash | MiniMax M3 |
|---|---|---|
| 思考 | 始终开启 | 可按请求开启或关闭 |
| 思考深度 | low 到 max |
没有本文所述的 effort 档位 |
| OpenAI 兼容字段 | reasoning_effort,思考内容在 reasoning_content |
以当前接口返回结构为准 |
| 上下文 | 1M | 1M |
| 输入 | 文本、图片、视频 | 官方页面列出图片、视频输入 |
| 缓存 | 支持 | 支持 |
如果旧代码发送 thinking: {"type": "disabled"} 或 effort: "none",M3.1 会返回 400。想降低延迟和思考消耗,应把 reasoning_effort 调低,而不是尝试关闭思考。
OpenAI SDK 怎么调用 MiniMax M3.1?
MiniMax 官方文档提供了 OpenAI-compatible 调用方式。先安装 SDK,并把密钥放在环境变量里:
pip install openai
export MINIMAX_API_KEY="your_api_key"
最小的 Chat Completions 示例如下:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.minimax.io/v1",
api_key=os.environ["MINIMAX_API_KEY"],
)
response = client.chat.completions.create(
model="MiniMax-M3.1-flash",
reasoning_effort="high",
messages=[
{"role": "user", "content": "用三句话说明一个 API 的重试边界。"},
],
)
print(response.choices[0].message.content)
reasoning_effort 支持 low、medium、high、xhigh 和 max。在 OpenAI-compatible 返回中,思考内容位于 reasoning_content,最终答案位于 content。业务代码应该允许 reasoning_content 缺失,并只在确实需要展示或记录时读取它。
如果使用 Anthropic SDK,官方把该协议列为推荐路径:
import anthropic
client = anthropic.Anthropic(
base_url="https://api.minimax.io/anthropic",
api_key="your_api_key",
)
message = client.messages.create(
model="MiniMax-M3.1-flash",
output_config={"effort": "high"},
max_tokens=4096,
messages=[{"role": "user", "content": "检查这段代码的边界条件。"}],
)
两种协议的字段名称不同:Anthropic-compatible 使用 output_config.effort,OpenAI-compatible 使用 reasoning_effort。迁移时要一起检查思考内容字段、输出上限和流式事件,不能只替换 Base URL。
哪些任务适合先测 M3.1?
- 代码仓库维护: 提供仓库、复现步骤、验收标准和测试命令,观察它是否能完成定位、修改和验证闭环。
- 长文档研究: 把资料、时间范围和引用要求写清楚,检查它是否区分来源、假设和结论。
- 多模态分析: 让模型读取截图或视频片段,再要求输出结构化检查结果;图片或视频输入成功不代表它会生成图片或视频。
- 工具调用: 先用一个可回滚的小任务验证工具参数、错误处理和重复调用,再扩大权限和上下文。
官方案例展示的是特定任务和环境下的结果,不能直接当成所有项目的速度或质量保证。上线前应记录模型 ID、思考档位、输入输出 Token、完成时间和失败重试次数。
从 M3 迁移到 M3.1 的检查清单
- 用精确的
MiniMax-M3.1-flash替换旧模型名,并确认账号确实有权限。 - 删除关闭思考的参数,把
reasoning_effort或output_config.effort设为明确档位。 - 更新响应解析:允许
reasoning_content缺失,最终文本读取content。 - 增大输出预算,避免思考 Token 和最终答案共享的小上限导致截断。
- 分别测试文本、图片、视频、工具调用、流式响应和缓存命中。
- 用同一组任务比较完成率、总延迟、Token 用量和实际账单。
常见问题
为什么旧资料里还会出现 Preview 后缀?
部分供应商早期资料仍会带 Preview 后缀,但本站当前公开模型目录使用新的 MiniMax-M3.1-flash 路由 ID。实际可用范围和计费仍以账号权限、实时目录和账单为准。
M3.1 Flash 可以关闭思考吗?
不可以。官方文档说明思考始终开启,发送关闭思考或 effort: "none" 会返回 400。需要降低延迟时,选择较低的思考档位。
MiniMax M3.1 的上下文是多少?
官方列出的上下文窗口是 1,000,000 Tokens。实际可用长度仍受接口、输出预算、客户端限制和账户策略影响。
MiniMax M3.1 支持 OpenAI SDK 吗?
支持。官方文档给出了 OpenAI-compatible Base URL https://api.minimax.io/v1 和 Chat Completions 示例。兼容协议不等于所有 OpenAI 特性都可用,工具、流式和 Responses 形态应逐项验证。
本站现在能直接调用 M3.1 吗?
本站公开模型目录会随着路由和供应商权限变化。请先查看实时模型价格,按页面显示的精确 Model ID 做小额验证;不要因为官方已经发布就推断第三方网关已经同步。
参考资料
- MiniMax 官方模型调用文档:模型 ID、上下文、协议、思考参数和示例。
- MiniMax 官方 API 总览:M3.1 Flash 的当前可用范围与 API 入口。
- MiniMax M Plan:订阅计划和 M3.1 Flash 的使用范围。
- MiniMax M3.1 Flash 任务案例:编码、研究和多模态任务示例。
资料核对日期:2026 年 10 月 1 日。本文是接入与选型说明,不是独立性能测评。