返回博客列表

MiniMax M3.1 Flash:1M 上下文、API 接入与 M3 迁移指南

MiniMax M3.1MiniMax APIM3.1 FlashOpenAI 兼容 APIAI Coding
MiniMax M3.1 Flash:1M 上下文、API 接入与 M3 迁移指南 cover

MiniMax 最新的 M 系列路由是 MiniMax-M3.1-flash。它面向 Agent 推理、工具调用、代码和长上下文任务,支持最多 1,000,000 Tokens 上下文、文本图片视频输入,以及可调的思考深度。

这次更新最容易被忽略的地方是模型 ID:本站当前模型目录使用新的 MiniMax-M3.1-flash,不要继续把早期资料里的 Preview 后缀当作请求 ID。准备接入前,先确认账号权限、实际模型列表和当前价格,再把代码切过去。

本文依据 MiniMax 官方模型调用文档整理,官方跑分、第三方延迟和本文站点的可用性不混在一起。本站的模型 ID、路由和计费以实时模型价格及实际调用结果为准。

MiniMax M3.1 Flash 的关键规格

项目 官方信息
精确模型 ID MiniMax-M3.1-flash
上下文窗口 1,000,000 Tokens
输入 文本、图片、视频
输出 文本
思考模式 始终开启,不能关闭
思考深度 low、medium、high、xhigh、max
默认思考深度 max
推荐协议 Anthropic-compatible
OpenAI 兼容端点 https://api.minimax.io/v1
Anthropic 兼容端点 https://api.minimax.io/anthropic
当前本站路由 模型目录已登记 MiniMax-M3.1-flash

1M 上下文适合长文档、完整代码仓库和多轮 Agent 会话,但不代表每次请求都应该塞满上下文。输入越长,延迟、输出预算和实际消耗都可能上升,应先用自己的任务测量。

M3.1 和 MiniMax M3 有什么不同?

两者都面向长上下文、多模态和代码工作流,但迁移时不能只替换 model 字符串:

能力 M3.1 Flash MiniMax M3
思考 始终开启 可按请求开启或关闭
思考深度 low 到 max 没有本文所述的 effort 档位
OpenAI 兼容字段 reasoning_effort,思考内容在 reasoning_content 以当前接口返回结构为准
上下文 1M 1M
输入 文本、图片、视频 官方页面列出图片、视频输入
缓存 支持 支持

如果旧代码发送 thinking: {"type": "disabled"} 或 effort: "none",M3.1 会返回 400。想降低延迟和思考消耗,应把 reasoning_effort 调低,而不是尝试关闭思考。

OpenAI SDK 怎么调用 MiniMax M3.1?

MiniMax 官方文档提供了 OpenAI-compatible 调用方式。先安装 SDK,并把密钥放在环境变量里:

pip install openai
export MINIMAX_API_KEY="your_api_key"

最小的 Chat Completions 示例如下:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.minimax.io/v1",
    api_key=os.environ["MINIMAX_API_KEY"],
)

response = client.chat.completions.create(
    model="MiniMax-M3.1-flash",
    reasoning_effort="high",
    messages=[
        {"role": "user", "content": "用三句话说明一个 API 的重试边界。"},
    ],
)

print(response.choices[0].message.content)

reasoning_effort 支持 low、medium、high、xhigh 和 max。在 OpenAI-compatible 返回中,思考内容位于 reasoning_content,最终答案位于 content。业务代码应该允许 reasoning_content 缺失,并只在确实需要展示或记录时读取它。

如果使用 Anthropic SDK,官方把该协议列为推荐路径:

import anthropic

client = anthropic.Anthropic(
    base_url="https://api.minimax.io/anthropic",
    api_key="your_api_key",
)

message = client.messages.create(
    model="MiniMax-M3.1-flash",
    output_config={"effort": "high"},
    max_tokens=4096,
    messages=[{"role": "user", "content": "检查这段代码的边界条件。"}],
)

两种协议的字段名称不同:Anthropic-compatible 使用 output_config.effort,OpenAI-compatible 使用 reasoning_effort。迁移时要一起检查思考内容字段、输出上限和流式事件,不能只替换 Base URL。

哪些任务适合先测 M3.1?

  • 代码仓库维护: 提供仓库、复现步骤、验收标准和测试命令,观察它是否能完成定位、修改和验证闭环。
  • 长文档研究: 把资料、时间范围和引用要求写清楚,检查它是否区分来源、假设和结论。
  • 多模态分析: 让模型读取截图或视频片段,再要求输出结构化检查结果;图片或视频输入成功不代表它会生成图片或视频。
  • 工具调用: 先用一个可回滚的小任务验证工具参数、错误处理和重复调用,再扩大权限和上下文。

官方案例展示的是特定任务和环境下的结果,不能直接当成所有项目的速度或质量保证。上线前应记录模型 ID、思考档位、输入输出 Token、完成时间和失败重试次数。

从 M3 迁移到 M3.1 的检查清单

  1. 用精确的 MiniMax-M3.1-flash 替换旧模型名,并确认账号确实有权限。
  2. 删除关闭思考的参数,把 reasoning_effort 或 output_config.effort 设为明确档位。
  3. 更新响应解析:允许 reasoning_content 缺失,最终文本读取 content。
  4. 增大输出预算,避免思考 Token 和最终答案共享的小上限导致截断。
  5. 分别测试文本、图片、视频、工具调用、流式响应和缓存命中。
  6. 用同一组任务比较完成率、总延迟、Token 用量和实际账单。

常见问题

为什么旧资料里还会出现 Preview 后缀?

部分供应商早期资料仍会带 Preview 后缀,但本站当前公开模型目录使用新的 MiniMax-M3.1-flash 路由 ID。实际可用范围和计费仍以账号权限、实时目录和账单为准。

M3.1 Flash 可以关闭思考吗?

不可以。官方文档说明思考始终开启,发送关闭思考或 effort: "none" 会返回 400。需要降低延迟时,选择较低的思考档位。

MiniMax M3.1 的上下文是多少?

官方列出的上下文窗口是 1,000,000 Tokens。实际可用长度仍受接口、输出预算、客户端限制和账户策略影响。

MiniMax M3.1 支持 OpenAI SDK 吗?

支持。官方文档给出了 OpenAI-compatible Base URL https://api.minimax.io/v1 和 Chat Completions 示例。兼容协议不等于所有 OpenAI 特性都可用,工具、流式和 Responses 形态应逐项验证。

本站现在能直接调用 M3.1 吗?

本站公开模型目录会随着路由和供应商权限变化。请先查看实时模型价格,按页面显示的精确 Model ID 做小额验证;不要因为官方已经发布就推断第三方网关已经同步。

参考资料

资料核对日期:2026 年 10 月 1 日。本文是接入与选型说明,不是独立性能测评。