腾讯混元 Hy4 preview 指南 2026:770B MoE、1M 上下文与 API

2026 年 8 月 29 日,我们核对了腾讯前一天发布的 Hy4 preview。这次最值得注意的并不是名字从 Hy3 变成 Hy4,而是腾讯把总参数扩到 770B、把上下文提升到 1M,并继续把模型放进 CodeBuddy、WorkBuddy 与真实工程任务中验证。
一句话结论:Hy4 preview 是腾讯混元面向 Coding、Agent、办公分析、游戏开发和科学研究的新一代开源 MoE 旗舰;官方 API/自托管 served model 名为 hy4-preview,但不同平台的模型 ID、价格和可用状态不能混用。
本文只使用腾讯官方发布、官方仓库、腾讯云 TokenHub 页面和官方引用的一手论文。厂商基准不是本站独立复测;截至本文核验时,本站实时模型目录尚未列出 hy4-preview,因此本文不宣称本站已经开放该路由。
Hy4 preview 核心数据
| 项目 | 官方已核实信息 |
|---|---|
| 发布时间 | 2026 年 8 月 28 日 |
| 官方名称 | Tencent Hy4 preview |
| 架构 | Mixture-of-Experts(MoE) |
| 主干参数 | 770B 总参数,49B 激活参数 |
| MTP 层 | 10B 总参数,0.7B 激活参数 |
| 主干层数 | 78 层 |
| 专家结构 | 256 个路由专家 + 1 个共享专家;每 Token 激活 top-8 路由专家 |
| 注意力 / 残差 | Gated DSA + IndexCache;4 路 iHC 残差流 |
| 上下文 | 官方仓库标注 1M;腾讯云产品页标注最大输入 960K、最大输出 64K |
| 官方本地 served model | hy4-preview |
| 开源权重 | tencent/Hy4-preview、tencent/Hy4-preview-FP8 |
| 许可证 | Apache 2.0 |
| 腾讯云广州区公开价 | 输入 ¥6、输出 ¥18、缓存命中 ¥0.3 / 百万 Tokens |
资料最后核验于 2026 年 8 月 29 日。正式接入前,应再次核对 TokenHub 控制台、目标地域、实时价格和实际响应中的用量字段。
Hy4 preview 是什么?它还是正式版 Hy4 吗?
Hy4 preview 是 Hy4 迭代的早期版本,不等同于未来不带 preview 后缀的正式版。腾讯在官方仓库中明确写出,它仍存在复杂任务思考时间偏长、容易过度自我验证等已知问题,并计划根据真实反馈继续迭代。
这条边界很重要——“旗舰 preview”表示它已经具备完整的开源权重、推理方案、微调流程和 API 入口,但不意味着模型行为、价格或服务等级已经永久固定。
腾讯同时在 WorkBuddy、CodeBuddy、元宝和 ima 等产品中提供 Hy4 preview,并通过腾讯云 TokenHub 与 OpenRouter 提供 API 接入。对于企业评估,这已经足以进入测试池;对于关键生产流程,仍应保留版本锁定、回归集和备用模型。
770B MoE 架构有哪些关键变化?
Hy4 preview 的主干包含 78 层。第 1 层使用标准 Dense FFN,其余 77 层采用 MoE:每层配置 256 个路由专家与 1 个共享专家,每个 Token 激活 top-8 路由专家及共享专家。
主干之外还原生内置 1 层 MTP,用于投机解码。官方参数口径把主干写成 770B/49B;如果计算 MTP 层,还要再加 10B 总参数和 0.7B 激活参数。看到不同页面写 770B 或接近 780B 时,应先确认是否把 MTP 算入总量。
注意力采用 Gated DeepSeek Sparse Attention(Gated DSA),并通过 IndexCache 在不同层复用稀疏索引;残差侧使用 4 路 identity Hyper-Connections(iHC)。这些设计的共同目标,是在 1M 长上下文和大规模 MoE 下控制计算与信息流成本。
官方仓库还给出 64 个注意力头、2048 的 Query 压缩维度、512 的 Key-Value 压缩维度,以及 Indexer top-k 2048。它们适合用于推理框架兼容性和显存规划,不应直接转换成“某项任务一定更强”的营销结论。
1M 上下文应该如何理解?
腾讯官方仓库把上下文长度标为 1M;腾讯云产品页把托管服务边界写成最大输入 960K、最大输出 64K。两者并不冲突:模型总窗口、平台预留输出、系统提示词和服务端安全余量可以采用不同展示口径。
生产评估不应第一步就提交接近 1M Tokens。更稳妥的做法是按 32K、128K、256K、512K 和超长上下文分档,分别记录:
- 首 Token 延迟与总耗时
- 输入、输出和缓存命中 Tokens
- 跨文件定位准确率
- 工具调用成功率与重试次数
- 任务完成率和人工返工时间
长上下文只是容量,不是自动正确。代码库、财务表格或研究材料越大,越需要先做检索、权限隔离和证据回链。
Hy4 preview 的 Coding 与 Agent 表现怎么看?
腾讯官方 benchmark 附录显示,Hy4 preview 相比 Hy3 在多项软件工程、工具调用和长上下文任务上有明显提升。下面只摘录同一张官方表里的部分数据:
| 腾讯发布评测 | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench(with tools) | 51.5 | 65.4 |
**这些是腾讯发布的评测,不是本站独立复测。**官方附录说明,不同模型使用当时可用的最高推理设置,部分带星号数据由腾讯自行测试;脚手架、Token 预算、沙箱资源和重复采样规则也会影响结果。
同一张表也提醒我们不要只挑高分:Hy4 preview 在 ProgramBench 为 17.5,低于 Kimi K3、GPT 5.6 Sol 和 Claude Opus 5 等对照项。模型升级是真实的,但并不存在“所有 Coding benchmark 全面第一”。
203 个真实工程任务的内部盲测说明了什么?
腾讯组织 163 位内部专家,对 203 个真实工程任务进行盲测。官方结果为:
- Hy4 preview:平均 2.99 / 4
- GLM 5.3:平均 2.92 / 4;Hy4 胜 46.8%、平 12.8%、负 40.4%
- Kimi K3:平均 2.94 / 4;Hy4 胜 51.2%、平 7.9%、负 40.9%
这组数据的价值在于任务来自腾讯内部的软件工程、游戏、金融和安全场景,而不是只有公开题库。但它仍然是厂商内部评估——样本、评分细则和完整任务集没有等同于第三方可复现 benchmark。
更可靠的采用方式,是把你的真实仓库、文档和验收命令做成内部回归集,再比较 Hy4 preview 与现用模型的通过率、延迟和整体成本。
Hy4 preview 适合哪些场景?
- 长周期 Coding Agent:理解需求、规划修改、调试并执行验收
- 前端开发:同时关注代码、视觉层级和交互质量
- 跨文件办公:从材料整理到文档、表格和演示文稿交付
- 游戏开发:生成原型并通过多轮工具操作继续迭代
- 金融与数据分析:处理公式、模型和多文件上下文
- 科学研究:AI 研究、分子动力学、凝聚态物理和基础数学
- 需要工具调用的 1M 长上下文搜索与知识工作
涉及生产写操作时,必须为 shell、数据库、支付、权限和外部消息设置人工确认或策略门禁。模型能力更强,并不会自动消除 Agent 的权限风险。
Hy4 preview 官方价格是多少?
腾讯云 TokenHub 产品页当前展示广州地域的参考价格:
| 计费项 | 公开价格 |
|---|---|
| 输入 | ¥6 / 百万 Tokens |
| 输出 | ¥18 / 百万 Tokens |
| 缓存命中 | ¥0.3 / 百万 Tokens |
这是腾讯云特定地域和时间的官方直连口径,不是所有第三方平台的统一价格。OpenRouter、其他推理服务和自托管成本采用各自计费;本站倍率也不能由腾讯云价格直接换算。
截至 2026 年 8 月 29 日核验时,本站实时价格页尚未列出 hy4-preview。如果后续开放,应以实时目录和实际账单为准,不要沿用本文里的腾讯云直连价。
三种 Hy4 模型 ID 不要混用
| 场景 | 应使用的名称 / ID |
|---|---|
| 腾讯官方仓库示例的 served model | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Hugging Face BF16 权重 | tencent/Hy4-preview |
| Hugging Face FP8 权重 | tencent/Hy4-preview-FP8 |
API 网关通常不会把 Hugging Face 仓库名自动转换成托管模型 ID。接入时应从目标平台控制台复制精确 ID,并先调用模型列表或发送最小测试请求。
如何自托管并调用 Hy4 preview?
腾讯官方仓库建议使用 vLLM 或 SGLang。启动后可通过 OpenAI-compatible Chat Completions 调用本地 served model:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
官方推荐 temperature=0.9、top_p=1.0。模型默认使用 high reasoning;本地模板需要直接回答时,官方示例通过 chat_template_kwargs.reasoning_effort = "no_think" 关闭思考。托管平台是否接受同一扩展字段,需要以平台文档为准。
官方 vLLM 配方使用 8 卡张量并行、MTP 投机解码、FLASHMLA_SPARSE 注意力后端,以及 hy_v4 的 tool/reasoning parser。不要把示例命令原样复制到资源不足或版本不同的机器,先核对 GPU、驱动、镜像和推理框架支持。
Hy4 preview 与 Hy3 怎么选?
| 维度 | Hy3 | Hy4 preview |
|---|---|---|
| 官方参数 | 295B 总参数 / 21B 激活 | 770B 总参数 / 49B 激活 |
| 上下文 | 256K | 1M |
| 定位 | 高性价比 Agent 与生产力 | 新一代旗舰 Coding、Agent 与复杂生产力 |
| 成熟度 | 已经过 preview 到正式版迭代 | Hy4 早期 preview |
| 自托管成本 | 相对较低 | 明显更高 |
如果重点是成本、部署规模和成熟度,Hy3 仍有现实价值。如果任务需要更长上下文、更强的长周期软件工程和工具执行,可以把 Hy4 preview 加入小流量评估,但不要仅凭总参数替换现有生产模型。
生产评估清单
- 从目标平台复制精确模型 ID,不手工猜测大小写或命名空间。
- 固定模型版本、Prompt、工具、推理强度、超时和最大输出。
- 先跑无副作用任务,再逐步开放文件、Shell、数据库和外部操作。
- 使用真实仓库和验收命令统计通过率,而不是只看聊天观感。
- 分档测试 32K 到超长上下文,记录延迟、缓存与总账单。
- 对复杂任务设置最大轮数、Token 预算和人工批准点。
- 验证工具调用、结构化输出和 reasoning 字段在目标网关上的映射。
- 为 preview 版本保留回归集、备用路由和快速回退方案。
关键结论
- Hy4 preview 于 2026 年 8 月 28 日发布并开源,是腾讯混元的新一代 MoE 旗舰。
- 主干为 770B 总参数、49B 激活参数,另有 10B/0.7B 的原生 MTP 层。
- 官方仓库标注 1M 上下文;腾讯云托管页标注最大输入 960K、最大输出 64K。
- 官方评测显示相较 Hy3 在 Coding、工具调用和长上下文任务上显著提升,但并非每项 benchmark 都领先。
hy4-preview、tencent/hy4-preview与tencent/Hy4-preview-FP8属于不同平台命名,不能混用。- 本文发布时本站尚未开放该路由;是否可用与如何计费必须查看实时目录。
常见问题
Hy4 preview 正式发布了吗?
是。腾讯于 2026 年 8 月 28 日发布并开源 Hy4 preview,同时在 WorkBuddy、CodeBuddy、元宝、ima、TokenHub 和 OpenRouter 等入口提供体验或 API。但它仍是 Hy4 的 preview 版本,不应描述为最终定版。
Hy4 preview 是多模态模型吗?
腾讯本次官方仓库把它定义为面向 Coding、Agent 和生产力的语言模型,公开规格重点是文本、工具调用和长上下文。不要仅因为腾讯混元家族包含视觉模型,就自动宣称该 API 接受图片或视频;应以目标平台能力表为准。
Hy4 preview 的上下文是多少?
官方仓库标注 1M。腾讯云产品页同时给出最大输入 960K、最大输出 64K,这是托管服务的具体边界。
Hy4 preview 的官方 API ID 是什么?
腾讯官方仓库的 served model 名为 hy4-preview;OpenRouter 使用 tencent/hy4-preview;自托管权重使用 tencent/Hy4-preview 或 FP8 版本。目标平台的控制台 ID 优先级最高。
Hy4 preview 支持工具调用吗?
官方 vLLM 配方启用了 hy_v4 tool parser 和自动工具选择,官方 benchmark 也覆盖 Toolathlon、MCP-Atlas 与多类 Agent 任务。托管接口的具体参数仍需按平台文档验证。
Hy4 preview 的价格是多少?
腾讯云 TokenHub 广州地域当前展示输入 ¥6、输出 ¥18、缓存命中 ¥0.3 / 百万 Tokens。地域、平台和活动可能改变价格;第三方网关价格应单独核对。
本站现在可以调用 Hy4 preview 吗?
截至 2026 年 8 月 29 日本文核验时,本站实时模型目录和启用上游尚未列出 hy4-preview。开放后会以实时价格页为准。
Hy4 preview 可以用于 Claude Code 或其他 Coding Agent 吗?
模型本身面向 Coding 与 Agent,并提供 OpenAI-compatible 本地推理方式。是否能直接用于某个客户端,取决于该客户端要求的协议、工具调用格式、reasoning 输出和目标平台兼容层,应先做最小请求与工具回归。