返回博客列表

腾讯混元 Hy4 preview 指南 2026:770B MoE、1M 上下文与 API

腾讯混元Hy4 previewCoding AgentMoE1M 上下文TokenHub

腾讯混元 Hy4 preview 官方 Logo

2026 年 8 月 29 日,我们核对了腾讯前一天发布的 Hy4 preview。这次最值得注意的并不是名字从 Hy3 变成 Hy4,而是腾讯把总参数扩到 770B、把上下文提升到 1M,并继续把模型放进 CodeBuddy、WorkBuddy 与真实工程任务中验证。

一句话结论:Hy4 preview 是腾讯混元面向 Coding、Agent、办公分析、游戏开发和科学研究的新一代开源 MoE 旗舰;官方 API/自托管 served model 名为 hy4-preview,但不同平台的模型 ID、价格和可用状态不能混用。

本文只使用腾讯官方发布、官方仓库、腾讯云 TokenHub 页面和官方引用的一手论文。厂商基准不是本站独立复测;截至本文核验时,本站实时模型目录尚未列出 hy4-preview,因此本文不宣称本站已经开放该路由。

Hy4 preview 核心数据

项目 官方已核实信息
发布时间 2026 年 8 月 28 日
官方名称 Tencent Hy4 preview
架构 Mixture-of-Experts(MoE)
主干参数 770B 总参数,49B 激活参数
MTP 层 10B 总参数,0.7B 激活参数
主干层数 78 层
专家结构 256 个路由专家 + 1 个共享专家;每 Token 激活 top-8 路由专家
注意力 / 残差 Gated DSA + IndexCache;4 路 iHC 残差流
上下文 官方仓库标注 1M;腾讯云产品页标注最大输入 960K、最大输出 64K
官方本地 served model hy4-preview
开源权重 tencent/Hy4-previewtencent/Hy4-preview-FP8
许可证 Apache 2.0
腾讯云广州区公开价 输入 ¥6、输出 ¥18、缓存命中 ¥0.3 / 百万 Tokens

资料最后核验于 2026 年 8 月 29 日。正式接入前,应再次核对 TokenHub 控制台、目标地域、实时价格和实际响应中的用量字段。

Hy4 preview 是什么?它还是正式版 Hy4 吗?

Hy4 preview 是 Hy4 迭代的早期版本,不等同于未来不带 preview 后缀的正式版。腾讯在官方仓库中明确写出,它仍存在复杂任务思考时间偏长、容易过度自我验证等已知问题,并计划根据真实反馈继续迭代。

这条边界很重要——“旗舰 preview”表示它已经具备完整的开源权重、推理方案、微调流程和 API 入口,但不意味着模型行为、价格或服务等级已经永久固定。

腾讯同时在 WorkBuddy、CodeBuddy、元宝和 ima 等产品中提供 Hy4 preview,并通过腾讯云 TokenHub 与 OpenRouter 提供 API 接入。对于企业评估,这已经足以进入测试池;对于关键生产流程,仍应保留版本锁定、回归集和备用模型。

770B MoE 架构有哪些关键变化?

Hy4 preview 的主干包含 78 层。第 1 层使用标准 Dense FFN,其余 77 层采用 MoE:每层配置 256 个路由专家与 1 个共享专家,每个 Token 激活 top-8 路由专家及共享专家。

主干之外还原生内置 1 层 MTP,用于投机解码。官方参数口径把主干写成 770B/49B;如果计算 MTP 层,还要再加 10B 总参数和 0.7B 激活参数。看到不同页面写 770B 或接近 780B 时,应先确认是否把 MTP 算入总量。

注意力采用 Gated DeepSeek Sparse Attention(Gated DSA),并通过 IndexCache 在不同层复用稀疏索引;残差侧使用 4 路 identity Hyper-Connections(iHC)。这些设计的共同目标,是在 1M 长上下文和大规模 MoE 下控制计算与信息流成本。

官方仓库还给出 64 个注意力头、2048 的 Query 压缩维度、512 的 Key-Value 压缩维度,以及 Indexer top-k 2048。它们适合用于推理框架兼容性和显存规划,不应直接转换成“某项任务一定更强”的营销结论。

1M 上下文应该如何理解?

腾讯官方仓库把上下文长度标为 1M;腾讯云产品页把托管服务边界写成最大输入 960K、最大输出 64K。两者并不冲突:模型总窗口、平台预留输出、系统提示词和服务端安全余量可以采用不同展示口径。

生产评估不应第一步就提交接近 1M Tokens。更稳妥的做法是按 32K、128K、256K、512K 和超长上下文分档,分别记录:

  • 首 Token 延迟与总耗时
  • 输入、输出和缓存命中 Tokens
  • 跨文件定位准确率
  • 工具调用成功率与重试次数
  • 任务完成率和人工返工时间

长上下文只是容量,不是自动正确。代码库、财务表格或研究材料越大,越需要先做检索、权限隔离和证据回链。

Hy4 preview 的 Coding 与 Agent 表现怎么看?

腾讯官方 benchmark 附录显示,Hy4 preview 相比 Hy3 在多项软件工程、工具调用和长上下文任务上有明显提升。下面只摘录同一张官方表里的部分数据:

腾讯发布评测 Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench(with tools) 51.5 65.4

**这些是腾讯发布的评测,不是本站独立复测。**官方附录说明,不同模型使用当时可用的最高推理设置,部分带星号数据由腾讯自行测试;脚手架、Token 预算、沙箱资源和重复采样规则也会影响结果。

同一张表也提醒我们不要只挑高分:Hy4 preview 在 ProgramBench 为 17.5,低于 Kimi K3、GPT 5.6 Sol 和 Claude Opus 5 等对照项。模型升级是真实的,但并不存在“所有 Coding benchmark 全面第一”。

203 个真实工程任务的内部盲测说明了什么?

腾讯组织 163 位内部专家,对 203 个真实工程任务进行盲测。官方结果为:

  • Hy4 preview:平均 2.99 / 4
  • GLM 5.3:平均 2.92 / 4;Hy4 胜 46.8%、平 12.8%、负 40.4%
  • Kimi K3:平均 2.94 / 4;Hy4 胜 51.2%、平 7.9%、负 40.9%

这组数据的价值在于任务来自腾讯内部的软件工程、游戏、金融和安全场景,而不是只有公开题库。但它仍然是厂商内部评估——样本、评分细则和完整任务集没有等同于第三方可复现 benchmark。

更可靠的采用方式,是把你的真实仓库、文档和验收命令做成内部回归集,再比较 Hy4 preview 与现用模型的通过率、延迟和整体成本。

Hy4 preview 适合哪些场景?

  • 长周期 Coding Agent:理解需求、规划修改、调试并执行验收
  • 前端开发:同时关注代码、视觉层级和交互质量
  • 跨文件办公:从材料整理到文档、表格和演示文稿交付
  • 游戏开发:生成原型并通过多轮工具操作继续迭代
  • 金融与数据分析:处理公式、模型和多文件上下文
  • 科学研究:AI 研究、分子动力学、凝聚态物理和基础数学
  • 需要工具调用的 1M 长上下文搜索与知识工作

涉及生产写操作时,必须为 shell、数据库、支付、权限和外部消息设置人工确认或策略门禁。模型能力更强,并不会自动消除 Agent 的权限风险。

Hy4 preview 官方价格是多少?

腾讯云 TokenHub 产品页当前展示广州地域的参考价格:

计费项 公开价格
输入 ¥6 / 百万 Tokens
输出 ¥18 / 百万 Tokens
缓存命中 ¥0.3 / 百万 Tokens

这是腾讯云特定地域和时间的官方直连口径,不是所有第三方平台的统一价格。OpenRouter、其他推理服务和自托管成本采用各自计费;本站倍率也不能由腾讯云价格直接换算。

截至 2026 年 8 月 29 日核验时,本站实时价格页尚未列出 hy4-preview。如果后续开放,应以实时目录和实际账单为准,不要沿用本文里的腾讯云直连价。

三种 Hy4 模型 ID 不要混用

场景 应使用的名称 / ID
腾讯官方仓库示例的 served model hy4-preview
OpenRouter tencent/hy4-preview
Hugging Face BF16 权重 tencent/Hy4-preview
Hugging Face FP8 权重 tencent/Hy4-preview-FP8

API 网关通常不会把 Hugging Face 仓库名自动转换成托管模型 ID。接入时应从目标平台控制台复制精确 ID,并先调用模型列表或发送最小测试请求。

如何自托管并调用 Hy4 preview?

腾讯官方仓库建议使用 vLLM 或 SGLang。启动后可通过 OpenAI-compatible Chat Completions 调用本地 served model:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

官方推荐 temperature=0.9top_p=1.0。模型默认使用 high reasoning;本地模板需要直接回答时,官方示例通过 chat_template_kwargs.reasoning_effort = "no_think" 关闭思考。托管平台是否接受同一扩展字段,需要以平台文档为准。

官方 vLLM 配方使用 8 卡张量并行、MTP 投机解码、FLASHMLA_SPARSE 注意力后端,以及 hy_v4 的 tool/reasoning parser。不要把示例命令原样复制到资源不足或版本不同的机器,先核对 GPU、驱动、镜像和推理框架支持。

Hy4 preview 与 Hy3 怎么选?

维度 Hy3 Hy4 preview
官方参数 295B 总参数 / 21B 激活 770B 总参数 / 49B 激活
上下文 256K 1M
定位 高性价比 Agent 与生产力 新一代旗舰 Coding、Agent 与复杂生产力
成熟度 已经过 preview 到正式版迭代 Hy4 早期 preview
自托管成本 相对较低 明显更高

如果重点是成本、部署规模和成熟度,Hy3 仍有现实价值。如果任务需要更长上下文、更强的长周期软件工程和工具执行,可以把 Hy4 preview 加入小流量评估,但不要仅凭总参数替换现有生产模型。

生产评估清单

  1. 从目标平台复制精确模型 ID,不手工猜测大小写或命名空间。
  2. 固定模型版本、Prompt、工具、推理强度、超时和最大输出。
  3. 先跑无副作用任务,再逐步开放文件、Shell、数据库和外部操作。
  4. 使用真实仓库和验收命令统计通过率,而不是只看聊天观感。
  5. 分档测试 32K 到超长上下文,记录延迟、缓存与总账单。
  6. 对复杂任务设置最大轮数、Token 预算和人工批准点。
  7. 验证工具调用、结构化输出和 reasoning 字段在目标网关上的映射。
  8. 为 preview 版本保留回归集、备用路由和快速回退方案。

关键结论

  • Hy4 preview 于 2026 年 8 月 28 日发布并开源,是腾讯混元的新一代 MoE 旗舰。
  • 主干为 770B 总参数、49B 激活参数,另有 10B/0.7B 的原生 MTP 层。
  • 官方仓库标注 1M 上下文;腾讯云托管页标注最大输入 960K、最大输出 64K。
  • 官方评测显示相较 Hy3 在 Coding、工具调用和长上下文任务上显著提升,但并非每项 benchmark 都领先。
  • hy4-previewtencent/hy4-previewtencent/Hy4-preview-FP8 属于不同平台命名,不能混用。
  • 本文发布时本站尚未开放该路由;是否可用与如何计费必须查看实时目录。

常见问题

Hy4 preview 正式发布了吗?

是。腾讯于 2026 年 8 月 28 日发布并开源 Hy4 preview,同时在 WorkBuddy、CodeBuddy、元宝、ima、TokenHub 和 OpenRouter 等入口提供体验或 API。但它仍是 Hy4 的 preview 版本,不应描述为最终定版。

Hy4 preview 是多模态模型吗?

腾讯本次官方仓库把它定义为面向 Coding、Agent 和生产力的语言模型,公开规格重点是文本、工具调用和长上下文。不要仅因为腾讯混元家族包含视觉模型,就自动宣称该 API 接受图片或视频;应以目标平台能力表为准。

Hy4 preview 的上下文是多少?

官方仓库标注 1M。腾讯云产品页同时给出最大输入 960K、最大输出 64K,这是托管服务的具体边界。

Hy4 preview 的官方 API ID 是什么?

腾讯官方仓库的 served model 名为 hy4-preview;OpenRouter 使用 tencent/hy4-preview;自托管权重使用 tencent/Hy4-preview 或 FP8 版本。目标平台的控制台 ID 优先级最高。

Hy4 preview 支持工具调用吗?

官方 vLLM 配方启用了 hy_v4 tool parser 和自动工具选择,官方 benchmark 也覆盖 Toolathlon、MCP-Atlas 与多类 Agent 任务。托管接口的具体参数仍需按平台文档验证。

Hy4 preview 的价格是多少?

腾讯云 TokenHub 广州地域当前展示输入 ¥6、输出 ¥18、缓存命中 ¥0.3 / 百万 Tokens。地域、平台和活动可能改变价格;第三方网关价格应单独核对。

本站现在可以调用 Hy4 preview 吗?

截至 2026 年 8 月 29 日本文核验时,本站实时模型目录和启用上游尚未列出 hy4-preview。开放后会以实时价格页为准。

Hy4 preview 可以用于 Claude Code 或其他 Coding Agent 吗?

模型本身面向 Coding 与 Agent,并提供 OpenAI-compatible 本地推理方式。是否能直接用于某个客户端,取决于该客户端要求的协议、工具调用格式、reasoning 输出和目标平台兼容层,应先做最小请求与工具回归。

主要来源