騰訊混元 Hy4 preview API 指南 2026:770B MoE、1M 上下文與 Coding Agent

2026 年 8 月 29 日,我們核對了騰訊前一天發布的 Hy4 preview。這次最值得注意的並不是名稱從 Hy3 變成 Hy4,而是騰訊把主幹擴展到 770B 參數、把上下文提升到 1M,並繼續在 CodeBuddy、WorkBuddy 與真實工程工作流中評估。
一句話結論:Hy4 preview 是騰訊混元面向 Coding、Agent、辦公分析、遊戲開發與科學研究的新一代開源 MoE 旗艦;官方 API/自託管 served model 名稱是 hy4-preview,但不同平台的模型 ID、價格與可用狀態不能混用。
本文只使用騰訊官方發布、官方儲存庫、騰訊雲 TokenHub 頁面與官方引用的一手論文。廠商基準測試不是本站獨立複測;截至本文核驗時,本站即時模型目錄尚未列出 hy4-preview,因此本文不宣稱本站已經開放該閘道路由。
Hy4 preview 核心資料
| 項目 | 官方已核實資訊 |
|---|---|
| 發布日期 | 2026 年 8 月 28 日 |
| 官方名稱 | Tencent Hy4 preview |
| 架構 | Mixture-of-Experts(MoE) |
| 主幹參數 | 770B 總參數,49B 啟用參數 |
| 原生 MTP 層 | 10B 總參數,0.7B 啟用參數 |
| 主幹深度 | 78 層 |
| 專家配置 | 256 個路由專家 + 1 個共享專家;每個 Token 啟用 top-8 路由專家 |
| 注意力/殘差 | Gated DSA + IndexCache;4 路 iHC 殘差流 |
| 上下文 | 官方儲存庫標示 1M;騰訊雲產品頁標示最大輸入 960K、最大輸出 64K |
| 官方本地 served model | hy4-preview |
| 開放權重 | tencent/Hy4-preview、tencent/Hy4-preview-FP8 |
| 授權條款 | Apache 2.0 |
| 騰訊雲廣州區公開價格 | 輸入 CNY 6、輸出 CNY 18、快取讀取 CNY 0.3/每 1M Tokens |
最後核驗日期為 2026 年 8 月 29 日。正式採用前,應再次核對 TokenHub 控制台、目標區域、目前價格與實際回應中的 usage 欄位。
Hy4 preview 是什麼?它是正式版 Hy4 嗎?
Hy4 preview 是 Hy4 迭代的早期版本,不等同於未來不帶 preview 後綴的正式版。騰訊在官方儲存庫中明確列出,它仍有複雜任務思考時間偏長、容易過度自我驗證等已知問題,並會根據真實回饋繼續迭代。
這條邊界很重要——「旗艦 preview」表示它已經具備完整的開放權重、推理方案、微調流程與 API 入口,但不代表模型行為、價格或服務等級已永久固定。
騰訊同時在 WorkBuddy、CodeBuddy、元寶與 ima 等產品中提供 Hy4 preview,並透過騰訊雲 TokenHub 與 OpenRouter 提供 API 接入。對企業評估來說,這已足以進入測試池;對關鍵生產流程來說,仍應保留版本鎖定、回歸測試集與備用模型。
770B MoE 架構有哪些關鍵變化?
Hy4 preview 的主幹包含 78 層。第 1 層使用標準 Dense FFN,其餘 77 層採用 MoE:每層配置 256 個路由專家與 1 個共享專家,每個 Token 啟用 top-8 路由專家及共享專家。
主幹之外還原生內建 1 層 MTP,用於投機解碼。官方參數口徑把主幹寫成 770B/49B;如果把 MTP 層計入,還要再加 10B 總參數與 0.7B 啟用參數。看到不同頁面寫 770B 或接近 780B 時,應先確認是否把 MTP 算入總量。
注意力採用 Gated DeepSeek Sparse Attention(Gated DSA),並透過 IndexCache 在不同層複用稀疏索引;殘差側使用 4 路 identity Hyper-Connection(iHC)。這些設計的共同目標,是在 1M 長上下文與大規模 MoE 下控制計算量與資訊流成本。
官方儲存庫還給出 64 個注意力頭、2,048 的 Query 壓縮維度、512 的 Key-Value 壓縮維度,以及 Indexer top-k 2,048。這些數值適合用於推理框架相容性與容量規劃,不應直接轉換成「某項任務一定更強」的行銷結論。
1M 上下文視窗應該如何理解?
騰訊官方儲存庫把上下文長度標為 1M;騰訊雲產品頁把託管服務邊界寫成最大輸入 960K、最大輸出 64K。兩者並不衝突:模型總視窗、平台預留輸出、系統提示詞與服務端安全餘量可以採用不同的計算口徑。
生產評估不應第一步就提交接近 1M Tokens 的請求。更穩妥的做法是按 32K、128K、256K、512K 與超長上下文分檔,分別記錄:
- 首 Token 延遲與端到端耗時
- 輸入、輸出與快取讀取 Tokens
- 跨檔案定位準確率
- 工具呼叫成功率與重試次數
- 任務完成率與人工返工時間
長上下文只是容量,不是自動正確。程式碼庫、財務活頁簿或研究資料越大,越需要先做檢索、權限隔離與證據回鏈。
Hy4 preview 的 Coding 與 Agent 表現如何解讀?
騰訊官方 benchmark 附錄顯示,Hy4 preview 相比 Hy3 在多項軟體工程、工具呼叫與長上下文任務上有明顯提升。下面只摘錄同一張官方表格中的部分資料:
| 騰訊發布的評測 | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench(with tools) | 51.5 | 65.4 |
**這些是騰訊發布的評測結果,不是本站獨立複測。**官方附錄說明,不同模型使用當時可用的最高推理設定,部分帶星號的結果由騰訊自行測試;測試框架、Token 預算、沙箱資源與重複採樣規則也會影響分數。
同一張表也提醒我們不要只挑高分:Hy4 preview 在 ProgramBench 的分數是 17.5,低於 Kimi K3、GPT 5.6 Sol 與 Claude Opus 5 等對照項。模型升級是真實的,但並不存在「所有 Coding benchmark 全面第一」。
203 個真實工程任務的內部盲測說明了什麼?
騰訊組織 163 位內部專家,對 203 個真實工程任務進行盲測。官方結果為:
- Hy4 preview:平均 2.99/4
- GLM 5.3:平均 2.92/4;Hy4 勝 46.8%、平 12.8%、負 40.4%
- Kimi K3:平均 2.94/4;Hy4 勝 51.2%、平 7.9%、負 40.9%
這組資料的價值在於任務來自騰訊內部的軟體工程、遊戲、金融與安全場景,而不只是公開題庫。但它仍然是廠商內部評估——樣本、評分細則與完整任務集並不等同於第三方可重現 benchmark。
更可靠的採用方式,是把你的真實儲存庫、文件與驗收指令做成內部回歸集,再比較 Hy4 preview 與現用模型的通過率、延遲與整體成本。
Hy4 preview 適合哪些工作負載?
- 長週期 Coding Agent:理解需求、規劃修改、除錯並執行驗收
- 前端開發:同時關注程式碼、視覺層級與互動品質
- 跨檔案辦公:從材料整理到文件、試算表與簡報交付
- 遊戲開發:產生原型,並透過多輪工具操作繼續迭代
- 金融與資料分析:處理公式、模型與多檔案上下文
- 科學研究:AI 研究、分子動力學、凝聚態物理與基礎數學
- 需要工具呼叫的 1M 長上下文搜尋與知識工作
涉及生產環境寫入操作時,必須為 Shell、資料庫、支付、權限與外部訊息設定人工確認或策略閘門。模型能力更強,並不會自動消除 Agent 的權限風險。
Hy4 preview 官方價格是多少?
騰訊雲 TokenHub 產品頁目前展示廣州地域的參考價格:
| 計費項目 | 公開價格 |
|---|---|
| 輸入 | ¥6/每 1M Tokens |
| 輸出 | ¥18/每 1M Tokens |
| 快取命中 | ¥0.3/每 1M Tokens |
這是騰訊雲特定地域與時間的官方直連口徑,不是所有第三方平台的統一價格。OpenRouter、其他推理服務與自託管成本採用各自計費;本站倍率也不能由騰訊雲價格直接換算。
截至 2026 年 8 月 29 日核驗時,本站即時價格頁尚未列出 hy4-preview。如果後續開放,應以即時目錄與實際帳單為準,不要沿用本文中的騰訊雲直連價格。
三種 Hy4 模型 ID 不要混用
| 接入途徑 | 應使用的名稱/ID |
|---|---|
| 官方儲存庫的本地 served model | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Hugging Face BF16 權重 | tencent/Hy4-preview |
| Hugging Face FP8 權重 | tencent/Hy4-preview-FP8 |
API 閘道通常不會把 Hugging Face 儲存庫名稱自動轉換成託管模型 ID。接入時應從目標平台控制台複製精確 ID,並先呼叫模型清單或送出最小測試請求。
如何自託管並呼叫 Hy4 preview?
騰訊官方儲存庫建議使用 vLLM 或 SGLang。啟動後,可透過 OpenAI-compatible Chat Completions 呼叫本地 served model:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
官方推薦 temperature=0.9、top_p=1.0。模型預設使用 high reasoning;本地模板需要直接回答時,官方範例透過 chat_template_kwargs.reasoning_effort = "no_think" 關閉思考。託管平台是否接受相同的擴充欄位,仍需以平台文件為準。
官方 vLLM 配方使用 8 卡張量並行、MTP 投機解碼、FLASHMLA_SPARSE 注意力後端,以及 hy_v4 的 tool/reasoning parser。不要把範例命令原樣複製到資源不足或版本不同的機器,應先核對 GPU、驅動程式、映像檔與推理框架支援。
Hy4 preview 與 Hy3 怎麼選?
| 維度 | Hy3 | Hy4 preview |
|---|---|---|
| 官方參數 | 295B 總參數/21B 啟用參數 | 770B 總參數/49B 啟用參數 |
| 上下文 | 256K | 1M |
| 定位 | 高性價比 Agent 與生產力 | 新一代旗艦 Coding、Agent 與複雜生產力 |
| 成熟度 | 已從 preview 迭代至正式版 | Hy4 早期 preview |
| 自託管成本 | 相對較低 | 明顯更高 |
如果重點是成本、部署規模與成熟度,Hy3 仍有現實價值。如果任務需要更長上下文、更強的長週期軟體工程與工具執行,可以把 Hy4 preview 加入小流量評估,但不要僅憑總參數替換現有生產模型。
生產評估清單
- 從目標平台複製精確模型 ID,不要手動猜測大小寫或命名空間。
- 固定模型版本、Prompt、工具、推理強度、逾時設定與最大輸出。
- 先執行無副作用任務,再逐步開放檔案、Shell、資料庫與外部操作。
- 使用真實儲存庫與驗收指令統計通過率,而不是只看聊天觀感。
- 分檔測試 32K 到超長上下文,記錄延遲、快取與總帳單。
- 對複雜任務設定最大輪數、Token 預算與人工批准點。
- 驗證工具呼叫、結構化輸出與 reasoning 欄位在目標閘道上的映射。
- 為 preview 版本保留回歸集、備用路由與快速回復方案。
關鍵結論
- Hy4 preview 於 2026 年 8 月 28 日發布並開源,是騰訊混元的新一代 MoE 旗艦。
- 主幹為 770B 總參數、49B 啟用參數,另有 10B/0.7B 的原生 MTP 層。
- 官方儲存庫標示 1M 上下文;騰訊雲託管頁標示最大輸入 960K、最大輸出 64K。
- 官方評測顯示相較 Hy3 在 Coding、工具呼叫與長上下文任務上顯著提升,但並非每項 benchmark 都領先。
hy4-preview、tencent/hy4-preview與tencent/Hy4-preview-FP8屬於不同平台命名,不能混用。- 本文發布時本站尚未開放該路由;是否可用與如何計費必須查看即時目錄。
常見問題
Hy4 preview 正式發布了嗎?
是。騰訊於 2026 年 8 月 28 日發布並開源 Hy4 preview,同時在 WorkBuddy、CodeBuddy、元寶、ima、TokenHub 與 OpenRouter 等入口提供體驗或 API。但它仍是 Hy4 的 preview 版本,不應描述為最終定版。
Hy4 preview 是多模態模型嗎?
騰訊本次官方儲存庫把它定位為面向 Coding、Agent 與生產力的語言模型,公開規格重點是文字、工具呼叫與長上下文。不要僅因騰訊混元家族包含視覺模型,就自動宣稱這個 API 接受圖片或影片;應以目標平台能力表為準。
Hy4 preview 的上下文是多少?
官方儲存庫標示 1M。騰訊雲產品頁同時給出最大輸入 960K、最大輸出 64K,這是託管服務的具體邊界。
Hy4 preview 的官方 API ID 是什麼?
騰訊官方儲存庫的 served model 名稱為 hy4-preview;OpenRouter 使用 tencent/hy4-preview;自託管權重使用 tencent/Hy4-preview 或 FP8 版本。目標平台的控制台 ID 優先級最高。
Hy4 preview 支援工具呼叫嗎?
官方 vLLM 配方啟用了 hy_v4 tool parser 與自動工具選擇,官方 benchmark 也涵蓋 Toolathlon、MCP-Atlas 與多類 Agent 任務。託管介面的具體參數仍需依平台文件驗證。
Hy4 preview 的價格是多少?
騰訊雲 TokenHub 廣州地域目前展示輸入 ¥6、輸出 ¥18、快取命中 ¥0.3/每 1M Tokens。地域、平台與活動可能改變價格;第三方閘道價格應單獨核對。
本站現在可以呼叫 Hy4 preview 嗎?
截至 2026 年 8 月 29 日本文核驗時,本站即時模型目錄與啟用上游尚未列出 hy4-preview。開放後會以即時價格頁為準。
Hy4 preview 可以用於 Claude Code 或其他 Coding Agent 嗎?
模型本身面向 Coding 與 Agent,並提供 OpenAI-compatible 本地推理方式。是否能直接用於某個用戶端,取決於該用戶端要求的協定、工具呼叫格式、reasoning 輸出與目標平台相容層,應先做最小請求與工具回歸。