返回部落格列表

騰訊混元 Hy4 preview API 指南 2026:770B MoE、1M 上下文與 Coding Agent

騰訊混元Hy4 previewCoding AgentMoE1M 上下文TokenHub

騰訊混元 Hy4 preview 官方 Logo

2026 年 8 月 29 日,我們核對了騰訊前一天發布的 Hy4 preview。這次最值得注意的並不是名稱從 Hy3 變成 Hy4,而是騰訊把主幹擴展到 770B 參數、把上下文提升到 1M,並繼續在 CodeBuddy、WorkBuddy 與真實工程工作流中評估。

一句話結論:Hy4 preview 是騰訊混元面向 Coding、Agent、辦公分析、遊戲開發與科學研究的新一代開源 MoE 旗艦;官方 API/自託管 served model 名稱是 hy4-preview,但不同平台的模型 ID、價格與可用狀態不能混用。

本文只使用騰訊官方發布、官方儲存庫、騰訊雲 TokenHub 頁面與官方引用的一手論文。廠商基準測試不是本站獨立複測;截至本文核驗時,本站即時模型目錄尚未列出 hy4-preview,因此本文不宣稱本站已經開放該閘道路由。

Hy4 preview 核心資料

項目 官方已核實資訊
發布日期 2026 年 8 月 28 日
官方名稱 Tencent Hy4 preview
架構 Mixture-of-Experts(MoE)
主幹參數 770B 總參數,49B 啟用參數
原生 MTP 層 10B 總參數,0.7B 啟用參數
主幹深度 78 層
專家配置 256 個路由專家 + 1 個共享專家;每個 Token 啟用 top-8 路由專家
注意力/殘差 Gated DSA + IndexCache;4 路 iHC 殘差流
上下文 官方儲存庫標示 1M;騰訊雲產品頁標示最大輸入 960K、最大輸出 64K
官方本地 served model hy4-preview
開放權重 tencent/Hy4-previewtencent/Hy4-preview-FP8
授權條款 Apache 2.0
騰訊雲廣州區公開價格 輸入 CNY 6、輸出 CNY 18、快取讀取 CNY 0.3/每 1M Tokens

最後核驗日期為 2026 年 8 月 29 日。正式採用前,應再次核對 TokenHub 控制台、目標區域、目前價格與實際回應中的 usage 欄位。

Hy4 preview 是什麼?它是正式版 Hy4 嗎?

Hy4 preview 是 Hy4 迭代的早期版本,不等同於未來不帶 preview 後綴的正式版。騰訊在官方儲存庫中明確列出,它仍有複雜任務思考時間偏長、容易過度自我驗證等已知問題,並會根據真實回饋繼續迭代。

這條邊界很重要——「旗艦 preview」表示它已經具備完整的開放權重、推理方案、微調流程與 API 入口,但不代表模型行為、價格或服務等級已永久固定。

騰訊同時在 WorkBuddy、CodeBuddy、元寶與 ima 等產品中提供 Hy4 preview,並透過騰訊雲 TokenHub 與 OpenRouter 提供 API 接入。對企業評估來說,這已足以進入測試池;對關鍵生產流程來說,仍應保留版本鎖定、回歸測試集與備用模型。

770B MoE 架構有哪些關鍵變化?

Hy4 preview 的主幹包含 78 層。第 1 層使用標準 Dense FFN,其餘 77 層採用 MoE:每層配置 256 個路由專家與 1 個共享專家,每個 Token 啟用 top-8 路由專家及共享專家。

主幹之外還原生內建 1 層 MTP,用於投機解碼。官方參數口徑把主幹寫成 770B/49B;如果把 MTP 層計入,還要再加 10B 總參數與 0.7B 啟用參數。看到不同頁面寫 770B 或接近 780B 時,應先確認是否把 MTP 算入總量。

注意力採用 Gated DeepSeek Sparse Attention(Gated DSA),並透過 IndexCache 在不同層複用稀疏索引;殘差側使用 4 路 identity Hyper-Connection(iHC)。這些設計的共同目標,是在 1M 長上下文與大規模 MoE 下控制計算量與資訊流成本。

官方儲存庫還給出 64 個注意力頭、2,048 的 Query 壓縮維度、512 的 Key-Value 壓縮維度,以及 Indexer top-k 2,048。這些數值適合用於推理框架相容性與容量規劃,不應直接轉換成「某項任務一定更強」的行銷結論。

1M 上下文視窗應該如何理解?

騰訊官方儲存庫把上下文長度標為 1M;騰訊雲產品頁把託管服務邊界寫成最大輸入 960K、最大輸出 64K。兩者並不衝突:模型總視窗、平台預留輸出、系統提示詞與服務端安全餘量可以採用不同的計算口徑。

生產評估不應第一步就提交接近 1M Tokens 的請求。更穩妥的做法是按 32K、128K、256K、512K 與超長上下文分檔,分別記錄:

  • 首 Token 延遲與端到端耗時
  • 輸入、輸出與快取讀取 Tokens
  • 跨檔案定位準確率
  • 工具呼叫成功率與重試次數
  • 任務完成率與人工返工時間

長上下文只是容量,不是自動正確。程式碼庫、財務活頁簿或研究資料越大,越需要先做檢索、權限隔離與證據回鏈。

Hy4 preview 的 Coding 與 Agent 表現如何解讀?

騰訊官方 benchmark 附錄顯示,Hy4 preview 相比 Hy3 在多項軟體工程、工具呼叫與長上下文任務上有明顯提升。下面只摘錄同一張官方表格中的部分資料:

騰訊發布的評測 Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench(with tools) 51.5 65.4

**這些是騰訊發布的評測結果,不是本站獨立複測。**官方附錄說明,不同模型使用當時可用的最高推理設定,部分帶星號的結果由騰訊自行測試;測試框架、Token 預算、沙箱資源與重複採樣規則也會影響分數。

同一張表也提醒我們不要只挑高分:Hy4 preview 在 ProgramBench 的分數是 17.5,低於 Kimi K3、GPT 5.6 Sol 與 Claude Opus 5 等對照項。模型升級是真實的,但並不存在「所有 Coding benchmark 全面第一」。

203 個真實工程任務的內部盲測說明了什麼?

騰訊組織 163 位內部專家,對 203 個真實工程任務進行盲測。官方結果為:

  • Hy4 preview:平均 2.99/4
  • GLM 5.3:平均 2.92/4;Hy4 勝 46.8%、平 12.8%、負 40.4%
  • Kimi K3:平均 2.94/4;Hy4 勝 51.2%、平 7.9%、負 40.9%

這組資料的價值在於任務來自騰訊內部的軟體工程、遊戲、金融與安全場景,而不只是公開題庫。但它仍然是廠商內部評估——樣本、評分細則與完整任務集並不等同於第三方可重現 benchmark。

更可靠的採用方式,是把你的真實儲存庫、文件與驗收指令做成內部回歸集,再比較 Hy4 preview 與現用模型的通過率、延遲與整體成本。

Hy4 preview 適合哪些工作負載?

  • 長週期 Coding Agent:理解需求、規劃修改、除錯並執行驗收
  • 前端開發:同時關注程式碼、視覺層級與互動品質
  • 跨檔案辦公:從材料整理到文件、試算表與簡報交付
  • 遊戲開發:產生原型,並透過多輪工具操作繼續迭代
  • 金融與資料分析:處理公式、模型與多檔案上下文
  • 科學研究:AI 研究、分子動力學、凝聚態物理與基礎數學
  • 需要工具呼叫的 1M 長上下文搜尋與知識工作

涉及生產環境寫入操作時,必須為 Shell、資料庫、支付、權限與外部訊息設定人工確認或策略閘門。模型能力更強,並不會自動消除 Agent 的權限風險。

Hy4 preview 官方價格是多少?

騰訊雲 TokenHub 產品頁目前展示廣州地域的參考價格:

計費項目 公開價格
輸入 ¥6/每 1M Tokens
輸出 ¥18/每 1M Tokens
快取命中 ¥0.3/每 1M Tokens

這是騰訊雲特定地域與時間的官方直連口徑,不是所有第三方平台的統一價格。OpenRouter、其他推理服務與自託管成本採用各自計費;本站倍率也不能由騰訊雲價格直接換算。

截至 2026 年 8 月 29 日核驗時,本站即時價格頁尚未列出 hy4-preview。如果後續開放,應以即時目錄與實際帳單為準,不要沿用本文中的騰訊雲直連價格。

三種 Hy4 模型 ID 不要混用

接入途徑 應使用的名稱/ID
官方儲存庫的本地 served model hy4-preview
OpenRouter tencent/hy4-preview
Hugging Face BF16 權重 tencent/Hy4-preview
Hugging Face FP8 權重 tencent/Hy4-preview-FP8

API 閘道通常不會把 Hugging Face 儲存庫名稱自動轉換成託管模型 ID。接入時應從目標平台控制台複製精確 ID,並先呼叫模型清單或送出最小測試請求。

如何自託管並呼叫 Hy4 preview?

騰訊官方儲存庫建議使用 vLLM 或 SGLang。啟動後,可透過 OpenAI-compatible Chat Completions 呼叫本地 served model:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

官方推薦 temperature=0.9top_p=1.0。模型預設使用 high reasoning;本地模板需要直接回答時,官方範例透過 chat_template_kwargs.reasoning_effort = "no_think" 關閉思考。託管平台是否接受相同的擴充欄位,仍需以平台文件為準。

官方 vLLM 配方使用 8 卡張量並行、MTP 投機解碼、FLASHMLA_SPARSE 注意力後端,以及 hy_v4 的 tool/reasoning parser。不要把範例命令原樣複製到資源不足或版本不同的機器,應先核對 GPU、驅動程式、映像檔與推理框架支援。

Hy4 preview 與 Hy3 怎麼選?

維度 Hy3 Hy4 preview
官方參數 295B 總參數/21B 啟用參數 770B 總參數/49B 啟用參數
上下文 256K 1M
定位 高性價比 Agent 與生產力 新一代旗艦 Coding、Agent 與複雜生產力
成熟度 已從 preview 迭代至正式版 Hy4 早期 preview
自託管成本 相對較低 明顯更高

如果重點是成本、部署規模與成熟度,Hy3 仍有現實價值。如果任務需要更長上下文、更強的長週期軟體工程與工具執行,可以把 Hy4 preview 加入小流量評估,但不要僅憑總參數替換現有生產模型。

生產評估清單

  1. 從目標平台複製精確模型 ID,不要手動猜測大小寫或命名空間。
  2. 固定模型版本、Prompt、工具、推理強度、逾時設定與最大輸出。
  3. 先執行無副作用任務,再逐步開放檔案、Shell、資料庫與外部操作。
  4. 使用真實儲存庫與驗收指令統計通過率,而不是只看聊天觀感。
  5. 分檔測試 32K 到超長上下文,記錄延遲、快取與總帳單。
  6. 對複雜任務設定最大輪數、Token 預算與人工批准點。
  7. 驗證工具呼叫、結構化輸出與 reasoning 欄位在目標閘道上的映射。
  8. 為 preview 版本保留回歸集、備用路由與快速回復方案。

關鍵結論

  • Hy4 preview 於 2026 年 8 月 28 日發布並開源,是騰訊混元的新一代 MoE 旗艦。
  • 主幹為 770B 總參數、49B 啟用參數,另有 10B/0.7B 的原生 MTP 層。
  • 官方儲存庫標示 1M 上下文;騰訊雲託管頁標示最大輸入 960K、最大輸出 64K。
  • 官方評測顯示相較 Hy3 在 Coding、工具呼叫與長上下文任務上顯著提升,但並非每項 benchmark 都領先。
  • hy4-previewtencent/hy4-previewtencent/Hy4-preview-FP8 屬於不同平台命名,不能混用。
  • 本文發布時本站尚未開放該路由;是否可用與如何計費必須查看即時目錄。

常見問題

Hy4 preview 正式發布了嗎?

是。騰訊於 2026 年 8 月 28 日發布並開源 Hy4 preview,同時在 WorkBuddy、CodeBuddy、元寶、ima、TokenHub 與 OpenRouter 等入口提供體驗或 API。但它仍是 Hy4 的 preview 版本,不應描述為最終定版。

Hy4 preview 是多模態模型嗎?

騰訊本次官方儲存庫把它定位為面向 Coding、Agent 與生產力的語言模型,公開規格重點是文字、工具呼叫與長上下文。不要僅因騰訊混元家族包含視覺模型,就自動宣稱這個 API 接受圖片或影片;應以目標平台能力表為準。

Hy4 preview 的上下文是多少?

官方儲存庫標示 1M。騰訊雲產品頁同時給出最大輸入 960K、最大輸出 64K,這是託管服務的具體邊界。

Hy4 preview 的官方 API ID 是什麼?

騰訊官方儲存庫的 served model 名稱為 hy4-preview;OpenRouter 使用 tencent/hy4-preview;自託管權重使用 tencent/Hy4-preview 或 FP8 版本。目標平台的控制台 ID 優先級最高。

Hy4 preview 支援工具呼叫嗎?

官方 vLLM 配方啟用了 hy_v4 tool parser 與自動工具選擇,官方 benchmark 也涵蓋 Toolathlon、MCP-Atlas 與多類 Agent 任務。託管介面的具體參數仍需依平台文件驗證。

Hy4 preview 的價格是多少?

騰訊雲 TokenHub 廣州地域目前展示輸入 ¥6、輸出 ¥18、快取命中 ¥0.3/每 1M Tokens。地域、平台與活動可能改變價格;第三方閘道價格應單獨核對。

本站現在可以呼叫 Hy4 preview 嗎?

截至 2026 年 8 月 29 日本文核驗時,本站即時模型目錄與啟用上游尚未列出 hy4-preview。開放後會以即時價格頁為準。

Hy4 preview 可以用於 Claude Code 或其他 Coding Agent 嗎?

模型本身面向 Coding 與 Agent,並提供 OpenAI-compatible 本地推理方式。是否能直接用於某個用戶端,取決於該用戶端要求的協定、工具呼叫格式、reasoning 輸出與目標平台相容層,應先做最小請求與工具回歸。

主要來源