Hướng dẫn API Tencent Hy4 preview 2026: MoE 770B, ngữ cảnh 1M và coding agent

Ngày 29 tháng 8 năm 2026, chúng tôi đã xem xét Hy4 preview được Tencent phát hành một ngày trước đó. Điểm thay đổi quan trọng không chỉ là chuyển từ Hy3 sang Hy4: Tencent đã mở rộng backbone lên 770B tham số, tăng ngữ cảnh lên 1M và tiếp tục đánh giá mô hình trong CodeBuddy, WorkBuddy cùng các quy trình kỹ thuật thực tế.
Tóm tắt trong một câu: Hy4 preview là MoE flagship mở mới của Tencent Hunyuan dành cho coding, agent, phân tích văn phòng, phát triển game và nghiên cứu khoa học; tên served model chính thức cho self-host là hy4-preview, nhưng ID mô hình, giá và khả năng sử dụng khác nhau theo từng nền tảng.
Hướng dẫn này dựa trên thông báo phát hành của Tencent, repository chính thức, các trang Tencent Cloud TokenHub và những bài báo gốc được repository trích dẫn. Benchmark của nhà cung cấp không phải là bài kiểm thử độc lập của trang này. Tại thời điểm xác minh, live catalog của trang chưa liệt kê hy4-preview, vì vậy bài viết không khẳng định route gateway đã được mở.
Thông tin chính về Hy4 preview
| Hạng mục | Thông tin chính thức đã xác minh |
|---|---|
| Ngày phát hành | 28 tháng 8 năm 2026 |
| Tên chính thức | Tencent Hy4 preview |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Tham số backbone | Tổng 770B, kích hoạt 49B |
| Lớp MTP gốc | Tổng 10B, kích hoạt 0.7B |
| Độ sâu backbone | 78 lớp |
| Bố trí expert | 256 routed + 1 shared expert; mỗi token kích hoạt top-8 routed expert |
| Attention / residual | Gated DSA + IndexCache; bốn residual stream iHC |
| Ngữ cảnh | Repository ghi 1M; Tencent Cloud ghi input tối đa 960K và output tối đa 64K |
| Served model local chính thức | hy4-preview |
| Open weight | tencent/Hy4-preview, tencent/Hy4-preview-FP8 |
| Giấy phép | Apache 2.0 |
| Giá niêm yết Tencent Cloud tại Quảng Châu | Input CNY 6, output CNY 18, đọc cache CNY 0.3 / 1M token |
Lần xác minh cuối là ngày 29 tháng 8 năm 2026. Trước khi đưa vào production, hãy kiểm tra lại console TokenHub, khu vực mục tiêu, giá hiện tại và các trường usage trong response thực tế.
Hy4 preview là gì và có phải bản Hy4 cuối cùng không?
Hy4 preview là một phiên bản sớm trong quá trình phát triển Hy4, không phải bản phát hành cuối cùng trong tương lai khi bỏ hậu tố preview. Tencent nêu rõ các vấn đề đã biết, bao gồm việc suy luận lâu hơn cần thiết ở tác vụ phức tạp và tự kiểm tra quá mức kết quả của chính mình.
Ranh giới này rất quan trọng. “Flagship preview” có nghĩa là mô hình đã có open weight, công thức inference, pipeline fine-tuning và lối vào API. Điều đó không có nghĩa hành vi, giá hay cấp độ dịch vụ đã được cố định vĩnh viễn.
Tencent cũng cung cấp Hy4 preview trong WorkBuddy, CodeBuddy, Yuanbao và ima, đồng thời có API qua Tencent Cloud TokenHub và OpenRouter. Như vậy đã đủ để đưa mô hình vào nhóm đánh giá, nhưng các quy trình production quan trọng vẫn cần khóa phiên bản, duy trì bộ hồi quy và giữ một mô hình dự phòng.
Kiến trúc MoE 770B đã thay đổi những gì?
Backbone của Hy4 preview có 78 lớp. Lớp đầu tiên dùng Dense FFN; 77 lớp còn lại là lớp MoE với 256 routed expert và một shared expert. Mỗi token kích hoạt tám routed expert đứng đầu cùng shared expert.
Backbone còn có một lớp MTP gốc để hỗ trợ speculative decoding. Tencent báo cáo backbone có tổng 770B và 49B tham số kích hoạt; nếu tính cả MTP thì cộng thêm 10B tổng và 0.7B kích hoạt. Nếu một trang ghi 770B còn trang khác ghi gần 780B, hãy kiểm tra MTP có được tính vào hay không.
Attention sử dụng Gated DeepSeek Sparse Attention (Gated DSA) cùng IndexCache để tái sử dụng sparse index giữa các lớp. Nhánh residual dùng bốn stream identity Hyper-Connection (iHC). Các thiết kế này cùng hướng tới việc kiểm soát chi phí tính toán và luồng thông tin ở ngữ cảnh 1M và quy mô MoE lớn.
Repository cũng nêu 64 attention head, chiều nén Query 2.048, chiều nén Key-Value 512 và indexer top-k 2.048. Các giá trị này hữu ích cho khả năng tương thích của inference framework và lập kế hoạch tài nguyên, nhưng tự chúng không chứng minh kết quả của bất kỳ tác vụ nào.
Nên hiểu cửa sổ ngữ cảnh 1M như thế nào?
Repository của Tencent ghi độ dài ngữ cảnh là 1M. Trang sản phẩm Tencent Cloud mô tả giới hạn dịch vụ hosted là input tối đa 960K và output tối đa 64K. Hai cách ghi này có thể cùng tồn tại vì cửa sổ mô hình, output dự phòng, system prompt và khoảng an toàn của dịch vụ dùng các ranh giới tính toán khác nhau.
Đừng bắt đầu kiểm thử production bằng request gần một triệu token. Hãy chia thành các mức 32K, 128K, 256K, 512K và ngữ cảnh siêu dài, rồi ghi lại:
- thời gian tới token đầu tiên và độ trễ end-to-end
- token input, output và đọc cache
- độ chính xác truy xuất giữa các file
- tỷ lệ gọi tool thành công và số lần retry
- tỷ lệ tác vụ đạt yêu cầu và thời gian sửa thủ công
Dung lượng ngữ cảnh không tự động tạo ra độ chính xác. Repository lớn, bảng tính tài chính và kho tài liệu nghiên cứu vẫn cần retrieval, cô lập quyền và liên kết tới bằng chứng.
Hy4 preview mạnh đến đâu trong coding và agent?
Phụ lục benchmark của Tencent báo cáo mức cải thiện rộng so với Hy3 trong kỹ thuật phần mềm, sử dụng tool và tác vụ ngữ cảnh dài. Dưới đây là một số giá trị được chọn từ cùng bảng chính thức:
| Đánh giá do Tencent công bố | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench (with tools) | 51.5 | 65.4 |
Đây là kết quả do Tencent công bố, không phải bài kiểm thử độc lập của trang này. Tencent lưu ý rằng các mô hình được đánh giá ở thiết lập reasoning cao nhất có sẵn tại thời điểm đó, một số kết quả có dấu sao do Tencent chạy, và harness, ngân sách token, tài nguyên sandbox cùng việc lấy mẫu lặp lại đều ảnh hưởng đến điểm số.
Cùng bảng đó cũng nhắc chúng ta không nên chỉ chọn các điểm cao. Trong so sánh của Tencent, Hy4 preview đạt 17.5 trên ProgramBench, thấp hơn Kimi K3, GPT 5.6 Sol và Claude Opus 5. Mức tăng qua thế hệ là có thật, nhưng Hy4 không dẫn đầu mọi coding benchmark.
Đánh giá chuyên gia trên 203 tác vụ thực tế cho thấy điều gì?
Tencent đã tổ chức đánh giá mù với 163 chuyên gia nội bộ trên 203 tác vụ kỹ thuật thực tế. Kết quả được công bố là:
- Hy4 preview: trung bình 2.99 / 4
- GLM 5.3: trung bình 2.92 / 4; Hy4 thắng 46.8%, hòa 12.8%, thua 40.4%
- Kimi K3: trung bình 2.94 / 4; Hy4 thắng 51.2%, hòa 7.9%, thua 40.9%
Các số liệu này đáng chú ý vì tác vụ đến từ công việc kỹ thuật phần mềm, game, tài chính và bảo mật của Tencent, chứ không chỉ từ bảng xếp hạng công khai. Tuy vậy, đây vẫn là đánh giá nội bộ của nhà cung cấp, không phải benchmark bên thứ ba có thể tái lập đầy đủ với bộ tác vụ và rubric công khai.
Cách áp dụng đáng tin cậy là xây dựng bộ hồi quy từ repository, tài liệu và lệnh nghiệm thu của chính bạn, sau đó so sánh tỷ lệ đạt, độ trễ và tổng chi phí với các mô hình đang dùng.
Hy4 preview phù hợp với workload nào?
- coding agent dài hạn có thể lập kế hoạch, tạo patch, debug và xác minh
- công việc frontend cần quan tâm đồng thời đến code, phân cấp thị giác và chất lượng tương tác
- quy trình văn phòng nhiều file tạo ra tài liệu, bảng tính và bài trình bày
- prototype game có thể chạy rồi tiếp tục làm việc với engine qua nhiều lượt
- mô hình tài chính và phân tích dữ liệu nhiều file
- nghiên cứu về AI, động lực học phân tử, vật lý vật chất ngưng tụ và toán học
- quy trình tìm kiếm và knowledge work dùng tool trên ngữ cảnh 1M
Các thao tác ghi trong production vẫn cần policy gate hoặc phê duyệt của con người đối với shell, cơ sở dữ liệu, thanh toán, quyền hạn và tin nhắn bên ngoài. Mô hình mạnh hơn không loại bỏ rủi ro cấp quyền cho agent.
Giá chính thức của Hy4 preview là bao nhiêu?
Tencent Cloud TokenHub hiện hiển thị các mức giá tham khảo sau cho Quảng Châu:
| Hạng mục tính phí | Giá công khai |
|---|---|
| Input | CNY 6 / 1M token |
| Output | CNY 18 / 1M token |
| Đọc cache | CNY 0.3 / 1M token |
Đây là giá truy cập trực tiếp theo khu vực và thời điểm của Tencent Cloud, không phải giá chung cho mọi nền tảng bên thứ ba. OpenRouter, các nhà cung cấp inference khác và self-hosting có cách tính riêng; không thể suy ra multiplier của gateway từ giá trực tiếp TokenHub.
Tại thời điểm xác minh ngày 29 tháng 8 năm 2026, trang giá theo thời gian thực của trang này chưa liệt kê hy4-preview. Nếu sau này được thêm vào, hãy dùng live catalog và sổ cái request thay vì giá trực tiếp Tencent Cloud trong bài này.
Không trộn lẫn các ID mô hình Hy4 này
| Đường truy cập | Tên / ID cần dùng |
|---|---|
| Served model local trong repository chính thức | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Weight BF16 trên Hugging Face | tencent/Hy4-preview |
| Weight FP8 trên Hugging Face | tencent/Hy4-preview-FP8 |
API gateway thường không dịch tên repository Hugging Face thành ID mô hình hosted. Hãy sao chép đúng identifier từ nền tảng mục tiêu và xác minh bằng lệnh gọi danh sách mô hình hoặc một request tối thiểu.
Tự host và gọi Hy4 preview như thế nào?
Tencent khuyến nghị vLLM hoặc SGLang. Sau khi khởi chạy, có thể gọi served model local qua Chat Completions API tương thích OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
Tencent khuyến nghị temperature=0.9 và top_p=1.0. Mô hình mặc định dùng high reasoning. Template local của repository dùng chat_template_kwargs.reasoning_effort = "no_think" cho câu trả lời trực tiếp; nhà cung cấp hosted có thể cung cấp các trường mở rộng khác.
Công thức vLLM chính thức dùng tensor parallelism tám chiều, speculative decoding MTP, attention backend FLASHMLA_SPARSE và tool/reasoning parser hy_v4. Không dán nguyên lệnh mẫu lên máy có GPU, driver, image hoặc framework khác mà chưa kiểm tra khả năng đáp ứng.
Hy4 preview so với Hy3
| Tiêu chí | Hy3 | Hy4 preview |
|---|---|---|
| Quy mô chính thức | Tổng 295B / kích hoạt 21B | Tổng 770B / kích hoạt 49B |
| Ngữ cảnh | 256K | 1M |
| Định vị | agent và năng suất với chi phí hiệu quả | flagship mới cho coding, agent và năng suất phức tạp |
| Mức độ trưởng thành | đã đi từ preview đến bản phát hành chính thức | Hy4 preview giai đoạn đầu |
| Chi phí self-hosting | thấp hơn | cao hơn đáng kể |
Hy3 vẫn thực tế nếu chi phí, quy mô triển khai và độ trưởng thành là ưu tiên. Hãy thêm Hy4 preview vào một đợt đánh giá có kiểm soát khi cần ngữ cảnh dài hơn, kỹ thuật phần mềm dài hạn mạnh hơn hoặc thực thi tool tốt hơn, nhưng đừng thay thế mô hình production chỉ dựa trên tổng số tham số.
Checklist đánh giá production
- Sao chép đúng model ID từ nền tảng mục tiêu; không tự đoán chữ hoa, chữ thường hay namespace.
- Cố định phiên bản mô hình, prompt, tool, reasoning effort, timeout và output tối đa.
- Bắt đầu bằng tác vụ chỉ đọc trước khi cấp quyền file, shell, database hoặc side effect bên ngoài.
- Đo tỷ lệ đạt bằng repository thực và lệnh nghiệm thu, không chỉ dựa vào cảm nhận khi chat.
- Kiểm thử các mức ngữ cảnh từ 32K trở lên, ghi lại độ trễ, mức dùng cache và tổng chi phí.
- Đặt số lượt tối đa, ngân sách token và điểm phê duyệt cho tác vụ phức tạp.
- Xác minh mapping của tool call, structured output và trường reasoning trên nhà cung cấp mục tiêu.
- Giữ bộ hồi quy, route dự phòng và phương án rollback nhanh cho mô hình preview.
Tóm tắt chính
- Hy4 preview được phát hành và mở mã nguồn ngày 28 tháng 8 năm 2026, trở thành MoE flagship mới của Tencent Hunyuan.
- Backbone có tổng 770B và 49B tham số kích hoạt, cộng thêm lớp MTP gốc 10B/0.7B.
- Repository ghi ngữ cảnh 1M; Tencent Cloud ghi input tối đa 960K và output tối đa 64K.
- Tencent báo cáo mức tăng lớn so với Hy3 ở coding, sử dụng tool và ngữ cảnh dài, nhưng không dẫn đầu mọi benchmark.
- hy4-preview, tencent/hy4-preview và tencent/Hy4-preview-FP8 là các identifier theo từng nền tảng.
- Tại thời điểm bài viết, gateway này chưa mở route; phải kiểm tra khả năng dùng và tính phí trong live catalog.
Câu hỏi thường gặp
Hy4 preview đã được phát hành chính thức chưa?
Rồi. Tencent phát hành và mở mã nguồn Hy4 preview ngày 28 tháng 8 năm 2026, với các lối truy cập qua WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub và OpenRouter. Đây vẫn là preview, không phải bản Hy4 cuối cùng.
Hy4 preview có phải mô hình đa phương thức không?
Repository phát hành của Tencent giới thiệu đây là mô hình ngôn ngữ cho coding, agent và năng suất, với đặc tả công khai tập trung vào text, tool và ngữ cảnh dài. Không được suy ra rằng mô hình nhận ảnh hoặc video chỉ vì dòng Hunyuan rộng hơn có các mô hình thị giác; hãy kiểm tra bảng khả năng của nhà cung cấp mục tiêu.
Độ dài ngữ cảnh của Hy4 preview là bao nhiêu?
Repository ghi ngữ cảnh 1M. Tencent Cloud ghi riêng giới hạn của dịch vụ hosted là input tối đa 960K và output tối đa 64K.
API ID chính thức của Hy4 preview là gì?
Tên served model trong repository chính thức là hy4-preview; OpenRouter dùng tencent/hy4-preview; weight self-host dùng tencent/Hy4-preview hoặc biến thể FP8. ID trong console của nền tảng mục tiêu được ưu tiên.
Hy4 preview có hỗ trợ gọi tool không?
Công thức vLLM của Tencent bật hy_v4 tool parser và tự động chọn tool, còn bộ benchmark có Toolathlon và MCP-Atlas. Hãy xác minh tham số chính xác của hosted API trong tài liệu nhà cung cấp.
Hy4 preview có giá bao nhiêu?
Tencent Cloud TokenHub hiện hiển thị tại Quảng Châu: input CNY 6, output CNY 18 và đọc cache CNY 0.3 cho mỗi triệu token. Khu vực, nền tảng và chương trình khuyến mãi có thể làm thay đổi giá.
Hiện tôi có thể gọi Hy4 preview qua gateway này không?
Tại thời điểm xác minh ngày 29 tháng 8 năm 2026, live catalog và upstream đã bật không liệt kê hy4-preview. Hãy kiểm tra trang giá theo thời gian thực để biết trạng thái về sau.
Hy4 preview có chạy với Claude Code hoặc coding agent khác không?
Mô hình hướng tới coding và agent, đồng thời hỗ trợ cách serving local tương thích OpenAI. Khả năng tương thích với client cụ thể còn phụ thuộc giao thức, dạng tool call, output reasoning và compatibility layer của nhà cung cấp; trước tiên hãy kiểm tra request tối thiểu và hồi quy tool.
Nguồn chính
- Thông báo chính thức của Tencent: Tencent Releases and Open-Sources Tencent Hy4 preview
- GitHub chính thức Tencent Hunyuan: Hy4-preview
- Trang sản phẩm và giá Tencent Cloud TokenHub
- Trang sản phẩm Tencent Cloud Hunyuan: giới hạn Hy4 preview
- Bài nghiên cứu Gated DeepSeek Sparse Attention
- Bài nghiên cứu IndexCache
- Giá mô hình theo thời gian thực của trang này: dùng để kiểm tra khả năng mở route về sau, không phải giá chính thức của Tencent Cloud