Guide Tencent Hy4 Preview 2026 : MoE 770B, contexte 1M et agents de programmation

Le 29 août 2026, nous avons examiné Hy4 preview, publié par Tencent la veille. Le changement important ne se limite pas au passage de Hy3 à Hy4 : Tencent a porté le socle à 770B paramètres, étendu le contexte à 1M et continué à évaluer le modèle dans CodeBuddy, WorkBuddy et de vrais workflows d'ingénierie.
En une phrase : Hy4 preview est le nouveau modèle MoE open source phare de Tencent Hunyuan pour la programmation, les agents, l'analyse de documents de bureau, le développement de jeux et la recherche scientifique ; son nom officiel de modèle servi en local est hy4-preview, mais les identifiants de modèle, les prix et la disponibilité varient selon la plateforme.
Ce guide s'appuie sur l'annonce de Tencent, son dépôt officiel, les pages Tencent Cloud TokenHub et les articles scientifiques de référence cités par le dépôt. Les benchmarks du fournisseur ne sont pas des tests indépendants réalisés par ce site. Au moment de la vérification, le catalogue live de ce site ne listait pas hy4-preview ; cet article ne prétend donc pas que la route est déjà ouverte sur la passerelle.
Principaux faits sur Hy4 preview
| Élément | Informations officielles vérifiées |
|---|---|
| Date de sortie | 28 août 2026 |
| Nom officiel | Tencent Hy4 preview |
| Architecture | Mixture-of-Experts (MoE) |
| Paramètres du socle | 770B au total, 49B actifs |
| Couche MTP native | 10B au total, 0.7B actifs |
| Profondeur du socle | 78 couches |
| Organisation des experts | 256 experts routés + 1 expert partagé ; top-8 experts routés activés par token |
| Attention / résiduel | Gated DSA + IndexCache ; quatre flux résiduels iHC |
| Contexte | 1M dans le dépôt ; Tencent Cloud indique 960K d'entrée maximale et 64K de sortie maximale |
| Modèle officiel servi en local | hy4-preview |
| Poids ouverts | tencent/Hy4-preview, tencent/Hy4-preview-FP8 |
| Licence | Apache 2.0 |
| Prix public Tencent Cloud à Guangzhou | CNY 6 en entrée, CNY 18 en sortie, CNY 0.3 en lecture du cache par 1M tokens |
Dernière vérification : 29 août 2026. Avant une adoption en production, revérifiez la console TokenHub, la région cible, le prix courant et les champs d'utilisation de la réponse.
Qu'est-ce que Hy4 preview, et est-ce la version finale de Hy4 ?
Hy4 preview est une première itération de Hy4, et non une future version finale dépourvue du suffixe preview. Tencent documente explicitement des problèmes connus, notamment un raisonnement parfois plus long que nécessaire sur les tâches complexes et une tendance à trop vérifier son propre travail.
Cette distinction est importante. « Preview phare » signifie que le modèle dispose déjà de poids ouverts, de recettes d'inférence, d'un pipeline de fine-tuning et d'un accès API. Cela ne signifie pas que son comportement, son prix ou ses niveaux de service sont définitivement figés.
Tencent rend également Hy4 preview disponible dans WorkBuddy, CodeBuddy, Yuanbao et ima, avec un accès API via Tencent Cloud TokenHub et OpenRouter. Cela suffit pour justifier une évaluation, tandis que les workflows critiques doivent toujours verrouiller la version, conserver une suite de régression et prévoir un modèle de secours.
Qu'est-ce qui change dans l'architecture MoE 770B ?
Le socle de Hy4 preview comporte 78 couches. La première utilise un FFN dense ; les 77 suivantes sont des couches MoE avec 256 experts routés et un expert partagé. Pour chaque token, les huit meilleurs experts routés ainsi que l'expert partagé sont activés.
Une couche MTP native prend en charge le décodage spéculatif. Tencent annonce 770B paramètres au total et 49B actifs pour le socle ; l'ajout de MTP représente 10B paramètres au total et 0.7B actifs. Lorsqu'une page indique 770B et une autre une valeur proche de 780B, vérifiez si MTP est inclus.
L'attention utilise Gated DeepSeek Sparse Attention (Gated DSA) avec IndexCache pour réutiliser les index clairsemés entre les couches. Le chemin résiduel utilise quatre flux identity Hyper-Connection (iHC). Ensemble, ces choix visent à maintenir un coût de calcul et un flux d'information maîtrisables avec un contexte de 1M et une architecture MoE de grande taille.
Le dépôt précise également 64 têtes d'attention, une dimension de compression des requêtes de 2,048, une dimension de compression key-value de 512 et un indexer top-k de 2,048. Ces valeurs aident à vérifier la compatibilité des frameworks d'inférence et à planifier la capacité ; elles ne prouvent pas à elles seules le résultat d'une tâche.
Comment interpréter la fenêtre de contexte de 1M ?
Le dépôt de Tencent indique une longueur de contexte de 1M. La page produit Tencent Cloud décrit des limites hébergées de 960K d'entrée maximale et 64K de sortie maximale. Ces informations peuvent coexister, car la fenêtre du modèle, la sortie réservée par le service hébergé, le prompt système et la marge de sécurité utilisent des périmètres de comptage différents.
Ne commencez pas les tests de production avec une requête proche d'un million de tokens. Utilisez plutôt des paliers de 32K, 128K, 256K, 512K et contexte ultra-long, en enregistrant :
- le délai avant le premier token et la latence de bout en bout
- les tokens d'entrée, de sortie et de lecture du cache
- la précision de récupération entre fichiers
- le taux de réussite des appels d'outils et le nombre de tentatives
- le taux de réussite des tâches et le temps de reprise humaine
La capacité de contexte n'est pas synonyme d'exactitude automatique. Les grands dépôts, classeurs financiers et corpus de recherche ont toujours besoin de récupération, d'isolation des permissions et de liens vers les preuves.
Quelle est la puissance de Hy4 preview pour la programmation et les agents ?
L'annexe de benchmarks de Tencent rapporte des progrès généraux par rapport à Hy3 sur l'ingénierie logicielle, l'utilisation d'outils et les tâches à long contexte. Quelques valeurs de la même table officielle sont présentées ci-dessous :
| Évaluation publiée par Tencent | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench (avec outils) | 51.5 | 65.4 |
Ce sont des résultats publiés par Tencent, pas des tests indépendants de ce site. Tencent précise que les modèles ont été évalués avec leur réglage de raisonnement disponible le plus élevé, que certains résultats marqués d'un astérisque ont été exécutés par Tencent et que les harnesses, budgets de tokens, ressources de sandbox et échantillonnages répétés influencent les scores.
La même table évite de sélectionner uniquement les meilleurs chiffres : Hy4 preview obtient 17.5 sur ProgramBench, derrière Kimi K3, GPT 5.6 Sol et Claude Opus 5 dans la comparaison de Tencent. Le gain d'une génération à l'autre est réel, mais Hy4 n'est pas en tête de tous les benchmarks de programmation.
Que montre l'évaluation d'experts sur 203 tâches ?
Tencent a organisé une évaluation en aveugle avec 163 experts internes sur 203 tâches d'ingénierie réelles. Le résultat publié est le suivant :
- Hy4 preview : moyenne de 2.99 / 4
- GLM 5.3 : 2.92 / 4 ; Hy4 a gagné 46.8 %, égalé 12.8 % et perdu 40.4 % des comparaisons
- Kimi K3 : 2.94 / 4 ; Hy4 a gagné 51.2 %, égalé 7.9 % et perdu 40.9 % des comparaisons
Ces chiffres sont intéressants parce que les tâches provenaient des activités de Tencent dans le logiciel, le jeu vidéo, la finance et la sécurité, plutôt que de seuls classements publics. Il s'agit néanmoins d'une évaluation interne du fournisseur, et non d'un benchmark tiers entièrement reproductible avec un ensemble de tâches et une grille publiques.
La méthode d'adoption la plus fiable consiste à constituer une suite de régression à partir de vos propres dépôts, documents et commandes d'acceptation, puis à comparer le taux de réussite, la latence et le coût total avec les modèles que vous utilisez déjà.
Quels workloads conviennent à Hy4 preview ?
- agents de programmation à long horizon qui planifient, modifient, déboguent et vérifient
- développement frontend où le code, la hiérarchie visuelle et la qualité des interactions comptent ensemble
- workflows bureautiques multi-fichiers qui produisent des documents, des feuilles de calcul et des présentations
- prototypes de jeux jouables suivis d'un travail itératif multi-tour sur le moteur
- modélisation financière et analyse de données multi-fichiers
- recherche en IA, dynamique moléculaire, physique de la matière condensée et mathématiques
- recherche et workflows de connaissance avec outils sur un contexte de 1M
Les écritures en production doivent toujours être protégées par des règles ou une approbation humaine pour le shell, les bases de données, les paiements, les permissions et les messages externes. Un modèle plus puissant ne supprime pas le risque d'autorisation d'un agent.
Quel est le prix officiel de Hy4 preview ?
TokenHub de Tencent Cloud affiche actuellement les prix de référence suivants pour Guangzhou :
| Élément facturé | Prix public |
|---|---|
| Entrée | CNY 6 / 1M tokens |
| Sortie | CNY 18 / 1M tokens |
| Lecture du cache | CNY 0.3 / 1M tokens |
Il s'agit d'un prix direct propre à une région et à une période de Tencent Cloud, et non d'un prix universel pour les plateformes tierces. OpenRouter, les autres fournisseurs d'inférence et l'auto-hébergement ont une économie distincte ; on ne peut pas déduire le multiplicateur d'une passerelle à partir du prix direct de TokenHub.
Au moment de la vérification, le 29 août 2026, la page de tarification live de ce site ne listait pas hy4-preview. S'il est ajouté plus tard, utilisez le catalogue live et le registre des requêtes plutôt que le prix direct Tencent Cloud indiqué dans cet article.
Ne mélangez pas ces identifiants de modèle Hy4
| Chemin d'accès | Nom / identifiant à utiliser |
|---|---|
| Modèle servi localement par le dépôt officiel | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Poids BF16 Hugging Face | tencent/Hy4-preview |
| Poids FP8 Hugging Face | tencent/Hy4-preview-FP8 |
Une passerelle API ne traduit généralement pas le nom d'un dépôt Hugging Face en identifiant de modèle hébergé. Copiez l'identifiant exact depuis la plateforme cible et vérifiez-le avec un appel de liste des modèles ou une requête minimale.
Comment auto-héberger et appeler Hy4 preview ?
Tencent recommande vLLM ou SGLang. Après le lancement, appelez le modèle servi localement via une API Chat Completions compatible OpenAI :
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
Tencent recommande temperature=0.9 et top_p=1.0. Le modèle utilise par défaut un raisonnement élevé. Le template local du dépôt utilise chat_template_kwargs.reasoning_effort = "no_think" pour les réponses directes ; les fournisseurs hébergés peuvent exposer des champs d'extension différents.
La recette vLLM officielle utilise le parallélisme tensoriel sur huit voies, le décodage spéculatif MTP, le backend d'attention FLASHMLA_SPARSE et les parseurs d'outils et de raisonnement hy_v4. Ne copiez pas cette recette sur du matériel doté d'un autre GPU, pilote, image ou framework sans vérifier d'abord la capacité.
Hy4 preview face à Hy3
| Dimension | Hy3 | Hy4 preview |
|---|---|---|
| Échelle officielle | 295B au total / 21B actifs | 770B au total / 49B actifs |
| Contexte | 256K | 1M |
| Positionnement | agents et productivité à coût maîtrisé | nouveau flagship pour la programmation, les agents et la productivité complexe |
| Maturité | passé de preview à une sortie formelle | preview Hy4 précoce |
| Coût d'auto-hébergement | plus faible | nettement plus élevé |
Hy3 reste pertinent lorsque le coût, l'échelle de déploiement et la maturité sont prioritaires. Ajoutez Hy4 preview à une évaluation contrôlée si vous avez besoin d'un contexte plus long et d'une meilleure ingénierie à long horizon ou exécution d'outils, mais ne remplacez pas un modèle de production sur la seule base du nombre total de paramètres.
Checklist d'évaluation en production
- Copiez l'identifiant exact depuis la plateforme cible ; ne devinez ni la casse ni l'espace de noms.
- Verrouillez la version du modèle, le prompt, les outils, le niveau de raisonnement, le délai d'attente et la sortie maximale.
- Commencez par des tâches en lecture seule avant d'autoriser des effets de bord sur les fichiers, le shell, la base de données ou des services externes.
- Mesurez le taux de réussite avec de vrais dépôts et commandes d'acceptation, pas avec une impression de conversation.
- Testez les paliers de contexte à partir de 32K et notez la latence, l'utilisation du cache et la facturation totale.
- Fixez un nombre maximal de tours, des budgets de tokens et des étapes d'approbation pour les tâches complexes.
- Vérifiez les appels d'outils, la sortie structurée et le mapping des champs de raisonnement chez le fournisseur cible.
- Conservez une suite de régression, une route de secours et un retour arrière rapide pour un modèle preview.
Points clés à retenir
- Hy4 preview a été lancé et open source le 28 août 2026 comme nouveau modèle MoE phare de Tencent Hunyuan.
- Son socle compte 770B paramètres au total et 49B actifs, auxquels s'ajoute une couche MTP native de 10B/0.7B.
- Le dépôt indique un contexte de 1M ; Tencent Cloud indique 960K d'entrée maximale et 64K de sortie maximale.
- Tencent rapporte de forts gains par rapport à Hy3 en programmation, utilisation d'outils et long contexte, mais pas une domination de chaque benchmark.
hy4-preview,tencent/hy4-previewettencent/Hy4-preview-FP8sont des identifiants propres à chaque plateforme.- Cette passerelle n'avait pas ouvert la route au moment de la publication ; la disponibilité et la facturation nécessitent une vérification du catalogue live.
Questions fréquentes
Hy4 preview est-il officiellement sorti ?
Oui. Tencent a publié et open source Hy4 preview le 28 août 2026, avec un accès via WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub et OpenRouter. Il reste une version preview, et non la version finale de Hy4.
Hy4 preview est-il multimodal ?
Le dépôt de lancement de Tencent le présente comme un modèle de langage pour la programmation, les agents et la productivité, avec des spécifications publiques centrées sur le texte, les outils et le long contexte. Ne déduisez pas une entrée image ou vidéo simplement parce que la famille Hunyuan plus large comprend des modèles visuels ; vérifiez le tableau de capacités du fournisseur cible.
Quelle est la longueur de contexte de Hy4 preview ?
Le dépôt indique un contexte de 1M. Tencent Cloud indique séparément 960K d'entrée maximale et 64K de sortie maximale pour le service hébergé.
Quel est l'identifiant API officiel de Hy4 preview ?
Le nom du modèle servi par le dépôt officiel est hy4-preview ; OpenRouter utilise tencent/hy4-preview ; les poids auto-hébergés utilisent tencent/Hy4-preview ou la variante FP8. L'identifiant de la console de la plateforme cible fait foi.
Hy4 preview prend-il en charge les appels d'outils ?
La recette vLLM de Tencent active le parseur d'outils hy_v4 et le choix automatique des outils, tandis que sa suite de benchmarks inclut Toolathlon et MCP-Atlas. Vérifiez les paramètres hébergés exacts auprès du fournisseur.
Combien coûte Hy4 preview ?
Tencent Cloud TokenHub affiche actuellement pour Guangzhou CNY 6 en entrée, CNY 18 en sortie et CNY 0.3 en lecture du cache par million de tokens. La région, la plateforme et les promotions peuvent modifier le prix.
Puis-je appeler Hy4 preview via cette passerelle maintenant ?
Au moment de la vérification, le 29 août 2026, le catalogue live et les upstreams activés ne listaient pas hy4-preview. Consultez la page de tarification live pour connaître toute disponibilité ultérieure.
Hy4 preview peut-il fonctionner avec Claude Code ou un autre agent de programmation ?
Le modèle vise la programmation et les agents et prend en charge un service local compatible OpenAI. La compatibilité du client dépend toutefois du protocole, du format des appels d'outils, de la sortie de raisonnement et de la couche de compatibilité du fournisseur ; validez donc d'abord une requête minimale et une régression d'outils.
Sources principales
- Annonce Tencent : Tencent Releases and Open-Sources Tencent Hy4 preview
- GitHub officiel Tencent Hunyuan : Hy4-preview
- Page produit et tarifs Tencent Cloud TokenHub
- Page produit Tencent Cloud Hunyuan : limites de Hy4 preview
- Article sur Gated DeepSeek Sparse Attention
- Article sur IndexCache
- Tarifs live des modèles de ce site : pour vérifier la disponibilité ultérieure de la route, et non le prix officiel de Tencent Cloud