Guía de la API Tencent Hy4 preview 2026: MoE 770B, contexto 1M y agentes de código

El 29 de agosto de 2026 revisamos Hy4 preview, publicada por Tencent el día anterior. El cambio importante no es solo pasar de Hy3 a Hy4: Tencent amplió el backbone hasta 770B de parámetros, aumentó el contexto a 1M y siguió evaluando el modelo dentro de CodeBuddy, WorkBuddy y flujos reales de ingeniería.
En una frase: Hy4 preview es el nuevo MoE insignia de código abierto de Tencent Hunyuan para programación, agentes, análisis ofimático, desarrollo de juegos e investigación científica; el nombre oficial del served model para alojamiento propio es hy4-preview, pero los ID de modelo, precios y disponibilidad dependen de la plataforma.
Esta guía se basa en el lanzamiento de Tencent, el repositorio oficial, las páginas de Tencent Cloud TokenHub y los artículos primarios citados por el repositorio. Los benchmarks del proveedor no son pruebas independientes de este sitio. En el momento de la comprobación, el catálogo en tiempo real de este sitio no incluía hy4-preview, por lo que este artículo no afirma que la ruta del gateway ya esté abierta.
Datos clave de Hy4 preview
| Elemento | Información oficial verificada |
|---|---|
| Fecha de lanzamiento | 28 de agosto de 2026 |
| Nombre oficial | Tencent Hy4 preview |
| Arquitectura | Mixture-of-Experts (MoE) |
| Parámetros del backbone | 770B en total, 49B activos |
| Capa MTP nativa | 10B en total, 0.7B activos |
| Profundidad del backbone | 78 capas |
| Distribución de expertos | 256 expertos routed + 1 compartido; se activan los top-8 routed por token |
| Atención / residual | Gated DSA + IndexCache; cuatro streams residuales iHC |
| Contexto | 1M en el repositorio; Tencent Cloud indica entrada máxima de 960K y salida máxima de 64K |
| Served model local oficial | hy4-preview |
| Pesos abiertos | tencent/Hy4-preview, tencent/Hy4-preview-FP8 |
| Licencia | Apache 2.0 |
| Precio público de Tencent Cloud en Guangzhou | Entrada CNY 6, salida CNY 18, lectura de caché CNY 0.3 / 1M tokens |
Última verificación: 29 de agosto de 2026. Antes de adoptarlo en producción, revisa de nuevo la consola de TokenHub, la región de destino, el precio actual y los campos de uso de la respuesta real.
¿Qué es Hy4 preview? ¿Es el lanzamiento final de Hy4?
Hy4 preview es una iteración inicial de Hy4, no el futuro lanzamiento final sin el sufijo preview. Tencent documenta explícitamente problemas conocidos, como dedicar más tiempo del necesario al razonamiento de tareas complejas y verificar en exceso su propio trabajo.
Este límite importa. «Flagship preview» significa que el modelo ya cuenta con pesos abiertos, recetas de inferencia, un flujo de ajuste fino y una entrada de API. No significa que el comportamiento, el precio o el nivel de servicio hayan quedado fijados para siempre.
Tencent también ofrece Hy4 preview en WorkBuddy, CodeBuddy, Yuanbao e ima, y proporciona acceso a la API mediante Tencent Cloud TokenHub y OpenRouter. Eso basta para incluirlo en una evaluación, pero los flujos críticos de producción deben fijar versiones, mantener conjuntos de regresión y conservar un modelo de respaldo.
¿Qué cambió en la arquitectura MoE de 770B?
El backbone de Hy4 preview tiene 78 capas. La primera utiliza Dense FFN; las otras 77 son capas MoE con 256 expertos routed y un experto compartido. Cada token activa los ocho mejores expertos routed y el experto compartido.
El backbone también incluye una capa MTP nativa para speculative decoding. Tencent informa del backbone con 770B de parámetros totales y 49B activos; al incluir MTP se añaden 10B totales y 0.7B activos. Si una página indica 770B y otra se acerca a 780B, comprueba si MTP está incluido.
La atención utiliza Gated DeepSeek Sparse Attention (Gated DSA) y IndexCache para reutilizar el sparse index entre capas. La ruta residual usa cuatro streams identity Hyper-Connection (iHC). En conjunto, estos diseños buscan mantener bajo control el cálculo y el flujo de información con contexto 1M y un MoE de gran escala.
El repositorio también especifica 64 cabezas de atención, una dimensión de compresión Query de 2.048, una dimensión de compresión Key-Value de 512 y un indexer top-k de 2.048. Estos valores sirven para comprobar la compatibilidad del framework de inferencia y planificar recursos; por sí solos no demuestran el resultado de ninguna tarea.
¿Cómo interpretar la ventana de contexto 1M?
El repositorio de Tencent indica una longitud de contexto de 1M. La página de producto de Tencent Cloud describe límites alojados de 960K de entrada y 64K de salida. Pueden coexistir porque la ventana del modelo, la salida reservada, el system prompt y el margen de seguridad del servicio usan límites contables distintos.
No empieces las pruebas de producción con una solicitud cercana a un millón de tokens. Usa niveles como 32K, 128K, 256K, 512K y contexto ultralargo, y registra:
- tiempo hasta el primer token y latencia de extremo a extremo
- tokens de entrada, salida y lectura de caché
- precisión de recuperación entre archivos
- éxito de llamadas a herramientas y número de reintentos
- tasa de tareas superadas y tiempo de retrabajo humano
La capacidad de contexto no equivale a corrección automática. Los repositorios grandes, las hojas financieras y los corpus de investigación siguen necesitando recuperación, aislamiento de permisos y enlaces a las evidencias.
¿Qué nivel tiene Hy4 preview en programación y agentes?
El anexo de benchmarks de Tencent informa de mejoras amplias frente a Hy3 en ingeniería de software, uso de herramientas y tareas de contexto largo. Estos son algunos valores de la misma tabla oficial:
| Evaluación publicada por Tencent | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench (with tools) | 51.5 | 65.4 |
Son resultados publicados por Tencent, no pruebas independientes de este sitio. Tencent señala que los modelos se evaluaron con la configuración de razonamiento más alta disponible entonces, que algunos resultados marcados con asterisco fueron ejecutados por Tencent y que el harness, el presupuesto de tokens, los recursos del sandbox y el muestreo repetido afectan a las puntuaciones.
La misma tabla impide seleccionar solo los números favorables: en la comparación de Tencent, Hy4 preview obtiene 17.5 en ProgramBench, por debajo de Kimi K3, GPT 5.6 Sol y Claude Opus 5. La mejora entre generaciones es real, pero Hy4 no lidera todos los benchmarks de programación.
¿Qué muestra la evaluación de expertos en 203 tareas reales?
Tencent realizó una evaluación ciega con 163 expertos internos sobre 203 tareas reales de ingeniería. El resultado publicado fue:
- Hy4 preview: media de 2.99 / 4
- GLM 5.3: media de 2.92 / 4; Hy4 ganó 46.8%, empató 12.8% y perdió 40.4%
- Kimi K3: media de 2.94 / 4; Hy4 ganó 51.2%, empató 7.9% y perdió 40.9%
Estos datos importan porque las tareas procedían de los trabajos de Tencent en ingeniería de software, juegos, finanzas y seguridad, y no solo de tablas de clasificación públicas. Aun así, sigue siendo una evaluación interna del proveedor, no un benchmark externo totalmente reproducible con un conjunto de tareas y una rúbrica públicos.
El método fiable de adopción es crear un conjunto de regresión con tus propios repositorios, documentos y comandos de aceptación, y comparar después la tasa de aprobación, la latencia y el coste total con los modelos que ya utilizas.
¿Qué cargas de trabajo encajan con Hy4 preview?
- agentes de programación de larga duración que planifican, aplican parches, depuran y verifican
- trabajo frontend en el que importan el código, la jerarquía visual y la calidad de interacción
- flujos ofimáticos entre archivos que entregan documentos, hojas de cálculo y presentaciones
- prototipos de juegos ejecutables seguidos de trabajo con el motor en varias rondas
- modelado financiero y análisis de datos en varios archivos
- investigación en IA, dinámica molecular, física de la materia condensada y matemáticas
- búsqueda y trabajo de conocimiento con herramientas sobre contexto 1M
Las escrituras en producción siguen necesitando controles de política o aprobación humana para shell, bases de datos, pagos, permisos y mensajes externos. Un modelo más potente no elimina el riesgo de autorización de los agentes.
¿Cuál es el precio oficial de Hy4 preview?
Tencent Cloud TokenHub muestra actualmente estos precios de referencia para Guangzhou:
| Concepto de facturación | Precio público |
|---|---|
| Entrada | CNY 6 / 1M tokens |
| Salida | CNY 18 / 1M tokens |
| Lectura de caché | CNY 0.3 / 1M tokens |
Es un precio de acceso directo de Tencent Cloud específico de una región y un momento, no un precio universal para plataformas de terceros. OpenRouter, otros proveedores de inferencia y el alojamiento propio tienen economías distintas; el multiplicador de un gateway no se puede deducir del precio directo de TokenHub.
En la comprobación del 29 de agosto de 2026, la página de precios en tiempo real de este sitio no incluía hy4-preview. Si se añade después, utiliza el catálogo en tiempo real y el registro de solicitudes, no el precio directo de Tencent Cloud de este artículo.
No mezcles estos ID de modelos Hy4
| Vía de acceso | Nombre / ID que debes usar |
|---|---|
| Served model local del repositorio oficial | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Pesos BF16 de Hugging Face | tencent/Hy4-preview |
| Pesos FP8 de Hugging Face | tencent/Hy4-preview-FP8 |
Un gateway de API normalmente no traduce el nombre de un repositorio de Hugging Face al ID de un modelo alojado. Copia el identificador exacto de la plataforma de destino y compruébalo con una llamada a la lista de modelos o una solicitud mínima.
¿Cómo alojar y llamar a Hy4 preview?
Tencent recomienda vLLM o SGLang. Después del arranque, llama al served model local mediante una API Chat Completions compatible con OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
Tencent recomienda temperature=0.9 y top_p=1.0. El modelo utiliza high reasoning de forma predeterminada. La plantilla local del repositorio usa chat_template_kwargs.reasoning_effort = "no_think" para respuestas directas; los proveedores alojados pueden ofrecer campos de extensión diferentes.
La receta oficial de vLLM utiliza paralelismo tensorial de ocho vías, speculative decoding MTP, el backend de atención FLASHMLA_SPARSE y los parsers de herramientas y razonamiento hy_v4. No copies la receta en hardware con otra GPU, controlador, imagen o framework sin comprobar antes la capacidad.
Hy4 preview frente a Hy3
| Dimensión | Hy3 | Hy4 preview |
|---|---|---|
| Escala oficial | 295B totales / 21B activos | 770B totales / 49B activos |
| Contexto | 256K | 1M |
| Posicionamiento | agentes y productividad rentables | nuevo flagship para programación, agentes y productividad compleja |
| Madurez | evolucionó de preview a lanzamiento formal | Hy4 preview inicial |
| Coste de alojamiento propio | menor | considerablemente mayor |
Hy3 sigue siendo práctico cuando predominan el coste, la escala de despliegue y la madurez. Añade Hy4 preview a una evaluación controlada cuando necesites más contexto, ingeniería de software de larga duración o ejecución de herramientas más fuerte, pero no sustituyas un modelo de producción basándote solo en el número total de parámetros.
Lista de comprobación para producción
- Copia el ID exacto del modelo desde la plataforma de destino; no adivines mayúsculas, minúsculas ni namespace.
- Fija la versión del modelo, el prompt, las herramientas, el nivel de razonamiento, el tiempo de espera y la salida máxima.
- Empieza con tareas de solo lectura antes de conceder acceso a archivos, shell, base de datos o efectos externos.
- Mide la tasa de aprobación con repositorios reales y comandos de aceptación, no con impresiones del chat.
- Prueba niveles de contexto desde 32K hacia arriba y registra latencia, uso de caché y facturación total.
- Define turnos máximos, presupuestos de tokens y puntos de aprobación para tareas complejas.
- Comprueba las llamadas a herramientas, la salida estructurada y el mapeo de campos de razonamiento en el proveedor de destino.
- Conserva un conjunto de regresión, una ruta de respaldo y un rollback rápido para el modelo preview.
Conclusiones clave
- Hy4 preview se lanzó y se publicó como código abierto el 28 de agosto de 2026 como nuevo MoE insignia de Tencent Hunyuan.
- Su backbone tiene 770B de parámetros totales y 49B activos, además de una capa MTP nativa de 10B/0.7B.
- El repositorio indica contexto 1M; Tencent Cloud indica entrada máxima de 960K y salida máxima de 64K.
- Tencent informa de grandes mejoras frente a Hy3 en programación, uso de herramientas y contexto largo, pero no de liderazgo en todos los benchmarks.
- hy4-preview, tencent/hy4-preview y tencent/Hy4-preview-FP8 son identificadores específicos de cada plataforma.
- En el momento de publicación este gateway no había abierto la ruta; la disponibilidad y la facturación deben comprobarse en el catálogo en tiempo real.
Preguntas frecuentes
¿Hy4 preview se ha lanzado oficialmente?
Sí. Tencent lanzó y publicó como código abierto Hy4 preview el 28 de agosto de 2026, con acceso mediante WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub y OpenRouter. Sigue siendo una preview, no el lanzamiento final de Hy4.
¿Hy4 preview es multimodal?
El repositorio de lanzamiento de Tencent lo presenta como un modelo de lenguaje para programación, agentes y productividad, con especificaciones públicas centradas en texto, herramientas y contexto largo. No deduzcas que acepta imágenes o vídeos solo porque la familia Hunyuan incluye modelos visuales; revisa la tabla de capacidades del proveedor de destino.
¿Cuál es la longitud de contexto de Hy4 preview?
El repositorio especifica un contexto de 1M. Tencent Cloud indica por separado una entrada máxima de 960K y una salida máxima de 64K para el servicio alojado.
¿Cuál es el ID oficial de la API de Hy4 preview?
El nombre del served model del repositorio oficial es hy4-preview; OpenRouter utiliza tencent/hy4-preview; los pesos para alojamiento propio son tencent/Hy4-preview o la variante FP8. Tiene prioridad el ID mostrado en la consola de la plataforma de destino.
¿Hy4 preview admite llamadas a herramientas?
La receta de vLLM de Tencent activa el parser de herramientas hy_v4 y la selección automática, mientras que su benchmark incluye Toolathlon y MCP-Atlas. Comprueba los parámetros exactos de la API alojada en la documentación del proveedor.
¿Cuánto cuesta Hy4 preview?
Tencent Cloud TokenHub muestra actualmente en Guangzhou CNY 6 para la entrada, CNY 18 para la salida y CNY 0.3 para la lectura de caché por millón de tokens. La región, la plataforma y las promociones pueden cambiar el precio.
¿Puedo llamar a Hy4 preview a través de este gateway ahora?
En la comprobación del 29 de agosto de 2026, el catálogo en tiempo real y los upstream habilitados no incluían hy4-preview. Consulta la página de precios en tiempo real para conocer una disponibilidad posterior.
¿Hy4 preview funciona con Claude Code u otro agente de programación?
El modelo está orientado a programación y agentes y admite una ruta local compatible con OpenAI. La compatibilidad del cliente depende del protocolo, la forma de las llamadas a herramientas, la salida de razonamiento y la capa de compatibilidad del proveedor; valida primero una solicitud mínima y una regresión de herramientas.
Fuentes principales
- Lanzamiento oficial de Tencent: Tencent Releases and Open-Sources Tencent Hy4 preview
- GitHub oficial de Tencent Hunyuan: Hy4-preview
- Página de producto y precios de Tencent Cloud TokenHub
- Página de producto Tencent Cloud Hunyuan: límites de Hy4 preview
- Artículo sobre Gated DeepSeek Sparse Attention
- Artículo sobre IndexCache
- Precios de modelos en tiempo real de este sitio: para comprobar la disponibilidad posterior de la ruta, no el precio oficial de Tencent Cloud