Guia da API Tencent Hy4 preview 2026: MoE de 770B, contexto de 1M e agentes de programação

Em 29 de agosto de 2026, analisamos o Hy4 preview, lançado pela Tencent no dia anterior. A mudança importante não é apenas passar do Hy3 para o Hy4: a Tencent ampliou o backbone para 770B de parâmetros, aumentou o contexto para 1M e continuou avaliando o modelo no CodeBuddy, no WorkBuddy e em fluxos reais de engenharia.
Em uma frase: o Hy4 preview é o novo MoE flagship de código aberto da Tencent Hunyuan para programação, agentes, análise de escritório, desenvolvimento de jogos e pesquisa científica; o nome oficial do served model para auto-hospedagem é hy4-preview, mas IDs de modelo, preços e disponibilidade variam conforme a plataforma.
Este guia usa o lançamento da Tencent, o repositório oficial, as páginas do Tencent Cloud TokenHub e os artigos primários citados pelo repositório. Os benchmarks do fornecedor não são testes independentes deste site. Na data da verificação, o catálogo em tempo real deste site não listava hy4-preview, portanto este artigo não afirma que a rota do gateway já esteja aberta.
Dados principais do Hy4 preview
| Item | Informação oficial verificada |
|---|---|
| Data de lançamento | 28 de agosto de 2026 |
| Nome oficial | Tencent Hy4 preview |
| Arquitetura | Mixture-of-Experts (MoE) |
| Parâmetros do backbone | 770B no total, 49B ativados |
| Camada MTP nativa | 10B no total, 0.7B ativados |
| Profundidade do backbone | 78 camadas |
| Estrutura de especialistas | 256 routed + 1 shared expert; top-8 routed experts ativados por token |
| Atenção / residual | Gated DSA + IndexCache; quatro residual streams iHC |
| Contexto | 1M no repositório; Tencent Cloud lista entrada máxima de 960K e saída máxima de 64K |
| Served model local oficial | hy4-preview |
| Pesos abertos | tencent/Hy4-preview, tencent/Hy4-preview-FP8 |
| Licença | Apache 2.0 |
| Preço público do Tencent Cloud em Guangzhou | Entrada CNY 6, saída CNY 18, leitura de cache CNY 0.3 / 1M tokens |
Última verificação em 29 de agosto de 2026. Antes de adotar em produção, confira novamente o console do TokenHub, a região de destino, o preço atual e os campos de uso da resposta real.
O que é o Hy4 preview? É o lançamento final do Hy4?
Hy4 preview é uma iteração inicial do Hy4, não o futuro lançamento final sem o sufixo preview. A Tencent documenta explicitamente problemas conhecidos, incluindo gastar mais tempo do que o necessário raciocinando sobre tarefas complexas e verificar o próprio trabalho em excesso.
Essa fronteira é importante. “Flagship preview” significa que o modelo já tem pesos abertos, receitas de inferência, um pipeline de fine-tuning e uma entrada de API. Isso não significa que comportamento, preço ou nível de serviço estejam congelados para sempre.
A Tencent também oferece Hy4 preview no WorkBuddy, CodeBuddy, Yuanbao e ima, além de acesso à API pelo Tencent Cloud TokenHub e pelo OpenRouter. Isso é suficiente para incluí-lo na avaliação, enquanto fluxos críticos de produção ainda devem fixar versões, manter conjuntos de regressão e conservar um modelo de fallback.
O que mudou na arquitetura MoE de 770B?
O backbone do Hy4 preview tem 78 camadas. A primeira usa Dense FFN; as outras 77 são camadas MoE com 256 routed experts e um shared expert. Cada token ativa os oito melhores routed experts e o shared expert.
O backbone também inclui uma camada MTP nativa para speculative decoding. A Tencent informa o backbone com 770B de parâmetros totais e 49B ativos; incluir o MTP acrescenta 10B totais e 0.7B ativos. Se uma página informa 770B e outra se aproxima de 780B, verifique se o MTP está incluído.
A atenção usa Gated DeepSeek Sparse Attention (Gated DSA) com IndexCache para reutilizar sparse indexes entre camadas. O caminho residual usa quatro streams identity Hyper-Connection (iHC). Juntos, esses projetos buscam manter sob controle o cálculo e o fluxo de informação com contexto 1M e um MoE de grande escala.
O repositório também especifica 64 attention heads, dimensão de compressão Query de 2.048, dimensão de compressão Key-Value de 512 e indexer top-k de 2.048. Esses valores ajudam na compatibilidade do framework de inferência e no planejamento de capacidade, mas não provam sozinhos o resultado de nenhuma tarefa.
Como entender a janela de contexto de 1M?
O repositório da Tencent lista um contexto de 1M. A página do produto Tencent Cloud descreve limites hospedados de 960K de entrada e 64K de saída. Isso pode coexistir porque a janela do modelo, a saída reservada, o system prompt e a margem de segurança do serviço usam limites de contabilização diferentes.
Não comece o teste de produção com uma solicitação próxima de um milhão de tokens. Use faixas como 32K, 128K, 256K, 512K e contexto ultralongo, registrando:
- tempo até o primeiro token e latência de ponta a ponta
- tokens de entrada, saída e leitura de cache
- precisão da recuperação entre arquivos
- sucesso das chamadas de ferramentas e quantidade de retries
- taxa de aprovação das tarefas e tempo de retrabalho humano
Capacidade de contexto não é correção automática. Repositórios grandes, planilhas financeiras e bases de pesquisa ainda precisam de retrieval, isolamento de permissões e links para evidências.
Qual é o desempenho do Hy4 preview em programação e agentes?
O apêndice de benchmarks da Tencent relata ganhos amplos sobre o Hy3 em engenharia de software, uso de ferramentas e tarefas de contexto longo. Estes são alguns valores da mesma tabela oficial:
| Avaliação publicada pela Tencent | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench (with tools) | 51.5 | 65.4 |
São resultados publicados pela Tencent, não testes independentes deste site. A Tencent informa que os modelos foram avaliados com a configuração de raciocínio mais alta disponível naquele momento, que alguns resultados com asterisco foram executados pela própria Tencent e que harnesses, orçamentos de tokens, recursos de sandbox e amostragem repetida afetam as pontuações.
A mesma tabela impede escolher apenas os números favoráveis: na comparação da Tencent, o Hy4 preview marca 17.5 no ProgramBench, abaixo de Kimi K3, GPT 5.6 Sol e Claude Opus 5. O ganho entre gerações é real, mas o Hy4 não lidera todos os benchmarks de programação.
O que mostra a avaliação de especialistas em 203 tarefas reais?
A Tencent conduziu uma avaliação cega com 163 especialistas internos em 203 tarefas reais de engenharia. O resultado publicado foi:
- Hy4 preview: média de 2.99 / 4
- GLM 5.3: média de 2.92 / 4; Hy4 venceu 46.8%, empatou 12.8% e perdeu 40.4%
- Kimi K3: média de 2.94 / 4; Hy4 venceu 51.2%, empatou 7.9% e perdeu 40.9%
Esses dados importam porque as tarefas vieram do trabalho da Tencent em engenharia de software, jogos, finanças e segurança, e não apenas de rankings públicos. Ainda assim, continua sendo uma avaliação interna do fornecedor, não um benchmark externo totalmente reproduzível com conjunto de tarefas e rubrica públicos.
O método confiável de adoção é criar uma suíte de regressão a partir dos seus próprios repositórios, documentos e comandos de aceitação, e depois comparar taxa de aprovação, latência e custo total com os modelos que você já usa.
Que tipos de workload combinam com o Hy4 preview?
- agentes de programação de longa duração que planejam, aplicam patches, depuram e verificam
- trabalho de frontend em que código, hierarquia visual e qualidade da interação importam
- fluxos de escritório entre vários arquivos que entregam documentos, planilhas e apresentações
- protótipos de jogos executáveis seguidos de trabalho com a engine em várias rodadas
- modelagem financeira e análise de dados em vários arquivos
- pesquisa em IA, dinâmica molecular, física da matéria condensada e matemática
- pesquisa com ferramentas e fluxos de conhecimento em contexto 1M
Escritas em produção ainda precisam de controles de política ou aprovação humana para shell, bancos de dados, pagamentos, permissões e mensagens externas. Um modelo mais forte não elimina o risco de autorização dos agentes.
Qual é o preço oficial do Hy4 preview?
O Tencent Cloud TokenHub exibe atualmente estes preços de referência para Guangzhou:
| Item de cobrança | Preço público |
|---|---|
| Entrada | CNY 6 / 1M tokens |
| Saída | CNY 18 / 1M tokens |
| Leitura de cache | CNY 0.3 / 1M tokens |
Este é um preço de acesso direto do Tencent Cloud específico de região e momento, não um preço universal para plataformas de terceiros. OpenRouter, outros provedores de inferência e self-hosting têm economias separadas; não é possível deduzir o multiplicador de um gateway a partir do preço direto do TokenHub.
Na verificação de 29 de agosto de 2026, a página de preços em tempo real deste site não listava hy4-preview. Se for adicionado depois, use o catálogo em tempo real e o registro de requests, não o preço direto do Tencent Cloud deste artigo.
Não misture estes IDs de modelo do Hy4
| Caminho de acesso | Nome / ID a usar |
|---|---|
| Served model local do repositório oficial | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Pesos BF16 do Hugging Face | tencent/Hy4-preview |
| Pesos FP8 do Hugging Face | tencent/Hy4-preview-FP8 |
Um gateway de API normalmente não converte o nome de um repositório do Hugging Face em um ID de modelo hospedado. Copie o identificador exato da plataforma de destino e valide-o com uma chamada à lista de modelos ou uma solicitação mínima.
Como fazer self-hosting e chamar o Hy4 preview?
A Tencent recomenda vLLM ou SGLang. Depois de iniciar, chame o served model local por uma API Chat Completions compatível com OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
A Tencent recomenda temperature=0.9 e top_p=1.0. O modelo usa high reasoning por padrão. O template local do repositório usa chat_template_kwargs.reasoning_effort = "no_think" para respostas diretas; provedores hospedados podem expor campos de extensão diferentes.
A receita oficial do vLLM usa paralelismo tensorial de oito vias, speculative decoding MTP, o backend de atenção FLASHMLA_SPARSE e parsers de ferramentas e raciocínio hy_v4. Não cole a receita em hardware com GPU, driver, imagem ou framework diferentes sem conferir a capacidade.
Hy4 preview comparado ao Hy3
| Dimensão | Hy3 | Hy4 preview |
|---|---|---|
| Escala oficial | 295B no total / 21B ativos | 770B no total / 49B ativos |
| Contexto | 256K | 1M |
| Posicionamento | agentes e produtividade com bom custo | novo flagship para programação, agentes e produtividade complexa |
| Maturidade | evoluiu de preview para lançamento formal | Hy4 preview inicial |
| Custo de self-hosting | menor | consideravelmente maior |
O Hy3 continua prático quando custo, escala de implantação e maturidade são prioritários. Inclua o Hy4 preview em uma avaliação controlada quando precisar de contexto mais longo, engenharia de software de longa duração ou execução de ferramentas mais forte, mas não substitua um modelo de produção apenas pelo número total de parâmetros.
Checklist de avaliação para produção
- Copie o ID exato do modelo da plataforma de destino; não adivinhe maiúsculas, namespace ou grafia.
- Fixe versão do modelo, prompt, ferramentas, esforço de raciocínio, timeout e saída máxima.
- Comece com tarefas somente de leitura antes de conceder acesso a arquivos, shell, banco de dados ou efeitos externos.
- Meça a taxa de aprovação com repositórios reais e comandos de aceitação, não pela impressão do chat.
- Teste faixas de contexto a partir de 32K e registre latência, uso de cache e cobrança total.
- Defina número máximo de turnos, orçamento de tokens e pontos de aprovação para tarefas complexas.
- Valide chamadas de ferramentas, saída estruturada e mapeamento dos campos de reasoning no provedor de destino.
- Mantenha uma suíte de regressão, uma rota de fallback e rollback rápido para um modelo preview.
Principais conclusões
- O Hy4 preview foi lançado e aberto em 28 de agosto de 2026 como o novo MoE flagship da Tencent Hunyuan.
- Seu backbone tem 770B de parâmetros totais e 49B ativos, além de uma camada MTP nativa de 10B/0.7B.
- O repositório lista contexto 1M; o Tencent Cloud lista entrada máxima de 960K e saída máxima de 64K.
- A Tencent relata grandes ganhos sobre o Hy3 em programação, uso de ferramentas e contexto longo, mas não liderança em todos os benchmarks.
- hy4-preview, tencent/hy4-preview e tencent/Hy4-preview-FP8 são identificadores específicos de cada plataforma.
- Na data de publicação, este gateway não havia aberto a rota; disponibilidade e cobrança exigem consulta ao catálogo em tempo real.
Perguntas frequentes
O Hy4 preview foi lançado oficialmente?
Sim. A Tencent lançou e abriu o código do Hy4 preview em 28 de agosto de 2026, com acesso pelo WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub e OpenRouter. Ele continua sendo uma versão preview, não o lançamento final do Hy4.
O Hy4 preview é multimodal?
O repositório de lançamento da Tencent o apresenta como um modelo de linguagem para programação, agentes e produtividade, com especificações públicas concentradas em texto, ferramentas e contexto longo. Não presuma entrada de imagem ou vídeo apenas porque a família Hunyuan inclui modelos visuais; verifique a tabela de recursos do provedor de destino.
Qual é o tamanho do contexto do Hy4 preview?
O repositório especifica contexto de 1M. O Tencent Cloud lista separadamente entrada máxima de 960K e saída máxima de 64K para o serviço hospedado.
Qual é o ID oficial da API do Hy4 preview?
O nome do served model no repositório oficial é hy4-preview; o OpenRouter usa tencent/hy4-preview; os pesos self-host usam tencent/Hy4-preview ou a variante FP8. O ID no console da plataforma de destino tem prioridade.
O Hy4 preview oferece chamadas de ferramentas?
A receita vLLM da Tencent ativa o hy_v4 tool parser e a seleção automática de ferramentas, enquanto os benchmarks incluem Toolathlon e MCP-Atlas. Confirme os parâmetros exatos da API hospedada na documentação do provedor.
Quanto custa o Hy4 preview?
O Tencent Cloud TokenHub mostra atualmente em Guangzhou CNY 6 para entrada, CNY 18 para saída e CNY 0.3 para leitura de cache por milhão de tokens. Região, plataforma e promoções podem mudar o preço.
Posso chamar o Hy4 preview por este gateway agora?
Na verificação de 29 de agosto de 2026, o catálogo em tempo real e os upstreams habilitados não listavam hy4-preview. Consulte a página de preços em tempo real para saber se houve disponibilidade posterior.
O Hy4 preview funciona com Claude Code ou outro agente de programação?
O modelo é voltado para programação e agentes e oferece uma forma local de serving compatível com OpenAI. A compatibilidade do cliente depende do protocolo, do formato das chamadas de ferramentas, da saída de reasoning e da camada de compatibilidade do provedor; valide primeiro uma solicitação mínima e uma regressão de ferramentas.
Fontes principais
- Lançamento oficial da Tencent: Tencent Releases and Open-Sources Tencent Hy4 preview
- GitHub oficial da Tencent Hunyuan: Hy4-preview
- Página de produto e preços do Tencent Cloud TokenHub
- Página de produto Tencent Cloud Hunyuan: limites do Hy4 preview
- Artigo sobre Gated DeepSeek Sparse Attention
- Artigo sobre IndexCache
- Preços de modelos em tempo real deste site: para conferir a disponibilidade futura da rota, não o preço oficial do Tencent Cloud