Руководство по API Tencent Hy4 preview 2026: MoE 770B, контекст 1M и coding-агенты

29 августа 2026 года мы изучили Hy4 preview, опубликованную Tencent днём ранее. Главное изменение — не просто переход от Hy3 к Hy4: Tencent увеличила backbone до 770B параметров, расширила контекст до 1M и продолжила проверять модель внутри CodeBuddy, WorkBuddy и реальных инженерных процессов.
Одним предложением: Hy4 preview — новый открытый MoE-флагман Tencent Hunyuan для программирования, агентных задач, офисного анализа, разработки игр и научных исследований; официальное имя served model для самостоятельного размещения — hy4-preview, но ID моделей, цены и доступность зависят от платформы.
Это руководство опирается на релиз Tencent, официальный репозиторий, страницы Tencent Cloud TokenHub и первичные статьи, на которые ссылается репозиторий. Бенчмарки поставщика не являются независимыми тестами этого сайта. На момент проверки live-каталог этого сайта не содержал hy4-preview, поэтому статья не утверждает, что маршрут шлюза уже открыт.
Ключевые факты о Hy4 preview
| Пункт | Проверенная официальная информация |
|---|---|
| Дата релиза | 28 августа 2026 года |
| Официальное название | Tencent Hy4 preview |
| Архитектура | Mixture-of-Experts (MoE) |
| Параметры backbone | 770B всего, 49B активных |
| Нативный слой MTP | 10B всего, 0.7B активных |
| Глубина backbone | 78 слоёв |
| Схема экспертов | 256 маршрутизируемых + 1 общий эксперт; для каждого токена активируются top-8 маршрутизируемых экспертов |
| Attention / residual | Gated DSA + IndexCache; четыре residual-потока iHC |
| Контекст | В репозитории 1M; Tencent Cloud указывает максимум 960K на вход и 64K на выход |
| Официальная локальная served model | hy4-preview |
| Открытые веса | tencent/Hy4-preview, tencent/Hy4-preview-FP8 |
| Лицензия | Apache 2.0 |
| Публичная цена Tencent Cloud в Гуанчжоу | Вход CNY 6, выход CNY 18, чтение кэша CNY 0.3 / 1M токенов |
Последняя проверка выполнена 29 августа 2026 года. Перед использованием в production повторно проверьте консоль TokenHub, целевой регион, текущую цену и поля usage в реальном ответе.
Что такое Hy4 preview и является ли она финальной Hy4?
Hy4 preview — ранняя итерация Hy4, а не будущий финальный релиз без суффикса preview. Tencent прямо документирует известные проблемы: модель может дольше необходимого рассуждать над сложными задачами и чрезмерно перепроверять собственную работу.
Эта граница важна. «Флагманская preview» означает, что у модели уже есть открытые веса, рецепты инференса, pipeline дообучения и API-вход. Это не означает, что поведение, цена или уровень сервиса навсегда зафиксированы.
Tencent также предоставляет Hy4 preview в WorkBuddy, CodeBuddy, Yuanbao и ima, а API-доступ — через Tencent Cloud TokenHub и OpenRouter. Этого достаточно для включения модели в пул тестирования, но для критичных production-процессов нужно фиксировать версии, поддерживать регрессионный набор и сохранять резервную модель.
Что изменилось в архитектуре MoE на 770B?
Backbone Hy4 preview состоит из 78 слоёв. Первый слой использует Dense FFN, остальные 77 являются MoE-слоями с 256 маршрутизируемыми и одним общим экспертом. Каждый токен активирует восемь лучших маршрутизируемых экспертов и общий эксперт.
В backbone есть нативный слой MTP для speculative decoding. Tencent указывает backbone как 770B общих и 49B активных параметров; при добавлении MTP нужно прибавить ещё 10B общих и 0.7B активных параметров. Если одна страница говорит 770B, а другая — почти 780B, проверьте, включён ли MTP.
В attention используется Gated DeepSeek Sparse Attention (Gated DSA), а IndexCache повторно использует sparse index между слоями. В residual-пути работают четыре потока identity Hyper-Connection (iHC). Все эти решения направлены на контролируемые вычисления и информационный поток при контексте 1M и масштабе большого MoE.
Репозиторий также указывает 64 attention heads, размерность сжатия Query 2 048, размерность сжатия Key-Value 512 и indexer top-k 2 048. Эти значения полезны для совместимости inference-фреймворка и планирования ресурсов, но сами по себе не доказывают результат конкретной задачи.
Как понимать контекстное окно 1M?
В репозитории Tencent длина контекста указана как 1M. На странице продукта Tencent Cloud для hosted-сервиса указаны максимум 960K входных и 64K выходных токенов. Это совместимые границы: окно модели, зарезервированный вывод, системный prompt и запас безопасности могут учитываться по-разному.
Не начинайте production-тестирование с запроса почти на миллион токенов. Разделите тесты на уровни 32K, 128K, 256K, 512K и ultra-long context и записывайте:
- время до первого токена и сквозную задержку
- входные, выходные токены и чтение из кэша
- точность поиска между файлами
- успешность вызовов инструментов и число повторов
- долю пройденных задач и время ручной доработки
Ёмкость контекста не равна автоматической корректности. Большим репозиториям, финансовым таблицам и исследовательским корпусам по-прежнему нужны retrieval, изоляция прав и ссылки на доказательства.
Насколько Hy4 preview сильна в coding и агентах?
В приложении к бенчмаркам Tencent сообщает о широком улучшении по сравнению с Hy3 в программной инженерии, использовании инструментов и задачах с длинным контекстом. Ниже выбраны значения из одной официальной таблицы:
| Оценка Tencent | Hy3 | Hy4 preview |
|---|---|---|
| SWE-bench Multilingual | 75.8 | 82.9 |
| DeepSWE | 28.0 | 64.3 |
| SWE Atlas - Refactoring | 32.9 | 53.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| Toolathlon-Verified | 56.2 | 74.1 |
| OneMillionBench (with tools) | 51.5 | 65.4 |
Это результаты, опубликованные Tencent, а не независимые тесты этого сайта. Tencent отмечает, что модели оценивались на доступной в тот момент максимальной настройке рассуждения, часть результатов со звёздочкой выполнялась самой Tencent, а harness, бюджет токенов, ресурсы sandbox и повторная выборка влияют на баллы.
Та же таблица не позволяет выбирать только удобные цифры: в сравнении Tencent Hy4 preview набрала 17.5 на ProgramBench, уступив Kimi K3, GPT 5.6 Sol и Claude Opus 5. Улучшение от поколения к поколению реально, но Hy4 не лидирует в каждом coding-бенчмарке.
Что показывает экспертная оценка 203 реальных задач?
Tencent провела слепую оценку 203 реальных инженерных задач с участием 163 внутренних экспертов. Опубликованные результаты:
- Hy4 preview: среднее 2.99 / 4
- GLM 5.3: среднее 2.92 / 4; Hy4 победила в 46.8%, ничья 12.8%, проигрыш 40.4%
- Kimi K3: среднее 2.94 / 4; Hy4 победила в 51.2%, ничья 7.9%, проигрыш 40.9%
Эти данные важны потому, что задачи пришли из программной инженерии, игр, финансов и безопасности Tencent, а не только из открытых таблиц лидеров. Но это по-прежнему внутренняя оценка поставщика, а не полностью воспроизводимый сторонний benchmark с публичным набором задач и рубрикой.
Надёжный способ внедрения — собрать регрессионный набор из собственных репозиториев, документов и команд приёмки, а затем сравнить с уже используемыми моделями долю успешных задач, задержку и общую стоимость.
Для каких нагрузок подходит Hy4 preview?
- долгие coding-агенты, которые планируют, применяют патчи, отлаживают и проверяют
- frontend-задачи, где важны код, визуальная иерархия и качество взаимодействия
- офисные процессы с несколькими файлами, создающие документы, таблицы и презентации
- игровые прототипы с последующей работой движка в нескольких раундах
- финансовое моделирование и анализ данных в нескольких файлах
- исследования в области ИИ, молекулярной динамики, физики конденсированного состояния и математики
- поиск и knowledge-work с инструментами в контексте 1M
Записи в production по-прежнему требуют policy gate или ручного одобрения для shell, баз данных, платежей, прав доступа и внешних сообщений. Более сильная модель не устраняет риск авторизации агента.
Какова официальная цена Hy4 preview?
Tencent Cloud TokenHub сейчас показывает следующие справочные цены для Гуанчжоу:
| Элемент тарификации | Публичная цена |
|---|---|
| Вход | CNY 6 / 1M токенов |
| Выход | CNY 18 / 1M токенов |
| Чтение кэша | CNY 0.3 / 1M токенов |
Это цена прямого доступа Tencent Cloud, привязанная к региону и моменту времени, а не универсальная цена сторонних платформ. OpenRouter, другие провайдеры инференса и self-hosting используют отдельную экономику; мультипликатор шлюза нельзя вывести из прямой цены TokenHub.
На момент проверки 29 августа 2026 года страница цен в реальном времени этого сайта не содержала hy4-preview. Если позже маршрут будет добавлен, используйте live-каталог и журнал запросов, а не прямую цену Tencent Cloud из этой статьи.
Не смешивайте эти ID моделей Hy4
| Путь доступа | Используемое имя / ID |
|---|---|
| Локальная served model официального репозитория | hy4-preview |
| OpenRouter | tencent/hy4-preview |
| Веса Hugging Face BF16 | tencent/Hy4-preview |
| Веса Hugging Face FP8 | tencent/Hy4-preview-FP8 |
API-шлюз обычно не переводит имя репозитория Hugging Face в ID hosted-модели. Скопируйте точный идентификатор с целевой платформы и проверьте его вызовом списка моделей или минимальным запросом.
Как развернуть Hy4 preview самостоятельно и вызвать её?
Tencent рекомендует vLLM или SGLang. После запуска локальную served model можно вызвать через OpenAI-совместимый Chat Completions API:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="EMPTY",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Review this patch and list the highest-risk regressions."}
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
Tencent рекомендует temperature=0.9 и top_p=1.0. По умолчанию модель использует high reasoning. Локальный шаблон репозитория применяет chat_template_kwargs.reasoning_effort = "no_think" для прямых ответов; hosted-провайдеры могут поддерживать другие расширенные поля.
Официальный рецепт vLLM использует tensor parallelism на 8 GPU, speculative decoding MTP, attention backend FLASHMLA_SPARSE и parsers tool/reasoning для hy_v4. Не переносите команду без проверки на оборудование с другой GPU, версией драйвера, образом или поддержкой framework.
Hy4 preview и Hy3
| Измерение | Hy3 | Hy4 preview |
|---|---|---|
| Официальный масштаб | 295B всего / 21B активных | 770B всего / 49B активных |
| Контекст | 256K | 1M |
| Позиционирование | экономичные агенты и продуктивность | новый флагман для coding, агентов и сложной продуктивности |
| Зрелость | от preview до формального релиза | ранняя Hy4 preview |
| Стоимость self-hosting | ниже | существенно выше |
Hy3 по-прежнему практична, если важнее стоимость, масштаб развёртывания и зрелость. Добавляйте Hy4 preview в контролируемую оценку, когда нужны более длинный контекст и сильная долгосрочная инженерная работа или исполнение инструментов, но не заменяйте production-модель только на основании числа параметров.
Чек-лист production-оценки
- Скопируйте точный ID модели с целевой платформы; не угадывайте регистр или namespace.
- Зафиксируйте версию модели, prompt, инструменты, режим рассуждения, timeout и максимальный вывод.
- Начинайте с задач только на чтение, прежде чем выдавать доступ к файлам, shell, базе данных или внешним побочным эффектам.
- Измеряйте долю успешных задач на реальных репозиториях и командах приёмки, а не впечатление от чата.
- Проверьте уровни контекста от 32K и выше, записывая задержку, использование кэша и общую стоимость.
- Для сложных задач задайте максимум раундов, бюджет токенов и точки одобрения.
- Проверьте на целевом провайдере вызовы инструментов, структурированный вывод и отображение полей reasoning.
- Для preview-модели сохраните регрессионный набор, резервный маршрут и быстрый откат.
Главное
- Hy4 preview выпущена и открыта 28 августа 2026 года как новый MoE-флагман Tencent Hunyuan.
- Её backbone содержит 770B общих и 49B активных параметров, плюс нативный слой MTP 10B/0.7B.
- Репозиторий указывает контекст 1M, а Tencent Cloud — максимум 960K входных и 64K выходных токенов.
- Tencent сообщает о заметном росте результатов Hy4 по сравнению с Hy3 в coding, использовании инструментов и длинном контексте, но не о лидерстве в каждом benchmark.
- hy4-preview, tencent/hy4-preview и tencent/Hy4-preview-FP8 — идентификаторы разных платформ.
- На момент публикации эта платформа не открыла маршрут; доступность и тарификацию нужно проверять в live-каталоге.
Частые вопросы
Hy4 preview официально запущена?
Да. Tencent выпустила и открыла Hy4 preview 28 августа 2026 года, предоставив доступ через WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub и OpenRouter. Это по-прежнему preview, а не финальный релиз Hy4.
Hy4 preview мультимодальна?
Репозиторий релиза Tencent описывает её как языковую модель для coding, агентов и продуктивности, а публичные спецификации сосредоточены на тексте, инструментах и длинном контексте. Не следует делать вывод о входных изображениях или видео только потому, что в семействе Hunyuan есть визуальные модели: проверьте таблицу возможностей целевого провайдера.
Какова длина контекста Hy4 preview?
Репозиторий указывает контекст 1M. Tencent Cloud отдельно указывает для hosted-сервиса максимум 960K на вход и 64K на выход.
Каков официальный API ID Hy4 preview?
В официальном репозитории имя served model — hy4-preview; OpenRouter использует tencent/hy4-preview; для self-hosting применяются tencent/Hy4-preview или вариант FP8. Приоритет имеет ID в консоли целевой платформы.
Поддерживает ли Hy4 preview вызов инструментов?
Рецепт vLLM от Tencent включает hy_v4 tool parser и автоматический выбор инструментов, а в benchmark входят Toolathlon и MCP-Atlas. Точные параметры hosted API проверяйте по документации провайдера.
Сколько стоит Hy4 preview?
Tencent Cloud TokenHub сейчас показывает в Гуанчжоу CNY 6 за вход, CNY 18 за выход и CNY 0.3 за чтение кэша на миллион токенов. Цена может меняться в зависимости от региона, платформы и промоакций.
Можно ли сейчас вызвать Hy4 preview через этот шлюз?
На момент проверки 29 августа 2026 года live-каталог и включённые upstream не содержали hy4-preview. Более позднюю доступность проверяйте на странице цен в реальном времени.
Работает ли Hy4 preview с Claude Code или другим coding-агентом?
Модель ориентирована на coding и агентов и поддерживает локальную OpenAI-совместимую схему serving. Совместимость конкретного клиента зависит от протокола, формы вызова инструментов, вывода reasoning и compatibility layer провайдера, поэтому сначала проверьте минимальный запрос и регрессию инструментов.
Основные источники
- Официальный релиз Tencent: Tencent Releases and Open-Sources Tencent Hy4 preview
- Официальный GitHub Tencent Hunyuan: Hy4-preview
- Страница продукта и цен Tencent Cloud TokenHub
- Страница продукта Tencent Cloud Hunyuan: ограничения Hy4 preview
- Статья о Gated DeepSeek Sparse Attention
- Статья об IndexCache
- Цены моделей на этом сайте в реальном времени: для проверки будущей доступности маршрута, а не официальной цены Tencent Cloud