Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Назад к блогу

Руководство по API Tencent Hy4 preview 2026: MoE 770B, контекст 1M и coding-агенты

Tencent HunyuanHy4 previewCoding AgentMoEконтекст 1MTokenHub

Официальный логотип Tencent Hy4 preview

29 августа 2026 года мы изучили Hy4 preview, опубликованную Tencent днём ранее. Главное изменение — не просто переход от Hy3 к Hy4: Tencent увеличила backbone до 770B параметров, расширила контекст до 1M и продолжила проверять модель внутри CodeBuddy, WorkBuddy и реальных инженерных процессов.

Одним предложением: Hy4 preview — новый открытый MoE-флагман Tencent Hunyuan для программирования, агентных задач, офисного анализа, разработки игр и научных исследований; официальное имя served model для самостоятельного размещения — hy4-preview, но ID моделей, цены и доступность зависят от платформы.

Это руководство опирается на релиз Tencent, официальный репозиторий, страницы Tencent Cloud TokenHub и первичные статьи, на которые ссылается репозиторий. Бенчмарки поставщика не являются независимыми тестами этого сайта. На момент проверки live-каталог этого сайта не содержал hy4-preview, поэтому статья не утверждает, что маршрут шлюза уже открыт.

Ключевые факты о Hy4 preview

Пункт Проверенная официальная информация
Дата релиза 28 августа 2026 года
Официальное название Tencent Hy4 preview
Архитектура Mixture-of-Experts (MoE)
Параметры backbone 770B всего, 49B активных
Нативный слой MTP 10B всего, 0.7B активных
Глубина backbone 78 слоёв
Схема экспертов 256 маршрутизируемых + 1 общий эксперт; для каждого токена активируются top-8 маршрутизируемых экспертов
Attention / residual Gated DSA + IndexCache; четыре residual-потока iHC
Контекст В репозитории 1M; Tencent Cloud указывает максимум 960K на вход и 64K на выход
Официальная локальная served model hy4-preview
Открытые веса tencent/Hy4-preview, tencent/Hy4-preview-FP8
Лицензия Apache 2.0
Публичная цена Tencent Cloud в Гуанчжоу Вход CNY 6, выход CNY 18, чтение кэша CNY 0.3 / 1M токенов

Последняя проверка выполнена 29 августа 2026 года. Перед использованием в production повторно проверьте консоль TokenHub, целевой регион, текущую цену и поля usage в реальном ответе.

Что такое Hy4 preview и является ли она финальной Hy4?

Hy4 preview — ранняя итерация Hy4, а не будущий финальный релиз без суффикса preview. Tencent прямо документирует известные проблемы: модель может дольше необходимого рассуждать над сложными задачами и чрезмерно перепроверять собственную работу.

Эта граница важна. «Флагманская preview» означает, что у модели уже есть открытые веса, рецепты инференса, pipeline дообучения и API-вход. Это не означает, что поведение, цена или уровень сервиса навсегда зафиксированы.

Tencent также предоставляет Hy4 preview в WorkBuddy, CodeBuddy, Yuanbao и ima, а API-доступ — через Tencent Cloud TokenHub и OpenRouter. Этого достаточно для включения модели в пул тестирования, но для критичных production-процессов нужно фиксировать версии, поддерживать регрессионный набор и сохранять резервную модель.

Что изменилось в архитектуре MoE на 770B?

Backbone Hy4 preview состоит из 78 слоёв. Первый слой использует Dense FFN, остальные 77 являются MoE-слоями с 256 маршрутизируемыми и одним общим экспертом. Каждый токен активирует восемь лучших маршрутизируемых экспертов и общий эксперт.

В backbone есть нативный слой MTP для speculative decoding. Tencent указывает backbone как 770B общих и 49B активных параметров; при добавлении MTP нужно прибавить ещё 10B общих и 0.7B активных параметров. Если одна страница говорит 770B, а другая — почти 780B, проверьте, включён ли MTP.

В attention используется Gated DeepSeek Sparse Attention (Gated DSA), а IndexCache повторно использует sparse index между слоями. В residual-пути работают четыре потока identity Hyper-Connection (iHC). Все эти решения направлены на контролируемые вычисления и информационный поток при контексте 1M и масштабе большого MoE.

Репозиторий также указывает 64 attention heads, размерность сжатия Query 2 048, размерность сжатия Key-Value 512 и indexer top-k 2 048. Эти значения полезны для совместимости inference-фреймворка и планирования ресурсов, но сами по себе не доказывают результат конкретной задачи.

Как понимать контекстное окно 1M?

В репозитории Tencent длина контекста указана как 1M. На странице продукта Tencent Cloud для hosted-сервиса указаны максимум 960K входных и 64K выходных токенов. Это совместимые границы: окно модели, зарезервированный вывод, системный prompt и запас безопасности могут учитываться по-разному.

Не начинайте production-тестирование с запроса почти на миллион токенов. Разделите тесты на уровни 32K, 128K, 256K, 512K и ultra-long context и записывайте:

  • время до первого токена и сквозную задержку
  • входные, выходные токены и чтение из кэша
  • точность поиска между файлами
  • успешность вызовов инструментов и число повторов
  • долю пройденных задач и время ручной доработки

Ёмкость контекста не равна автоматической корректности. Большим репозиториям, финансовым таблицам и исследовательским корпусам по-прежнему нужны retrieval, изоляция прав и ссылки на доказательства.

Насколько Hy4 preview сильна в coding и агентах?

В приложении к бенчмаркам Tencent сообщает о широком улучшении по сравнению с Hy3 в программной инженерии, использовании инструментов и задачах с длинным контекстом. Ниже выбраны значения из одной официальной таблицы:

Оценка Tencent Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench (with tools) 51.5 65.4

Это результаты, опубликованные Tencent, а не независимые тесты этого сайта. Tencent отмечает, что модели оценивались на доступной в тот момент максимальной настройке рассуждения, часть результатов со звёздочкой выполнялась самой Tencent, а harness, бюджет токенов, ресурсы sandbox и повторная выборка влияют на баллы.

Та же таблица не позволяет выбирать только удобные цифры: в сравнении Tencent Hy4 preview набрала 17.5 на ProgramBench, уступив Kimi K3, GPT 5.6 Sol и Claude Opus 5. Улучшение от поколения к поколению реально, но Hy4 не лидирует в каждом coding-бенчмарке.

Что показывает экспертная оценка 203 реальных задач?

Tencent провела слепую оценку 203 реальных инженерных задач с участием 163 внутренних экспертов. Опубликованные результаты:

  • Hy4 preview: среднее 2.99 / 4
  • GLM 5.3: среднее 2.92 / 4; Hy4 победила в 46.8%, ничья 12.8%, проигрыш 40.4%
  • Kimi K3: среднее 2.94 / 4; Hy4 победила в 51.2%, ничья 7.9%, проигрыш 40.9%

Эти данные важны потому, что задачи пришли из программной инженерии, игр, финансов и безопасности Tencent, а не только из открытых таблиц лидеров. Но это по-прежнему внутренняя оценка поставщика, а не полностью воспроизводимый сторонний benchmark с публичным набором задач и рубрикой.

Надёжный способ внедрения — собрать регрессионный набор из собственных репозиториев, документов и команд приёмки, а затем сравнить с уже используемыми моделями долю успешных задач, задержку и общую стоимость.

Для каких нагрузок подходит Hy4 preview?

  • долгие coding-агенты, которые планируют, применяют патчи, отлаживают и проверяют
  • frontend-задачи, где важны код, визуальная иерархия и качество взаимодействия
  • офисные процессы с несколькими файлами, создающие документы, таблицы и презентации
  • игровые прототипы с последующей работой движка в нескольких раундах
  • финансовое моделирование и анализ данных в нескольких файлах
  • исследования в области ИИ, молекулярной динамики, физики конденсированного состояния и математики
  • поиск и knowledge-work с инструментами в контексте 1M

Записи в production по-прежнему требуют policy gate или ручного одобрения для shell, баз данных, платежей, прав доступа и внешних сообщений. Более сильная модель не устраняет риск авторизации агента.

Какова официальная цена Hy4 preview?

Tencent Cloud TokenHub сейчас показывает следующие справочные цены для Гуанчжоу:

Элемент тарификации Публичная цена
Вход CNY 6 / 1M токенов
Выход CNY 18 / 1M токенов
Чтение кэша CNY 0.3 / 1M токенов

Это цена прямого доступа Tencent Cloud, привязанная к региону и моменту времени, а не универсальная цена сторонних платформ. OpenRouter, другие провайдеры инференса и self-hosting используют отдельную экономику; мультипликатор шлюза нельзя вывести из прямой цены TokenHub.

На момент проверки 29 августа 2026 года страница цен в реальном времени этого сайта не содержала hy4-preview. Если позже маршрут будет добавлен, используйте live-каталог и журнал запросов, а не прямую цену Tencent Cloud из этой статьи.

Не смешивайте эти ID моделей Hy4

Путь доступа Используемое имя / ID
Локальная served model официального репозитория hy4-preview
OpenRouter tencent/hy4-preview
Веса Hugging Face BF16 tencent/Hy4-preview
Веса Hugging Face FP8 tencent/Hy4-preview-FP8

API-шлюз обычно не переводит имя репозитория Hugging Face в ID hosted-модели. Скопируйте точный идентификатор с целевой платформы и проверьте его вызовом списка моделей или минимальным запросом.

Как развернуть Hy4 preview самостоятельно и вызвать её?

Tencent рекомендует vLLM или SGLang. После запуска локальную served model можно вызвать через OpenAI-совместимый Chat Completions API:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

Tencent рекомендует temperature=0.9 и top_p=1.0. По умолчанию модель использует high reasoning. Локальный шаблон репозитория применяет chat_template_kwargs.reasoning_effort = "no_think" для прямых ответов; hosted-провайдеры могут поддерживать другие расширенные поля.

Официальный рецепт vLLM использует tensor parallelism на 8 GPU, speculative decoding MTP, attention backend FLASHMLA_SPARSE и parsers tool/reasoning для hy_v4. Не переносите команду без проверки на оборудование с другой GPU, версией драйвера, образом или поддержкой framework.

Hy4 preview и Hy3

Измерение Hy3 Hy4 preview
Официальный масштаб 295B всего / 21B активных 770B всего / 49B активных
Контекст 256K 1M
Позиционирование экономичные агенты и продуктивность новый флагман для coding, агентов и сложной продуктивности
Зрелость от preview до формального релиза ранняя Hy4 preview
Стоимость self-hosting ниже существенно выше

Hy3 по-прежнему практична, если важнее стоимость, масштаб развёртывания и зрелость. Добавляйте Hy4 preview в контролируемую оценку, когда нужны более длинный контекст и сильная долгосрочная инженерная работа или исполнение инструментов, но не заменяйте production-модель только на основании числа параметров.

Чек-лист production-оценки

  1. Скопируйте точный ID модели с целевой платформы; не угадывайте регистр или namespace.
  2. Зафиксируйте версию модели, prompt, инструменты, режим рассуждения, timeout и максимальный вывод.
  3. Начинайте с задач только на чтение, прежде чем выдавать доступ к файлам, shell, базе данных или внешним побочным эффектам.
  4. Измеряйте долю успешных задач на реальных репозиториях и командах приёмки, а не впечатление от чата.
  5. Проверьте уровни контекста от 32K и выше, записывая задержку, использование кэша и общую стоимость.
  6. Для сложных задач задайте максимум раундов, бюджет токенов и точки одобрения.
  7. Проверьте на целевом провайдере вызовы инструментов, структурированный вывод и отображение полей reasoning.
  8. Для preview-модели сохраните регрессионный набор, резервный маршрут и быстрый откат.

Главное

  • Hy4 preview выпущена и открыта 28 августа 2026 года как новый MoE-флагман Tencent Hunyuan.
  • Её backbone содержит 770B общих и 49B активных параметров, плюс нативный слой MTP 10B/0.7B.
  • Репозиторий указывает контекст 1M, а Tencent Cloud — максимум 960K входных и 64K выходных токенов.
  • Tencent сообщает о заметном росте результатов Hy4 по сравнению с Hy3 в coding, использовании инструментов и длинном контексте, но не о лидерстве в каждом benchmark.
  • hy4-preview, tencent/hy4-preview и tencent/Hy4-preview-FP8 — идентификаторы разных платформ.
  • На момент публикации эта платформа не открыла маршрут; доступность и тарификацию нужно проверять в live-каталоге.

Частые вопросы

Hy4 preview официально запущена?

Да. Tencent выпустила и открыла Hy4 preview 28 августа 2026 года, предоставив доступ через WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub и OpenRouter. Это по-прежнему preview, а не финальный релиз Hy4.

Hy4 preview мультимодальна?

Репозиторий релиза Tencent описывает её как языковую модель для coding, агентов и продуктивности, а публичные спецификации сосредоточены на тексте, инструментах и длинном контексте. Не следует делать вывод о входных изображениях или видео только потому, что в семействе Hunyuan есть визуальные модели: проверьте таблицу возможностей целевого провайдера.

Какова длина контекста Hy4 preview?

Репозиторий указывает контекст 1M. Tencent Cloud отдельно указывает для hosted-сервиса максимум 960K на вход и 64K на выход.

Каков официальный API ID Hy4 preview?

В официальном репозитории имя served model — hy4-preview; OpenRouter использует tencent/hy4-preview; для self-hosting применяются tencent/Hy4-preview или вариант FP8. Приоритет имеет ID в консоли целевой платформы.

Поддерживает ли Hy4 preview вызов инструментов?

Рецепт vLLM от Tencent включает hy_v4 tool parser и автоматический выбор инструментов, а в benchmark входят Toolathlon и MCP-Atlas. Точные параметры hosted API проверяйте по документации провайдера.

Сколько стоит Hy4 preview?

Tencent Cloud TokenHub сейчас показывает в Гуанчжоу CNY 6 за вход, CNY 18 за выход и CNY 0.3 за чтение кэша на миллион токенов. Цена может меняться в зависимости от региона, платформы и промоакций.

Можно ли сейчас вызвать Hy4 preview через этот шлюз?

На момент проверки 29 августа 2026 года live-каталог и включённые upstream не содержали hy4-preview. Более позднюю доступность проверяйте на странице цен в реальном времени.

Работает ли Hy4 preview с Claude Code или другим coding-агентом?

Модель ориентирована на coding и агентов и поддерживает локальную OpenAI-совместимую схему serving. Совместимость конкретного клиента зависит от протокола, формы вызова инструментов, вывода reasoning и compatibility layer провайдера, поэтому сначала проверьте минимальный запрос и регрессию инструментов.

Основные источники