Qwen3.8-Flash API: гайд 2026 по цене, 1M контексту и подключению
27 августа 2026 года, на следующий день после открытия Qwen3.8-Flash-Next, мы собрали материалы для только что запущенного на сайте маршрута qwen3.8-flash. Самая частая ошибка начинается с названия: открытые веса и production API используют разные Model ID.
Qwen3.8-Flash-Next — открытая мультимодальная MoE для предварительного просмотра архитектуры Qwen4; qwen3.8-flash — production API-модель Alibaba Cloud Bailian и QwenCloud с контекстом 1M по умолчанию, входом для изображений/текста/видео, Function Calling и структурированным выводом. На сайте открыт маршрут qwen3.8-flash; множитель и фактическое списание проверяйте на странице цен в реальном времени и в счёте.
Ниже отдельно разобраны архитектура открытой модели, возможности официального API Alibaba Cloud, официальная прямая цена и маршрут сайта. Бенчмарки, опубликованные командой Qwen, не являются независимым тестом сайта, а региональные цены Alibaba Cloud не переводятся напрямую в множитель сайта.
Ключевые данные Qwen3.8-Flash
| Параметр | Проверенная информация |
|---|---|
| Официальная дата выпуска | 26 августа 2026 года |
| ID API сайта / Bailian | qwen3.8-flash |
| ID открытых весов | Qwen/Qwen3.8-Flash-Next |
| Структура параметров | Основная модель 125B + N-gram Embedding 51B, 6B активных параметров |
| Контекст | Production API по умолчанию 1M; open-source версия нативно 262,144, с расширением YaRN до 1M |
| Вход / выход | Изображения, текст и видео на входе; текст на выходе |
| Возможности API | Function Calling, структурированный вывод, Web Search, context cache |
| Позиционирование | Coding Agent, офисная автоматизация, визуальное понимание, высокопараллельные workflow |
| Множитель сайта | Не фиксируем в статье; смотрите актуальную цену и счёт |
Данные проверены 27 августа 2026 года. Перед production-подключением снова проверьте список моделей, региональную документацию Bailian и поле usage в реальном ответе.
Как связаны Qwen3.8-Flash и Qwen3.8-Flash-Next?
Команда Qwen сначала открыла веса Qwen3.8-Flash-Next, чтобы сообщество могло изучить архитектуру Qwen4. Production-версия предоставляется под именем Qwen3.8-Flash. Техническое направление общее, но способ вызова различается.
| Название | Назначение | Точный ID | Контекст |
|---|---|---|---|
| Qwen3.8-Flash-Next | Self-hosting, исследование архитектуры, open-source оценка | Qwen/Qwen3.8-Flash-Next |
Нативно 262,144, YaRN до 1M |
| Qwen3.8-Flash | Hosted production API | qwen3.8-flash |
По умолчанию 1M |
| Qwen3.8-Max | Hosted-флагман с максимальными возможностями | qwen3.8-max |
1M |
При вызове через сайт или совместимый интерфейс Alibaba Cloud не вставляйте имя репозитория Hugging Face в параметр model. И наоборот, при self-hosting одного hosted API ID недостаточно: framework не скачает веса автоматически.
Что нового в архитектуре Qwen3.8-Flash-Next?
В Qwen3.8-Flash-Next гибридное внимание построено на Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA). GDN сжимает историю в фиксированное состояние, а QSA через лёгкий индексатор выбирает важный контекст по микроблокам. Это снижает вычисления attention и обращения к KV Cache в длинных последовательностях.
Модель также добавляет Gated Residual (GR): остаточный поток разделяется на четыре ветви с динамическим управлением чтением и записью. N-gram Embedding обращается к локальному контексту через таблицу и расширяет ёмкость модели почти без роста матричных вычислений на Token. Для обучения использовались улучшенный Muon Optimizer и повторно подогнанный Scaling Law.
Заявленный размер — основная модель 125B, дополнительные N-gram Embedding 51B и 6B параметров, активных на Token. Команда Qwen сообщает, что стоимость обучения примерно в девять раз ниже Qwen3.7-Plus. Это сравнение производителя, а не измерение стоимости inference на сайте.
Какие ограничения есть у контекста 1M и мультимодальности?
На странице модели Qwen3.8-Flash Alibaba Cloud указано окно 1,000,000 Tokens: для обычного режима максимум ввода 991,808, для thinking mode — 983,616, максимум вывода 131,072 и максимум цепочки рассуждений 262,144. На вход можно передать изображения, текст и видео, на выходе получается текст.
1M не означает, что каждый запрос стоит заполнять почти до миллиона Tokens. Системный Prompt, схемы инструментов, кодирование изображений/видео, история сообщений и резерв под вывод занимают окно; сверхдлинный запрос также увеличивает задержку и цену. В production сначала тестируйте уровни 32K, 128K, 256K и длинный контекст.
В таблице возможностей также перечислены Function Calling, структурированный вывод, Web Search и context cache. Batch поддерживается в регионе Beijing, но отмечен как неподдерживаемый в Singapore — региональные различия нужно отдельно проверить до деплоя.
Как читать официальные бенчмарки Qwen по коду и Agent?
Команда Qwen сравнила Qwen3.8-Flash-Next с Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 и другими моделями. Ниже приведены четыре значения:
| Опубликованный тест производителя | Qwen3.7-Plus | Qwen3.8-Flash-Next | Тип задачи |
|---|---|---|---|
| DeepSWE 1.1 | 16.5 | 58.7 | Agentic coding |
| SWE-bench Multilingual | 75.8 | 81.0 | Многоязычная software engineering |
| CoWorkBench | 65.1 | 73.9 | Длительные офисные задачи |
| Toolathlon Verified | 50.6 | 73.5 | Реальный вызов инструментов |
Эти оценки опубликованы Qwen и не являются независимым тестом сайта. На результат сильно влияют версия модели, бюджет рассуждения, окружение инструментов и scorer. Нельзя напрямую считать баллы открытого Flash-Next результатом hosted API в вашем клиенте, регионе и квоте.
Как разделять официальную цену Qwen3.8-Flash и цену сайта?
В релизе QwenCloud для запуска указана справочная цена production-версии: 0.16 доллара за миллион входных Tokens и 0.47 доллара за миллион выходных Tokens; в том же релизе на тот момент было сказано, что API скоро откроется. Затем страница моделей Alibaba Cloud Bailian добавила call ID qwen3.8-flash и разные цены и возможности в CNY для Beijing, Singapore и других регионов.
Обе цифры относятся к прямому официальному доступу и могут изменяться из-за региона, кэша, Batch и промоакций. Сайт не пересчитывает официальную цену в долларах или региональную цену Bailian в свой множитель. Для qwen3.8-flash используйте актуальную страницу цен и счёт запроса.
Новые пользователи могут открыть страницу покупки API, а владельцы Key — страницу пополнения. Сначала зафиксируйте Prompt и длину контекста, запишите входные, выходные и кэшированные Tokens, затем сравнивайте реальную стоимость.
Как вызвать API Qwen3.8-Flash
Сайт предоставляет совместимый с OpenAI интерфейс Chat Completions; точный ID модели — qwen3.8-flash:
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{
"role": "user",
"content": "Summarize the failing tests, then propose the smallest safe patch."
}
]
}'
Qwen3.8-Flash поддерживает thinking и non-thinking mode, но разные совместимые слои могут по-разному отображать enable_thinking, reasoning_effort, streaming-параметры инструментов и встроенные инструменты. Начните с минимального текстового запроса и добавляйте thinking, изображения, видео, инструменты и длинный контекст по одному.
Для каких задач подходит Qwen3.8-Flash?
- высокопараллельные Coding Agent, code review и анализ падения тестов;
- многоязычные codebase и задачи software engineering уровня SWE-bench;
- длительная автоматизация почты, таблиц, документов и материалов встреч;
- понимание изображений, графиков и длинного видео;
- workflow с Function Calling, структурированным выводом и Web Search;
- длинные документы и большие codebase, где нужен 1M контекст при чувствительности к цене;
- исследование preview-архитектуры Qwen4 в self-hosting и адаптация inference framework.
Для архитектурных решений, критического security review или разовой задачи высокой ценности сравните модель с Qwen3.8-Max, GLM-5.3, Claude и другими сильными моделями. Ценность Flash — в стоимости и throughput, а не в замене всех моделей одним ID.
Qwen3.8-Flash или Qwen3.8-Max?
Если задач много и нужны мультимодальность, инструменты и контекст 1M, начните с небольшого трафика на Qwen3.8-Flash. Если важнее верхний предел сложного рассуждения, устойчивость и качество критического ответа, переключите тот же тест на Qwen3.8-Max.
Не сравнивайте один ответ. Минимальный набор метрик: доля пройденных задач, задержка до первого токена, полное время, успешность вызовов инструментов, входные/выходные Tokens, попадание в кэш и число повторных работ. Низкая цена модели не обязательно означает меньшую общую стоимость, если требуется больше повторов.
Чек-лист production-оценки
- Для hosted API используйте
qwen3.8-flash, для self-hosting —Qwen/Qwen3.8-Flash-Next. - Перед сравнением зафиксируйте репозиторий, Prompt, версии инструментов, тайм-аут и команду приёмки.
- Отдельно проверьте thinking и non-thinking mode, записывая отличия формата ответа.
- Проверьте текст, изображения, видео, Function Calling и структурированный вывод.
- Разбейте тесты по 32K, 128K, 256K и длинному контексту и измерьте задержку и счёт.
- Уточните, поддерживает ли выбранный регион Batch, кэш и нужные встроенные инструменты.
- Задайте пределы для числа инструментов, максимального вывода, общего бюджета и внешних действий.
- Подготовьте резервный маршрут на случай нехватки ёмкости, rate limit или несовместимости протокола.
Главные выводы
qwen3.8-flash— точный ID hosted API сайта и Alibaba Cloud.Qwen/Qwen3.8-Flash-Next— имя открытых весов; его нельзя указывать вmodelдля hosted API.- Hosted-версия по умолчанию поддерживает 1M контекст, изображения, текст, видео и Function Calling.
- Основная модель 125B + N-gram Embedding 51B; на каждый Token активируется 6B параметров.
- Официальные бенчмарки и региональные цены нужно отделять от поведения маршрута, множителя и счёта сайта.
- Production-выбор должен учитывать успешность, задержку, usage, вызовы инструментов и стоимость переделок.
Частые вопросы
Qwen3.8-Flash уже официально запущен?
Да. Команда Qwen 26 августа 2026 года выпустила веса Flash-Next, а официальная страница Alibaba Cloud уже содержит production call ID qwen3.8-flash. На сайте открыт тот же маршрут.
Какой контекст у Qwen3.8-Flash?
Hosted production API по умолчанию поддерживает контекст 1M. Открытый Flash-Next нативно поддерживает 262,144 Tokens и может расширить окно до 1,000,000 Tokens через YaRN.
Поддерживает ли Qwen3.8-Flash изображения и видео?
Да. В официальной таблице Alibaba Cloud указаны изображения, текст и видео на входе, текст на выходе, а также Function Calling и структурированный вывод.
Qwen3.8-Flash-Next и Qwen3.8-Flash — один ID?
Нет. Первый — имя open-source репозитория и self-hosted весов, второй — значение параметра model для production API.
Есть ли у Qwen3.8-Flash thinking mode?
Да, доступны thinking и non-thinking mode. Совместимые интерфейсы могут по-разному отображать расширенные параметры, поэтому сначала проверьте минимальный запрос, затем включайте thinking.
Можно ли использовать Qwen3.8-Flash в Claude Code или Codex?
Alibaba Cloud называет его совместимым с OpenAI и Anthropic и отдельно упоминает Claude Code и Codex. На практике всё равно проверьте вызов инструментов, streaming, тайм-аут и возврат usage.
Какова официальная цена Qwen3.8-Flash?
В стартовом материале QwenCloud указаны 0.16 доллара за миллион входных и 0.47 доллара за миллион выходных Tokens; у Alibaba Cloud Bailian есть отдельные региональные цены в CNY. Множитель и счёт сайта — отдельная система, смотрите актуальную страницу цен.
Где купить или пополнить Qwen3.8-Flash API?
Новые пользователи могут открыть страницу покупки API, а владельцы Key — страницу пополнения.
Основные источники
- Qwen: Qwen3.8-Flash-Next — A New Architecture, Towards Ultimate Cost-Efficiency: архитектура, параметры, контекст, бенчмарки производителя, open source и позиция QwenCloud по цене
- Alibaba Cloud Bailian: сведения о Qwen3.8-Flash: production ID, модальности, контекст, Function Calling, структурированный вывод и региональные возможности
- Официальный GitHub Qwen: Qwen3.8-Flash-Next: имя открытых весов, технический отчёт и история версий
- Список моделей сайта: актуальный маршрут и подключение; цена и доступность определяются актуальной страницей