Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Назад к блогу

Qwen3.8-Flash API: гайд 2026 по цене, 1M контексту и подключению

Qwen3.8-FlashQwen APIQwen Flashcoding agentконтекст 1M

27 августа 2026 года, на следующий день после открытия Qwen3.8-Flash-Next, мы собрали материалы для только что запущенного на сайте маршрута qwen3.8-flash. Самая частая ошибка начинается с названия: открытые веса и production API используют разные Model ID.

Qwen3.8-Flash-Next — открытая мультимодальная MoE для предварительного просмотра архитектуры Qwen4; qwen3.8-flash — production API-модель Alibaba Cloud Bailian и QwenCloud с контекстом 1M по умолчанию, входом для изображений/текста/видео, Function Calling и структурированным выводом. На сайте открыт маршрут qwen3.8-flash; множитель и фактическое списание проверяйте на странице цен в реальном времени и в счёте.

Ниже отдельно разобраны архитектура открытой модели, возможности официального API Alibaba Cloud, официальная прямая цена и маршрут сайта. Бенчмарки, опубликованные командой Qwen, не являются независимым тестом сайта, а региональные цены Alibaba Cloud не переводятся напрямую в множитель сайта.

Ключевые данные Qwen3.8-Flash

Параметр Проверенная информация
Официальная дата выпуска 26 августа 2026 года
ID API сайта / Bailian qwen3.8-flash
ID открытых весов Qwen/Qwen3.8-Flash-Next
Структура параметров Основная модель 125B + N-gram Embedding 51B, 6B активных параметров
Контекст Production API по умолчанию 1M; open-source версия нативно 262,144, с расширением YaRN до 1M
Вход / выход Изображения, текст и видео на входе; текст на выходе
Возможности API Function Calling, структурированный вывод, Web Search, context cache
Позиционирование Coding Agent, офисная автоматизация, визуальное понимание, высокопараллельные workflow
Множитель сайта Не фиксируем в статье; смотрите актуальную цену и счёт

Данные проверены 27 августа 2026 года. Перед production-подключением снова проверьте список моделей, региональную документацию Bailian и поле usage в реальном ответе.

Как связаны Qwen3.8-Flash и Qwen3.8-Flash-Next?

Команда Qwen сначала открыла веса Qwen3.8-Flash-Next, чтобы сообщество могло изучить архитектуру Qwen4. Production-версия предоставляется под именем Qwen3.8-Flash. Техническое направление общее, но способ вызова различается.

Название Назначение Точный ID Контекст
Qwen3.8-Flash-Next Self-hosting, исследование архитектуры, open-source оценка Qwen/Qwen3.8-Flash-Next Нативно 262,144, YaRN до 1M
Qwen3.8-Flash Hosted production API qwen3.8-flash По умолчанию 1M
Qwen3.8-Max Hosted-флагман с максимальными возможностями qwen3.8-max 1M

При вызове через сайт или совместимый интерфейс Alibaba Cloud не вставляйте имя репозитория Hugging Face в параметр model. И наоборот, при self-hosting одного hosted API ID недостаточно: framework не скачает веса автоматически.

Что нового в архитектуре Qwen3.8-Flash-Next?

В Qwen3.8-Flash-Next гибридное внимание построено на Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA). GDN сжимает историю в фиксированное состояние, а QSA через лёгкий индексатор выбирает важный контекст по микроблокам. Это снижает вычисления attention и обращения к KV Cache в длинных последовательностях.

Модель также добавляет Gated Residual (GR): остаточный поток разделяется на четыре ветви с динамическим управлением чтением и записью. N-gram Embedding обращается к локальному контексту через таблицу и расширяет ёмкость модели почти без роста матричных вычислений на Token. Для обучения использовались улучшенный Muon Optimizer и повторно подогнанный Scaling Law.

Заявленный размер — основная модель 125B, дополнительные N-gram Embedding 51B и 6B параметров, активных на Token. Команда Qwen сообщает, что стоимость обучения примерно в девять раз ниже Qwen3.7-Plus. Это сравнение производителя, а не измерение стоимости inference на сайте.

Какие ограничения есть у контекста 1M и мультимодальности?

На странице модели Qwen3.8-Flash Alibaba Cloud указано окно 1,000,000 Tokens: для обычного режима максимум ввода 991,808, для thinking mode — 983,616, максимум вывода 131,072 и максимум цепочки рассуждений 262,144. На вход можно передать изображения, текст и видео, на выходе получается текст.

1M не означает, что каждый запрос стоит заполнять почти до миллиона Tokens. Системный Prompt, схемы инструментов, кодирование изображений/видео, история сообщений и резерв под вывод занимают окно; сверхдлинный запрос также увеличивает задержку и цену. В production сначала тестируйте уровни 32K, 128K, 256K и длинный контекст.

В таблице возможностей также перечислены Function Calling, структурированный вывод, Web Search и context cache. Batch поддерживается в регионе Beijing, но отмечен как неподдерживаемый в Singapore — региональные различия нужно отдельно проверить до деплоя.

Как читать официальные бенчмарки Qwen по коду и Agent?

Команда Qwen сравнила Qwen3.8-Flash-Next с Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 и другими моделями. Ниже приведены четыре значения:

Опубликованный тест производителя Qwen3.7-Plus Qwen3.8-Flash-Next Тип задачи
DeepSWE 1.1 16.5 58.7 Agentic coding
SWE-bench Multilingual 75.8 81.0 Многоязычная software engineering
CoWorkBench 65.1 73.9 Длительные офисные задачи
Toolathlon Verified 50.6 73.5 Реальный вызов инструментов

Эти оценки опубликованы Qwen и не являются независимым тестом сайта. На результат сильно влияют версия модели, бюджет рассуждения, окружение инструментов и scorer. Нельзя напрямую считать баллы открытого Flash-Next результатом hosted API в вашем клиенте, регионе и квоте.

Как разделять официальную цену Qwen3.8-Flash и цену сайта?

В релизе QwenCloud для запуска указана справочная цена production-версии: 0.16 доллара за миллион входных Tokens и 0.47 доллара за миллион выходных Tokens; в том же релизе на тот момент было сказано, что API скоро откроется. Затем страница моделей Alibaba Cloud Bailian добавила call ID qwen3.8-flash и разные цены и возможности в CNY для Beijing, Singapore и других регионов.

Обе цифры относятся к прямому официальному доступу и могут изменяться из-за региона, кэша, Batch и промоакций. Сайт не пересчитывает официальную цену в долларах или региональную цену Bailian в свой множитель. Для qwen3.8-flash используйте актуальную страницу цен и счёт запроса.

Новые пользователи могут открыть страницу покупки API, а владельцы Key — страницу пополнения. Сначала зафиксируйте Prompt и длину контекста, запишите входные, выходные и кэшированные Tokens, затем сравнивайте реальную стоимость.

Как вызвать API Qwen3.8-Flash

Сайт предоставляет совместимый с OpenAI интерфейс Chat Completions; точный ID модели — qwen3.8-flash:

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {
        "role": "user",
        "content": "Summarize the failing tests, then propose the smallest safe patch."
      }
    ]
  }'

Qwen3.8-Flash поддерживает thinking и non-thinking mode, но разные совместимые слои могут по-разному отображать enable_thinking, reasoning_effort, streaming-параметры инструментов и встроенные инструменты. Начните с минимального текстового запроса и добавляйте thinking, изображения, видео, инструменты и длинный контекст по одному.

Для каких задач подходит Qwen3.8-Flash?

  • высокопараллельные Coding Agent, code review и анализ падения тестов;
  • многоязычные codebase и задачи software engineering уровня SWE-bench;
  • длительная автоматизация почты, таблиц, документов и материалов встреч;
  • понимание изображений, графиков и длинного видео;
  • workflow с Function Calling, структурированным выводом и Web Search;
  • длинные документы и большие codebase, где нужен 1M контекст при чувствительности к цене;
  • исследование preview-архитектуры Qwen4 в self-hosting и адаптация inference framework.

Для архитектурных решений, критического security review или разовой задачи высокой ценности сравните модель с Qwen3.8-Max, GLM-5.3, Claude и другими сильными моделями. Ценность Flash — в стоимости и throughput, а не в замене всех моделей одним ID.

Qwen3.8-Flash или Qwen3.8-Max?

Если задач много и нужны мультимодальность, инструменты и контекст 1M, начните с небольшого трафика на Qwen3.8-Flash. Если важнее верхний предел сложного рассуждения, устойчивость и качество критического ответа, переключите тот же тест на Qwen3.8-Max.

Не сравнивайте один ответ. Минимальный набор метрик: доля пройденных задач, задержка до первого токена, полное время, успешность вызовов инструментов, входные/выходные Tokens, попадание в кэш и число повторных работ. Низкая цена модели не обязательно означает меньшую общую стоимость, если требуется больше повторов.

Чек-лист production-оценки

  1. Для hosted API используйте qwen3.8-flash, для self-hosting — Qwen/Qwen3.8-Flash-Next.
  2. Перед сравнением зафиксируйте репозиторий, Prompt, версии инструментов, тайм-аут и команду приёмки.
  3. Отдельно проверьте thinking и non-thinking mode, записывая отличия формата ответа.
  4. Проверьте текст, изображения, видео, Function Calling и структурированный вывод.
  5. Разбейте тесты по 32K, 128K, 256K и длинному контексту и измерьте задержку и счёт.
  6. Уточните, поддерживает ли выбранный регион Batch, кэш и нужные встроенные инструменты.
  7. Задайте пределы для числа инструментов, максимального вывода, общего бюджета и внешних действий.
  8. Подготовьте резервный маршрут на случай нехватки ёмкости, rate limit или несовместимости протокола.

Главные выводы

  • qwen3.8-flash — точный ID hosted API сайта и Alibaba Cloud.
  • Qwen/Qwen3.8-Flash-Next — имя открытых весов; его нельзя указывать в model для hosted API.
  • Hosted-версия по умолчанию поддерживает 1M контекст, изображения, текст, видео и Function Calling.
  • Основная модель 125B + N-gram Embedding 51B; на каждый Token активируется 6B параметров.
  • Официальные бенчмарки и региональные цены нужно отделять от поведения маршрута, множителя и счёта сайта.
  • Production-выбор должен учитывать успешность, задержку, usage, вызовы инструментов и стоимость переделок.

Частые вопросы

Qwen3.8-Flash уже официально запущен?

Да. Команда Qwen 26 августа 2026 года выпустила веса Flash-Next, а официальная страница Alibaba Cloud уже содержит production call ID qwen3.8-flash. На сайте открыт тот же маршрут.

Какой контекст у Qwen3.8-Flash?

Hosted production API по умолчанию поддерживает контекст 1M. Открытый Flash-Next нативно поддерживает 262,144 Tokens и может расширить окно до 1,000,000 Tokens через YaRN.

Поддерживает ли Qwen3.8-Flash изображения и видео?

Да. В официальной таблице Alibaba Cloud указаны изображения, текст и видео на входе, текст на выходе, а также Function Calling и структурированный вывод.

Qwen3.8-Flash-Next и Qwen3.8-Flash — один ID?

Нет. Первый — имя open-source репозитория и self-hosted весов, второй — значение параметра model для production API.

Есть ли у Qwen3.8-Flash thinking mode?

Да, доступны thinking и non-thinking mode. Совместимые интерфейсы могут по-разному отображать расширенные параметры, поэтому сначала проверьте минимальный запрос, затем включайте thinking.

Можно ли использовать Qwen3.8-Flash в Claude Code или Codex?

Alibaba Cloud называет его совместимым с OpenAI и Anthropic и отдельно упоминает Claude Code и Codex. На практике всё равно проверьте вызов инструментов, streaming, тайм-аут и возврат usage.

Какова официальная цена Qwen3.8-Flash?

В стартовом материале QwenCloud указаны 0.16 доллара за миллион входных и 0.47 доллара за миллион выходных Tokens; у Alibaba Cloud Bailian есть отдельные региональные цены в CNY. Множитель и счёт сайта — отдельная система, смотрите актуальную страницу цен.

Где купить или пополнить Qwen3.8-Flash API?

Новые пользователи могут открыть страницу покупки API, а владельцы Key — страницу пополнения.

Основные источники