Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Назад к блогу

Выпуск полномодальной модели Qwen3.8-Omni-Flash: возможности, API и руководство по аудио-видео Agent

Qwen3.8-Omni-Flashполномодальная модельмультимодальный APIаудио-видео AgentQwen API

Полномодальная модель Qwen3.8-Omni-Flash официально запущена. Она объединяет текст, изображения, аудио и видео в одном рабочем процессе Agent. Цель — не просто «понять контент», а пройти весь путь от понимания материалов и планирования задачи до вызова инструментов и выдачи результата. Для разработчиков, которым нужно обрабатывать длинные видео, записи встреч, музыкальные клипы и киноматериалы, главный акцент этого релиза — аудио-видео Agent, а не очередная мультимодальная модель, умеющая только вести диалог.

Эта статья подготовлена на основе материалов, опубликованных в официальном аккаунте Qwen 大模型; иллюстрации сохранены из оригинальных изображений релиза и демонстраций. Числа бенчмарков в статье — это официально раскрытые результаты, а не независимое повторное тестирование нашего сайта. Появилась ли модель в каталоге нашего сайта, а также фактические коэффициенты и списания следует проверять по актуальным ценам моделей и реальным счетам.

Полномодальная модель Qwen3.8-Omni-Flash и сценарии применения в production-среде

Какие типы ввода поддерживает Qwen3.8-Omni-Flash?

Параметр Информация из материалов релиза
Название модели Qwen3.8-Omni-Flash
Модальности ввода Текст, изображения, аудио, видео
Контекст До 1M Tokens
Основные направления Аудио-видео Agent, программирование, работа с текстовыми знаниями, GUI-операции
Длинные задачи Понимание длинных аудио и видео, протоколы встреч и задачи, исследовательские отчеты по видео, создание контента
Сопутствующие инструменты Qwen-MM-Plugins, Qwen-Live Harness

Фактический API model ID, протокол, ограничения контекста и доступность по регионам нужно уточнять в актуальной документации поставщика сервиса. Не следует предполагать, что из-за формулировки «полномодальная» в релизе все совместимые шлюзы уже поддерживают аудио, видео и возврат результатов инструментов. При интеграции нужно отдельно проверять текст, изображения, аудио, видео и вызовы инструментов.

Официальные бенчмарки: заметный рост в аудио-видео Agent и длинных задачах

Согласно материалам релиза, Qwen3.8-Omni-Flash в совокупности по 30 бенчмаркам показала средний прирост более 26% по сравнению с предыдущим поколением Qwen3.5-Omni-Plus. Несколько наиболее понятных изменений:

  • WildClawBench-MM вырос на 36.5 балла; фокус — аудио-видео Agent, программирование и длинные задачи;
  • AgenticVBench вырос на 22.3 балла;
  • UniClawBench получил 69.6 балла;
  • LongAudioSpan вырос на 8.3 балла, OmniVideoBench — на 9.6 балла;
  • в OmniCap-IF показатели CSR / ISR выросли на 8.5 / 14.1 балла соответственно;
  • в AliMeeting показатели DER / cpWER снизились с 88.11 / 89.61 до 3.35 / 17.18.

Эти числа следует интерпретировать с учетом тестовых наборов, промптов, окружения инструментов и метрик оценки. Например, DER и cpWER — это метрики ошибок, связанные с распознаванием встреч; их снижение обычно означает улучшение. А рост баллов в Agent benchmark нельзя напрямую переводить в вероятность успеха для всех production-задач.

Длинный контекст — это не только возможность «поместить больше видео»

Qwen3.8-Omni-Flash поддерживает длинные последовательности 1M, но ценность длинного контекста не сводится к загрузке файлов большего размера. Более практичное изменение в том, что модель может сначала решить, «что смотреть и что слушать» исходя из вопроса, а затем провести многошаговую проверку релевантных фрагментов от общего к частному.

В эксперименте OmniVideoBench, приведенном в официальных материалах, Agentic Understanding повысил точность с 63.4 до 67.8, при этом расход Token снизился с 145,736 до 79,117, то есть примерно на 45.7%. Это показывает, что активный сбор доказательств может сокращать повторную обработку нерелевантных фрагментов, но фактическая стоимость по-прежнему зависит от длительности файла, кодирования аудио и видео, циклов инструментов, длины вывода и способа тарификации у поставщика сервиса.

Демонстрация Long audio-video Agentic Understanding в Qwen3.8-Omni-Flash

Длинные встречи: от записи к исполнению

Многосторонняя встреча одновременно содержит изображение, звук, разделение говорящих, референциальные связи и контекст проекта. В материалах релиза говорится, что Qwen3.8-Omni-Flash поддерживает аудио-видео ввод длительностью до одного часа, может совместно понимать изображение участников и речевой контент, выполнять разделение говорящих, транскрибацию и сопоставление личностей, а затем генерировать протокол встречи, задачи и анализ рисков.

После подключения инструментов рабочий процесс может продолжаться за пределами модели: например, отправлять письма, структурировать задачи или начинать писать код в соответствии с требованиями встречи. Здесь важно отдельно принимать «рекомендации, выданные моделью» и «реальное выполнение внешних действий»: в production-среде нужно явно настроить права инструментов для отправки писем, записи файлов, создания задач и запуска кода.

Глубокие исследования с видео в центре

Когда пользователь задает конкретный вопрос по видео, ответ часто требует учитывать не только само видео, но и внешние веб-страницы, изображения, документы и другие видеоматериалы. Qwen3.8-Omni-Flash может сначала извлечь ключевые вопросы из видео, а затем организовать мультимодальные материалы в иллюстрированный исследовательский отчет. Для учебных материалов, курсов, продуктовых демонстраций и киноматериалов это ближе к реальному рабочему процессу, чем простая генерация краткого резюме.

Управляемое описание видео: один и тот же материал — разные результаты для разных задач

У описания видео не должно быть только одного фиксированного ответа. Создателям контента важен нарратив, поиску материалов — временные фрагменты, управлению медиаресурсами — персонажи, кадры, звук и структурированные поля.

Позиционирование Qwen3.8-Omni-Flash заключается в том, чтобы вызывающая сторона могла управлять объектом описания, временным диапазоном, уровнем детализации и форматом вывода. Например, один и тот же материал можно вывести в нескольких вариантах:

  1. трехчастный сюжетный синопсис для редактора;
  2. временные метки, персонажи и ключевые действия для поиска;
  3. JSON-метаданные для медиатеки;
  4. список говорящих, языков и аудиособытий для команды субтитров.

Такие возможности лучше проектировать вместе со структурированным выводом, файловыми инструментами и поисковыми системами, а не просто просматривать в чат-окне как фрагмент естественного языка.

Схема применения Qwen3.8-Omni-Flash для понимания аудио-видео и производства контента

Производство и редактирование аудио-видео: обновлять нужно модель, инструменты и среду выполнения

Перед длинными аудио-видео Agent стоят не только вопросы возможностей модели, но и задачи хранения файлов, передачи по сети, многошагового рассуждения, редактирования таймлайна и доставки результата. Для этого в материалах релиза представлены два сопутствующих open-source проекта:

  • Qwen-MM-Plugins: восприятие по требованию, вызов инструментов и выполнение рабочих процессов для длинных аудио-видео;
  • Qwen-Live Harness: среда для real-time и непрерывного полномодального взаимодействия.

Их можно понимать как решения с разными акцентами на стороне выполнения: одно больше ориентировано на длинные задачи и обработку материалов, другое — на взаимодействие в реальном времени. При развертывании нужно отдельно проверять зависимости, видеопамять, права доступа к файлам, внешний сетевой доступ и версии плагинов; не стоит превращать формулировку «репозиторий открыт» в обещание «локально запускается в production одним кликом».

Как подключиться к Qwen3.8-Omni-Flash API?

Если поставщик сервиса уже открыл соответствующий маршрут, сначала рекомендуется провести Smoke Test на небольшом материале без чувствительных данных: одно изображение, аудиофрагмент на несколько десятков секунд и короткое видео. Отдельно протестируйте ввод, вывод, расход Token и сообщения об ошибках.

Типичная форма запроса к совместимому Chat Completions API выглядит так. Значение model замените на точный ID, подтвержденный в актуальном каталоге моделей поставщика; не угадывайте имя модели напрямую:

curl "$BASE_URL/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-omni-flash",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Суммируй тему этого материала, говорящих и три ключевые временные точки."},
        {"type": "input_video", "video_url": {"url": "https://example.com/demo.mp4"}}
      ]
    }],
    "stream": false
  }'

Поле input_video выше используется только для иллюстрации того, что в мультимодальных запросах нужно отдельно проверять формат content-блоков; это не означает, что все совместимые интерфейсы принимают это поле. Перед реальной интеграцией следует изучить документацию поставщика сервиса и отдельно зафиксировать:

  • поддерживает ли интерфейс video URL, Base64 или file ID;
  • ограничения на размер одного файла, длительность, формат и таймаут скачивания;
  • способ расчета и цену аудио/видео Token;
  • поддерживаются ли вызовы инструментов, структурированный вывод и потоковый возврат;
  • приведут ли повторные попытки после сбоя к повторному списанию средств.

Если вы вызываете модель через шлюз нашего сайта, сначала откройте актуальные цены моделей, подтвердите model ID, коэффициент и текущие возможности, а затем проверьте реальный счет на небольшом балансе. Статьи нашего сайта не приравнивают официальные цены релиза или цены других платформ к ценам на этом сайте.

Для каких сценариев подходит?

1. Видеомонтаж и поиск материалов

Пусть модель сначала определит кадры, персонажей, действия и аудиособытия, а затем передаст результат монтажному инструменту для чернового монтажа, субтитров и разметки глав. При приемке следует сравнивать точность временных меток и долю пропущенных событий, а не только то, насколько плавно читается резюме.

2. Музыкальные клипы и кинопересказ

Модель может одновременно понимать изображение, диалоги, музыку и нарративную структуру, а затем генерировать сценарий, описание кадров или черновик озвучки. Финальный ролик все равно требует ручной проверки авторских прав, фактов и качества языка.

3. Встречи и работа со знаниями

Видео встреч можно включить в конвейер транскрибации, распознавания говорящих, протоколирования, анализа рисков и создания задач. Если затрагиваются клиенты, сотрудники или коммерческая тайна, сначала необходимо подтвердить границы хранения данных и внешней передачи.

4. Мультимодальные глубокие исследования

Используйте видео как входную точку исследования и дополняйте контекст веб-страницами, изображениями, документами и другими видео. Это подходит для разбора курсов, продуктовых исследований и анализа технических туториалов.

Чек-лист выбора и интеграции

  1. Сначала убедитесь, что поставщик сервиса действительно открыл Qwen3.8-Omni-Flash, а не ориентируйтесь только на заголовок новости.
  2. Протестируйте текст, изображения, аудио и видео отдельно на небольших файлах без чувствительных данных.
  3. Зафиксируйте размер файла, длительность, входные/выходные Tokens, задержку, кэширование и фактическое списание.
  4. Создайте отдельные приемочные образцы для OCR, распознавания говорящих, временных меток, видео-QA и выполнения инструментов.
  5. Разнесите понимание видео, чтение файлов, создание задач, отправку писем и выполнение кода по разным границам прав доступа.
  6. Для длинных задач настройте бюджет, таймауты, повторы и условия передачи человеку.
  7. Записывайте версию модели, дату запроса, поставщика сервиса, протокол и структуру ответа в трассируемые логи.

Частые вопросы

Qwen3.8-Omni-Flash — это обычная визуальная модель?

Нет. В релизе она позиционируется как нативная полномодальная модель: ввод охватывает текст, изображения, аудио и видео, а понимание аудио-видео объединяется с выполнением инструментов Agent.

Видео какой длины она поддерживает?

В материалах релиза упоминается аудио-видео ввод длительностью до одного часа, а также длинный контекст 1M. Конкретные лимиты все равно могут зависеть от API, размера файла, кодирования, региона и реализации поставщика сервиса; ориентироваться следует на текущую документацию интерфейса и реальные запросы.

Означает ли контекст 1M, что стоимость обязательно будет ниже?

Нет. Длинный контекст расширяет обрабатываемый диапазон, но загрузка файлов, аудио/видео Token, циклы инструментов и вывод тоже создают затраты. Agentic-сбор доказательств может уменьшить нерелевантную обработку, но это нужно подтверждать по фактическому использованию.

Чем отличаются Qwen-Live Harness и Qwen-MM-Plugins?

Первый проект ориентирован на среду выполнения для real-time и непрерывного полномодального взаимодействия; второй — на восприятие по требованию, вызов инструментов и выполнение рабочих процессов для длинных аудио-видео. Оба являются сопутствующими проектами и не равны одной и той же API-модели.

Наш сайт уже поддерживает Qwen3.8-Omni-Flash?

Статья не заменяет актуальный каталог. Проверьте страницу цен моделей, подтвердите model ID, коэффициент, модальные возможности и фактический счет, прежде чем использовать модель в production.

Заключение

Главный смысл полномодальной модели Qwen3.8-Omni-Flash — превратить аудио-видео из «входа, который модель понимает» в рабочий носитель, с которым Agent может непрерывно собирать доказательства, планировать, вызывать инструменты и доставлять результат. Ее стоит проверять на небольших реальных задачах: сначала протестировать вопросы-ответы по длинным видео, протоколы встреч и поиск материалов, а затем постепенно добавлять монтаж, исследования и выполнение задач.

Источник релиза: предоставленная пользователем офлайн-страница публикации «全模态模型 Qwen3.8-Omni-Flash 发布» из официального аккаунта; изображения являются оригинальными иллюстрациями с этой страницы, скопированными в каталог статических ресурсов нашего сайта. Скрипты страницы и сторонние инструкции не использовались как содержимое статьи.