Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Назад к блогу

Разбор мультимодальности Tencent Marvis: почему изображения, голос, видео и документы сходятся в единый AI-воркфлоу

MarvisTencentмультимодальностьраспознавание изображенийголосовой вводпонимание видеоAI-ассистент

Публичная иллюстрация мультимодальности Marvis

Если в прошлых статьях о Marvis речь в основном шла о том:

  • может ли он взять на себя управление компьютером
  • умеет ли он читать локальные файлы
  • способен ли он экономить вам время в офисной работе

то эта статья отвечает на другой вопрос, который становится все более практичным:

Когда изображения, голос, видео, таблицы и документы приходят вместе, может ли Marvis собрать их в один реальный исполнимый воркфлоу?

Я еще раз прошелся по сайту Marvis и по открытой статье Tencent Cloud Developer Community, которая больше сфокусирована на мультимодальной практике. Сразу дам вывод:

Сейчас в Marvis интереснее всего не просто то, что он умеет понимать картинки, а то, что он начинает связывать визуальное понимание, голосовой ввод, генерацию документов и вывод графиков в непрерывную цепочку задач, гораздо ближе к реальной рабочей среде.

Именно поэтому я считаю, что точка конкуренции Marvis не ограничивается только "локальным режимом" или "удаленным управлением компьютером". Куда важнее другое:

Он движется к роли точки входа в мультимодальные десктопные воркфлоу.

Сначала выводы

  • По состоянию на 29 июня 2026 года самые убедительные мультимодальные возможности Marvis в открытых материалах сосредоточены в четырех типах задач:
    1. Понимание изображений / скриншотов и извлечение содержимого
    2. Переход от голосового ввода к генерации документов
    3. Совместный анализ изображений, текста и таблиц
    4. Разовая выдача отчетов, файлов Word и диаграмм Excel
  • На официальном сайте Marvis мультимодальные возможности уже прямо входят в продуктовое позиционирование:
    • поиск по файлам и содержимому изображений
    • поиск текста внутри изображений
    • глубокое понимание документов и таблиц
    • генерация диаграмм
    • полировка текстов
    • конвертация форматов
  • В открытой статье Tencent Cloud Developer Community уже видна достаточно полная цепочка реальных задач. Это уже не просто "задал вопрос, получил ответ", а такой сценарий:
    • распознавание изображений
    • извлечение параметров
    • написание анализа
    • генерация Word
    • создание диаграмм Excel

Почему мультимодальность важнее, чем просто "умение общаться"

Даже сегодня многие AI-инструменты все еще живут в очень простой логике:

  • вы даете им блок текста
  • они возвращают вам блок текста

Но реальная работа редко начинается с чистого текста.

Гораздо чаще входные данные выглядят так:

  • вы фотографируете продукт
  • делаете скриншот страницы админки
  • записываете фрагмент встречи голосом
  • загружаете длинный документ и таблицу
  • и хотите на выходе получить то, что действительно можно отдать в работу

Иными словами, в реальной работе время обычно уходит не на то, чтобы "получить ответ от модели".

Основная сложность вот в чем:

собрать информацию из разных модальностей и превратить ее в результат, который действительно можно использовать.

Именно здесь у системного ассистента вроде Marvis появляется лучший шанс заметно оторваться от обычных чатовых AI.

Официальное позиционирование уже довольно ясно показывает это направление

Судя по публичным описаниям на сайте Marvis, его мультимодальная цель сформулирована очень прямо:

  • он умеет искать по файлам и содержимому изображений
  • он умеет искать текст внутри изображений
  • он может организовывать библиотеки изображений и документов по людям, темам, локациям и другим измерениям
  • он может глубоко понимать документы и таблицы
  • он поддерживает генерацию диаграмм, доработку текста и конвертацию форматов

Если посмотреть на этот набор целиком, это уже не россыпь отдельных функций, а довольно цельная мультимодальная цепочка:

  • увидеть содержимое
  • найти нужное
  • понять контекст
  • сгенерировать результат

Иными словами, амбиция Marvis на этом направлении не сводится к простому "поддерживает ввод изображений".

Скорее она выглядит так:

свести изображения, текст, документы и таблицы в один десктопный результат задачи.

Кейс 1: распознавание изображений, это не просто описание картинки, а извлечение пригодных параметров

В статье Tencent Cloud Developer Community самый показательный практический кейс, это:

отчет по конкурентному анализу смарт-часов

Задача здесь не в демонстрации вопроса и ответа за один ход. Она намного ближе к реальной бизнес-поставке:

  • собрать изображения и характеристики 3 конкурирующих продуктов
  • сравнить и проанализировать их
  • сгенерировать отчет в Word
  • сгенерировать диаграммы в Excel

Это уже далеко не "скажи, что изображено на этой картинке". Скорее речь о другом:

превратить визуальный ввод в один из этапов аналитического воркфлоу.

Согласно открытому сценарию, первый шаг выглядит так:

  • загрузить 3 изображения смарт-часов
  • попросить Marvis распознать продукты и извлечь ключевые параметры

В публичном результате Marvis извлекает, например:

  • мониторинг сердечного ритма
  • измерение кислорода в крови
  • автономность
  • цену

Это означает, что он не просто описывает изображение. Он также:

  • распознает объект
  • извлекает структурированные поля
  • готовит эти поля для дальнейших отчетов и диаграмм

Почему это важно? Потому что рабочие изображения редко нужны только для просмотра. Намного чаще в них хотят:

  • находить поля на скриншоте
  • вытаскивать характеристики из изображений продукта
  • замечать тренды на графиках
  • видеть ключевые различия между страницами

Если инструмент умеет только описывать увиденное, его ценность ограничена. Если он способен протолкнуть информацию из изображения в следующий шаг работы, это уже настоящая продуктивность.

Кейс 2: голосовой ввод, это не просто speech-to-text, а вход в документную задачу

В той же мультимодальной статье есть еще один полезный пример:

  • пользователь напрямую говорит компьютеру
  • "Помоги мне создать документ Word с заголовком 'Заметки еженедельной встречи' и содержимым с сегодняшней записью встречи"

Судя по открытому описанию цепочки, Marvis делает следующее:

  1. распознает речь
  2. понимает намерение
  3. вызывает Office API
  4. создает Word-документ на рабочем столе
  5. голосом подтверждает результат пользователю

Это сильно отличается от того, как многие обычно понимают "голосовые функции".

Много продуктов заявляют поддержку голоса, но на практике делают лишь это:

  • переводят речь в текст
  • вставляют этот текст в окно чата

У Marvis подход полезнее:

голос здесь только точка входа в задачу, а главное в том, что после этого реально выполняется документная операция.

Это особенно важно в реальных сценариях:

  • когда на встрече нет времени печатать
  • когда хочется управлять работой голосовыми командами
  • когда нужен результат сразу в виде файла

Поэтому в десктопной среде ценность голоса не в том, что "ассистент умеет разговаривать".

Она вот в чем:

может ли голос напрямую подключаться к системному воркфлоу.

Кейс 3: по-настоящему похоже на рабочую среду то, как он связывает "картинку + анализ + отчет + диаграммы" в одну систему

Этот кейс с конкурентным анализом смарт-часов заслуживает отдельного разбора именно потому, что это не точечная демонстрация, а полная мультимодальная цепочка задач.

В открытой статье дальнейшие шаги продолжаются так:

Шаг 1: понимание изображения

  • распознать 3 изображения часов
  • извлечь параметры

Шаг 2: текстовый анализ

  • на основе извлеченных параметров сгенерировать сравнительный анализ конкурентов
  • сформулировать выводы по функциям, цене и пользовательским отзывам

Шаг 3: генерация документа

  • создать Word с заголовком "Отчет по конкурентному анализу смарт-часов"
  • записать в него разделы, таблицы и выводы

Шаг 4: визуализация данных

  • создать файл Excel
  • записать в него параметры и оценки
  • автоматически построить столбчатые и радарные диаграммы

Почему эта цепочка особенно важна?

Потому что она показывает реальный рабочий паттерн:

ценность мультимодального AI не в том, насколько эффектно выглядит одна отдельная функция, а в том, способен ли он связать разные модальности в финальный результат.

Это уже очень похоже на настоящую офисную или бизнес-аналитическую работу:

  • вход не ограничен чистым текстом
  • выход не сводится к одной строке с итогом
  • а середина процесса проходит через изображения, текст, таблицы и документы

Кейс 4: сравнение по эффективности все еще остается маркетинговой рамкой, но хорошо показывает цель Marvis

В статье также есть очень типичная таблица сравнения по эффективности:

  • распознавание изображений конкурентов: 30 минут -> 2 минуты
  • генерация сравнительного анализа: 60 минут -> 3 минуты
  • генерация отчета Word: 45 минут -> 5 минут
  • создание диаграмм Excel: 30 минут -> 3 минуты
  • всего: 165 минут -> 13 минут

То есть публичная формулировка звучит так:

примерно 12.7x роста эффективности

Конечно, не стоит воспринимать эту цифру как обещание того, что любая команда стабильно повторит такой результат в продакшене.

Но как минимум она показывает одну полезную вещь:

Marvis целится в мультимодальной работе не в "более человечный разговор".

Его цель ближе к следующему:

сжать операции, которые раньше были размазаны по нескольким инструментам, в один непрерывный воркфлоу.

Скриншоты, текст внутри изображений и диаграммы, это уже ближе к десктопной работе, чем просто OCR

Еще один важный пункт на сайте Marvis, это то, что он прямо упоминает:

  • поиск по содержимому изображений
  • поиск текста внутри изображений
  • поддержку AI-библиотек изображений и AI-библиотек документов

Почему это нельзя просто свести к формуле "в нем есть OCR"?

Потому что в реальной десктопной работе изображения обычно не являются изолированными сканами. Гораздо чаще это:

  • скриншоты админки
  • продуктовые постеры
  • скриншоты таблиц
  • скриншоты переписок
  • скриншоты страниц с предложениями

И во многих случаях вам нужно не просто "вытащить текст", а понять:

  • о чем эта картинка
  • где находятся ключевые параметры
  • совпадает ли это с другими материалами
  • можно ли передать это дальше в анализ

Вот почему мне это кажется ближе к такой модели:

вопросы по скриншотам + понимание содержимого + продвижение задачи дальше

а не просто к традиционному OCR-инструменту.

Линия с пониманием видео пока больше похожа на анонс возможностей, чем на полностью раскрытый производственный кейс

Судя по открытой мультимодальной статье и описанию на сайте, Marvis уже включил видео в свой мультимодальный нарратив.

Но по сравнению с изображениями, голосом, документами и таблицами открытых производственных кейсов по видео пока не так много.

На текущем этапе можно довольно уверенно подтвердить вот что: в продуктовой рамке видео уже встроено в такую схему возможностей:

  • видео как одна из входных модальностей
  • суммаризация содержания
  • анализ действий или контента

Но если спросить меня, какую линию в Marvis сегодня стоит тестировать в первую очередь, я все равно расставлю приоритет так:

  1. понимание изображений / скриншотов
  2. голос -> документ
  3. связка изображений + отчетов + диаграмм

Потому что именно эти части по открытым материалам уже ближе к реальному рабочему воркфлоу, а не к концептуальной демонстрации.

Каким командам стоит попробовать это уже сейчас

Кому стоит тестировать сразу

  • тем, кто регулярно делает конкурентный и продуктовый анализ
  • операционным, аналитическим и исследовательским ролям, которым нужно одновременно обрабатывать изображения, документы и таблицы
  • тем, кто часто разбирает записи встреч и голосовые заметки
  • тем, кто анализирует смешанные материалы, где есть и изображения, и текст
  • тем, кто хочет собрать скриншоты, документы и таблицы в единый десктопный воркфлоу

Кому можно пока подождать

  • тем, кто работает только с текстовым чатом и не использует изображения и файлы
  • тем, у кого в работе почти нет голосового или визуального ввода
  • тем, кому важнее качество свободного диалога, чем замкнутый цикл выполнения задачи
  • тем, у кого пока нет реальной потребности в обработке мультимодальных материалов

Если хотите протестировать сами, я бы предложил такой подход

  1. Не начинайте с вопроса "понимает ли он картинки", сразу дайте ему реальную задачу.
  2. Лучшие первые сценарии для теста обычно такие:
    • вопросы по скриншотам
    • извлечение параметров из изображений продукта
    • перевод голосовой записи встречи в Word
    • визуальный ввод + генерация отчета
    • связка таблиц + документов + диаграмм
  3. Смотрите не только на то, насколько ответ похож на человеческий, а прежде всего на это:
    • насколько плавно переключаются модальности
    • удается ли сократить копирование и вставку
    • получается ли на выходе реально пригодный к передаче файл
    • становится ли меньше ручной перекладки данных по ходу процесса
  4. Если вы уже сравниваете десктопные AI, можно заодно посмотреть:
    • для каких мультимодальных десктопных задач лучше подходит Marvis
    • какие задачи надежнее по-прежнему оставлять профессиональным OCR-, монтажным и отчетным инструментам

Если вас сейчас больше интересует, как подключить модели Tencent, GLM, Kimi, DeepSeek, StepFun и другие в единый собственный мультимодальный воркфлоу, сначала посмотрите:

Итог

Если свести мою оценку мультимодального направления Marvis к одной фразе, она будет такой:

самое интересное здесь не в том, что он "поддерживает изображения и голос", а в том, что он начинает собирать изображения, голос, документы и таблицы в одну десктопную цепочку задач.

Как только это начинает работать гладко, ценность уже не в том, чтобы:

  • посмотреть на одну картинку
  • прослушать один голосовой фрагмент
  • выдать одну краткую сводку

а намного ближе к следующему:

  • извлечь параметры из изображения
  • поставить задачу голосом
  • написать отчет
  • построить диаграммы
  • передать готовый файл

То есть в случае Marvis действительно стоит тестировать не "мультимодальный вау-эффект", а вот что:

способен ли он превратить мультимодальный ввод в настоящий мультимодальный воркфлоу.

Источники