Разбор Tencent Marvis как команды из 6 AI-агентов: PM, File, Computer и Browser Agent. Почему это уже похоже на цифровое рабочее место на десктопе

Если воспринимать Marvis просто как "еще один чат-бот Tencent", то легче всего пропустить именно ту часть, в которой он радикально отличается от обычного AI в окне чата.
Для этого материала я заново прошелся по нескольким типам открытых источников:
- официальный сайт
Marvis - подробные руководства в Tencent Cloud Developer Community
- открытые статьи с реальными примерами multi-agent взаимодействия
После этого мой вывод стал вполне однозначным:
самое важное в Marvis не в том, насколько по-человечески он отвечает, а в том, что он начинает раздавать настольные задачи целой "AI-команде".
То есть логика уже не такая:
- вы задали один вопрос
- он дал один ответ
А скорее такая:
- вы ставите задачу
- он делит ее на шаги
- распределяет шаги между разными Agent
- а затем возвращает результат
Именно поэтому для меня Marvis больше похож на:
цифровое рабочее место на десктопе
а не на:
еще одну оболочку вокруг разговорной модели
Сначала вывод
-
По состоянию на 29 июня 2026 года в открытых материалах
Marvisдовольно прямо описывается как:- AI-помощник уровня операционной системы
- система совместной работы 1+5 Agent
- или, если говорить проще, AI-команда из 6 человек внутри компьютера
-
В открытых руководствах эта команда чаще всего делится так:
- PM Agent: понимает задачу, разбивает ее на шаги и раздает подзадачи
- File Agent: ищет файлы, конвертирует форматы, читает документы и понимает их содержание
- Computer Agent: проверяет конфигурацию, меняет настройки, отключает автозапуск и оптимизирует систему
- APP Agent: работает с приложениями, запускает процессы и связывает действия между программами
- Search Agent: ищет информацию в сети, агрегирует данные и указывает источники
- Browser Agent: забирает данные с веб-страниц, взаимодействует с сайтами и обрабатывает информацию на уровне страницы
-
Самый важный сигнал не в том, что у продукта "есть 6 названий", а в том, что в открытых материалах уже показываются вполне конкретные цепочки задач:
- компьютер слишком долго загружается ->
PMпередает задачуComputer Agent - нужно разобрать протоколы нескольких отделов -> несколько Agent извлекают решения, собирают
PPTи напоминают о встрече - конвертация файлов, проверка договоров, анализ таблиц -> задачи уходят в
File / Officeслой
- компьютер слишком долго загружается ->
-
Если вас сейчас интересует:
- чем desktop agent реально отличается от обычного chat AI
- не является ли multi-agent подход просто маркетинговым шумом
- может ли Marvis действительно брать на себя связку шагов
то именно эта линия куда полезнее, чем простой вопрос "умеет ли он хорошо болтать".
Почему формулировка "AI-команда" в случае Marvis не выглядит чистым маркетингом
Сегодня многие продукты любят говорить про:
- intelligent agent
- multi-agent
- автоматическое взаимодействие
- AI-команду
Но в большинстве случаев за этими словами в итоге стоит:
- одно окно чата
- набор советов
- а всю оставшуюся работу пользователь делает руками
У Marvis самый заметный сдвиг в открытых материалах в том, что он пытается сделать саму идею "команды" более предметной.
В открытом руководстве Tencent Cloud Developer Community "Marvis 保姆级教程(一)|全网都在找的「AI牛马」到手,别只拿来聊天!" продукт описан предельно прямо:
- после установки в компьютере появляется "AI-команда из 6 человек"
- она готова работать
24часа в сутки - пользователю не нужно изучать сложные workflow
- достаточно поставить задачу, а дальше система сама начинает распределять работу
Почему это вообще стоит обсуждать? Не потому что "шесть человек" звучит эффектно, а потому что здесь озвучивается самая неудобная часть любого настольного workflow:
сложнее всего не один конкретный шаг, а то, кто подхватит следующий шаг и как именно они будут стыковаться между собой.
Шесть ролей из открытых руководств довольно хорошо объясняют настольную логику Marvis
Шесть ролей из публичных материалов очень похожи на реальный офис.
1. PM Agent
Его работа не в том, чтобы сразу что-то делать руками, а в том, чтобы сначала понять задачу, потом разбить ее на шаги и только потом раздать подзадачи.
Это особенно важно, потому что реальный пользователь не формулирует запрос так:
- сначала открой системные настройки
- потом прочитай конкретный лог
- затем реши, какой элемент автозапуска можно отключить
Обычно человек говорит иначе:
- компьютер слишком долго загружается, посмотри, какие программы можно отключить
И ценность PM Agent как раз в том, чтобы перевести такой "человеческий" запрос в операционную логику:
- это задача по системной оптимизации
- сначала нужно просканировать автозагрузку
- затем передать задачу системному Agent
- а перед критичным действием запросить подтверждение у пользователя
2. File Agent
И официальный сайт, и открытые руководства довольно подробно описывают этот слой:
- поиск файлов
- поиск по содержимому
- понимание документов
- пакетная конвертация форматов
Word / Excel / PDF / OCRпо изображениям
По сути это больше похоже на:
файлового управляющего + интерпретатор содержимого
а не просто на функцию "прочитай документ".
3. Computer Agent
Именно здесь Marvis сильнее всего похож на системного AI-помощника.
Этот Agent отвечает за:
- проверку конфигурации компьютера
- изменение системных настроек
- оптимизацию автозапуска
- очистку системного мусора
- отключение рекламы и лишних фоновых пунктов запуска
То есть он не просто объясняет, "что надо сделать", а пытается:
сам закрывать за вас мелкие системные задачи.
4. APP Agent
В открытых руководствах его описывают так:
- умеет работать с приложениями на компьютере
- запускает процессы
- выполняет действия между разными приложениями
Это важно, потому что за пределами файлов и системных настроек большая часть реальной настольной работы выглядит так:
- открыть одно приложение
- нажать пару кнопок
- перейти в другое приложение
- а потом выгрузить результат
Если в эту цепочку включается App-слой, Marvis перестает быть просто "системным помощником" и начинает напоминать исполнителя workflow.
5. Search Agent
Его роль сводится к трем вещам:
- искать данные в сети
- собирать информацию из нескольких источников
- указывать, откуда взялись выводы
В отличие от обычной модели, которая часто просто "выдает ответ", такой Agent делает акцент на другом:
- откуда пришла информация
- можно ли ее проверить
- можно ли передать результаты поиска другим Agent для следующего шага
6. Browser Agent
Это продолжение Search, но уже со сдвигом в сторону выполнения:
- взаимодействие с веб-страницами
- извлечение данных с сайтов
- структурирование информации на уровне страницы
Иначе говоря, Search ближе к "найти информацию", а Browser ближе к "зайти на страницу и сделать за вас половину работы".
Сценарий 1: самый жизненный пример здесь не сложный workflow, а банальное "компьютер слишком долго загружается"
В открытых руководствах первый действительно понятный пример связан не со сложной офисной автоматизацией, а вот с таким запросом:
Компьютер слишком долго загружается. Посмотри, какие программы можно отключить.
Мне нравится этот пример, потому что именно так многие пользователи и начнут говорить с desktop AI в первый раз.
Описанная в руководстве публичная цепочка выглядит так:
- PM Agent принимает задачу: понимает, что это запрос на системную оптимизацию
- Computer Agent сканирует: проверяет элементы автозагрузки
- Выдает отчет человеческим языком: объясняет, какие программы тормозят запуск, а какие драйверы лучше оставить
- Запрашивает второе подтверждение перед действием: перед отключением показывает подтверждение
Почему это важно?
Потому что здесь разница между Marvis и обычным chat AI показана очень предметно:
- он не просто говорит, где это выключить
- не кидает вам инструкцию по шагам
- а сначала сам сканирует, затем сам оценивает ситуацию и только потом просит подтвердить действие
В этом и состоит одно из ключевых отличий desktop agent от обычного AI для вопросов и ответов:
он начинает входить в цепочку исполнения.
Сценарий 2: протоколы нескольких отделов -> извлечь решения -> собрать PPT -> показать днем. Вот где multi-agent действительно похож на офисную работу
В открытой статье "Marvis 6 大 Agent 协同实战:以“打工好帮手”为例" приведен сценарий, который гораздо ближе к сложной офисной задаче, чем отключение автозапуска.
Там задача формулируется так:
- разобрать протоколы встреч
3отделов за прошлую неделю - извлечь ключевые решения
- собрать
PPT - подготовить материал к показу на встрече в
14:00
Самое интересное в статье не только итоговый результат, а то, как описана логика взаимодействия:
- не один Agent "тащит" всю задачу в одиночку
- несколько Agent делят работу
- система автоматически делает поиск файлов, извлечение содержания, сборку
PPTи напоминание о встрече
Почему этот пример стоит выделить отдельно?
Потому что без реальной цепочки задач слова "multi-agent" звучат слишком абстрактно, а в таком офисном сценарии все становится очень конкретным:
- где лежат файлы
- кто читает их первым
- кто вытягивает выводы
- кто собирает презентацию
- кто добавляет напоминание
И именно здесь становится видно:
Marvis не просто раздает одной модели разные названия, а реально пытается делать task routing.
Сценарий 3: настоящая ценность File Agent не в поиске имени файла, а в том, что он пытается собрать файловый workflow в одну цепочку

И официальный сайт, и открытые руководства постоянно возвращаются к одной мысли:
все, что связано с файлами, Marvis хочет закрывать одной связной линией.
Сюда входят:
- поиск файлов
- поиск по содержимому
- конвертация форматов
- чтение документов
- понимание содержания
В открытом руководстве приводится и очень прямой пример:
Преобразуй файл
2026年Q1销售数据.xlsxс рабочего стола в
Описанная там цепочка выполнения такая:
- Agent из слоя
Computer / Fileнаходит нужный файл - читает
Excel - создает
PDF - автоматически подстраивает ширину столбцов, колонтитулы и структуру страницы
- сохраняет результат на рабочий стол
Это показывает, что File Agent на самом деле пытается делать не "чтение одного файла", а другое:
цельную документную цепочку от поиска файла до готового результата.
Если эта цепочка работает стабильно, то заметная часть самой дробной офисной рутины начинает исчезать.
Сценарий 4: официальная идея "говорить по-человечески" на самом деле снижает порог для PM Agent
В открытой статье "吊打所有 AI 助手!腾讯王炸 Marvis 上线,免费解锁电脑全智能操控" есть фраза, которую, на мой взгляд, особенно важно вынести отдельно:
не нужно учить профессиональные команды и разбираться в сложных функциях; достаточно одного разговорного запроса, чтобы решить массу мелких операций.
Если перевести это на более простой язык, смысл такой:
PM Agent должен быть достаточно сильным, чтобы пользователю не приходилось изучать еще один слой интерфейса.
Потому что большинство людей вообще не хотят разбираться:
- какого Agent нужно звать
- какая задача относится к браузеру
- какая относится к файлам
- когда сначала нужен системный слой, а когда слой приложений
Они хотят сказать всего лишь:
- у меня тормозит компьютер
- помоги найти тот файл
- переведи эти материалы в документ
- найди данные в сети и собери по ним план
Если Marvis хочет состояться как продукт, PM-слой должен уметь хорошо раскладывать такие задачи сам.
Формула "1+5 Agent" в открытых материалах показывает, что Marvis хочет стать промежуточным слоем для задач
В статье 2671890 есть и более архитектурная формулировка:
- основной Agent (координация)
- 5 специализированных Agent
Это означает, что траектория Marvis не сводится к отдельным разрозненным инструментам:
- файловому utility
- системному помощнику
- браузерному плагину
Скорее продукт пытается стать:
промежуточным системным слоем
Что это значит на практике?
Пользователь ставит цель, а дальше система сама решает:
- куда идти первым
- что читать
- когда переключаться
- и куда вернуть итоговый результат
Если такой слой действительно работает, ценность продукта уже не в том, что "это помощник с большим количеством функций", а в другом:
это распределитель настольных задач.
Почему эта линия важнее для реальной рабочей среды, чем просто "еще один chat AI"
На мой взгляд, реальная ценность схемы 6 Agent / 1+5 в Marvis в том, что она цепляет самую утомительную часть настольной работы:
- файлов слишком много
- шаги слишком мелкие
- приложения слишком разрознены
- пользователи не хотят учить workflow
Обычный chat AI может стоять рядом и давать советы, но он редко снимает такие вопросы:
- в каком приложении это делать
- где лежат данные
- как сохранить итоговый результат
- где именно нужно подтверждение
А вот стабильная multi-agent система уже может брать на себя именно эту промежуточную работу, которую никто не любит, но все делают каждый день.
Кому в первую очередь стоит тестировать эту линию
На мой взгляд, особенно внимательно на нее стоит смотреть таким группам пользователей:
- тем, кто каждый день работает с локальными документами, системными настройками и поиском в браузере
- тем, кто постоянно переключается между
файл -> веб -> документ -> приложение - тем, кто хочет закрывать настольную рутину естественным языком, а не учить сложные сценарии автоматизации
- тем, кому интереснее делить задачу между несколькими AI-модулями, чем просто смотреть в одно окно чата
Если вас больше всего раздражает следующее:
- AI умеет говорить, но не умеет делать
- файлы, приложения и система живут как три отдельные вселенные
- а в финале все равно приходится прокликивать все самому
то настольная линия Marvis как AI-команды как минимум заслуживает более серьезного внимания, чем обычной "еще один AI-чат".
Мой итоговый вывод
Если подвести итог этой статье одной фразой, мой вывод такой:
главная вещь в Marvis не в том, насколько он разговорчив, а в том, что он начинает раскладывать настольную работу на цифровую команду с разделением ролей.
Публично Marvis уже показывает не только "шесть имен Agent", а и вполне конкретные рабочие контуры:
PMпонимает задачу и разбивает ее на шагиFileработает с файлами, конвертацией и содержаниемComputerзанимается системой, настройками и оптимизациейSearch / Browserидут в веб и возвращают материалыAPPсвязывает это с действиями внутри приложений
Если это взаимодействие между ролями действительно станет стабильным, смысл продукта перестанет быть таким:
AI просто отвечает на вопросы
и станет таким:
AI берет на себя часть настольного workflow
Если вам сейчас важнее посмотреть:
- текущие варианты подключения
- модели и цены
- покупку API Key
- обучающие материалы
можно начать отсюда:
FAQ
Какие роли входят в "AI-команду из 6 человек" у Marvis?
В открытых руководствах чаще всего встречается такой набор:
PM AgentFile AgentComputer AgentAPP AgentSearch AgentBrowser Agent
В открытых статьях это же иногда описывают формулой "1+5 Agent collaboration": один главный Agent координирует работу, а несколько специализированных Agent выполняют задачи.
Чем Marvis принципиально отличается от обычного chat AI?
Ключевая разница не в стиле ответа, а в том, что продукт пытается заходить в:
- системные настройки
- локальные файлы
- действия внутри приложений
- веб-взаимодействие
То есть он сдвигается от "ответов" в сторону "исполнения".
Какую цепочку задач чаще всего показывают в открытых руководствах?
Один из самых типичных примеров выглядит так:
- компьютер слишком долго загружается
PMраспознает это как задачу системной оптимизацииComputer Agentсканирует автозагрузку- выдает рекомендации
- а перед критичным отключением еще раз просит подтверждение
Какой пример multi-agent взаимодействия больше всего похож на реальную офисную работу?
В открытой практической статье один из самых показательных примеров такой:
- разобрать протоколы нескольких отделов
- извлечь ключевые решения
- собрать
PPT - добавить напоминание о встрече
Это уже гораздо ближе к реальной настольной задаче, чем к одноходовому вопросу-ответу.
С чего начать, если я хочу быстро посмотреть актуальную публичную информацию о Marvis?
Самый прямой старт - с этих страниц: