Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Volver al blog

Marvis de Tencent como equipo de 6 agentes de IA: PM, File, Computer y Browser Agent, y por qué ya se parece más a un puesto de trabajo digital en el escritorio

MarvisTencentagente de IAagente de escritorioasistente de archivosoperaciones del sistemaBrowser Agent

Portada oficial de Marvis

Si entiendes Marvis solo como “otro chat de IA de Tencent”, lo más fácil es pasar por alto justo la parte que más lo diferencia de una caja de conversación normal.

Esta vez repasé de nuevo varios materiales públicos:

  • el sitio oficial de Marvis
  • tutoriales paso a paso publicados en Tencent Cloud Developer Community
  • casos públicos de colaboración entre varios agentes

Después de leerlos, mi conclusión es bastante clara:

Lo más interesante de Marvis no es lo bien que responde, sino que empieza a repartir tareas de escritorio a un verdadero "equipo de IA".

Es decir, ya no funciona solo así:

  • tú preguntas algo
  • la IA responde algo

Empieza a funcionar más bien así:

  • tú le asignas una tarea
  • la descompone en varios pasos
  • reparte cada paso al agente adecuado
  • y luego te devuelve el resultado

Por eso creo que Marvis se parece más a:

un puesto de trabajo digital sobre el escritorio

y menos a:

otro contenedor con un modelo conversacional

La conclusión primero

  • A fecha de 29 de junio de 2026, en la información pública Marvis ya aparece descrito de forma bastante explícita como:

    • asistente de IA a nivel de sistema operativo
    • sistema colaborativo de agentes 1+5
    • o, dicho más directo, un equipo de 6 agentes de IA dentro del ordenador
  • En los tutoriales públicos, la división del trabajo más repetida es esta:

    1. PM Agent: entiende la tarea, la divide y la distribuye
    2. File Agent: busca archivos, convierte formatos, lee documentos y entiende contenidos
    3. Computer Agent: revisa configuraciones, ajusta opciones, desactiva autoarranques y optimiza el sistema
    4. APP Agent: opera aplicaciones, ejecuta flujos y encadena acciones entre apps
    5. Search Agent: consulta información online, la agrega y aporta fuentes
    6. Browser Agent: extrae datos de páginas, interactúa con la web y procesa información a nivel de página
  • La señal importante no es “que haya 6 nombres”, sino que en los materiales públicos ya aparecen cadenas de tareas muy concretas:

    • el ordenador tarda demasiado en arrancar -> PM lo deriva a Computer Agent
    • ordenar actas de reuniones de varios departamentos -> varios agentes extraen datos, generan una PPT y añaden recordatorios
    • conversión de archivos, revisión de contratos y análisis de hojas de cálculo -> agentes de tipo File / Office se encargan del flujo
  • Si ahora mismo te interesa:

    • en qué se diferencia realmente un agente de escritorio de una IA de chat convencional
    • si el multiagente es marketing o sirve para tareas reales de escritorio
    • si Marvis puede empezar de verdad a encadenar procesos por ti

    entonces esta línea de análisis aporta mucho más que limitarse a preguntar “si conversa bien o no”.

Por qué hablar de “equipo de IA” en Marvis no parece puro marketing

Muchos productos hoy también hablan de:

  • agentes inteligentes
  • multiagente
  • colaboración automática
  • equipos de IA

Pero la mayoría de las veces, después de todos esos términos, lo que te entregan sigue siendo:

  • una caja de chat
  • una lista de sugerencias
  • y el resto lo sigues haciendo tú a mano

Lo que cambia en el material público de Marvis es que intenta volver concreta la idea de “equipo”.

En el tutorial público de Tencent Cloud Developer Community, Marvis 保姆级教程(一)|全网都在找的「AI牛马」到手,别只拿来聊天!, el autor lo describe de manera muy directa:

  • tras instalarlo, el ordenador gana un “equipo de 6 agentes de IA”
  • disponible las 24 horas
  • sin necesidad de aprender flujos de trabajo complejos
  • basta con darle una tarea para que empiece a repartirse el trabajo

Lo valioso de esa descripción no es que “seis personas” suene vistoso, sino que verbaliza el problema más pesado de las tareas de escritorio:

lo más difícil no es un paso concreto, sino quién recibe el siguiente paso y cómo se conecta con el anterior.

Los 6 puestos del tutorial público dejan bastante clara la ruta de Marvis para el escritorio

Los seis roles que aparecen en el tutorial se parecen mucho a un equipo real de oficina:

1. PM Agent

Su trabajo no es ejecutar directamente, sino entender primero tu tarea, dividirla y asignarla.

Eso es clave, porque un usuario real no va a decir:

  • abre la configuración del sistema
  • luego lee determinado registro
  • después decide qué elementos de inicio pueden desactivarse

Lo que dirá normalmente será algo como:

  • mi ordenador arranca muy lento, ayúdame a ver qué programas puedo cerrar

Y el valor de PM Agent es precisamente traducir esa petición en lenguaje natural a algo como:

  • esto es un problema de optimización del sistema
  • primero hay que revisar los elementos de inicio
  • luego pasarlo al agente del sistema
  • y pedir confirmación antes de las acciones delicadas

2. File Agent

Tanto la versión oficial como los tutoriales públicos explican bastante bien este bloque de capacidades:

  • buscar archivos
  • encontrar contenido dentro de archivos
  • entender documentos
  • convertir formatos en lote
  • Word / Excel / PDF / OCR de imágenes

Se parece más a:

un administrador de archivos + un analizador de contenidos

que a un simple “lector de documentos”.

3. Computer Agent

Aquí es donde Marvis más se acerca a un “asistente de IA a nivel de sistema”.

Se encarga de:

  • consultar la configuración del ordenador
  • ajustar opciones del sistema
  • optimizar el arranque
  • limpiar basura del sistema
  • desactivar anuncios y elementos de inicio innecesarios

Es decir, no responde solo “cómo deberías hacerlo”, sino que intenta:

hacer por ti las pequeñas tareas del nivel de sistema.

4. APP Agent

En los tutoriales públicos aparece descrito como un agente capaz de:

  • operar aplicaciones en el ordenador
  • ejecutar flujos
  • coordinar acciones entre varias apps

Esto importa, porque fuera del sistema y de los archivos, una parte enorme del trabajo real de escritorio consiste en:

  • abrir una aplicación concreta
  • pulsar unos botones
  • cambiar a otra aplicación
  • y exportar el resultado

En cuanto la capa de aplicaciones entra en escena, Marvis deja de ser solo un “asistente del sistema” y se acerca más a un ejecutor de procesos.

5. Search Agent

Su papel es:

  • buscar información online
  • agregar información
  • devolver resultados con fuente

La diferencia frente a un modelo convencional es que muchos chats solo “dicen una respuesta”, mientras que un Search Agent pone más peso en:

  • de dónde sale la información
  • si esa respuesta se puede rastrear
  • y si otros agentes pueden reutilizar luego esos resultados

6. Browser Agent

Se parece a una extensión de Search, pero con más sesgo hacia la ejecución:

  • interacción con páginas web
  • extracción de datos web
  • organización de información a nivel de página

Dicho de otro modo, Search sirve más para “encontrar información”; Browser sirve más para “entrar en una web y dejar medio trabajo hecho”.

Escenario 1: lo que más se parece al primer uso real no es una tarea compleja, sino “mi ordenador tarda demasiado en arrancar”

En el tutorial público, el ejemplo más cotidiano no es una gran automatización de oficina, sino este:

Mi ordenador tarda demasiado en arrancar. Ayúdame a ver qué programas puedo desactivar.

Me gusta mucho este ejemplo porque se parece muchísimo a lo primero que un usuario real le diría a una IA de escritorio.

La cadena pública de ejecución que describe el tutorial es esta:

  1. PM Agent recibe la tarea: decide que se trata de una optimización del sistema
  2. Computer Agent escanea: revisa los programas de inicio
  3. Genera un informe en lenguaje humano: explica qué software ralentiza el arranque y qué controladores conviene mantener
  4. Doble confirmación en acciones críticas: antes de desactivar algo, pide permiso

¿Por qué esta parte importa tanto?

Porque deja muy concreta la diferencia entre Marvis y una IA conversacional corriente:

  • no te dice simplemente dónde hacer clic
  • no te lanza un artículo con instrucciones
  • primero analiza, luego valora y solo después te pide confirmación

Esa es una de las diferencias más de fondo entre un agente de escritorio y una IA de preguntas y respuestas:

empieza a entrar en la cadena de ejecución.

Escenario 2: varias actas de reunión -> extracción de decisiones -> generación de PPT -> presentación por la tarde, esto sí se parece a colaboración multiagente

El artículo público Marvis 6 大 Agent 协同实战:以“打工好帮手”为例 ofrece un ejemplo que se parece más a una tarea compleja de oficina que el simple hecho de “desactivar autoarranques”.

La tarea del ejemplo es:

  • ordenar las actas de reuniones de 3 departamentos de la semana pasada
  • extraer decisiones clave
  • generar una presentación en PPT
  • y exponerla en la reunión de las 2 de la tarde

Lo más importante del artículo no es el entregable final, sino la lógica de colaboración que describe:

  • no hay un único agente cargando con todo “a la fuerza”
  • hay reparto entre varios agentes
  • se automatizan la búsqueda de archivos, la extracción de contenido, la generación de la PPT y el recordatorio de la reunión

¿Por qué merece un apartado propio?

Porque cuando “multiagente” no va unido a una cadena de tareas, suena hueco; pero cuando aterriza en un escenario así, se vuelve muy concreto:

  • dónde están los archivos
  • quién los lee primero
  • quién extrae las conclusiones
  • quién genera el material de presentación
  • quién añade el recordatorio final

Es decir, este tipo de caso sí ayuda a demostrar que:

Marvis no solo reparte un gran modelo bajo varios nombres, sino que intenta hacer enrutamiento real de tareas.

Escenario 3: lo que de verdad hace valioso al File Agent no es encontrar un nombre de archivo, sino convertir el trabajo documental en una cadena completa

Imagen pública oficial de conversión de formatos en Marvis

Tanto los tutoriales públicos como el discurso oficial insisten una y otra vez en la misma idea:

quiere absorber de punta a punta las tareas relacionadas con archivos.

Eso incluye:

  • localizar archivos
  • buscarlos por contenido
  • convertir formatos
  • leer documentos
  • entender el contenido

En los tutoriales aparece un ejemplo muy directo:

Convierte 2026年Q1销售数据.xlsx del escritorio a PDF y optimiza la maquetación.

La cadena de ejecución que describen es:

  • un agente de tipo Computer / File localiza el archivo
  • lee el Excel
  • genera el PDF
  • ajusta automáticamente ancho de columnas, encabezados y pies de página
  • y lo guarda de nuevo en el escritorio

Eso deja claro que la ambición del File Agent no es simplemente “leer un archivo”, sino:

cubrir toda la cadena documental, desde localizarlo hasta entregar el resultado.

Si esa cadena se vuelve estable, mucha de la microtarea más molesta de oficina empieza a desaparecer.

Escenario 4: la “interacción en lenguaje humano” oficial, en el fondo, está reduciendo el coste de descomponer tareas para el PM Agent

En el texto público 吊打所有 AI 助手!腾讯王炸 Marvis 上线,免费解锁电脑全智能操控, hay una frase que merece mucha atención:

No hace falta aprender instrucciones profesionales ni explorar funciones complejas; con una sola petición en lenguaje cotidiano ayuda al usuario a resolver operaciones tediosas.

Si la traducimos a lenguaje llano, en realidad significa esto:

PM Agent tiene que ser lo bastante fuerte como para ahorrarle al usuario una capa entera de aprendizaje.

Porque la mayoría de la gente no quiere aprender:

  • qué agente debería usar
  • qué tarea pertenece al navegador
  • qué parte pertenece a archivos
  • cuándo conviene pasar antes por el sistema que por la aplicación

Solo quieren decir:

  • mi ordenador va lentísimo
  • ayúdame a recuperar ese archivo
  • pásame este material a documento
  • busca información y redacta un esquema

Si Marvis quiere funcionar de verdad, la capa PM tiene que encargarse de dividir correctamente el trabajo por ellos.

El sistema público de “1+5 agentes colaborativos” muestra que la apuesta real es construir una capa intermedia de tareas

El mismo artículo 2671890 también usa una formulación más útil desde el punto de vista de arquitectura:

  • un agente principal (orquestación)
  • 5 agentes especializados

Eso indica que la ruta de Marvis no es fabricar por separado:

  • una herramienta de archivos
  • un mayordomo del sistema
  • una extensión de navegador

Sino intentar convertirse en:

una capa intermedia del sistema

¿Qué significa eso?

Que el usuario le da un objetivo y la herramienta decide:

  • a dónde ir primero
  • qué leer
  • cómo cambiar de contexto
  • y dónde devolver el resultado

Si esa capa funciona, su valor deja de ser solo “un asistente con muchas funciones” y pasa a ser:

un distribuidor de tareas de escritorio.

Por qué esta línea tiene más valor productivo que la típica “IA de chat”

Para mí, el valor real de este sistema 6 Agent / 1+5 de Marvis es que apunta justo a la parte más cansada del entorno productivo de escritorio:

  • demasiados archivos
  • pasos demasiado fragmentados
  • aplicaciones demasiado dispersas
  • usuarios que no quieren aprender flujos

Una IA de chat puede darte sugerencias al lado, pero le cuesta mucho resolver por ti:

  • qué aplicación usar
  • dónde están los datos
  • cómo guardar el resultado
  • qué paso necesita confirmación

Si un sistema multiagente es estable, empieza precisamente a encargarse de esas tareas intermedias que nadie quiere hacer, pero todo el mundo acaba haciendo todos los días.

Quién debería probar primero esta línea

Creo que merece la pena mirarlo antes que nadie si encajas en alguno de estos perfiles:

  • personas que trabajan cada día con documentos locales, configuración del sistema y búsquedas web
  • personas que cambian constantemente entre archivos -> web -> documentos -> aplicaciones
  • personas que quieren resolver tareas de escritorio en lenguaje natural sin aprender scripts de automatización complejos
  • personas que quieren repartir una tarea entre varios módulos de IA en lugar de quedarse con una sola caja de chat

Si ahora mismo lo que más te frustra es esto:

  • la IA sabe hablar, pero no sabe hacer
  • archivos, aplicaciones y sistema siguen separados
  • y al final sigues haciendo tú todos los clics

entonces la ruta de “equipo de IA de escritorio” de Marvis merece bastante más atención que “otro chat más”.

Mi valoración final

Si tuviera que resumir este análisis del equipo de 6 agentes de IA de Marvis en una sola frase, sería esta:

Lo más importante de Marvis no es que converse bien, sino que empieza a convertir las tareas de escritorio en el trabajo repartido de un equipo digital.

Lo que ya ha mostrado públicamente no es solo “tener 6 nombres de agente”, sino varias funciones bastante concretas:

  • PM entiende la tarea y la divide
  • File procesa archivos, convierte formatos y lee contenido
  • Computer administra el sistema, cambia ajustes y optimiza
  • Search / Browser sale al mundo web a buscar y capturar información
  • APP conecta la operación sobre aplicaciones con el flujo completo

Si esas divisiones de trabajo consiguen coordinarse de forma estable, su significado ya no será:

la IA te ayuda a responder preguntas

sino:

la IA empieza a ejecutar por ti una parte del flujo de trabajo de escritorio

Si ahora mismo te interesa más:

  • la ruta actual de acceso
  • los modelos y precios
  • la compra de API Key
  • los tutoriales de uso

puedes empezar por aquí:

FAQ

¿Qué roles forman exactamente el “equipo de 6 agentes de IA” de Marvis?

En los tutoriales públicos, la lista más habitual es:

  • PM Agent
  • File Agent
  • Computer Agent
  • APP Agent
  • Search Agent
  • Browser Agent

En otros textos públicos aparece la misma idea formulada como “sistema colaborativo 1+5”: un agente principal orquesta y varios agentes especializados ejecutan.

¿Cuál es la mayor diferencia entre Marvis y una IA de chat convencional?

La mayor diferencia no está en el estilo de respuesta, sino en que intenta entrar en:

  • la configuración del sistema
  • los archivos locales
  • la operación de aplicaciones
  • la interacción con páginas web

Es decir, empieza a moverse del terreno de “responder” al terreno de “ejecutar”.

¿Cuál es la cadena de tareas más representativa en los tutoriales públicos?

Un ejemplo muy típico es este:

  • el ordenador arranca demasiado lento
  • PM lo identifica como una tarea de optimización del sistema
  • Computer Agent revisa los elementos de inicio
  • genera recomendaciones
  • y antes de desactivar algo importante vuelve a pedir confirmación

¿Cuál es el ejemplo de colaboración multiagente que más se parece al trabajo real de oficina?

En los casos públicos, uno de los ejemplos más representativos es:

  • ordenar actas de varios departamentos
  • extraer decisiones clave
  • generar una PPT
  • y añadir el recordatorio de la reunión

Eso se parece mucho más a una tarea de escritorio real que una simple pregunta-respuesta de una sola ronda.

Si quiero empezar por la información pública actual de Marvis, ¿por dónde debería mirar?

Estas tres páginas son el punto de partida más directo:

Referencias