返回部落格列表

騰訊 Marvis 多模態案例拆解:圖片、語音、影片、文件為什麼開始整合到同一條 AI 工作流裡?

Marvis騰訊多模態圖像辨識語音輸入影片理解AI 助手

Marvis 多模態公開配圖

如果說前幾篇 Marvis 文章聊的是:

  • 它能不能接管電腦
  • 它能不能讀取本機檔案
  • 它能不能在辦公室裡幫你省時間

那這一篇更想回答一個越來越貼近現實的問題:

當圖片、語音、影片、表格、文件一起進來時,Marvis 能不能把它們收斂成一條真正可執行的工作流?

我重新看了一遍 Marvis 官網,以及騰訊雲開發者社群那篇更偏向「多模態實戰」的公開文章。我的結論先放前面:

Marvis 現在最值得關注的,不只是它會不會看圖,而是它開始把圖像理解、語音輸入、文件生成、圖表輸出,整合成一條更接近真實生產環境的連續任務鏈。

這也是為什麼我覺得,Marvis 真正的競爭點,不只是「本機模式」或「遠端控電腦」,而是:

它正在往「多模態桌面工作流入口」這個方向走。

先說結論

  • 截至 2026 年 6 月 29 日,公開資料裡,Marvis 在多模態方向最有說服力的能力,集中在四類任務:
    1. 圖片 / 截圖理解與內容擷取
    2. 語音輸入到文件生成
    3. 圖像 + 文字 + 表格聯合分析
    4. 報告、Word、Excel 圖表的一次性交付
  • Marvis 官網已經明確把多模態相關能力寫進產品定位裡:
    • 搜尋檔案 / 圖片內容
    • 搜尋圖片內文字
    • 文件、表格深度理解
    • 圖表生成
    • 文案潤飾
    • 格式轉換
  • 騰訊雲開發者社群公開稿裡,已經出現比較完整的真實任務鏈,不再只是「問一句答一句」,而是:
    • 看圖辨識
    • 提參數
    • 寫分析
    • 出 Word
    • 做 Excel 圖表

為什麼多模態這件事,比「會聊天」更重要

很多 AI 工具到今天還停留在一個邏輯裡:

  • 你給它一段文字
  • 它回你一段文字

但真實工作裡的輸入,根本不是純文字。

更常見的是:

  • 你拍了一張產品圖
  • 你截了一張後台頁面
  • 你錄了一段會議語音
  • 你丟進來一份長文件和一張表
  • 你還希望它最後給你一個能交付的結果

也就是說,真實工作裡最消耗人的,通常不是「讓模型回答」,而是:

把不同模態的資訊收進來,再拼成一個你真的能拿去用的產物。

而這正是 Marvis 這種系統級助手,最有機會和一般聊天型 AI 拉開差距的地方。

官網公開能力已經把這條線說得很清楚

從 Marvis 官網的公開描述來看,它在多模態方向的目標非常直接:

  • 可以搜尋 檔案 / 圖片內容
  • 可以搜尋 圖片內文字
  • 可以根據人像、主題、地點等維度整理圖庫和文件庫
  • 可以對 文件、表格 做深度理解
  • 支援 圖表生成、文案潤飾、格式轉換

這組能力放在一起,其實已經不是單點功能,而是一條相對完整的多模態鏈:

  • 看內容
  • 找內容
  • 理解內容
  • 生成結果

也就是說,Marvis 在這條線上的野心,不只是「支援圖片輸入」這麼簡單,而是:

讓圖片、文字、文件、表格這些不同輸入,最後匯到一個桌面級任務結果裡。

案例 1:看圖辨識,不只是描述圖片,而是直接提取參數

騰訊雲開發者社群那篇公開稿裡,最能說明問題的實戰案例,是一個:

智慧手錶競品分析報告

它的任務目標不是單輪問答,而是一個很像真實商業工作的交付:

  • 蒐集 3 款競品的圖片和參數
  • 做對比分析
  • 生成 Word 報告
  • 生成 Excel 圖表

這已經不是「幫我看看這張圖是什麼」,而是更接近:

把圖像輸入變成分析任務的一部分。

按公開稿件裡的步驟,第一步就是:

  • 上傳 3 款智慧手錶圖片
  • Marvis 辨識產品並提取關鍵參數

公開結果裡,Marvis 給出的輸出包括:

  • 心率監測
  • 血氧檢測
  • 續航力
  • 價格

這意味著它做的事情不只是圖像描述,而是:

  • 辨識物件
  • 提取結構化欄位
  • 為後續報告和圖表繼續服務

這類能力為什麼重要?因為真實工作裡的圖片,很少只是「看看而已」,更常見的是:

  • 從截圖裡找欄位
  • 從產品圖裡找參數
  • 從圖表裡找趨勢
  • 從頁面裡找關鍵差異

如果只能看圖說話,價值很有限。 但如果能把圖像裡的資訊繼續推進到下一步工作流,那才是真正的生產力。

案例 2:語音輸入,不只是轉文字,而是直接變成文件任務

同一篇多模態公開稿裡,另一個很值得看的例子,是:

  • 使用者直接對著電腦說
  • 「幫我建立一個 Word 文件,標題是『週會紀要』,內容是今天的會議記錄」

按公開稿件的鏈路,Marvis 做的是:

  1. 語音辨識
  2. 理解指令
  3. 呼叫 Office API
  4. 生成桌面上的 Word 文件
  5. 再用語音回饋結果

這和很多人理解的「語音功能」不太一樣。

很多產品說支援語音,其實只是:

  • 把語音轉成文字
  • 再把文字貼進聊天框

Marvis 這裡更像是:

語音只是任務入口,重點是後面真的執行了文件操作。

這對一些真實場景特別有意義:

  • 開會時來不及打字
  • 需要一邊操作一邊下口令
  • 想讓它直接把結果落成檔案

所以在桌面環境裡,語音的價值不是「能說話」,而是:

能不能把語音直接接進系統工作流。

案例 3:真正像生產環境的,是它把「看圖 + 分析 + 出報告 + 做圖表」串成一套

這個智慧手錶競品分析案例之所以適合單獨寫一篇,就是因為它不是單點演示,而是一整條多模態任務鏈。

公開稿件裡,後面的步驟繼續往下走:

第一步:圖像理解

  • 辨識 3 款手錶圖片
  • 提參數

第二步:文字分析

  • 基於參數生成競品對比分析
  • 寫出功能、價格、使用者評價結論

第三步:文件生成

  • 生成標題為「智慧手錶競品分析報告」的 Word
  • 寫入章節、表格、結論

第四步:資料視覺化

  • 建立 Excel
  • 寫入參數和評分
  • 自動生成長條圖、雷達圖

這條鏈為什麼特別重要?

因為它暴露了一個真實的工作模式:

多模態 AI 的價值,不在某個單點能力最炫,而在它能不能把不同模態串成一個最終交付。

這已經很接近真實辦公室或商業分析工作的樣子了:

  • 輸入不是純文字
  • 輸出也不是一句總結
  • 中間還要跨圖像、文字、表格、文件

案例 4:效率對比雖然是公開口徑,但足夠說明它在瞄準什麼

這篇公開稿還給了一個非常典型的效率對比表:

  • 辨識競品圖片:30 分鐘 -> 2 分鐘
  • 生成對比分析:60 分鐘 -> 3 分鐘
  • 生成 Word 報告:45 分鐘 -> 5 分鐘
  • 製作 Excel 圖表:30 分鐘 -> 3 分鐘
  • 總計:165 分鐘 -> 13 分鐘

也就是公開口徑裡的:

12.7 倍效率提升

這種數字你當然不能當成任何團隊都能穩定複現的承諾。 但它至少說明了一件事:

Marvis 在多模態方向瞄準的,不是「更像人一樣閒聊」,而是:

把原本分散在多個工具裡的操作,盡量壓進一條連續工作流。

截圖、圖片內文字、圖表,這條線比一般 OCR 更接近桌面使用

Marvis 官網裡另一個很關鍵的點,是它明確提到:

  • 搜圖片內容
  • 搜圖片內文字
  • 支援 AI 圖庫、AI 文件庫

這件事為什麼不能簡單理解成「有 OCR」?

因為真正的桌面工作裡,你碰到的圖片通常不是孤立的掃描件,而是:

  • 後台截圖
  • 產品海報
  • 表格截圖
  • 聊天記錄截圖
  • 方案頁截圖

很多時候你要的不是「把文字讀出來」,而是:

  • 這張圖裡在講什麼
  • 關鍵參數在哪裡
  • 跟別的資料對不對得上
  • 能不能繼續拿去做後續分析

這就是為什麼我覺得它更接近:

截圖問答 + 內容理解 + 任務推進

而不只是傳統意義上的 OCR 工具。

影片理解這條線,現在更像能力預告,而不是完全展開的生產案例

從公開的多模態文章和官網口徑來看,Marvis 現在已經把 影片 列進多模態能力敘事裡了。

但和圖片、語音、文件、表格相比,影片方向的公開生產案例還沒有那麼完整。

現階段能比較穩地確認的是,它在產品敘事上已經把影片納入下面這種能力框架:

  • 影片作為輸入模態之一
  • 可以做內容摘要
  • 可以做行為或內容分析

但如果你問我,今天 Marvis 最值得先實測的是哪條線,我還是會把優先級放在:

  1. 圖片 / 截圖理解
  2. 語音 -> 文件
  3. 圖像 + 報告 + 圖表聯動

因為這些部分,公開資料已經更接近真實工作流,而不是概念展示。

它現在最適合哪些團隊先試

適合馬上試的人

  • 經常做競品分析、產品分析的人
  • 需要把圖片、文件、表格一起處理的營運 / 商業分析 / 研究職位
  • 經常整理會議錄音、語音備忘的人
  • 需要做圖文混合材料分析的人
  • 想把截圖、文件、表格都收進同一個桌面工作流的人

可以先觀望的人

  • 只做純文字聊天,不碰圖片和檔案
  • 工作裡幾乎不需要圖像或語音輸入
  • 更關注模型閒聊體驗,而不是任務閉環
  • 還沒有真實多模態資料處理需求的人

如果你想自己測,我建議這樣測

  1. 不要先問「它懂不懂圖片」,直接給真實任務。
  2. 最適合先試的切口通常是:
    • 截圖問答
    • 產品圖參數提取
    • 會議語音轉 Word
    • 圖像輸入 + 報告生成
    • 表格 + 文件 + 圖表聯動
  3. 不只看答案像不像人,重點看:
    • 模態切換是否順暢
    • 能不能少複製貼上
    • 最終文件是否真的能交付
    • 中間是否減少了人工搬運
  4. 如果你本來就在評估桌面 AI,也可以順手比較:
    • Marvis 更適合哪些多模態桌面任務
    • 哪些任務繼續交給專業 OCR、剪輯、報表工具來做更穩

如果你現在更關心的是:怎樣把騰訊系、GLM、Kimi、DeepSeek、StepFun 等模型統一接進自己的多模態工作流,可以先看:

最後結論

如果只用一句話總結我對 Marvis 多模態方向的判斷,那就是:

它真正有意思的,不是「支援圖片和語音」這件事本身,而是它開始把圖片、語音、文件、表格往一條桌面級任務鏈裡收。

這件事一旦做順,價值就不再是:

  • 看一張圖
  • 聽一段語音
  • 總結一句話

而是更接近:

  • 看圖提參數
  • 語音下任務
  • 寫報告
  • 出圖表
  • 交付檔案

也就是說,Marvis 這條線最值得測的,不是「多模態炫技」,而是:

它能不能把多模態輸入真的變成多模態工作流。

參考資料