騰訊 Marvis 多模態案例拆解:圖片、語音、影片、文件為什麼開始整合到同一條 AI 工作流裡?

如果說前幾篇 Marvis 文章聊的是:
- 它能不能接管電腦
- 它能不能讀取本機檔案
- 它能不能在辦公室裡幫你省時間
那這一篇更想回答一個越來越貼近現實的問題:
當圖片、語音、影片、表格、文件一起進來時,Marvis 能不能把它們收斂成一條真正可執行的工作流?
我重新看了一遍 Marvis 官網,以及騰訊雲開發者社群那篇更偏向「多模態實戰」的公開文章。我的結論先放前面:
Marvis 現在最值得關注的,不只是它會不會看圖,而是它開始把圖像理解、語音輸入、文件生成、圖表輸出,整合成一條更接近真實生產環境的連續任務鏈。
這也是為什麼我覺得,Marvis 真正的競爭點,不只是「本機模式」或「遠端控電腦」,而是:
它正在往「多模態桌面工作流入口」這個方向走。
先說結論
- 截至 2026 年 6 月 29 日,公開資料裡,
Marvis在多模態方向最有說服力的能力,集中在四類任務:- 圖片 / 截圖理解與內容擷取
- 語音輸入到文件生成
- 圖像 + 文字 + 表格聯合分析
- 報告、Word、Excel 圖表的一次性交付
- Marvis 官網已經明確把多模態相關能力寫進產品定位裡:
- 搜尋檔案 / 圖片內容
- 搜尋圖片內文字
- 文件、表格深度理解
- 圖表生成
- 文案潤飾
- 格式轉換
- 騰訊雲開發者社群公開稿裡,已經出現比較完整的真實任務鏈,不再只是「問一句答一句」,而是:
- 看圖辨識
- 提參數
- 寫分析
- 出 Word
- 做 Excel 圖表
為什麼多模態這件事,比「會聊天」更重要
很多 AI 工具到今天還停留在一個邏輯裡:
- 你給它一段文字
- 它回你一段文字
但真實工作裡的輸入,根本不是純文字。
更常見的是:
- 你拍了一張產品圖
- 你截了一張後台頁面
- 你錄了一段會議語音
- 你丟進來一份長文件和一張表
- 你還希望它最後給你一個能交付的結果
也就是說,真實工作裡最消耗人的,通常不是「讓模型回答」,而是:
把不同模態的資訊收進來,再拼成一個你真的能拿去用的產物。
而這正是 Marvis 這種系統級助手,最有機會和一般聊天型 AI 拉開差距的地方。
官網公開能力已經把這條線說得很清楚
從 Marvis 官網的公開描述來看,它在多模態方向的目標非常直接:
- 可以搜尋 檔案 / 圖片內容
- 可以搜尋 圖片內文字
- 可以根據人像、主題、地點等維度整理圖庫和文件庫
- 可以對 文件、表格 做深度理解
- 支援 圖表生成、文案潤飾、格式轉換
這組能力放在一起,其實已經不是單點功能,而是一條相對完整的多模態鏈:
- 看內容
- 找內容
- 理解內容
- 生成結果
也就是說,Marvis 在這條線上的野心,不只是「支援圖片輸入」這麼簡單,而是:
讓圖片、文字、文件、表格這些不同輸入,最後匯到一個桌面級任務結果裡。
案例 1:看圖辨識,不只是描述圖片,而是直接提取參數
騰訊雲開發者社群那篇公開稿裡,最能說明問題的實戰案例,是一個:
智慧手錶競品分析報告
它的任務目標不是單輪問答,而是一個很像真實商業工作的交付:
- 蒐集
3款競品的圖片和參數 - 做對比分析
- 生成
Word報告 - 生成
Excel圖表
這已經不是「幫我看看這張圖是什麼」,而是更接近:
把圖像輸入變成分析任務的一部分。
按公開稿件裡的步驟,第一步就是:
- 上傳
3款智慧手錶圖片 - 讓
Marvis辨識產品並提取關鍵參數
公開結果裡,Marvis 給出的輸出包括:
- 心率監測
- 血氧檢測
- 續航力
- 價格
這意味著它做的事情不只是圖像描述,而是:
- 辨識物件
- 提取結構化欄位
- 為後續報告和圖表繼續服務
這類能力為什麼重要?因為真實工作裡的圖片,很少只是「看看而已」,更常見的是:
- 從截圖裡找欄位
- 從產品圖裡找參數
- 從圖表裡找趨勢
- 從頁面裡找關鍵差異
如果只能看圖說話,價值很有限。 但如果能把圖像裡的資訊繼續推進到下一步工作流,那才是真正的生產力。
案例 2:語音輸入,不只是轉文字,而是直接變成文件任務
同一篇多模態公開稿裡,另一個很值得看的例子,是:
- 使用者直接對著電腦說
- 「幫我建立一個 Word 文件,標題是『週會紀要』,內容是今天的會議記錄」
按公開稿件的鏈路,Marvis 做的是:
- 語音辨識
- 理解指令
- 呼叫 Office API
- 生成桌面上的 Word 文件
- 再用語音回饋結果
這和很多人理解的「語音功能」不太一樣。
很多產品說支援語音,其實只是:
- 把語音轉成文字
- 再把文字貼進聊天框
但 Marvis 這裡更像是:
語音只是任務入口,重點是後面真的執行了文件操作。
這對一些真實場景特別有意義:
- 開會時來不及打字
- 需要一邊操作一邊下口令
- 想讓它直接把結果落成檔案
所以在桌面環境裡,語音的價值不是「能說話」,而是:
能不能把語音直接接進系統工作流。
案例 3:真正像生產環境的,是它把「看圖 + 分析 + 出報告 + 做圖表」串成一套
這個智慧手錶競品分析案例之所以適合單獨寫一篇,就是因為它不是單點演示,而是一整條多模態任務鏈。
公開稿件裡,後面的步驟繼續往下走:
第一步:圖像理解
- 辨識
3款手錶圖片 - 提參數
第二步:文字分析
- 基於參數生成競品對比分析
- 寫出功能、價格、使用者評價結論
第三步:文件生成
- 生成標題為「智慧手錶競品分析報告」的
Word - 寫入章節、表格、結論
第四步:資料視覺化
- 建立
Excel - 寫入參數和評分
- 自動生成長條圖、雷達圖
這條鏈為什麼特別重要?
因為它暴露了一個真實的工作模式:
多模態 AI 的價值,不在某個單點能力最炫,而在它能不能把不同模態串成一個最終交付。
這已經很接近真實辦公室或商業分析工作的樣子了:
- 輸入不是純文字
- 輸出也不是一句總結
- 中間還要跨圖像、文字、表格、文件
案例 4:效率對比雖然是公開口徑,但足夠說明它在瞄準什麼
這篇公開稿還給了一個非常典型的效率對比表:
- 辨識競品圖片:
30分鐘 ->2分鐘 - 生成對比分析:
60分鐘 ->3分鐘 - 生成
Word報告:45分鐘 ->5分鐘 - 製作
Excel圖表:30分鐘 ->3分鐘 - 總計:
165分鐘 ->13分鐘
也就是公開口徑裡的:
約 12.7 倍效率提升
這種數字你當然不能當成任何團隊都能穩定複現的承諾。 但它至少說明了一件事:
Marvis 在多模態方向瞄準的,不是「更像人一樣閒聊」,而是:
把原本分散在多個工具裡的操作,盡量壓進一條連續工作流。
截圖、圖片內文字、圖表,這條線比一般 OCR 更接近桌面使用
Marvis 官網裡另一個很關鍵的點,是它明確提到:
- 搜圖片內容
- 搜圖片內文字
- 支援 AI 圖庫、AI 文件庫
這件事為什麼不能簡單理解成「有 OCR」?
因為真正的桌面工作裡,你碰到的圖片通常不是孤立的掃描件,而是:
- 後台截圖
- 產品海報
- 表格截圖
- 聊天記錄截圖
- 方案頁截圖
很多時候你要的不是「把文字讀出來」,而是:
- 這張圖裡在講什麼
- 關鍵參數在哪裡
- 跟別的資料對不對得上
- 能不能繼續拿去做後續分析
這就是為什麼我覺得它更接近:
截圖問答 + 內容理解 + 任務推進
而不只是傳統意義上的 OCR 工具。
影片理解這條線,現在更像能力預告,而不是完全展開的生產案例
從公開的多模態文章和官網口徑來看,Marvis 現在已經把 影片 列進多模態能力敘事裡了。
但和圖片、語音、文件、表格相比,影片方向的公開生產案例還沒有那麼完整。
現階段能比較穩地確認的是,它在產品敘事上已經把影片納入下面這種能力框架:
- 影片作為輸入模態之一
- 可以做內容摘要
- 可以做行為或內容分析
但如果你問我,今天 Marvis 最值得先實測的是哪條線,我還是會把優先級放在:
- 圖片 / 截圖理解
- 語音 -> 文件
- 圖像 + 報告 + 圖表聯動
因為這些部分,公開資料已經更接近真實工作流,而不是概念展示。
它現在最適合哪些團隊先試
適合馬上試的人
- 經常做競品分析、產品分析的人
- 需要把圖片、文件、表格一起處理的營運 / 商業分析 / 研究職位
- 經常整理會議錄音、語音備忘的人
- 需要做圖文混合材料分析的人
- 想把截圖、文件、表格都收進同一個桌面工作流的人
可以先觀望的人
- 只做純文字聊天,不碰圖片和檔案
- 工作裡幾乎不需要圖像或語音輸入
- 更關注模型閒聊體驗,而不是任務閉環
- 還沒有真實多模態資料處理需求的人
如果你想自己測,我建議這樣測
- 不要先問「它懂不懂圖片」,直接給真實任務。
- 最適合先試的切口通常是:
- 截圖問答
- 產品圖參數提取
- 會議語音轉 Word
- 圖像輸入 + 報告生成
- 表格 + 文件 + 圖表聯動
- 不只看答案像不像人,重點看:
- 模態切換是否順暢
- 能不能少複製貼上
- 最終文件是否真的能交付
- 中間是否減少了人工搬運
- 如果你本來就在評估桌面 AI,也可以順手比較:
Marvis更適合哪些多模態桌面任務- 哪些任務繼續交給專業 OCR、剪輯、報表工具來做更穩
如果你現在更關心的是:怎樣把騰訊系、GLM、Kimi、DeepSeek、StepFun 等模型統一接進自己的多模態工作流,可以先看:
最後結論
如果只用一句話總結我對 Marvis 多模態方向的判斷,那就是:
它真正有意思的,不是「支援圖片和語音」這件事本身,而是它開始把圖片、語音、文件、表格往一條桌面級任務鏈裡收。
這件事一旦做順,價值就不再是:
- 看一張圖
- 聽一段語音
- 總結一句話
而是更接近:
- 看圖提參數
- 語音下任務
- 寫報告
- 出圖表
- 交付檔案
也就是說,Marvis 這條線最值得測的,不是「多模態炫技」,而是:
它能不能把多模態輸入真的變成多模態工作流。