Phân tích case multimodal của Tencent Marvis: vì sao hình ảnh, giọng nói, video và tài liệu đang bắt đầu hội tụ vào cùng một workflow AI?

Nếu vài bài Marvis trước chủ yếu nói về:
- nó có thể tiếp quản máy tính hay không
- nó có thể đọc file cục bộ hay không
- nó có thể giúp bạn tiết kiệm thời gian trong môi trường văn phòng hay không
thì bài này muốn trả lời một câu hỏi đang ngày càng thực tế hơn:
Khi hình ảnh, giọng nói, video, bảng biểu và tài liệu cùng đổ vào một lúc, Marvis có gom chúng thành một workflow thật sự có thể chạy được hay không?
Tôi đã đọc lại website chính thức của Marvis, đồng thời xem lại bài viết công khai thiên về "thực chiến multimodal" trên Tencent Cloud Developer Community. Kết luận của tôi nói trước:
Điểm đáng chú ý nhất của Marvis lúc này không chỉ là nó có biết nhìn ảnh hay không, mà là nó bắt đầu gom hiểu hình ảnh, nhập liệu giọng nói, tạo tài liệu và xuất biểu đồ thành một chuỗi nhiệm vụ liên tục, gần với môi trường làm việc thật hơn.
Đó cũng là lý do tôi cho rằng lợi thế cạnh tranh thực sự của Marvis không chỉ nằm ở "local mode" hay "điều khiển máy tính từ xa", mà ở hướng đi lớn hơn:
nó đang tiến tới vai trò cổng vào cho workflow desktop multimodal.
Kết luận trước
- Tính đến ngày 29 tháng 6 năm 2026, trong các tài liệu công khai, năng lực multimodal thuyết phục nhất của
Marvistập trung ở bốn nhóm tác vụ:- Hiểu hình ảnh / ảnh chụp màn hình và trích xuất nội dung
- Nhập giọng nói rồi tạo tài liệu trực tiếp
- Phân tích kết hợp hình ảnh + văn bản + bảng biểu
- Bàn giao một lần báo cáo, Word và biểu đồ Excel
- Website chính thức của Marvis đã đưa rõ các năng lực liên quan đến multimodal vào thông điệp sản phẩm:
- tìm kiếm file / nội dung hình ảnh
- tìm kiếm chữ trong ảnh
- hiểu sâu tài liệu và bảng biểu
- tạo biểu đồ
- trau chuốt nội dung
- chuyển đổi định dạng
- Trong bài công khai trên Tencent Cloud Developer Community, chuỗi tác vụ đã khá hoàn chỉnh, không còn là kiểu "hỏi một câu trả một câu" nữa, mà là:
- nhận diện hình ảnh
- trích tham số
- viết phân tích
- xuất Word
- làm biểu đồ Excel
Vì sao multimodal lại quan trọng hơn chỉ "biết chat"
Nhiều công cụ AI đến hôm nay vẫn dừng ở cùng một logic:
- bạn đưa cho nó một đoạn văn bản
- nó trả lại cho bạn một đoạn văn bản
Nhưng đầu vào của công việc thực tế hiếm khi chỉ là văn bản thuần.
Thứ thường gặp hơn là:
- bạn chụp một tấm ảnh sản phẩm
- bạn chụp màn hình một trang backend
- bạn ghi âm một đoạn họp
- bạn ném vào một tài liệu dài kèm một bảng biểu
- và cuối cùng bạn còn muốn nó trả lại một kết quả có thể giao việc thật sự
Nói cách khác, thứ tốn sức nhất trong công việc thực tế thường không phải là "bắt mô hình trả lời", mà là:
gom thông tin từ nhiều modal khác nhau rồi ráp chúng thành một đầu ra mà bạn thật sự dùng được.
Và đó chính là nơi một trợ lý cấp hệ thống như Marvis có cơ hội tạo khoảng cách với AI chat thông thường.
Website chính thức đã nói rất rõ hướng đi này
Từ mô tả công khai trên website Marvis, mục tiêu multimodal của nó rất trực diện:
- có thể tìm kiếm file / nội dung hình ảnh
- có thể tìm kiếm chữ bên trong hình ảnh
- có thể tổ chức thư viện ảnh và thư viện tài liệu theo chân dung, chủ đề, địa điểm và các chiều dữ liệu khác
- có thể hiểu sâu tài liệu, bảng biểu
- hỗ trợ tạo biểu đồ, chỉnh văn phong, chuyển đổi định dạng
Đặt các năng lực này cạnh nhau, nó không còn là vài tính năng rời rạc nữa mà đã thành một chuỗi multimodal khá hoàn chỉnh:
- nhìn nội dung
- tìm nội dung
- hiểu nội dung
- tạo kết quả
Nói cách khác, tham vọng của Marvis trên hướng này không chỉ là "hỗ trợ đầu vào bằng hình ảnh", mà là:
để hình ảnh, văn bản, tài liệu và bảng biểu cuối cùng cùng hội tụ vào một kết quả tác vụ cấp desktop.
Case 1: Nhìn ảnh không chỉ để mô tả mà là trích tham số ngay
Case thực chiến đáng chú ý nhất trong bài công khai trên Tencent Cloud Developer Community là một bài toán:
báo cáo phân tích đối thủ cho đồng hồ thông minh
Mục tiêu của tác vụ này không phải hỏi đáp một lượt, mà là một đầu ra rất giống công việc thương mại ngoài đời:
- thu thập ảnh và thông số của
3mẫu đối thủ - làm phân tích so sánh
- tạo báo cáo
Word - tạo biểu đồ
Excel
Đây đã không còn là kiểu "giúp tôi xem bức ảnh này là gì", mà gần hơn với:
biến đầu vào là hình ảnh thành một phần của tác vụ phân tích.
Theo các bước trong bài công khai, bước đầu tiên là:
- tải lên ảnh của
3mẫu đồng hồ thông minh - để
Marvisnhận diện sản phẩm và trích xuất tham số chính
Trong kết quả công khai, đầu ra của Marvis bao gồm:
- đo nhịp tim
- đo SpO2
- thời lượng pin
- giá bán
Điều đó có nghĩa là thứ nó làm không chỉ là mô tả ảnh, mà là:
- nhận diện đối tượng
- trích xuất trường dữ liệu có cấu trúc
- tiếp tục phục vụ báo cáo và biểu đồ ở các bước sau
Vì sao loại năng lực này quan trọng? Bởi ảnh trong công việc thực tế hiếm khi chỉ để "xem cho biết", mà thường là:
- tìm trường dữ liệu trong ảnh chụp màn hình
- tìm tham số trong ảnh sản phẩm
- tìm xu hướng trong biểu đồ
- tìm khác biệt chính trong một trang giao diện
Nếu chỉ dừng ở mô tả ảnh bằng lời, giá trị sẽ khá hạn chế. Nhưng nếu thông tin trong ảnh có thể được đẩy tiếp sang bước làm việc tiếp theo, đó mới là năng suất thực sự.
Case 2: Nhập liệu bằng giọng nói không chỉ là speech-to-text mà thành luôn tác vụ tài liệu
Trong cùng bài multimodal công khai đó, một ví dụ khác rất đáng xem là:
- người dùng nói trực tiếp với máy tính
- "Hãy tạo giúp tôi một tài liệu Word, tiêu đề là 'Biên bản họp tuần', nội dung là ghi chép cuộc họp hôm nay"
Theo workflow được công khai, thứ Marvis làm là:
- nhận diện giọng nói
- hiểu chỉ lệnh
- gọi Office API
- tạo tài liệu Word trên desktop
- phản hồi kết quả lại bằng giọng nói
Điều này khác khá nhiều với cách nhiều người vẫn hiểu về "tính năng giọng nói".
Rất nhiều sản phẩm nói rằng hỗ trợ giọng nói, nhưng thực tế chỉ là:
- chuyển giọng nói thành văn bản
- rồi dán phần văn bản đó vào khung chat
Còn ở đây, Marvis giống hơn với:
giọng nói chỉ là cửa vào của tác vụ, trọng điểm nằm ở việc phía sau nó thật sự thực thi thao tác trên tài liệu.
Điều này đặc biệt có ý nghĩa trong vài bối cảnh thực tế:
- đang họp nên không kịp gõ
- cần vừa thao tác vừa ra lệnh bằng lời
- muốn nó trực tiếp hạ kết quả thành file
Vì vậy trong môi trường desktop, giá trị của giọng nói không phải là "có thể nói chuyện", mà là:
nó có nối được giọng nói thẳng vào workflow hệ thống hay không.
Case 3: Điều giống môi trường sản xuất thật là nó nối "xem ảnh + phân tích + ra báo cáo + làm biểu đồ" thành một chuỗi
Case phân tích đối thủ cho đồng hồ thông minh này đáng được tách riêng thành một bài cũng vì nó không phải màn demo một điểm, mà là cả một chuỗi tác vụ multimodal.
Trong bài công khai, các bước phía sau tiếp tục đi xuống như sau:
Bước 1: Hiểu hình ảnh
- nhận diện ảnh của
3mẫu đồng hồ - trích tham số
Bước 2: Phân tích văn bản
- tạo phần phân tích đối thủ dựa trên tham số
- viết ra kết luận về tính năng, giá cả và đánh giá người dùng
Bước 3: Tạo tài liệu
- tạo
Wordvới tiêu đề "Báo cáo phân tích đối thủ đồng hồ thông minh" - ghi vào các chương mục, bảng biểu và kết luận
Bước 4: Trực quan hóa dữ liệu
- tạo
Excel - ghi tham số và điểm số
- tự động sinh biểu đồ cột và biểu đồ radar
Vì sao chuỗi này đặc biệt quan trọng?
Bởi nó phơi bày một mô hình làm việc rất thật:
giá trị của AI multimodal không nằm ở chỗ một năng lực đơn lẻ có hào nhoáng đến đâu, mà ở việc nó có nối được nhiều modal thành một đầu ra hoàn chỉnh hay không.
Nó đã khá gần với hình dạng của công việc văn phòng hay phân tích thương mại ngoài đời:
- đầu vào không phải văn bản thuần
- đầu ra cũng không phải một câu tóm tắt
- ở giữa còn phải đi qua hình ảnh, văn bản, bảng biểu và tài liệu
Case 4: Bảng so sánh hiệu suất tuy vẫn là thông điệp công khai, nhưng đủ cho thấy nó đang nhắm tới điều gì
Bài công khai đó còn đưa ra một bảng so sánh hiệu suất rất điển hình:
- nhận diện ảnh đối thủ:
30phút ->2phút - tạo phân tích so sánh:
60phút ->3phút - tạo báo cáo
Word:45phút ->5phút - làm biểu đồ
Excel:30phút ->3phút - tổng cộng:
165phút ->13phút
Tức là theo cách diễn đạt công khai:
hiệu suất tăng khoảng 12.7 lần
Đương nhiên, bạn không thể xem con số này như một cam kết rằng team nào cũng tái hiện ổn định được đúng như vậy. Nhưng ít nhất nó nói lên một việc:
điều Marvis nhắm tới ở hướng multimodal không phải là "chat nhàn rỗi giống người hơn", mà là:
cố gắng nén những thao tác vốn bị phân tán ở nhiều công cụ về một workflow liên tục hơn.
Ảnh chụp màn hình, chữ trong ảnh, biểu đồ: hướng này gần desktop workflow hơn OCR thông thường
Một điểm rất đáng chú ý khác trên website Marvis là nó nêu rõ:
- tìm nội dung hình ảnh
- tìm chữ trong hình ảnh
- hỗ trợ AI image library, AI document library
Vì sao không nên hiểu đơn giản chuyện này là "có OCR"?
Bởi trong công việc desktop thực tế, những tấm ảnh bạn gặp thường không phải bản scan đứng riêng lẻ, mà là:
- ảnh chụp màn hình backend
- poster sản phẩm
- ảnh chụp bảng biểu
- ảnh chụp đoạn chat
- ảnh chụp màn hình trang phương án
Rất nhiều lúc, thứ bạn cần không phải chỉ là "đọc chữ ra", mà là:
- bức ảnh này đang nói gì
- tham số chính nằm ở đâu
- nó có khớp với tài liệu khác hay không
- có thể tiếp tục dùng nó cho phân tích bước sau hay không
Đó là lý do tôi thấy nó gần hơn với:
hỏi đáp trên ảnh chụp màn hình + hiểu nội dung + đẩy tiếp tác vụ
chứ không chỉ là một công cụ OCR theo nghĩa truyền thống.
Hướng hiểu video lúc này giống một tín hiệu năng lực hơn là case sản xuất đã mở hoàn toàn
Từ bài multimodal công khai và thông điệp trên website chính thức, có thể thấy Marvis đã đưa video vào câu chuyện năng lực multimodal của mình.
Nhưng so với hình ảnh, giọng nói, tài liệu và bảng biểu, các case sản xuất công khai ở hướng video hiện vẫn chưa hoàn chỉnh bằng.
Ở giai đoạn này, điều có thể xác nhận tương đối chắc là trong câu chuyện sản phẩm, video đã được đặt vào khung năng lực kiểu như:
- video là một trong các modal đầu vào
- có thể dùng để tóm tắt nội dung
- có thể dùng để phân tích hành vi hoặc nội dung
Nhưng nếu hỏi tôi hôm nay nên ưu tiên thực đo hướng nào của Marvis, tôi vẫn sẽ xếp thứ tự:
- hiểu hình ảnh / ảnh chụp màn hình
- giọng nói -> tài liệu
- liên động hình ảnh + báo cáo + biểu đồ
Vì ở các phần này, tài liệu công khai đã gần với workflow thật hơn là một màn trình diễn ý tưởng.
Hiện tại phù hợp để team nào thử trước
Phù hợp để thử ngay
- những người thường xuyên làm phân tích đối thủ, phân tích sản phẩm
- các vai trò vận hành / business analyst / nghiên cứu phải xử lý đồng thời ảnh, tài liệu và bảng biểu
- những người thường xuyên xử lý ghi âm cuộc họp hoặc voice memo
- các team cần phân tích tài liệu trộn giữa hình và chữ
- những ai muốn gom ảnh chụp màn hình, tài liệu và bảng biểu vào cùng một workflow desktop
Có thể quan sát thêm
- những người chỉ chat bằng văn bản thuần, gần như không đụng tới ảnh hay file
- công việc hầu như không cần đầu vào bằng hình ảnh hoặc giọng nói
- những người quan tâm nhiều hơn tới trải nghiệm chat của mô hình thay vì vòng khép kín của tác vụ
- những ai hiện chưa có nhu cầu xử lý dữ liệu multimodal thật sự
Nếu muốn tự test, tôi khuyên nên test như này
- Đừng bắt đầu bằng câu hỏi "nó có hiểu ảnh hay không", hãy đưa thẳng một tác vụ thật.
- Điểm vào phù hợp nhất để thử đầu tiên thường là:
- hỏi đáp trên ảnh chụp màn hình
- trích tham số từ ảnh sản phẩm
- chuyển giọng nói cuộc họp thành Word
- đầu vào hình ảnh + tạo báo cáo
- liên động bảng biểu + tài liệu + biểu đồ
- Đừng chỉ nhìn xem câu trả lời có giống người hay không, hãy tập trung vào:
- chuyển modal có mượt không
- có giảm được bước copy paste không
- file đầu ra cuối cùng có thật sự giao được không
- khâu thao tác thủ công ở giữa có giảm đi không
- Nếu bạn vốn đang đánh giá desktop AI, cũng có thể tiện tay so sánh:
Marvishợp hơn với những tác vụ desktop multimodal nào- tác vụ nào vẫn nên để OCR chuyên dụng, công cụ dựng video hay công cụ báo cáo chuyên dụng xử lý thì ổn định hơn
Nếu lúc này điều bạn quan tâm hơn là: làm sao gom các mô hình như Tencent, GLM, Kimi, DeepSeek, StepFun vào cùng workflow multimodal của riêng mình, có thể xem trước:
Kết luận cuối
Nếu chỉ dùng một câu để tóm tắt nhận định của tôi về hướng multimodal của Marvis, thì đó là:
điều thực sự thú vị không phải ở việc "nó hỗ trợ hình ảnh và giọng nói", mà ở chỗ nó bắt đầu gom hình ảnh, giọng nói, tài liệu và bảng biểu vào cùng một chuỗi tác vụ desktop.
Khi chuyện này chạy mượt, giá trị của nó sẽ không còn chỉ là:
- nhìn một tấm ảnh
- nghe một đoạn giọng nói
- tóm tắt một câu
mà sẽ gần hơn với:
- nhìn ảnh để trích tham số
- giao việc bằng giọng nói
- viết báo cáo
- tạo biểu đồ
- bàn giao file
Nói cách khác, hướng này của Marvis đáng test nhất không phải ở phần "phô diễn multimodal", mà là:
nó có thật sự biến đầu vào multimodal thành workflow multimodal hay không.