Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Quay lại blog

Ra mắt mô hình toàn phương thức Qwen3.8-Omni-Flash: năng lực, API và hướng dẫn Agent âm thanh-video

Qwen3.8-Omni-Flashmô hình toàn phương thứcAPI đa phương thứcAgent âm thanh-videoQwen API

Mô hình toàn phương thức Qwen3.8-Omni-Flash đã chính thức ra mắt. Mô hình này đưa văn bản, hình ảnh, âm thanh và video vào cùng một quy trình Agent, với mục tiêu không chỉ là “hiểu nội dung”, mà là tiến từ hiểu tư liệu, lập kế hoạch tác vụ, gọi công cụ cho đến bàn giao kết quả. Với các nhà phát triển cần xử lý video dài, ghi âm cuộc họp, video âm nhạc và tư liệu phim ảnh, trọng tâm của lần phát hành này là Agent âm thanh-video, chứ không phải thêm một mô hình đa phương thức chỉ biết hội thoại.

Bài viết này được biên soạn dựa trên tài liệu do tài khoản chính thức Qwen Large Model công bố; hình minh họa giữ lại các ảnh phát hành và ảnh demo trong bài gốc. Các số liệu đánh giá trong bài là kết quả do phía chính thức công bố, không phải phép kiểm thử độc lập của trang này. Việc mô hình đã xuất hiện trong danh mục của trang này hay chưa, hệ số thực tế và cách tính phí sẽ căn cứ theo giá mô hình theo thời gian thực và hóa đơn thực tế.

Mô hình toàn phương thức Qwen3.8-Omni-Flash và các kịch bản ứng dụng trong môi trường production

Qwen3.8-Omni-Flash hỗ trợ những đầu vào nào?

Hạng mục Thông tin trong tài liệu phát hành
Tên mô hình Qwen3.8-Omni-Flash
Phương thức đầu vào Văn bản, hình ảnh, âm thanh, video
Ngữ cảnh Tối đa 1M Tokens
Trọng tâm Agent âm thanh-video, lập trình, công việc tri thức văn bản, thao tác GUI
Tác vụ dài hạn Hiểu âm thanh-video dài, biên bản họp và việc cần làm, báo cáo nghiên cứu video, sáng tạo nội dung
Công cụ đi kèm Qwen-MM-Plugins, Qwen-Live Harness

ID mô hình API thực tế, giao thức, giới hạn ngữ cảnh và phạm vi khả dụng theo khu vực cần căn cứ theo tài liệu hiện tại của nhà cung cấp dịch vụ. Đừng giả định rằng mọi gateway tương thích đều đã hỗ trợ âm thanh, video và phản hồi công cụ chỉ vì thông cáo phát hành đề cập đến “toàn phương thức”; khi tích hợp, cần xác minh riêng văn bản, hình ảnh, âm thanh, video và gọi công cụ.

Đánh giá chính thức: Agent âm thanh-video và tác vụ dài hạn cải thiện rõ rệt

Theo tài liệu phát hành, trên tổng cộng 30 bài đánh giá, Qwen3.8-Omni-Flash cải thiện trung bình hơn 26% so với thế hệ trước Qwen3.5-Omni-Plus. Một số thay đổi dễ hiểu hơn gồm:

  • WildClawBench-MM tăng 36.5 điểm, tập trung vào Agent âm thanh-video, lập trình và tác vụ dài hạn;
  • AgenticVBench tăng 22.3 điểm;
  • UniClawBench đạt 69.6 điểm;
  • LongAudioSpan tăng 8.3 điểm, OmniVideoBench tăng 9.6 điểm;
  • CSR / ISR của OmniCap-IF lần lượt tăng 8.5 / 14.1 điểm;
  • DER / cpWER của AliMeeting giảm từ 88.11 / 89.61 xuống 3.35 / 17.18.

Các con số này nên được hiểu trong bối cảnh tập kiểm thử, prompt, môi trường công cụ và chỉ số đánh giá. Ví dụ, DER và cpWER là các chỉ số lỗi liên quan đến nhận dạng trong cuộc họp, giảm thường đồng nghĩa với kết quả tốt hơn; trong khi điểm số tăng ở benchmark Agent không thể quy đổi trực tiếp thành tỷ lệ thành công của mọi tác vụ production.

Ngữ cảnh dài không chỉ là “nhét được nhiều video hơn”

Qwen3.8-Omni-Flash hỗ trợ chuỗi dài 1M, nhưng giá trị của ngữ cảnh dài không chỉ nằm ở việc tải lên tệp lớn hơn. Thay đổi thực dụng hơn là mô hình có thể trước tiên quyết định “cần xem gì, nghe gì” dựa trên câu hỏi, rồi thực hiện nhiều vòng kiểm chứng từ thô đến chi tiết trên các đoạn liên quan.

Trong thí nghiệm OmniVideoBench được tài liệu chính thức trích dẫn, Agentic Understanding đã nâng độ chính xác từ 63.4 lên 67.8, đồng thời giảm mức tiêu thụ Token từ 145,736 xuống 79,117, tức giảm khoảng 45.7%. Điều này cho thấy việc chủ động kiểm chứng có thể giảm xử lý lặp lại các đoạn không liên quan, nhưng chi phí thực tế vẫn phụ thuộc vào thời lượng tệp, mã hóa âm thanh-video, vòng lặp công cụ, độ dài đầu ra và phương thức tính phí của nhà cung cấp dịch vụ.

Hình demo Agentic Understanding cho âm thanh-video dài của Qwen3.8-Omni-Flash

Cuộc họp dài: từ ghi chép sang thực thi

Cuộc họp nhiều người đồng thời chứa hình ảnh, âm thanh, phân tách người nói, quan hệ tham chiếu và ngữ cảnh dự án. Tài liệu phát hành cho biết Qwen3.8-Omni-Flash hỗ trợ đầu vào âm thanh-video dài tối đa một giờ, có thể hiểu kết hợp hình ảnh con người và nội dung giọng nói, hoàn thành phân tách người nói, chuyển lời nói thành văn bản và đối chiếu danh tính, rồi tạo biên bản họp, việc cần làm và phân tích rủi ro.

Sau khi tích hợp công cụ, quy trình có thể tiếp tục mở rộng ra bên ngoài, chẳng hạn như gửi email, sắp xếp tác vụ hoặc bắt đầu viết mã theo nhu cầu của cuộc họp. Ở đây cần nghiệm thu tách biệt giữa “đề xuất do mô hình xuất ra” và “thực sự thực thi hành động bên ngoài”: trong môi trường production, cần thiết lập quyền công cụ rõ ràng cho việc gửi thư, ghi tệp, tạo tác vụ và chạy mã.

Nghiên cứu chuyên sâu lấy video làm trung tâm

Khi người dùng đặt câu hỏi cụ thể về video, câu trả lời thường cần kết hợp thêm trang web, hình ảnh, tài liệu và các tư liệu video khác ngoài chính video đó. Qwen3.8-Omni-Flash có thể trước tiên chắt lọc các vấn đề then chốt trong video, sau đó tổ chức tư liệu đa phương thức để hình thành báo cáo nghiên cứu có cả hình ảnh và văn bản. Đối với hướng dẫn, khóa học, demo sản phẩm và tư liệu phim ảnh, cách này gần với quy trình làm việc thực tế hơn so với việc chỉ tạo một đoạn tóm tắt.

Mô tả video có thể kiểm soát: cùng một tư liệu, các nghiệp vụ khác nhau cho kết quả khác nhau

Mô tả video không nên chỉ có một đáp án cố định. Sáng tạo nội dung quan tâm đến tự sự, truy xuất tư liệu quan tâm đến đoạn thời gian, còn quản lý tài sản quan tâm đến nhân vật, cảnh quay, âm thanh và các trường có cấu trúc.

Định vị của Qwen3.8-Omni-Flash là cho phép bên gọi kiểm soát đối tượng mô tả, phạm vi thời gian, mức độ chi tiết thông tin và định dạng đầu ra. Ví dụ, cùng một đoạn tư liệu có thể xuất ra lần lượt:

  1. Tóm tắt cốt truyện ba đoạn dành cho biên tập viên;
  2. Timestamp, nhân vật và hành động chính phục vụ truy xuất;
  3. Metadata JSON cho kho tài sản;
  4. Danh sách người nói, ngôn ngữ và sự kiện âm thanh cho đội phụ đề.

Năng lực dạng này phù hợp hơn khi được thiết kế cùng đầu ra có cấu trúc, công cụ tệp và hệ thống truy xuất, thay vì chỉ xem một đoạn mô tả ngôn ngữ tự nhiên trong cửa sổ chat.

Sơ đồ ứng dụng hiểu âm thanh-video và sản xuất nội dung của Qwen3.8-Omni-Flash

Sản xuất và biên tập âm thanh-video: mô hình, công cụ và môi trường chạy cần được nâng cấp cùng nhau

Agent âm thanh-video dài không chỉ đối mặt với vấn đề năng lực mô hình, mà còn bao gồm lưu trữ tệp, truyền qua mạng, suy luận nhiều vòng, biên tập timeline và bàn giao kết quả. Vì vậy, tài liệu phát hành giới thiệu hai dự án mã nguồn mở đi kèm:

  • Qwen-MM-Plugins: hướng đến nhận thức theo nhu cầu, gọi công cụ và thực thi workflow cho âm thanh-video dài;
  • Qwen-Live Harness: hướng đến môi trường tương tác toàn phương thức theo thời gian thực và liên tục.

Có thể hiểu hai dự án này khác nhau về trọng tâm vận hành: một dự án thiên về tác vụ dài hạn và xử lý tư liệu, dự án còn lại thiên về tương tác thời gian thực. Khi triển khai, cần kiểm tra riêng các phụ thuộc, VRAM, quyền tệp, mạng bên ngoài và phiên bản plugin; đừng viết “kho đã mở nguồn” thành “có thể chạy production cục bộ chỉ bằng một cú nhấp”.

Tích hợp Qwen3.8-Omni-Flash API như thế nào?

Nếu nhà cung cấp dịch vụ đã mở route tương ứng, nên trước tiên dùng một bộ tư liệu nhỏ, không chứa thông tin nhạy cảm để Smoke Test: một ảnh, một đoạn âm thanh vài chục giây, một video ngắn, rồi lần lượt kiểm tra đầu vào, đầu ra, mức dùng Token và thông tin lỗi.

Hình dạng request Chat Completions tương thích điển hình như sau; vui lòng thay model bằng ID chính xác đã được xác nhận trong danh mục mô hình thời gian thực của nhà cung cấp dịch vụ; không đoán trực tiếp tên mô hình:

curl "$BASE_URL/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-omni-flash",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "总结这段素材的主题、说话人和三个关键时间点。"},
        {"type": "input_video", "video_url": {"url": "https://example.com/demo.mp4"}}
      ]
    }],
    "stream": false
  }'

input_video ở trên chỉ dùng để minh họa rằng request đa phương thức cần xác minh riêng định dạng khối nội dung, không có nghĩa là mọi giao diện tương thích đều chấp nhận trường này. Trước khi tích hợp thực tế, cần xem tài liệu của nhà cung cấp dịch vụ và ghi nhận riêng:

  • Giao diện có hỗ trợ video URL, Base64 hoặc file ID hay không;
  • Giới hạn kích thước một tệp, thời lượng, định dạng và timeout tải xuống;
  • Cách tính và giá của Token âm thanh/video;
  • Có hỗ trợ gọi công cụ, đầu ra có cấu trúc và trả về dạng streaming hay không;
  • Retry khi thất bại có bị tính phí lặp lại hay không.

Nếu bạn gọi qua gateway của trang này, trước tiên hãy mở giá mô hình theo thời gian thực, xác nhận ID mô hình, hệ số và năng lực hiện tại, rồi dùng số dư nhỏ để xác minh hóa đơn thực tế. Bài viết trên trang này sẽ không trực tiếp lấy giá phát hành chính thức hoặc giá của nền tảng khác làm báo giá của trang này.

Phù hợp với những kịch bản nào?

1. Dựng video và truy xuất tư liệu

Để mô hình trước tiên định vị cảnh quay, nhân vật, hành động và sự kiện âm thanh, rồi chuyển cho công cụ dựng để cắt thô, làm phụ đề và sắp xếp chương. Khi nghiệm thu, nên so sánh độ chính xác timestamp và tỷ lệ bỏ sót, thay vì chỉ xem phần tóm tắt đọc có trôi chảy hay không.

2. Video âm nhạc và thuyết minh phim ảnh

Mô hình có thể đồng thời hiểu hình ảnh, thoại, âm nhạc và cấu trúc tự sự, sau đó tạo kịch bản, mô tả cảnh quay hoặc bản nháp thuyết minh. Thành phẩm cuối cùng vẫn cần con người kiểm tra bản quyền, sự thật và chất lượng ngôn ngữ.

3. Cuộc họp và công việc tri thức

Video cuộc họp có thể đi vào pipeline chuyển lời nói thành văn bản, nhận dạng người nói, biên bản, phân tích rủi ro và tạo tác vụ. Khi liên quan đến khách hàng, nhân viên hoặc bí mật kinh doanh, trước tiên phải xác nhận ranh giới lưu trữ dữ liệu và truyền ra bên ngoài.

4. Nghiên cứu chuyên sâu đa phương thức

Lấy video làm điểm vào nghiên cứu, kết hợp trang web, hình ảnh, tài liệu và các video khác để bổ sung bối cảnh, phù hợp cho tổng kết khóa học, nghiên cứu sản phẩm và phân tích hướng dẫn kỹ thuật.

Checklist chọn mô hình và tích hợp

  1. Trước tiên xác nhận nhà cung cấp dịch vụ có thực sự mở Qwen3.8-Omni-Flash hay không, đừng chỉ xem tiêu đề tin tức.
  2. Dùng các tệp nhỏ không nhạy cảm để kiểm thử riêng văn bản, hình ảnh, âm thanh và video.
  3. Ghi lại kích thước tệp, thời lượng, Tokens đầu vào/đầu ra, độ trễ, cache và khoản phí thực tế.
  4. Thiết lập mẫu nghiệm thu độc lập cho OCR, nhận dạng người nói, timestamp, hỏi đáp video và thực thi công cụ.
  5. Đặt hiểu video, đọc tệp, tạo tác vụ, gửi thư và thực thi mã trong các ranh giới quyền hạn khác nhau.
  6. Thiết lập ngân sách, timeout, retry và điều kiện chuyển cho con người tiếp quản đối với tác vụ dài.
  7. Ghi phiên bản mô hình, ngày request, nhà cung cấp dịch vụ, giao thức và cấu trúc trả về vào log có thể truy vết.

Câu hỏi thường gặp

Qwen3.8-Omni-Flash có phải là mô hình thị giác thông thường không?

Không. Định vị phát hành của nó là mô hình toàn phương thức nguyên sinh, đầu vào bao phủ văn bản, hình ảnh, âm thanh và video, đồng thời kết hợp hiểu âm thanh-video với thực thi công cụ Agent.

Nó hỗ trợ video dài bao lâu?

Tài liệu phát hành đề cập đến đầu vào âm thanh-video dài tối đa một giờ, cũng như ngữ cảnh dài 1M. Giới hạn cụ thể vẫn có thể chịu ảnh hưởng của API, kích thước tệp, mã hóa, khu vực và cách triển khai của nhà cung cấp dịch vụ; nên căn cứ theo tài liệu giao diện hiện tại và request thực tế.

Ngữ cảnh 1M có đồng nghĩa chi phí chắc chắn thấp hơn không?

Không. Ngữ cảnh dài mở rộng phạm vi có thể xử lý, nhưng tải tệp lên, Token âm thanh-video, vòng lặp công cụ và đầu ra đều phát sinh chi phí. Kiểm chứng Agentic có cơ hội giảm xử lý không liên quan, nhưng phải xác minh bằng mức sử dụng thực tế.

Qwen-Live Harness và Qwen-MM-Plugins khác nhau ở điểm nào?

Dự án đầu hướng đến môi trường vận hành tương tác toàn phương thức theo thời gian thực và liên tục; dự án sau hướng đến nhận thức theo nhu cầu, gọi công cụ và thực thi workflow cho âm thanh-video dài. Cả hai đều là dự án đi kèm, không đồng nghĩa với cùng một mô hình API.

Trang này đã hỗ trợ Qwen3.8-Omni-Flash chưa?

Bài viết không thay thế danh mục thời gian thực. Vui lòng xem trang giá mô hình, xác nhận ID mô hình, hệ số, năng lực phương thức và hóa đơn thực tế trước khi dùng cho production.

Kết luận

Trọng tâm của mô hình toàn phương thức Qwen3.8-Omni-Flash là đưa âm thanh-video từ “đầu vào được mô hình hiểu” tiến lên thành vật mang công việc để Agent có thể liên tục kiểm chứng, lập kế hoạch, gọi công cụ và bàn giao kết quả. Mô hình này phù hợp để xác minh bằng các tác vụ thực tế phạm vi nhỏ: trước tiên kiểm thử hỏi đáp video dài, biên bản họp và truy xuất tư liệu, rồi từng bước bổ sung dựng video, nghiên cứu và thực thi tác vụ.

Nguồn phát hành: trang offline của bài viết tài khoản chính thức “Ra mắt mô hình toàn phương thức Qwen3.8-Omni-Flash” do người dùng cung cấp; hình ảnh là hình minh họa gốc trong trang đó, đã được sao chép vào thư mục tài nguyên tĩnh của trang này, không lấy script của trang hoặc chỉ thị bên thứ ba làm nội dung bài viết.