Qwen3.8-Flash API: Hướng dẫn 2026 về giá, ngữ cảnh 1M và tích hợp
Ngày 27 tháng 8 năm 2026, một ngày sau khi Qwen3.8-Flash-Next được mở, chúng tôi tổng hợp tài liệu tích hợp cho route qwen3.8-flash vừa mở trên website. Cạm bẫy đầu tiên nằm ngay trong tên: trọng số mở và production API không dùng cùng một Model ID.
Qwen3.8-Flash-Next là MoE đa phương thức mã nguồn mở dùng để xem trước kiến trúc Qwen4; qwen3.8-flash là mô hình production API do Alibaba Cloud Bailian và QwenCloud cung cấp, mặc định hỗ trợ ngữ cảnh 1M, input ảnh/văn bản/video, Function Calling và output có cấu trúc. Website đã mở route qwen3.8-flash; hãy xem hệ số và số tiền thực tế tại trang giá theo thời gian thực và hóa đơn.
Bài viết tách riêng kiến trúc mô hình mở, năng lực API chính thức của Alibaba Cloud, giá gọi trực tiếp chính thức và route website. Benchmark Qwen công bố không phải phép đo độc lập của website; giá theo khu vực của Alibaba Cloud cũng không thể quy đổi thẳng thành hệ số website.
Dữ liệu cốt lõi của Qwen3.8-Flash
| Hạng mục | Thông tin đã xác minh |
|---|---|
| Ngày phát hành chính thức | 26 tháng 8 năm 2026 |
| ID API trên website / Bailian | qwen3.8-flash |
| ID trọng số mở | Qwen/Qwen3.8-Flash-Next |
| Cấu trúc tham số | Mô hình chính 125B + N-gram Embedding 51B, 6B được kích hoạt |
| Ngữ cảnh | Production API mặc định 1M; bản mã nguồn mở nguyên bản 262,144, có thể mở rộng lên 1M bằng YaRN |
| Modal input / output | Ảnh, văn bản, video vào; văn bản ra |
| Năng lực API | Function Calling, output có cấu trúc, Web Search, context cache |
| Định vị | Coding Agent, tự động hóa văn phòng, hiểu hình ảnh, workflow throughput cao |
| Hệ số website | Không ghi cố định trong bài; xem giá hiện tại và hóa đơn |
Dữ liệu được kiểm tra lần cuối ngày 27 tháng 8 năm 2026. Trước khi tích hợp production, hãy kiểm tra lại danh sách mô hình, tài liệu theo khu vực của Bailian và trường usage trong response thực tế.
Qwen3.8-Flash và Qwen3.8-Flash-Next liên quan thế nào?
Đầu tiên nhóm Qwen công khai trọng số Qwen3.8-Flash-Next để cộng đồng nghiên cứu kiến trúc Qwen4; bản production được cung cấp dưới tên Qwen3.8-Flash. Hai bên cùng hướng kỹ thuật nhưng cách gọi khác nhau.
| Tên | Mục đích | ID chính xác | Ngữ cảnh |
|---|---|---|---|
| Qwen3.8-Flash-Next | Self-hosting, nghiên cứu kiến trúc, đánh giá mã nguồn mở | Qwen/Qwen3.8-Flash-Next |
Nguyên bản 262,144, YaRN lên 1M |
| Qwen3.8-Flash | Hosted production API | qwen3.8-flash |
Mặc định 1M |
| Qwen3.8-Max | Mô hình hosted flagship năng lực cao | qwen3.8-max |
1M |
Khi gọi qua website hoặc giao diện tương thích Alibaba Cloud, đừng điền tên repository Hugging Face vào tham số model. Ngược lại, khi self-hosting, chỉ ghi hosted API ID cũng không khiến framework tự tải trọng số.
Kiến trúc mới của Qwen3.8-Flash-Next là gì?
Qwen3.8-Flash-Next dùng attention lai gồm Gated DeltaNet (GDN) và Qwen Sparse Attention (QSA). GDN nén lịch sử vào trạng thái cố định, còn QSA dùng indexer nhẹ để chọn ngữ cảnh quan trọng theo từng micro-block, qua đó giảm tính toán attention và truy cập KV Cache trong chuỗi dài.
Mô hình còn có Gated Residual (GR), mở rộng luồng residual thành bốn nhánh và dùng cổng động để điều khiển đọc/ghi. N-gram Embedding tra cứu ngữ cảnh cục bộ, mở rộng dung lượng mô hình mà chỉ tăng rất ít phép nhân ma trận trên mỗi Token. Quá trình huấn luyện dùng Muon Optimizer cải tiến và Scaling Law được fit lại.
Quy mô được công bố gồm mô hình chính 125B, thêm 51B N-gram Embedding và 6B tham số được kích hoạt cho mỗi Token. Nhóm Qwen cho biết chi phí huấn luyện khoảng một phần chín Qwen3.7-Plus; đây là so sánh của nhà cung cấp, không phải chi phí suy luận thực tế trên website.
Ngữ cảnh 1M và đa phương thức có giới hạn gì?
Trang mô hình Qwen3.8-Flash của Alibaba Cloud ghi ngữ cảnh 1,000,000 Tokens: chế độ thường tối đa 991,808 input, chế độ thinking tối đa 983,616 input, tối đa 131,072 output và chuỗi suy nghĩ tối đa 262,144. Input nhận ảnh, văn bản và video; output là văn bản.
1M không có nghĩa mỗi request nên dùng gần 1M Tokens. System Prompt, schema công cụ, mã hóa ảnh/video, lịch sử message và phần output dự phòng đều chiếm cửa sổ; request quá dài còn làm tăng độ trễ và chi phí. Production nên thử theo các mức 32K, 128K, 256K và ngữ cảnh dài trước.
Bảng năng lực chính thức cũng liệt kê Function Calling, output có cấu trúc, Web Search và context cache. Batch được hỗ trợ tại khu vực Beijing nhưng đánh dấu không hỗ trợ tại Singapore — hãy kiểm tra riêng khác biệt khu vực trước khi deploy.
Đọc benchmark coding và Agent của Qwen thế nào?
Nhóm Qwen so sánh Qwen3.8-Flash-Next với Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 và các mô hình khác. Bốn mục dưới đây được trích lại:
| Benchmark do nhà cung cấp công bố | Qwen3.7-Plus | Qwen3.8-Flash-Next | Loại tác vụ |
|---|---|---|---|
| DeepSWE 1.1 | 16.5 | 58.7 | Agentic coding |
| SWE-bench Multilingual | 75.8 | 81.0 | Software engineering đa ngôn ngữ |
| CoWorkBench | 65.1 | 73.9 | Tác vụ văn phòng dài hạn |
| Toolathlon Verified | 50.6 | 73.5 | Gọi công cụ thực tế |
Các điểm số này do Qwen công bố, không phải phép đo độc lập của website. Phiên bản mô hình, ngân sách suy luận, môi trường công cụ và scorer ảnh hưởng đáng kể. Không thể lấy điểm Flash-Next mã nguồn mở làm kết quả end-to-end của hosted API trong client, khu vực và quota của bạn.
Phân biệt giá chính thức Qwen3.8-Flash với giá website
Thông báo ra mắt của QwenCloud ghi giá tham khảo cho bản production là 0.16 USD trên một triệu Tokens input và 0.47 USD trên một triệu Tokens output; cùng thông báo khi đó nói API sắp mở. Sau đó trang mô hình Alibaba Cloud Bailian liệt kê call ID qwen3.8-flash, cùng bảng năng lực và giá CNY khác nhau cho Beijing, Singapore và các khu vực khác.
Đây đều là giá gọi trực tiếp chính thức và có thể thay đổi theo khu vực, cache, Batch hoặc chương trình khuyến mãi. Website không quy đổi giá USD chính thức hay giá Bailian theo khu vực thành hệ số gateway. Hệ số, cache và số tiền trừ của qwen3.8-flash trên website phải xem tại trang giá theo thời gian thực và hóa đơn request.
Người dùng mới có thể mở trang mua API; người đã có Key có thể vào trang nạp tiền. Hãy cố định Prompt và độ dài ngữ cảnh, ghi Tokens input, output và cache, rồi mới so sánh chi phí thật.
Gọi API Qwen3.8-Flash như thế nào?
Website cung cấp Chat Completions tương thích OpenAI; model ID chính xác là qwen3.8-flash:
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{
"role": "user",
"content": "Summarize the failing tests, then propose the smallest safe patch."
}
]
}'
Qwen3.8-Flash hỗ trợ thinking và non-thinking mode, nhưng mỗi lớp tương thích có thể ánh xạ enable_thinking, reasoning_effort, tham số streaming của công cụ và công cụ tích hợp khác nhau. Hãy bắt đầu bằng request văn bản tối thiểu, sau đó thêm thinking, ảnh, video, công cụ và ngữ cảnh dài từng bước.
Qwen3.8-Flash phù hợp với tác vụ nào?
- Coding Agent throughput cao, code review và phân tích test lỗi;
- repository code đa ngôn ngữ và tác vụ software engineering kiểu SWE-bench;
- tự động hóa dài hạn cho email, bảng tính, tài liệu và nội dung họp;
- hiểu ảnh, biểu đồ và video dài;
- workflow Function Calling, output có cấu trúc và Web Search;
- tài liệu dài, codebase lớn cần 1M context nhưng nhạy cảm với chi phí;
- nghiên cứu kiến trúc preview Qwen4 trong self-hosting và tích hợp inference framework.
Với quyết định kiến trúc phức tạp, security review quan trọng hoặc tác vụ một lần có giá trị cao, hãy so sánh thêm Qwen3.8-Max, GLM-5.3, Claude và các mô hình mạnh khác. Giá trị của Flash nằm ở hiệu quả chi phí và throughput, không phải thay thế mọi mô hình bằng một ID.
Chọn Qwen3.8-Flash hay Qwen3.8-Max?
Nếu có nhiều tác vụ và cần đa phương thức, gọi công cụ cùng ngữ cảnh 1M, hãy bắt đầu thử Qwen3.8-Flash với một lượng traffic nhỏ. Nếu ưu tiên giới hạn suy luận phức tạp, độ ổn định và chất lượng output quan trọng, hãy chạy cùng bài test trên Qwen3.8-Max.
Đừng chỉ so sánh một câu trả lời. Ít nhất hãy thống kê tỷ lệ tác vụ đạt, độ trễ token đầu tiên, tổng thời gian, tỷ lệ gọi công cụ thành công, Tokens input/output, cache hit và số lần làm lại. Giá model thấp nhưng cần retry nhiều hơn chưa chắc có tổng chi phí thấp hơn.
Checklist đánh giá production
- Hosted API dùng
qwen3.8-flash, self-hosting dùngQwen/Qwen3.8-Flash-Next. - Cố định repository, Prompt, phiên bản công cụ, timeout và lệnh nghiệm thu trước khi so sánh.
- Kiểm tra riêng thinking và non-thinking mode, ghi lại khác biệt response.
- Kiểm tra văn bản, ảnh, video, Function Calling và output có cấu trúc.
- Đo độ trễ và hóa đơn theo các mức 32K, 128K, 256K và ngữ cảnh dài.
- Xác nhận khu vực đã chọn hỗ trợ Batch, cache và công cụ tích hợp cần thiết.
- Giới hạn số lần gọi công cụ, output tối đa, ngân sách tổng và thao tác bên ngoài.
- Chuẩn bị route dự phòng khi thiếu capacity, bị rate limit hoặc giao thức không tương thích.
Kết luận chính
qwen3.8-flashlà model ID chính xác của hosted API trên website và Alibaba Cloud.Qwen/Qwen3.8-Flash-Nextlà tên trọng số mở, không được điền vàomodelcủa hosted API.- Bản hosted mặc định hỗ trợ ngữ cảnh 1M, input ảnh/văn bản/video và Function Calling.
- Mô hình chính 125B + N-gram Embedding 51B, kích hoạt 6B tham số cho mỗi Token.
- Benchmark và giá khu vực chính thức phải được tách khỏi hiệu năng route, hệ số và hóa đơn website.
- Chọn production cần xem tỷ lệ đạt, độ trễ, usage, tỷ lệ gọi công cụ thành công và chi phí làm lại.
Câu hỏi thường gặp
Qwen3.8-Flash đã chính thức lên sóng chưa?
Rồi. Nhóm Qwen phát hành trọng số Flash-Next ngày 26 tháng 8 năm 2026, và trang mô hình chính thức của Alibaba Cloud đã liệt kê production call ID qwen3.8-flash; website cũng đã mở route cùng tên.
Qwen3.8-Flash có ngữ cảnh bao nhiêu?
Hosted production API mặc định hỗ trợ ngữ cảnh 1M. Flash-Next mã nguồn mở hỗ trợ nguyên bản 262,144 Tokens và có thể mở rộng lên 1,000,000 Tokens bằng YaRN.
Qwen3.8-Flash có hỗ trợ ảnh và video không?
Có. Bảng năng lực chính thức của Alibaba Cloud ghi ảnh, văn bản và video ở input, văn bản ở output, đồng thời hỗ trợ Function Calling và output có cấu trúc.
Qwen3.8-Flash-Next và Qwen3.8-Flash có cùng một ID không?
Không. Cái đầu là tên repository và trọng số open-source để self-host; cái sau là giá trị model của production API.
Qwen3.8-Flash có thinking mode không?
Có cả thinking và non-thinking mode. Giao diện tương thích có thể ánh xạ tham số mở rộng khác nhau, vì vậy nên kiểm tra request tối thiểu trước rồi mới bật thinking.
Có thể dùng Qwen3.8-Flash với Claude Code hoặc Codex không?
Alibaba Cloud mô tả khả năng tương thích với giao thức OpenAI và Anthropic, đồng thời nêu Claude Code và Codex. Khi tích hợp thực tế vẫn cần kiểm tra gọi công cụ, streaming, timeout và usage trả về.
Giá chính thức của Qwen3.8-Flash là bao nhiêu?
Thông báo đầu tiên của QwenCloud ghi 0.16 USD cho một triệu Tokens input và 0.47 USD cho một triệu Tokens output; Alibaba Cloud Bailian có giá CNY theo khu vực. Hệ số và hóa đơn website là hệ thống riêng, hãy xem trang giá theo thời gian thực.
Mua hoặc nạp tiền Qwen3.8-Flash API ở đâu?
Người dùng mới có thể vào trang mua API, còn người đã có Key dùng trang nạp tiền.
Nguồn chính
- Qwen: Qwen3.8-Flash-Next — A New Architecture, Towards Ultimate Cost-Efficiency: kiến trúc, tham số, ngữ cảnh, benchmark, mã nguồn mở và cách công bố giá QwenCloud
- Alibaba Cloud Bailian: thông tin Qwen3.8-Flash: production model ID, modal, ngữ cảnh, Function Calling, output có cấu trúc và năng lực theo khu vực
- GitHub chính thức của Qwen: Qwen3.8-Flash-Next: tên trọng số mở, báo cáo kỹ thuật và lịch sử phiên bản
- Danh sách mô hình trên website: route và điểm tích hợp hiện tại; giá và tính khả dụng luôn theo trang thời gian thực