Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Quay lại blog

Step-3.7-Flash: mô hình đa phương thức mới cho agent và coding workflow

Step-3.7-FlashStepFunAI agentCodingMô hình đa phương thức

Ngày 29/05/2026, StepFun, hay 阶跃星辰, công bố step-3.7-flash như một mô hình reasoning đa phương thức flagship cho các workflow xoay quanh agent, coding và xử lý ngữ cảnh dài. Điểm đáng chú ý là mô hình này không chỉ nhắm đến chat thông thường, mà được đặt vào những tác vụ có tần suất gọi cao: agent tự động, sinh và sửa code, đọc tài liệu dài, hiểu hình ảnh hoặc video, chuyển screenshot thành code và bóc tách hóa đơn thành bảng dữ liệu.

Cần nói rõ ngay từ đầu: các thông số hiệu năng trong bài chủ yếu dựa trên công bố chính thức và model card của StepFun. Trước khi có nhiều kết quả tái lập độc lập, nên trích dẫn chúng như số liệu do nhà phát hành công bố, nhất là với tốc độ sinh token, độ trễ thực tế và chất lượng trong từng bài toán sản xuất.

Step-3.7-Flash là gì?

step-3.7-flash là mô hình MoE với khoảng 198B tham số tổng và khoảng 11B tham số active cho mỗi token. Theo model card, phần language backbone có 196B tham số và visual encoder có 1.8B tham số. Cách thiết kế này giúp mô hình giữ dung lượng tổng lớn, nhưng chỉ kích hoạt một phần năng lực tính toán trong mỗi bước suy luận.

Cửa sổ ngữ cảnh được công bố là 256K tokens. Với đội ngũ kỹ thuật, con số này có ý nghĩa thực tế: có thể đưa vào một lượng lớn code, tài liệu sản phẩm, log, issue, đặc tả API hoặc lịch sử làm việc của agent trước khi buộc phải nén ngữ cảnh.

Thông số chính

Hạng mục Thông tin
Model ID step-3.7-flash
Loại mô hình flagship multimodal reasoning model
Kiến trúc MoE
Tham số khoảng 198B tổng, khoảng 11B active
Chi tiết model card 196B language backbone + 1.8B visual encoder
Ngữ cảnh 256K tokens
Reasoning effort low, medium, high
Tốc độ công bố tối đa 400 tokens/s theo nhà cung cấp
Trọng số/model card Apache-2.0

Ba mức reasoning effort là điểm nên để ý khi triển khai agent. Với tác vụ đơn giản, low có thể giúp giảm độ trễ và chi phí. Với phân tích code, lập kế hoạch nhiều bước hoặc kiểm tra tài liệu phức tạp, mediumhigh cho phép dành nhiều ngân sách suy luận hơn.

API: tương thích OpenAI và Anthropic

StepFun công bố step-3.7-flash hỗ trợ hai kiểu giao thức quen thuộc:

  • OpenAI Chat Completions
  • Anthropic Messages

Endpoint cho khu vực Trung Quốc là https://api.stepfun.com/v1. Endpoint quốc tế là https://api.stepfun.ai/v1. Điều này giúp các đội đã có client tương thích OpenAI hoặc Claude giảm đáng kể công việc tích hợp ban đầu, vì có thể bắt đầu bằng cách đổi base URL, model ID và cấu hình giá.

Giá chính thức theo khu vực

Ở thời điểm bài viết, giá được công bố như sau.

Khu vực Input không trúng cache Input trúng cache Output
Trung Quốc 1.35 CNY / 1M tokens 0.27 CNY / 1M tokens 8.1 CNY / 1M tokens
Quốc tế $0.20 / 1M tokens $0.04 / 1M tokens $1.15 / 1M tokens

Với agent tần suất cao, cache không phải chi tiết phụ. Nếu hệ thống thường lặp lại system prompt, mô tả tool, schema, policy hoặc ngữ cảnh nền cố định, mức giá cache hit có thể ảnh hưởng rõ đến tổng chi phí mỗi ngày.

Những kịch bản nên thử trước

Với agent, step-3.7-flash phù hợp để thử ở các workflow cần nhiều bước suy luận nhưng vẫn nhạy với chi phí: phân tích yêu cầu, gọi tool, đọc kết quả, tự sửa kế hoạch và tạo phản hồi cuối. Cửa sổ 256K tokens giúp agent giữ được nhiều trạng thái hơn trong một lần chạy.

Với coding, các bài toán đáng thử gồm sinh code mới, sửa bug theo log, đọc diff, viết test, chuyển đổi API, refactor cục bộ và rà soát repo lớn. Khi lỗi nằm rải rác giữa nhiều file, ngữ cảnh dài thường hữu ích hơn một prompt ngắn nhưng thiếu bằng chứng.

Với đa phương thức, mô hình có thể dùng cho đọc screenshot giao diện, chuyển layout thành code, hiểu hình ảnh/video, trích xuất thông tin từ phiếu thu, hóa đơn, bảng biểu hoặc form. Đây là nhóm tác vụ dễ tạo giá trị nhanh, nhưng cũng cần benchmark bằng dữ liệu thật vì ảnh chụp, font, ngôn ngữ và chất lượng scan thay đổi rất nhiều.

Open weights và triển khai riêng

Một điểm đáng chú ý là trọng số và model card được mở theo Apache-2.0. Với doanh nghiệp cần kiểm soát dữ liệu, tối ưu latency hoặc chạy workload trong hạ tầng riêng, đây là lựa chọn đáng theo dõi.

Các stack được nêu gồm vLLM, SGLang, Transformers, llama.cpp và NVIDIA NIM. Trong triển khai thực tế, lựa chọn phụ thuộc vào GPU, throughput mong muốn, batch serving, quantization, khả năng phục vụ đa phương thức và mức độ quen thuộc của đội vận hành.

Cách đánh giá thận trọng

Con số tối đa 400 tokens/s nên được hiểu là claim chính thức trong điều kiện của nhà cung cấp, không phải cam kết cho mọi workload. Khi đưa vào sản phẩm, hãy đo lại với prompt thật, độ dài ngữ cảnh thật, mức reasoning effort thật và concurrency gần với sản xuất.

Tương tự, benchmark coding hoặc agent nên phản ánh công việc hằng ngày của đội: issue cũ, PR thật, log lỗi thật, tài liệu dài, screenshot từ sản phẩm và bộ test có thể chấm tự động. Ngoài chất lượng câu trả lời, nên đo thêm số bước agent cần chạy, tỷ lệ retry, chi phí mỗi task và độ ổn định của output có cấu trúc.

Kết nối qua gateway LLM thống nhất

Nếu hệ thống hiện đã gọi model qua OpenAI-compatible Chat Completions hoặc Claude/Anthropic Messages, có thể đưa step-3.7-flash vào như một tuyến model mới để thử nghiệm có kiểm soát. Với kiến trúc lớn hơn, một LLM API gateway thống nhất giúp quản lý key, theo dõi chi phí, chọn vùng endpoint và so sánh model dễ hơn. Cách tiếp cận này thực dụng hơn việc thổi phồng một mô hình thành lời giải duy nhất: thử bằng dữ liệu thật, đo chi phí thật, rồi mở rộng dần cho agent, coding và workflow đa phương thức.

Nguồn tham khảo