Qwen3.8-Flash API料金・コーディングガイド 2026:1Mマルチモーダル
2026年8月27日、Qwen3.8-Flash-Nextがオープンソース化された翌日、当サイトで新たに開放した qwen3.8-flash ルートの接続資料をまとめました。最も起こりやすいミスは、名前そのものにあります。公開ウェイトと本番APIは同じモデルIDを使いません。
Qwen3.8-Flash-Next はQwen4アーキテクチャを先行検証するためのオープンなマルチモーダルMoEです。一方、qwen3.8-flash はAlibaba Cloud Model StudioとQwenCloudが提供する本番APIモデルで、デフォルトで1Mコンテキスト、画像・テキスト・動画入力、Function Calling、構造化出力に対応します。 当サイトでは qwen3.8-flash ルートを開放済みです。サイトの倍率と実際の請求額は、リアルタイム料金ページと請求台帳で確認してください。
この記事では、オープンモデルのアーキテクチャ、Alibaba Cloud公式APIの機能、公式の直結料金、当サイトのルートを分けて説明します。Qwenチームが公開したベンチマークは当サイトの独立テストではなく、Alibaba Cloudの地域別料金を当サイトの倍率へそのまま換算することもできません。
Qwen3.8-Flashの主要データ
| 項目 | 確認済み情報 |
|---|---|
| 公式公開日 | 2026年8月26日 |
| 当サイト/Model Studio API ID | qwen3.8-flash |
| 公開ウェイトID | Qwen/Qwen3.8-Flash-Next |
| パラメータ構成 | 125Bのメインモデル + 51BのN-gram Embedding、アクティブパラメータ6B |
| コンテキスト | 本番APIはデフォルト1M。公開版はネイティブ262,144で、YaRNにより1Mまで拡張可能 |
| 入力/出力モダリティ | 画像・テキスト・動画入力、テキスト出力 |
| API機能 | Function Calling、構造化出力、Web Search、コンテキストキャッシュ |
| 公開上の位置付け | Coding Agent、オフィス自動化、視覚理解、高並列ワークフロー |
| 当サイトの倍率 | この記事では固定値を記載しない。リアルタイム料金と実際の台帳を確認 |
最終確認日は2026年8月27日です。本番公開前にモデル一覧、Alibaba Cloudの地域別ドキュメント、実際のレスポンスに含まれる用量フィールドを再確認してください。
Qwen3.8-FlashとQwen3.8-Flash-Nextはどのような関係ですか?
Qwenチームはまず Qwen3.8-Flash-Next のウェイトを公開し、コミュニティがQwen4で予定されるアーキテクチャを研究できるようにしました。本番版は Qwen3.8-Flash の名前で提供されます。技術の方向性は共有しますが、呼び出し方法は異なります。
| 名称 | 用途 | 正確なID | コンテキスト |
|---|---|---|---|
| Qwen3.8-Flash-Next | セルフホスティング、アーキテクチャ研究、オープン評価 | Qwen/Qwen3.8-Flash-Next |
ネイティブ262,144。YaRNで1Mまで拡張可能 |
| Qwen3.8-Flash | ホスト型の本番API | qwen3.8-flash |
デフォルト1M |
| Qwen3.8-Max | 高い能力を重視するホスト型フラッグシップ | qwen3.8-max |
1M |
当サイトまたはAlibaba Cloud互換インターフェースから呼び出す場合、Hugging Faceのリポジトリ名を model パラメータへ入れないでください。逆にセルフホスティングで、ホスト型APIのIDだけを指定してフレームワークが自動的にウェイトをダウンロードすると期待することもできません。
Qwen3.8-Flash-Nextの新しいアーキテクチャとは?
Qwen3.8-Flash-NextはGated DeltaNet(GDN)とQwen Sparse Attention(QSA)を組み合わせたハイブリッドアテンションを採用しています。GDNは履歴を固定状態に圧縮し、QSAは軽量なインデクサーでマイクロブロックごとに重要なコンテキストを選びます。長い系列でのアテンション計算とKV Cacheへのアクセスコストを抑える設計です。
さらにGated Residual(GR)を加え、残差ストリームを4つの分岐に広げ、動的ゲートで読み書きを制御します。N-gram Embeddingはローカルコンテキストを検索し、トークンごとの行列計算をほとんど増やさずにモデル容量を拡張します。学習には改良版Muon Optimizerと再フィットしたScaling Lawを使用しています。
公式に示された規模は、メインモデル125B、追加のN-gram Embedding 51B、トークンごとのアクティブパラメータ6Bです。Qwenチームは、学習コストがQwen3.7-Plusの約9分の1だと説明しています。これはベンダーによる学習コスト比較であり、当サイトの推論コストを実測した値ではありません。
1Mコンテキストとマルチモーダル機能の境界は?
Alibaba CloudのQwen3.8-Flashモデルページには、コンテキスト長1,000,000 Tokensが記載されています。通常モードの最大入力は991,808、Thinkingモードは983,616、最大出力は131,072、最大思考チェーン長は262,144です。画像・テキスト・動画を入力でき、出力はテキストです。
1Mだからといって、毎回1M Tokens近くを送るべきではありません。システムプロンプト、ツールSchema、画像・動画のエンコード、メッセージ履歴、予約した出力がウィンドウを消費します。非常に長いリクエストは遅延と料金も増やします。本番ではまず32K、128K、256K、長文脈の段階に分けてテストしてください。
公式の機能表にはFunction Calling、構造化出力、Web Search、コンテキストキャッシュも掲載されています。Batchは北京リージョンでは対応し、シンガポールリージョンでは非対応と表示されています。デプロイ前に地域差を個別に確認してください。
Qwen公式のコーディング・Agentベンチマークはどう読むべきですか?
QwenチームはQwen3.8-Flash-Nextを、Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731などと比較しました。以下は4項目の抜粋です。
| ベンダー公開評価 | Qwen3.7-Plus | Qwen3.8-Flash-Next | タスク種別 |
|---|---|---|---|
| DeepSWE 1.1 | 16.5 | 58.7 | Agentic coding |
| SWE-bench Multilingual | 75.8 | 81.0 | 多言語ソフトウェアエンジニアリング |
| CoWorkBench | 65.1 | 73.9 | 長期オフィスタスク |
| Toolathlon Verified | 50.6 | 73.5 | 実ツール呼び出し |
**これらのスコアはQwenチームの公式リリースによるもので、当サイトの独立テストではありません。**モデルのバージョン、推論予算、ツール環境、スコアラーによって結果は大きく変わります。特に、オープン版Flash-Nextのスコアを、あなたのクライアント、地域、割当量におけるホスト型APIのエンドツーエンド性能と見なさないでください。
Qwen3.8-Flashの公式料金と当サイトの料金はどう区別しますか?
Qwenの公開記事は初回発表時、QwenCloudの本番版の参考料金を入力100万Tokensあたり0.16米ドル、出力100万Tokensあたり0.47米ドルと記載し、同じ記事でAPIは近日公開予定とも説明していました。その後Alibaba Cloud Model Studioのページには qwen3.8-flash の呼び出しIDが掲載され、北京やシンガポールなどの地域ごとに異なるCNY価格と機能表が示されています。
どちらも公式の直結料金であり、地域、キャッシュ、Batch、キャンペーンによって変わる可能性があります。当サイトは公式の米ドル価格やModel Studioの地域価格をゲートウェイ倍率へ直接換算しません。 当サイトの qwen3.8-flash ルートの倍率、キャッシュ、実際の請求額は、リアルタイム料金ページとリクエスト台帳を基準にします。
新規ユーザーはAPI購入ページから少額で開始できます。既存のKey利用者はチャージページで残高を追加できます。まずPromptとコンテキスト長を固定し、入力・出力・キャッシュTokensを記録してから実コストを比較してください。
Qwen3.8-Flash APIの呼び出し方
当サイトはOpenAI互換のChat Completionsエンドポイントを提供しています。正確なモデルIDは qwen3.8-flash です。
curl https://api.llm-token.cn/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{
"role": "user",
"content": "Summarize the failing tests, then propose the smallest safe patch."
}
]
}'
Qwen3.8-FlashはThinkingと非Thinkingモードに対応しますが、互換レイヤーによって enable_thinking、reasoning_effort、ツールストリーミングのパラメータ、組み込みツールのマッピングが異なる場合があります。まず最小のテキストリクエストから始め、Thinking、画像、動画、ツール、長文脈を一度に1つずつ追加してください。最初からすべての拡張パラメータを送らないでください。
Qwen3.8-Flashはどのタスクに向いていますか?
- 高並列のCoding Agent、コードレビュー、テスト失敗分析
- 多言語のコードリポジトリとSWE-bench系のソフトウェアエンジニアリング
- メール、スプレッドシート、文書、会議資料の長期オフィス自動化
- 画像、図表、長い動画の理解
- Function Calling、構造化出力、Web Searchのワークフロー
- 1Mコンテキストが必要だがコストも重視する長文書・大規模コードベース
- セルフホスト型Qwen4プレビューアーキテクチャの研究と推論フレームワーク対応
複雑なアーキテクチャ判断、重要なセキュリティ監査、高価値の単発タスクでは、Qwen3.8-Max、GLM-5.3、Claudeなどの強いモデルとも比較してください。Flashの価値はコスト効率とスループットであり、すべての評価を1つのモデルで置き換えることではありません。
Qwen3.8-FlashとQwen3.8-Max、どちらを選ぶべきですか?
タスク量が多く、マルチモーダル、ツール呼び出し、1Mコンテキストが必要なら、まずQwen3.8-Flashを少量のトラフィックで検証します。複雑な推論の上限、耐障害性、重要な出力品質を重視するなら、同じテストをQwen3.8-Maxへ切り替えます。
1つの回答だけで比較しないでください。少なくともタスク合格率、初回トークンまでの時間、総時間、ツール呼び出し成功率、入出力Tokens、キャッシュヒット、やり直し回数を記録します。単価が安くても、再試行が増えると全体のコストは下がらないことがあります。
本番評価チェックリスト
- ホスト型APIでは
qwen3.8-flash、セルフホストではQwen/Qwen3.8-Flash-Nextを使う。 - モデルを比較する前に、リポジトリ、Prompt、ツールのバージョン、タイムアウト、合格判定コマンドを固定する。
- Thinkingと非Thinkingを分けて検証し、レスポンス形式の差を記録する。
- テキスト、画像、動画、Function Calling、構造化出力をそれぞれテストする。
- 32K、128K、256K、長文脈の段階ごとに遅延と請求額を測る。
- 選んだ地域がBatch、キャッシュ、必要な組み込みツールに対応しているか確認する。
- ツール呼び出し、最大出力、総予算、外部操作に上限を設ける。
- 容量不足、レート制限、プロトコル非互換に備えて代替ルートを残す。
要点
qwen3.8-flashは当サイトとAlibaba Cloudのホスト型APIで使う正確なモデルIDです。Qwen/Qwen3.8-Flash-Nextは公開ウェイト名であり、ホスト型APIのmodelパラメータには入力しません。- ホスト型バージョンはデフォルトで1Mコンテキストに対応し、画像・テキスト・動画入力とFunction Callingを使えます。
- メインモデル125B、N-gram Embedding 51B、トークンごとのアクティブパラメータ6Bです。
- 公式ベンチマークと地域別料金は、当サイトのルート動作、倍率、台帳と分けて考えてください。
- 本番選定では、合格率、遅延、用量、ツール成功率、やり直しコストをまとめて評価します。
よくある質問
Qwen3.8-Flashは正式に公開されていますか?
はい。Qwenチームは2026年8月26日にFlash-Nextのウェイトを公開し、Alibaba Cloud公式モデルページには本番の呼び出しID qwen3.8-flash が掲載されています。当サイトでも同じルートを開放しています。
Qwen3.8-Flashのコンテキスト長はどれくらいですか?
ホスト型の本番APIはデフォルトで1Mコンテキストに対応します。公開版Flash-Nextは262,144 Tokensをネイティブに扱い、YaRNで1,000,000 Tokensまで拡張できます。
Qwen3.8-Flashは画像と動画に対応しますか?
はい。Alibaba Cloud公式の機能表には画像・テキスト・動画入力とテキスト出力、Function Calling、構造化出力が記載されています。
Qwen3.8-Flash-NextとQwen3.8-Flashは同じIDですか?
いいえ。前者は公開リポジトリとセルフホスト用ウェイトの名前で、後者は本番APIの model 値です。
Qwen3.8-FlashはThinkingモードに対応しますか?
Thinkingと非Thinkingの両方に対応します。互換インターフェースによって拡張パラメータの対応が異なる場合があるため、Thinking設定を追加する前に最小リクエストを検証してください。
Qwen3.8-FlashはClaude CodeやCodexで使えますか?
Alibaba CloudはOpenAIおよびAnthropicプロトコルとの互換性を説明し、Claude CodeとCodexを例に挙げています。実際の接続ではツール呼び出し、ストリーミング、タイムアウト、用量の返却もテストしてください。
Qwen3.8-Flashの公式料金はいくらですか?
QwenCloudの公開記事では、入力100万Tokensあたり0.16米ドル、出力100万Tokensあたり0.47米ドルとされています。Alibaba Cloud Model Studioには地域別のCNY料金があります。当サイトの倍率と請求台帳は独立した基準なので、リアルタイム料金ページを確認してください。
Qwen3.8-Flash APIはどこで購入・チャージできますか?
新規ユーザーはAPI購入ページへ、既存のKey利用者はチャージページをご利用ください。
主な情報源
- Qwen:Qwen3.8-Flash-Next — A New Architecture, Towards Ultimate Cost-Efficiency:アーキテクチャ、パラメータ、コンテキスト、ベンダーベンチマーク、公開ウェイト、QwenCloudの料金説明
- Alibaba Cloud Model Studio:Qwen3.8-Flashモデル情報:本番モデルID、モダリティ、コンテキスト、Function Calling、構造化出力、地域別機能
- Qwen公式GitHub:Qwen3.8-Flash-Next:公開ウェイトの命名、技術レポート、バージョン履歴
- 当サイトのモデル一覧:現在のルートと接続入口。料金と利用可否はリアルタイムページを基準にしてください