DeepSeek-V4-Flash-Vision-Exp API 完全ガイド 2026
DeepSeekは2026年8月21日、初の公式マルチモーダルAPIモデル deepseek-v4-flash-vision-exp をリリースしました。 DeepSeek V4 Flashのテキスト、推論、エージェント機能に画像理解を追加し、1Mトークンのコンテキストウィンドウ、最大384Kトークンの出力、画像1枚あたり最大384入力トークンを提供します。DeepSeek公式直接APIではV4 Flashと同一価格です。
exp はexperimental(実験版)を意味します。DeepSeek公式APIで呼び出せますが、長期的な安定版として扱うべきではありません。このガイドでは、DeepSeek公式仕様とベンダーベンチマーク、第三者の例、当ゲートウェイの公開ルート状況を分けて説明します。2026年8月22日の確認時点で、当ゲートウェイの公開価格カタログに新しいIDは未掲載でした。そのため、本記事ではゲートウェイの倍率を推測しません。
まずライブルートを確認: モデル価格に
deepseek-v4-flash-vision-expが表示されることを確認してから、API購入ページで少額残高を用意してください。利用可否と課金は、リクエスト時点のライブカタログと請求記録が正です。
DeepSeek-V4-Flash-Vision-Exp の主要仕様
| 項目 | 公式発表情報 |
|---|---|
| リリース日 | 2026年8月21日 |
| 正確なモデルID | deepseek-v4-flash-vision-exp |
| リリース状態 | 実験的マルチモーダルAPIモデル |
| コンテキストウィンドウ | 1Mトークン |
| 最大出力 | 384Kトークン |
| 画像トークン使用量 | 寸法に応じて算出、画像1枚あたり最大384トークン |
| 1リクエストの最大画像数 | 600 |
| 入力方法 | base64、外部URL、またはFiles APIの file_id によるテキスト + 画像 |
| API形式 | Chat Completions、Anthropic Messages、Responses API |
| ツール呼び出し | 対応 |
| 思考モード | 思考あり・なしに対応、デフォルトは思考あり |
| FIM補完 | 非対応 |
| 公式同時実行上限 | 2,500 |

出典:DeepSeekの2026年8月21日付けリリース。これらはベンダー公表の評価結果であり、当サイトによる独立テストではありません。
ベンチマーク分析:Opus-4.8に近いことは、全テストで勝つことではない
DeepSeekは、V4-Flash-Vision-ExpがマルチモーダルエージェントベンチマークでV4 Flashから大きく向上し、総合性能がOpus-4.8に近づいたとしています。公表表はその位置付けを裏付けますが、各結果は完全な圧勝ではなく、勝敗の混在を示しています。
| ベンチマーク | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-ExpはDeepSWE、Agents' Last Exam、ZeroBenchで画像内のOpus-4.8を上回る一方、Terminal Bench、NL2Repo、DSBench-Hardでは下回ります。V4-Flash-0731と直接比較できる9項目のうち8項目で上回り、例外はCybergymです。
評価条件も重要です。DeepSeekは公開テキストベースのCode AgentタスクをDeepSeek Harness Minimal Mode、最大出力トークン、top_p=0.95、temperature=1.0 で実行しています。ApexBenchとAgents' Last Examでは、テキスト専用のV4 Flashがマルチモーダル要素を無視するため、2つのビジョンモデルを同条件で比較したものではありません。
384トークンの画像に実際どれくらいかかるのか?
DeepSeekは画像を寸法に応じてリサイズおよびタイル分割し、その結果を入力トークンとして課金します。上限は画像1枚あたり384トークンです。複数画像は別々に計算され、リクエスト全体で共有する384トークンの上限ではありません。
DeepSeek公式のドル価格表では、Vision-ExpはV4 Flashと同価格です。
| DeepSeek公式直接API | オフピーク | ピーク |
|---|---|---|
| キャッシュヒット入力 / 1Mトークン | $0.007 | $0.014 |
| キャッシュミス入力 / 1Mトークン | $0.22 | $0.44 |
| 出力 / 1Mトークン | $0.66 | $1.32 |
すべての画像が384トークンの上限に達し、キャッシュミス入力として課金される保守的なケースでは、1,000枚の画像入力のみの費用はオフピークで約$0.0845、ピークで約$0.169です。テキスト入力、モデル出力、ツールループ、再試行は含まれません。
DeepSeekの中国語価格ページでは、地域別の人民元価格としてキャッシュミス入力がオフピークでCNY 1.50/M、ピークでCNY 3.00/Mと掲載されています。同じ最大画像の前提では、1,000枚の画像入力は約CNY 0.576またはCNY 1.152です。ドルと人民元の表は地域別の公式価格であり、リアルタイムの為替換算ではありません。
提供された中国語レポートはこれらの費用を他のVision APIと比較し、25倍から50倍の差と説明していました。この記事では、競合モデル、画像トークン規則、時間帯、出力課金を統一手法で検証できなかったため、その比率を転載しません。
実際の請求記録で確認: モデルが当ゲートウェイのライブカタログに表示されたら、既存キーに少額チャージし、機密でない画像1枚をテストしてください。画像トークン、テキストトークン、出力トークン、レイテンシ、実際の課金を記録します。
3つの画像入力方法
1. base64インライン
JPEG、PNG、GIF、WebPをdata URLとしてエンコードします。小さな画像や一時的な非公開画像に適しています。インラインリクエスト本体は48 MiBまで、画像1枚は32 MiBまでです。
2. 外部URL
一般公開され、HTTP(S)でダウンロード可能な画像を指定します。DeepSeekはURL画像1枚を32 MiBに制限し、ダウンロードは60秒以内に完了する必要があります。Cookie、プライベートネットワーク、または短期間の署名に依存するリンクは、実際のルートでテスト済みでない限り避けてください。
3. Files APIの file_id
画像を1回アップロードし、複数のリクエストで file_id を再利用します。公式Files APIは無料で、64 MiBまでのファイルを受け付け、1時間から30日の有効期限を任意で設定できます。同じデザイン、ダッシュボード、スクリーンショットを何度も確認するエージェントにとって、アップロード帯域の重複を減らせます。モデルが画像を読み取る際の画像トークンは依然として課金されます。
Chat Completionsの画像リクエスト
以下は、DeepSeek公式のOpenAI互換エンドポイントを呼び出す最小例です。
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "このページのスクリーンショットを調べ、主要セクション、色、レスポンシブ表示のリスクを列挙してください。"},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
Chat Completionsはテキストと画像のブロック配列を使います。Responses APIは input_image ブロックで画像を渡し、Anthropic Messagesは https://api.deepseek.com/anthropic エンドポイントを使用できます。コンテンツブロックのスキーマが異なるため、Chatのリクエスト本体をResponsesやMessagesにそのままコピーしないでください。
当ゲートウェイを使用する場合は、まず正確なモデルIDがライブカタログにあることを確認し、文書に記載されたゲートウェイのBase URLと認証方法を使ってください。DeepSeek公式で利用できることは、すべてのサードパーティゲートウェイが画像転送、Files API、各プロトコル、課金をすでに有効化した証明にはなりません。
実用的なマルチモーダルエージェントのワークフロー
提供された中国語資料には、スクリーンショットからWebサイトを再構築する例と、大まかな事業要件をB2Bプレゼンテーションにまとめる例があります。これらは第三者のデモであり、当サイトの独立テストではありませんが、実用的なパターンを示しています。
スクリーンショットからHTMLへ
コーディングツールがHTML、CSS、JavaScriptを生成する前に、モデルはレイアウト、階層、色、タイポグラフィ、間隔、画像位置を識別する必要があります。実際の評価では、最終スクリーンショット1枚だけでなく、視覚差分、375pxのモバイル表示、キーボードフォーカス、ホバー状態、モーション低減設定を比較すべきです。
レポート、スライド、デザインレビュー
Vision-Expはチャート、OCRテキスト、ビジュアルスタイル、ページ構造を読み取り、その根拠を文書、プレゼンテーション、コーディングのツールに渡せます。納品物の品質は、エージェントフレームワーク、利用可能なツール、元素材、検収プロセスにも依存します。画像理解だけで、顧客に納品できるスライドが保証されるわけではありません。
エージェントの視覚的検収
エージェントは、重要なブラウザやデスクトップ操作の後にスクリーンショットを確認し、観測状態と期待結果を比較できます。画像トークンの上限は繰り返しの視覚確認にかかる入力コストを抑えますが、出力とツール呼び出しも総予算に含める必要があります。
画像が不要なワークロードでは、まずDeepSeek V4 FlashとResponses APIのガイドと比較してください。より難しいテキスト専用の推論やコーディングには、DeepSeek-V4-Pro-0813 APIガイドも参考にしてください。新しい実験的Visionルートは、すべてのテキスト専用リクエストをすぐに移行する理由にはなりません。
画像理解は画像生成ではない
DeepSeekの文書では、deepseek-v4-flash-vision-exp をテキストと画像を受け取り、画像の説明、スクリーンショット内の文字読み取り、チャート分析を行うモデルと定義しています。画像生成モデルとしては掲載されていません。
生成されたWebサイトやスライドに画像が含まれる場合、その素材はプロンプト、ストック素材、描画コード、別の画像生成ツール、エージェントが利用できるファイルのいずれかに由来する可能性があります。視覚的な成果物だけで、Vision-Expがその画像を生成したとは証明できません。
本番導入の評価チェックリスト
- 正確なID
deepseek-v4-flash-vision-expを使用し、日付のエイリアスを推測で作らない。 - 現在のプロバイダーまたはゲートウェイのカタログにそのIDが実際に掲載されていることを確認する。
- base64、URL、Files APIを個別にテストし、サードパーティの対応範囲が同じと仮定しない。
- 秘密情報、個人データ、プライベートURL、顧客情報のない小さな画像を使う。
- 画像数、画像トークン、テキストトークン、出力トークン、レイテンシ、課金を記録する。
- 近似回答だけで承認せず、OCR、チャート、レイアウト、小さな文字用の採点可能なテストを構築する。
- ツール、ネットワークアクセス、ファイル書き込み、削除、デプロイ、決済に対する権限境界を保つ。
- 実験的なルートのため、
deepseek-v4-flash、deepseek-v4-pro、または別のVisionモデルへのフォールバックを維持する。
要点
deepseek-v4-flash-vision-expはDeepSeek APIで利用できる実験的マルチモーダルルートであり、画像生成モデルではありません。- 1Mトークンのコンテキストウィンドウ、最大384Kの出力、画像1枚あたり最大384入力トークンを備えます。
- Chat Completions、Anthropic Messages、Responses APIに対応し、base64、URL、Files APIで画像を渡せます。
- DeepSeekはマルチモーダルエージェント性能がOpus-4.8に近いとしていますが、公式表では3項目の勝利と複数の敗北が示されています。
- DeepSeek公式直接APIはV4 Flashと同価格ですが、サードパーティルートの価格とプロトコル対応は個別に確認が必要です。
- experimentalというラベルのため、本番使用前に受け入れテスト、予算、フォールバックルートが重要です。
よくある質問
DeepSeek-V4-Flash-Vision-Expは公式に利用できますか?
はい。DeepSeekは2026年8月21日に公式APIプラットフォームで提供を開始しました。実験的なルートであり、長期にわたる安定した動作を保証するものではありません。
正確なモデルIDは何ですか?
deepseek-v4-flash-vision-exp を使用します。表示用の大文字名ではなく、小文字とハイフンのAPI IDを保ってください。
すべての画像が常に384トークンを使いますか?
いいえ。実際のトークン数はDeepSeekのリサイズとタイル分割のルールに従います。画像1枚は最大384トークンで、複数画像は別々に計算されます。
Vision-Expは画像を生成できますか?
DeepSeekは画像理解、OCR、スクリーンショットの読み取り、チャート分析を文書化していますが、ネイティブな画像生成モデルとはしていません。Webサイトやデッキに含まれる画像は、他のツールや提供済み素材に由来する場合があります。
V4 Flashよりどれくらい強いですか?
Vision-ExpはDeepSeekの表で直接比較できる9項目のうち8項目で上回り、Cybergymで下回ります。ベンダーベンチマークは、すべてのテキストタスクやリポジトリタスクが改善することを保証しません。
Files APIで画像を再利用できますか?
はい。1回アップロードし、後続リクエストで返された file_id を参照できます。ファイルの保存とアップロードは無料ですが、モデルが画像を処理すると画像トークンは課金されます。
Codexで使用できますか?
DeepSeekはResponses APIの画像対応を確認していますが、Codexを介した画像転送はクライアントのバージョン、コンテンツブロックの形式、ゲートウェイに依存します。プレーンテキスト、画像入力、ツール結果の画像を個別にテストしてください。
当ゲートウェイのVision-Exp倍率はいくつですか?
2026年8月22日の確認時点で、当ゲートウェイの公開価格カタログにこのIDは掲載されていません。既存の deepseek-v4-flash ルートと同じとは推測せず、ライブのモデル価格を確認してください。
一次情報
- DeepSeek:V4 Flash Vision Expリリース:リリース日、モデルID、マルチモーダルの位置付け、ベンダーベンチマーク、API形式、Harness 0.1.1
- DeepSeek Visionガイド:画像の入力方法、トークン計算、フォーマット、サイズ、リクエスト制限
- DeepSeekのモデルと価格:1Mコンテキスト、384K出力、時間帯別の公式直接価格、2,500の同時実行数、機能表
- DeepSeek Files API:アップロード、
file_id、サイズ制限、有効期限の制御 - DeepSeek公式Xアナウンス:オリジナルのリリース告知