DeepSeek V4 Flash Vision Exp徹底レビュー:料金・制限・モデル比較
DeepSeek V4 Flash Vision Expを公式資料で検証し、画像Tokenコスト、API制限、Agentベンチマーク、Gemini 3.7 Flash・Claude Opus 4.8との比較、Modelflareの現行料金と提供状況を解説します。
DeepSeekは2026年8月21日にDeepSeek V4 Flash Vision Expを公開しました。正確なAPIモデルIDはdeepseek-v4-flash-vision-expです。テキストと画像を入力し、テキストを出力します。Token単価はV4 Flashと同じです。
重要なのは画像の課金方式です。DeepSeekは推論前に各画像をリサイズし、入力を最大384 Tokenに抑えます。スクリーンショットを繰り返し読むAgentでは非常に安価です。一方、大きな画像はおよそ800×800ピクセル相当の予算まで縮小されます。安さと、元の高解像度を保つことは同じではありません。
本モデルは実験版であり、あらゆる視覚ワークロードをそのまま置き換えるproductionモデルではありません。以下では、DeepSeek公式仕様、ベンダー公表ベンチマーク、再計算できる費用、Modelflareの現在の提供状況を分けて扱います。変動する情報は2026年8月22日に確認しました。
DeepSeek V4 Flash Vision Expの主要仕様
| 項目 | 公式値 |
|---|---|
| 公開日 | 2026年8月21日 |
| ステータス | 実験的APIモデル |
| モデルID | deepseek-v4-flash-vision-exp |
| 入出力 | テキスト・画像入力、テキスト出力 |
| コンテキスト | 1M Token |
| 最大出力 | 384K Token |
| Thinking | Thinking/非Thinkingをサポート。文書上の既定はThinking |
| 画像形式 | JPEG、PNG、GIF、WebP |
| API形式 | Chat Completions、Responses API、Anthropic互換Messages |
| 1画像の上限 | 自動リサイズ後に最大384入力Token |
| 同時実行上限 | 2,500 |
| FIM Completion | 非対応 |
DeepSeekは総パラメータ数、Active Parameter、Expert数、学習コーパス、今回のアーキテクチャ変更を公開していません。一次資料のない正確な数値は推測です。
V4 Flashから実際に変わった点
DeepSeekによれば、Vision Expの純粋なテキストAgent、推論、世界知識は正式版V4 Flashと同等です。追加されたのはネイティブな視覚理解です。スクリーンショット、文書画像、グラフ、写真を、別の画像説明モデルを挟まず同じツールループへ渡せます。
公開時の表には次の結果があります。
| 評価 | DeepSeek公表値 |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench(公開) | 25.7 |
| ApexBench Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench Pass@5 | 35.0 |
DeepSeekは、マルチモーダルAgent能力がClaude Opus 4.8に近いとも説明しています。これはベンダーの主張であり、Modelflareの独立評価ではありません。表にはテキストAgentと視覚依存タスクが混在します。公開コードAgent評価の条件はDeepSeek Harness minimal、max effort、top_p=0.95、temperature=1.0です。自社で再実行するタスクを選ぶ材料にはなりますが、万能ランキングではありません。
公式料金と画像1枚の実コスト
DeepSeek料金ページは100万Token当たりの米ドル料金を掲載しています。ピーク時間はUTC 01:00–04:00と06:00–10:00、それ以外はオフピークです。
| 課金項目 | オフピーク | ピーク |
|---|---|---|
| キャッシュ入力 | $0.007 | $0.014 |
| 非キャッシュ入力 | $0.22 | $0.44 |
| 出力 | $0.66 | $1.32 |
| 384 Token画像1枚の最大入力費用 | $0.00008448 | $0.00016896 |
最後の行は384 × 入力単価 ÷ 1,000,000の計算であり、別の画像料金ではありません。小さい画像はより少ないTokenになる場合があります。テキスト入力と生成出力は別途課金されます。
自動リサイズが安さと制限の両方を生みます。約384×384未満の画像は縦横比を保って拡大され、大きな画像は総画素数がおよそ800×800に近づくよう縮小されます。そのため2000×2000と5000×5000が同じ384 Token上限に達することがあります。費用は下がりますが、小さな文字、密なグラフのラベル、正確な画面座標が失われる可能性があります。
Gemini 3.7 Flash、Claude Opus 4.8との価格比較
3モデルは異なるマルチモーダル要件を解決します。下表は各社の直接API標準料金で、ツール、キャッシュ保存、再試行、Gateway割引を含みません。
| モデル | 状態 | 入力 | Context / 最大出力 | 非キャッシュ入力 | 出力 | 主なトレードオフ |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | 実験版 | テキスト、画像 | 1M / 384K | オフピーク$0.22、ピーク$0.44 | オフピーク$0.66、ピーク$1.32 | 最安クラス、画像384 Token上限。リサイズは強い |
| Gemini 3.7 Flash | GA | テキスト、画像、動画、音声、PDF | 1M / 64K | 2026-12-31まで$0.75 | 2026-12-31まで$3.75 | モダリティと組み込みツールが広い。価格は高く後に上昇 |
| Claude Opus 4.8 | GA | テキスト、画像、PDF | 1M / 128K | $5.00 | $25.00 | 高解像度視覚と成熟したComputer Use。プレミアム価格 |
画像なしで非キャッシュ入力100K Token、出力10K Tokenの場合:
- DeepSeekはオフピーク約$0.0286、ピーク約$0.0572。
- Gemini 3.7 Flashは導入価格で**$0.1125**。
- Claude Opus 4.8は**$0.75**。
この例ではDeepSeekはGeminiよりピークで約49%、オフピークで約75%安く、Claudeより92~96%安価です。比較しているのは請求額であり、品質ではありません。
画像では差が広がりますが、解像度も異なります。Anthropic文書では、Opus 4.8の1000×1000画像は1,296 Visual Token、約$0.00648です。DeepSeekは任意の画像をピーク$0.00016896、オフピーク$0.00008448に抑え、入力費用は約38~77分の1です。ただしDeepSeekは800×800付近まで縮小し、Opusはより多くの詳細を保持します。
100枚の1メガピクセル画像、100Kのテキスト入力、10Kの出力をまとめると、DeepSeekでは最大オフピーク$0.0370、ピーク$0.0741です。Anthropicの1画像1,296 Tokenを適用したOpus 4.8は**$1.398**です。これは同品質テストではなく、低価格な視覚トリアージと高解像度検査が別ワークロードだと示す計算です。
ワークロード別の選び方
DeepSeek V4 Flash Vision Expを管理された範囲で試す用途は、多数のスクリーンショット、一般文書、グラフ、OCRに近い抽出、ツールループ内の視覚観察です。すべての画素保持より、成功タスク当たりコストを優先する場合に向きます。
広いマルチモーダル処理にはGemini 3.7 Flashが適します。画像、動画、音声、PDFを1つの流れで処理し、Search Grounding、コード実行、File Search、URL Context、previewのComputer Useが必要な場合です。GeminiはGAですが、DeepSeekのVision endpointは実験版です。
高解像度の視覚AgentにはClaude Opus 4.8が候補です。密な文書、小さなUI、Computer Use、長時間ブラウザタスクの価値が価格を上回る場合です。Anthropicは長辺2,576ピクセル、最大4,784 Visual Tokenを保持できるため、1画像の単価だけを比較しても同条件にはなりません。
段階的ルーティングも可能です。低価格モデルが分類・抽出し、曖昧または詳細依存のケースだけ高解像度モデルへ送ります。ただし2回目の呼び出し、遅延、昇格率を測ってください。大半が昇格するなら2モデル構成は自動的には安くなりません。
画像の渡し方と制限
DeepSeek Visionガイドは次の3方式をサポートします。
- ローカル画像のbase64インライン;
- 公開HTTP/HTTPS URL;
- Files APIの再利用可能な
file_id。
| 境界 | 制限 |
|---|---|
| インラインRequest Body | 48 MiB |
| base64またはURL画像1枚 | 32 MiB |
| Files API画像1枚 | 64 MiB |
| 1リクエストの画像数 | 600 |
file_idなしの合計 |
64 MiB |
file_id込みの合計 |
200 MiB |
| 最大辺 | 8,192 px。15枚以上では4,096 px |
| 外部URL | 8,192文字、60秒以内に取得 |
detail: "low"は512×512へ縮小し、低詳細OCRや分類に向きます。high、original、現在のautoは通常の自動リサイズ前に原画像を保ちます。Chat Completionsでは画像はuserメッセージのみです。Responsesではdeveloperとツール出力にも置けますが、systemやassistantでは拒否されます。
Modelflare経由のResponses API例
Modelflareは正確なモデルIDとResponses API routeを公開しました。deepseek-stableグループのAPI Keyを使います。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "このダッシュボードを読み、3つの異常と、それぞれ画面上で確認できる根拠を返してください。",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
非公開画像は公開URLではなくbase64かFiles APIを使います。資格情報、非公開オブジェクトURL、個人情報をログに残さないでください。DeepSeekのResponses実装はstatelessで、previous_response_id、conversation、storeは非対応です。Function CallingとWeb Searchは使えますが、組み込みComputer Use、Code Interpreter、File Search、MCPは無視されます。
実験モデルのproductionチェック
- 正確な
deepseek-v4-flash-vision-expを固定し、deepseek-v4-flashを視覚aliasとみなさない。 - 小文字、密な表、グラフ、スクリーンショット、回転画像、敵対的内容を含む非機密テストセットを作る。
detail: "low"と既定を成功率、遅延、課金Tokenで比較する。- 複数protocolを使う場合、Chat Completions、Responses、Messagesを別々に検証する。
- Structured Output、Tool Callの対応、streaming、cancel、refusal、破損画像を試す。
- 繰り返す非公開画像はFiles API IDを使い、保存・削除方針を決める。
- 画像数・寸法、入力・cache・出力Token、retry、遅延、route、最終費用を記録する。
- 実トラフィックの基準を満たすまで、詳細依存・重要業務にはGA fallbackを残す。
HTTP 200は1リクエストの完了を示すだけです。スクリーンショットの正確な読解、各ツールの認可、成功タスク当たりコスト低下までは証明しません。
ModelflareでのDeepSeek V4 Flash Vision Exp料金
現在は利用できます。2026年8月22日の後続production確認では、公開モデルと料金に正確なdeepseek-v4-flash-vision-expがdeepseek-stableグループとして掲載され、OpenAI互換Chat CompletionsとResponses API routeが公開されました。
カタログは公式ピーク参考価格である入力$0.44、出力$1.32、cache入力$0.014 / 100万Tokenを基準にし、deepseek-stableの0.9x倍率を適用します。
| Modelflareグループ | 入力 | Cache入力 | 出力 | 384 Token画像1枚の最大非cache入力費用 |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
この料金では、非cacheテキスト入力100K Tokenと出力10K Tokenで約**$0.05148です。384 Token上限の画像100枚、テキスト入力100K、出力10Kなら最大約$0.06669**で、retryや別requestは含みません。
0.9xグループ価格をDeepSeek直結のオフピーク料金と混同しないでください。Modelflareは設定済み参考価格へ倍率を適用し、ベンダーの時間帯に応じて自動切替はしません。グループ、route、価格は変わるため、live料金ページと完了request記録を確認してください。
結論
DeepSeek V4 Flash Vision Expは視覚Agentの費用構造を変えます。画像1枚を最大384 Tokenに抑え、V4 Flash料金で処理します。スクリーンショットの一次選別、文書抽出、グラフ読解、大量の視覚ツールループでは実用的な差になります。
同じ384 Token上限が注意点でもあります。リサイズでComputer Useや密な文書に必要な詳細が消える可能性があり、endpointは実験版、benchmarkもベンダー公表です。「すべてを置き換えるモデル」ではなく、「低コスト視覚ワーカーとして検証するモデル」と捉えるのが妥当です。
公式資料と更新履歴
一次資料:
- DeepSeek API Change Log
- DeepSeek Vision Guide
- DeepSeekモデルと料金
- DeepSeek Responses API
- Google: Gemini 3.7 Flash
- Google: Gemini API料金
- Anthropic: Claudeモデル概要
- Anthropic: Vision Tokenと画像制限
更新履歴:
- **2026年8月22日:**初版公開。公式status、仕様、画像処理、制限、protocol、時間帯料金、競合料金、計算、Modelflareカタログを確認。
- **2026年8月22日後刻:**正確なIDのModelflare提供開始を反映。
deepseek-stable0.9x料金、費用計算、対応route、Modelflare Responses API例を追加。