DeepSeek V4 Flash Vision Exp徹底レビュー:料金・制限・モデル比較

DeepSeek V4 Flash Vision Expを公式資料で検証し、画像Tokenコスト、API制限、Agentベンチマーク、Gemini 3.7 Flash・Claude Opus 4.8との比較、Modelflareの現行料金と提供状況を解説します。

DeepSeekは2026年8月21日にDeepSeek V4 Flash Vision Expを公開しました。正確なAPIモデルIDはdeepseek-v4-flash-vision-expです。テキストと画像を入力し、テキストを出力します。Token単価はV4 Flashと同じです。

重要なのは画像の課金方式です。DeepSeekは推論前に各画像をリサイズし、入力を最大384 Tokenに抑えます。スクリーンショットを繰り返し読むAgentでは非常に安価です。一方、大きな画像はおよそ800×800ピクセル相当の予算まで縮小されます。安さと、元の高解像度を保つことは同じではありません。

本モデルは実験版であり、あらゆる視覚ワークロードをそのまま置き換えるproductionモデルではありません。以下では、DeepSeek公式仕様、ベンダー公表ベンチマーク、再計算できる費用、Modelflareの現在の提供状況を分けて扱います。変動する情報は2026年8月22日に確認しました。

DeepSeek V4 Flash Vision Expの主要仕様

項目 公式値
公開日 2026年8月21日
ステータス 実験的APIモデル
モデルID deepseek-v4-flash-vision-exp
入出力 テキスト・画像入力、テキスト出力
コンテキスト 1M Token
最大出力 384K Token
Thinking Thinking/非Thinkingをサポート。文書上の既定はThinking
画像形式 JPEG、PNG、GIF、WebP
API形式 Chat Completions、Responses API、Anthropic互換Messages
1画像の上限 自動リサイズ後に最大384入力Token
同時実行上限 2,500
FIM Completion 非対応

DeepSeekは総パラメータ数、Active Parameter、Expert数、学習コーパス、今回のアーキテクチャ変更を公開していません。一次資料のない正確な数値は推測です。

V4 Flashから実際に変わった点

DeepSeekによれば、Vision Expの純粋なテキストAgent、推論、世界知識は正式版V4 Flashと同等です。追加されたのはネイティブな視覚理解です。スクリーンショット、文書画像、グラフ、写真を、別の画像説明モデルを挟まず同じツールループへ渡せます。

公開時の表には次の結果があります。

評価 DeepSeek公表値
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench(公開) 25.7
ApexBench Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench Pass@5 35.0

DeepSeekは、マルチモーダルAgent能力がClaude Opus 4.8に近いとも説明しています。これはベンダーの主張であり、Modelflareの独立評価ではありません。表にはテキストAgentと視覚依存タスクが混在します。公開コードAgent評価の条件はDeepSeek Harness minimal、max effort、top_p=0.95temperature=1.0です。自社で再実行するタスクを選ぶ材料にはなりますが、万能ランキングではありません。

公式料金と画像1枚の実コスト

DeepSeek料金ページは100万Token当たりの米ドル料金を掲載しています。ピーク時間はUTC 01:00–04:00と06:00–10:00、それ以外はオフピークです。

課金項目 オフピーク ピーク
キャッシュ入力 $0.007 $0.014
非キャッシュ入力 $0.22 $0.44
出力 $0.66 $1.32
384 Token画像1枚の最大入力費用 $0.00008448 $0.00016896

最後の行は384 × 入力単価 ÷ 1,000,000の計算であり、別の画像料金ではありません。小さい画像はより少ないTokenになる場合があります。テキスト入力と生成出力は別途課金されます。

自動リサイズが安さと制限の両方を生みます。約384×384未満の画像は縦横比を保って拡大され、大きな画像は総画素数がおよそ800×800に近づくよう縮小されます。そのため2000×2000と5000×5000が同じ384 Token上限に達することがあります。費用は下がりますが、小さな文字、密なグラフのラベル、正確な画面座標が失われる可能性があります。

Gemini 3.7 Flash、Claude Opus 4.8との価格比較

3モデルは異なるマルチモーダル要件を解決します。下表は各社の直接API標準料金で、ツール、キャッシュ保存、再試行、Gateway割引を含みません。

モデル 状態 入力 Context / 最大出力 非キャッシュ入力 出力 主なトレードオフ
DeepSeek V4 Flash Vision Exp 実験版 テキスト、画像 1M / 384K オフピーク$0.22、ピーク$0.44 オフピーク$0.66、ピーク$1.32 最安クラス、画像384 Token上限。リサイズは強い
Gemini 3.7 Flash GA テキスト、画像、動画、音声、PDF 1M / 64K 2026-12-31まで$0.75 2026-12-31まで$3.75 モダリティと組み込みツールが広い。価格は高く後に上昇
Claude Opus 4.8 GA テキスト、画像、PDF 1M / 128K $5.00 $25.00 高解像度視覚と成熟したComputer Use。プレミアム価格

画像なしで非キャッシュ入力100K Token、出力10K Tokenの場合:

  • DeepSeekはオフピーク約$0.0286ピーク約$0.0572
  • Gemini 3.7 Flashは導入価格で**$0.1125**。
  • Claude Opus 4.8は**$0.75**。

この例ではDeepSeekはGeminiよりピークで約49%、オフピークで約75%安く、Claudeより92~96%安価です。比較しているのは請求額であり、品質ではありません。

画像では差が広がりますが、解像度も異なります。Anthropic文書では、Opus 4.8の1000×1000画像は1,296 Visual Token、約$0.00648です。DeepSeekは任意の画像をピーク$0.00016896、オフピーク$0.00008448に抑え、入力費用は約38~77分の1です。ただしDeepSeekは800×800付近まで縮小し、Opusはより多くの詳細を保持します。

100枚の1メガピクセル画像、100Kのテキスト入力、10Kの出力をまとめると、DeepSeekでは最大オフピーク$0.0370ピーク$0.0741です。Anthropicの1画像1,296 Tokenを適用したOpus 4.8は**$1.398**です。これは同品質テストではなく、低価格な視覚トリアージと高解像度検査が別ワークロードだと示す計算です。

ワークロード別の選び方

DeepSeek V4 Flash Vision Expを管理された範囲で試す用途は、多数のスクリーンショット、一般文書、グラフ、OCRに近い抽出、ツールループ内の視覚観察です。すべての画素保持より、成功タスク当たりコストを優先する場合に向きます。

広いマルチモーダル処理にはGemini 3.7 Flashが適します。画像、動画、音声、PDFを1つの流れで処理し、Search Grounding、コード実行、File Search、URL Context、previewのComputer Useが必要な場合です。GeminiはGAですが、DeepSeekのVision endpointは実験版です。

高解像度の視覚AgentにはClaude Opus 4.8が候補です。密な文書、小さなUI、Computer Use、長時間ブラウザタスクの価値が価格を上回る場合です。Anthropicは長辺2,576ピクセル、最大4,784 Visual Tokenを保持できるため、1画像の単価だけを比較しても同条件にはなりません。

段階的ルーティングも可能です。低価格モデルが分類・抽出し、曖昧または詳細依存のケースだけ高解像度モデルへ送ります。ただし2回目の呼び出し、遅延、昇格率を測ってください。大半が昇格するなら2モデル構成は自動的には安くなりません。

画像の渡し方と制限

DeepSeek Visionガイドは次の3方式をサポートします。

  1. ローカル画像のbase64インライン;
  2. 公開HTTP/HTTPS URL;
  3. Files APIの再利用可能なfile_id
境界 制限
インラインRequest Body 48 MiB
base64またはURL画像1枚 32 MiB
Files API画像1枚 64 MiB
1リクエストの画像数 600
file_idなしの合計 64 MiB
file_id込みの合計 200 MiB
最大辺 8,192 px。15枚以上では4,096 px
外部URL 8,192文字、60秒以内に取得

detail: "low"は512×512へ縮小し、低詳細OCRや分類に向きます。highoriginal、現在のautoは通常の自動リサイズ前に原画像を保ちます。Chat Completionsでは画像はuserメッセージのみです。Responsesではdeveloperとツール出力にも置けますが、systemassistantでは拒否されます。

Modelflare経由のResponses API例

Modelflareは正確なモデルIDとResponses API routeを公開しました。deepseek-stableグループのAPI Keyを使います。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "このダッシュボードを読み、3つの異常と、それぞれ画面上で確認できる根拠を返してください。",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

非公開画像は公開URLではなくbase64かFiles APIを使います。資格情報、非公開オブジェクトURL、個人情報をログに残さないでください。DeepSeekのResponses実装はstatelessで、previous_response_id、conversation、storeは非対応です。Function CallingとWeb Searchは使えますが、組み込みComputer Use、Code Interpreter、File Search、MCPは無視されます。

実験モデルのproductionチェック

  1. 正確なdeepseek-v4-flash-vision-expを固定し、deepseek-v4-flashを視覚aliasとみなさない。
  2. 小文字、密な表、グラフ、スクリーンショット、回転画像、敵対的内容を含む非機密テストセットを作る。
  3. detail: "low"と既定を成功率、遅延、課金Tokenで比較する。
  4. 複数protocolを使う場合、Chat Completions、Responses、Messagesを別々に検証する。
  5. Structured Output、Tool Callの対応、streaming、cancel、refusal、破損画像を試す。
  6. 繰り返す非公開画像はFiles API IDを使い、保存・削除方針を決める。
  7. 画像数・寸法、入力・cache・出力Token、retry、遅延、route、最終費用を記録する。
  8. 実トラフィックの基準を満たすまで、詳細依存・重要業務にはGA fallbackを残す。

HTTP 200は1リクエストの完了を示すだけです。スクリーンショットの正確な読解、各ツールの認可、成功タスク当たりコスト低下までは証明しません。

ModelflareでのDeepSeek V4 Flash Vision Exp料金

現在は利用できます。2026年8月22日の後続production確認では、公開モデルと料金に正確なdeepseek-v4-flash-vision-expdeepseek-stableグループとして掲載され、OpenAI互換Chat CompletionsとResponses API routeが公開されました。

カタログは公式ピーク参考価格である入力$0.44、出力$1.32、cache入力$0.014 / 100万Tokenを基準にし、deepseek-stableの0.9x倍率を適用します。

Modelflareグループ 入力 Cache入力 出力 384 Token画像1枚の最大非cache入力費用
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

この料金では、非cacheテキスト入力100K Tokenと出力10K Tokenで約**$0.05148です。384 Token上限の画像100枚、テキスト入力100K、出力10Kなら最大約$0.06669**で、retryや別requestは含みません。

0.9xグループ価格をDeepSeek直結のオフピーク料金と混同しないでください。Modelflareは設定済み参考価格へ倍率を適用し、ベンダーの時間帯に応じて自動切替はしません。グループ、route、価格は変わるため、live料金ページと完了request記録を確認してください。

結論

DeepSeek V4 Flash Vision Expは視覚Agentの費用構造を変えます。画像1枚を最大384 Tokenに抑え、V4 Flash料金で処理します。スクリーンショットの一次選別、文書抽出、グラフ読解、大量の視覚ツールループでは実用的な差になります。

同じ384 Token上限が注意点でもあります。リサイズでComputer Useや密な文書に必要な詳細が消える可能性があり、endpointは実験版、benchmarkもベンダー公表です。「すべてを置き換えるモデル」ではなく、「低コスト視覚ワーカーとして検証するモデル」と捉えるのが妥当です。

公式資料と更新履歴

一次資料:

更新履歴:

  • **2026年8月22日:**初版公開。公式status、仕様、画像処理、制限、protocol、時間帯料金、競合料金、計算、Modelflareカタログを確認。
  • **2026年8月22日後刻:**正確なIDのModelflare提供開始を反映。deepseek-stable 0.9x料金、費用計算、対応route、Modelflare Responses API例を追加。