DeepSeek V4.1 Flash 詳解:アーキテクチャ、Modelflare の価格、競合との比較
一次資料に基づき、DeepSeek V4.1 Flash のアーキテクチャ、1M コンテキスト、384K 出力、Agent ベンチマーク、API の制限を分解し、OpenAI と Anthropic のモデル、および現在の Modelflare での提供と価格を比べます。

DeepSeek V4.1 Flash は、長い Agent ループのために作られた、低コストでオープンウェイトのマルチモーダルモデルです。2026年9月10日にリリースされ、100万トークンのコンテキストウィンドウ、最大 384K の出力トークン、異例に安い公式 API、そしてプロンプト処理と KV キャッシュの圧力を下げるアーキテクチャを組み合わせます。最も明確な利点は、すべてのベンチマークに勝つことではありません。コーディング、ターミナル、自動化、ツール使用の評価で競争力を残したまま、1ドルあたりに試みられる、長コンテキストの Agent 作業の量です。
その結論には、境界が要ります。下のベンチマークの数は DeepSeek が公表したものであり、Modelflare が独立に再現したものではありません。DeepSeek 自身の報告は、最も難しい推論と端の場合で、このモデルはなお最大のクローズドシステムに後れる、と言います。正しい第一者 API のモデル ID は deepseek-flash です。DeepSeek V4.1 Flash は今、バージョン付きのモデル ID deepseek-v4.1-flash-0910 で Modelflare に載っており、公開の deepseek-stable グループで Chat Completions と Responses の両方があります。
最終確認:2026-09-10 UTC。価格、別名、カタログの状態は変わり得ます。
直接の答え:DeepSeek V4.1 Flash とは何か
DeepSeek のリリース告知は、DeepSeek V4.1 Flash を、以前の Flash ラインの本番代替と定義します。公式エンドポイントは deepseek-flash を受け付けます。旧名 deepseek-v4-flash と deepseek-v4-flash-vision-exp は、DeepSeek が一時的に受け付け、Flash の料金で V4.1 Flash へ振り分けます。2026年9月14日 04:00 UTC から、DeepSeek は、deepseek-v4-pro へのリクエストも、のちの V4.1 Pro のリリースまで V4.1 Flash へ振り分ける、と言います。
この移行方針は、DeepSeek 自身の API に属します。Modelflare は、リリース日付の入った明示的な ID deepseek-v4.1-flash-0910 を使い、以前の deepseek-v4-flash の項目を静かに貼り替えません。Modelflare の運用者がローンチを確認し、モデルは公開と origin の両方の価格カタログに 2026-09-10 15:21 UTC で現れました。クライアントは、第一者の別名がすべてのゲートウェイで変わらず働くと仮定せず、自分のプロバイダーが示す正確な ID を使うべきです。
このモデルの実際の構成は、五つの部分です。画像とテキストのマルチモーダル入力。テキスト出力。552B パラメータの MoE バックボーン。追加の 196B パラメータの Engram メモリ。そして、プロンプトトークンあたり 8B パラメータ対、デコードされたトークンあたり 16B の、非対称な活性化です。最後の点が中心です。入力の重い Agent の作業負荷は、同規模の対称なデコーダーだけの設計より、繰り返すプリフィルのあいだの計算が少なくて済むはずです。
仕様を一覧する
次の値は、公式リリース、モデルカード、技術報告から来ます。「バックボーンのパラメータ」と「Engram のパラメータ」は異なる格納を記述し、どちらの数も、トークンあたりの活性計算には等しくありません。
| 項目 | DeepSeek V4.1 Flash |
|---|---|
| 公式 API ID | deepseek-flash |
| Modelflare のモデル ID | deepseek-v4.1-flash-0910 |
| モデルの分類 | マルチモーダル混合エキスパート Transformer |
| 入力 / 出力 | テキストと画像が入る。テキストが出る |
| Transformer の配置 | 40 層:20 層の因果エンコーダー + 20 層のデコーダー |
| パラメータの格納 | 552B のバックボーン + 196B の Engram 条件メモリ |
| 活性パラメータ | プリフィルトークンあたり 8B。デコードトークンあたり 16B |
| コンテキスト / 最大出力 | 1M / 384K トークン |
| 事前学習 | 45T のマルチモーダルコーパストークン。テキストのみ対マルチモーダルのトークン比は 7:1 |
| 主な注意 / キャッシュ設計 | CED + CSA2 + FP4 のグローバル KV。FP8 の局所 SWA KV |
| グローバル KV の足跡 | トークンあたり 890 バイト。DeepSeek が報告 |
| 公開の推論プリセット | 内部の effort 尺度で low = 50、high = 75、max = 100 |
| 公式 API の同時実行上限 | 2,500 の同時リクエスト |
| ライセンス | MIT チェックポイントライセンス |
384K の出力上限は、この記事の現在の OpenAI と Anthropic の比較モデルに公表された、128K の最大の三倍です。それは上限であり、推奨ではありません。非常に長い出力は、遅延、費用、ドリフトの面を増やします。長い Agent にとってより有用な問いは、ツール呼び出しのあと、モデルが要件を保持し、実際の受け入れ検査を通せるかです。
なぜアーキテクチャは、長い Agent ループのために建てられているか
ツールを使う Agent は、観測、コマンドの結果、編集を、履歴へ繰り返し足します。新しいターンごとに、プロンプトのプリフィル、伸びるコンテキストの上の注意、KV の格納、新しい出力が要ることがあります。DeepSeek V4.1 Flash は、単により小さい一つのモデルに頼らず、各費用を別々に攻めます。
| Agent の費用 | V4.1 Flash の仕組み | 意図する効果 |
|---|---|---|
| 長いプロンプトの再処理 | Causal Encoder-Decoder(CED) | DeepSeek の分析では、長い列の漸近的なプリフィル作業をほぼ半分にする |
| グローバル履歴を HBM に保つ | CSA2 の層をまたぐ再利用 + FP4 | 重複するグローバル KV の項目と、項目あたりのバイトを減らす |
| 局所の注意状態を持続する | SWA Bounded Replay | 各層の完全な局所キャッシュを格納せず、有界の局所窓を再構成する |
| 安定したトークンパターンを想起する | Engram | 条件付きの n-gram メモリを、疎にアクセスされる表へ移す |
| トークンを生成する | DSpark の投機的デコード | 幾つかの候補位置を下書きし、確信度とシステムの負荷に基づいて検証長を選ぶ |
| 画像を扱う | DeepSeek-ViT + プロジェクター | 視覚入力を、事前学習以降テキストと一緒に処理される埋め込みへ変換する |
これらの仕組みは、主にサービングの経済とスループットを改善します。それ自体では、より良い推論を証明しません。モデルの品質は、データ、事後学習、Agent のハーネス、購入する推論 effort の量にも依存します。
CED:キャッシュに触れる前に、プロンプト処理を切る
技術報告は、40 の Transformer 層を、20 層の因果エンコーダーと 20 層のデコーダーに分けます。最初の二層は、128 トークンのスライディングウィンドウだけを使います。残りの層は、局所のスライディングウィンドウ注意と、圧縮されたグローバルコンテキストを組み合わせます。
グローバル注意では、デコーダーは各層で、独立した完全な KV 履歴を建てません。そのグローバルなキーと値は、エンコーダー最終の隠れ状態から投影されます。局所のスライディングウィンドウ状態は、層ごとに残ります。DeepSeek は、長い列のプリフィル複雑度を、対応する全層経路のおよそ半分と見積もります。支配項は、すべてのトークンを全部の L 層で処理することから、グローバルコンテキストをおおよそ L/2 で処理することへ変わり、それに有界の局所窓の作業が加わります。
それが、8B/16B の活性化の分かれを説明します。プロンプトトークンは、プリフィルのあいだ約 8B のバックボーンパラメータを活性化します。新しく生成されたトークンは、デコードのあいだ約 16B を活性化します。巨大な文書と短い答えの作業負荷は、数十万の生成トークンが支配する作業負荷より、利益が大きいです。CED は、その請求の前半を減らします。デコードを無料にはしません。
CSA2、FP4、SWA Bounded Replay:メモリの話
Compressed Sparse Attention 2 は、キャッシュを列、層、精度の次元に沿って圧縮します。各 CSA2 層は、三つのモードの一つへ静的に割り当てられます。Full は、主 KV、インデクサーのキー、新しい Top-K 位置を計算します。Reindex は、主 KV とインデクサーのキーを再利用し、自分のクエリで再走査します。Reuse は、共有 KV と以前の疎な選択の両方を再利用します。各層は、なお自分のクエリと、局所スライディングウィンドウの KV を持ちます。
デコーダーの最初の Full 層は、Top-512 の項目を選び、候補プールを建てます。あとの Reindex 層は、その縮小されたプールから、自分の Top-512 位置を選びます。主グローバル KV は、およそ 4 ビットの E2M1 表現を使い、16 チャネルごとに E4M3 のスケールを持ちます。DeepSeek は、量子化により敏感な局所 SWA キャッシュに、FP8 を残します。
| キャッシュ層 | 精度 / 寿命 | 報告された結果 | 保証しないこと |
|---|---|---|---|
| 実行時のグローバル KV | FP4、HBM に常駐 | 890 バイト/トークン。V4 Flash の約 1/4 で、V1 より 437× 小さい | すべての端の場合での完全な疎選択 |
| 実行時の局所 SWA KV | FP8 | 128 トークンの層局所窓を保つ | 任意の同時実行で無視できるメモリ |
| 持続するグローバル KV | DeepSeek の配備設計では、ホストメモリまたは SSD | 長く生き、再利用できるグローバル状態 | 公開 API 上の固定された保持期間 |
| 持続する局所 SWA 状態 | Bounded Replay で再構成 | 同じ列長で、V4 Flash の総持続キャッシュ足跡の約 1/8 | 捨てられたすべての局所状態の正確な再生 |
報告は、その配備がグローバルな持続 KV を少なくとも 72 時間保ち、分散した短命の SWA プールを使う、と言います。公開のコンテキストキャッシュガイドは、キャッシュ作成を自動かつベストエフォートと述べ、構築に数秒かかり得ること、項目は一般に数時間から数日のあと消されることを述べます。本番のクライアントは、公開の契約を権威として扱うべきです。保証された 72 時間のヒットを前提に予算せず、ヒットとミスのトークンフィールドを見てください。
DeepSeek は、二つの頑健さの境界を自分で特定します。CSA2 は誤った疎位置を選べること、Bounded Replay は捨てられた局所状態を近似することです。そのテストは、評価された設定で系統的な劣化を見つけませんでしたが、極端なコンテキストとキャッシュ再開の境界は、さらなるストレステストの領域のままです。
Engram、DSpark、マルチモーダルの経路
Engram は、記憶の一部を、密なモデル計算から分けます。V4.1 Flash は、196B パラメータを、ゼロ起点の第 1 層と第 14 層にある二つの条件メモリモジュールへ割り当てます。それぞれは、長さ二、三、四のトークン n-gram、八つのハッシュヘッド、コンテキストを知るゲーティング、RDMA 上のホストメモリプリフェッチを使います。これらは格納されたパラメータであり、すべてのトークンで活性化される、もう 196B のパラメータではありません。
DSpark は、別に訓練された投機的デコーダーです。三つの Transformer ブロックが、128 トークンのスライディングウィンドウを見通し、五つの位置を並列に提案します。軽い依存ヘッドが下書きトークンを関係付け、確信度ヘッドが、下書きのどれだけが検証を生き残るかを見積もります。スケジューラは、それらの確率と測られたエンジンのスループットを使い、現在の負荷の下で検証長を選びます。これは、バックボーンの最終検証の役割を変えずに、システムのトークンスループットを改善できます。
視覚経路は、別に訓練された DeepSeek-ViT を使い、2D の回転位置符号化を持ちます。3×3 の pixel-unshuffle の一歩が、言語モデルへの投影の前に、視覚トークン数を九分の一に減らします。視覚エンコーダーは、報告された構成で 32 層、隠れサイズ 1,024、注意ヘッド 16 です。その自己回帰の訓練段階は、より早い、約 47B の画像テキスト対にわたる対照段階のあと、544×544 から 1,344×1,344 のあいだに縮尺された画像を使います。
訓練と事後訓練
DeepSeek は、マルチモーダルデータが言語モデルの訓練へ統合された、45T の事前学習トークンを報告します。テキストのみとマルチモーダルのパイプラインは、重なりの置換と重複除去のあと、7:1 のトークン比で合流します。疎な注意は、密な注意のウォームアップなしに、64K の列長から最初に訓練されます。コンテキストは、34T トークンの時点で 1M へ伸びます。
| 段階 | 公表された詳細 | なぜ重要か |
|---|---|---|
| 視覚の対照事前学習 | 約 47B の画像テキスト対、低解像度の段階 | 言語への統合の前に、広い視覚表現を学ぶ |
| 視覚の自己回帰調整 | キャプション、図表、OCR、関連データを含む 236B トークン | 細かい視覚と文書の理解を足す |
| LLM の事前学習 | 45T トークン。マルチモーダルデータは最初から含まれる | 視覚を、遅いプロンプトアダプターだけとして扱わない |
| コンテキスト訓練 | 64K からの疎な注意。34T トークンで 1M へ延長 | 配備される注意パターンを訓練し、訓練のあとだけ変換しない |
| 事後訓練 | SFT、強化学習、オンポリシー蒸留 | 推論、ツール、Agent の振る舞いを揃える |
報告は、新しい事後訓練のアルゴリズムを主張しません。利得を、合成の課題と環境の作成、改善されたデータフィルタ、検証可能な報酬、アーキテクチャとデータの規模に帰します。これは、「モデルアーキテクチャ」の主張を比べるときに重要です。CED と CSA2 は効率を説明し、観測された Agent の性能は、訓練とスキャフォールドの積み全体の積です。
推論 effort:品質には、見えるトークン請求がある
DeepSeek は、1 から 100 の内部 effort の連続を出し、公開 API のプリセット low、high、max を 50、75、100 へ写像します。互換の入力は、minimal と low を low へ、medium、high、xhigh を high へ、max または ultra を max へ写像します。思考の既定は、high です。
DeepSeek が報告した掃引では、effort を 25 から 100 へ上げると、八つの推論評価にわたる平均結果が 67.1% から 76.3% へ、DeepSWE が 66.0% から 74.2% へ、Terminal-Bench 2.1 が 82.4% から 90.6% へ増えました。出力トークンは約 2.5× 増えました。60–80 の範囲が、最大トークン予算の半分未満で、品質のほとんどを捉えました。100 への最後の移動は、より小さい利得のために、Agent の軌跡を 1.6–1.8× 長くしました。
これは、このモデルの最も有用な制御の一つです。分類、抽出、再試行できる探索には low を使ってください。通常のコーディングと調査には high です。max は、もう一度の試行や、逃した端の場合が、余分なトークンより高くつく課題に残してください。これらを出発の仮説として扱い、受け入れられた課題の費用を測ってください。
思考モードでは、temperature と presence/frequency のペナルティは無視され、top_p の最小は 0.95 です。ツールがあるとき、クライアントは、ツール結果と並んで、アシスタントメッセージからの完全な reasoning_content を返さなければなりません。省くと、400 の応答になります。その状態の規則は、馴染みの OpenAI パラメータ集合を写すより重要です。
OpenAI と Anthropic とのベンチマーク比較
この表は、DeepSeek の技術報告の表 3 から選んだ結果を再現します。すべてのモデルは、報告の Max 設定で示されます。DeepSeek は、一部の評価に異なる必須または公式のスキャフォールドを使い、コーディングには 1M の DeepSeek Harness コンテキストを、視覚 Agent の課題には 512K の Claude Code コンテキストを使いました。数は、プロバイダーが報告した証拠であり、独立した直接対決のテストではなく、本番の SLA でもありません。
| 評価 | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
最も強い読みは、具体的です。V4.1 Flash は、Agent 課題で V4 Flash から大きく踏み出し、DeepSWE、Terminal-Bench 2.1、自動化、ツールを使う HLE で、GPT-5.6 Sol と Claude Opus 5 に競争的です。GPQA、あとの Terminal-Bench の版、Chartography ではリードしません。報告自身が警告します。よくある課題での近さは、最も難しい推論と端の場合での、フロンティアの同等を意味しません。
GPT-6 Astra と Claude Fable 5.1 は、この点数表から省かれています。DeepSeek の報告が、それらについて同じ行ごとの比較データを公表していないからです。別々のプロバイダーページから点数を足すと、偽の共通ハーネスができます。チームは、同じリポジトリの課題、ツール、タイムアウト、ネットワーク方針、受け入れ検査の上で、すべての候補を評価すべきです。
API の互換は広いが、同一ではありません
公式サービスは、OpenAI Chat Completions、OpenAI Responses、Anthropic 互換 APIを出します。その広さは移行の仕事を下げますが、互換が記述するのはリクエストの形であり、同一のライフサイクルの意味ではありません。
| 面 | DeepSeek V4.1 Flash の振る舞い | 移行の結果 |
|---|---|---|
| Chat Completions | ストリーミング、JSON 出力、関数呼び出し。非思考モードの prefix/FIM | 既存の OpenAI クライアントが、最も単純な出発点です |
| Responses | ステートレス。関数と画像に対応 | 会話の全体を、自分で永続化してください |
| Responses の状態フィールド | previous_response_id、会話、store、background、コンテキスト管理は未対応か無視される |
200 の応答は、それらの機能が効いたことを証明しません |
| ホストされたツール | Web 検索、ファイル検索、コードインタープリター、computer use、MCP の組み込みは無視される。カスタムツールの対応は限られる | ツールはアプリケーションで実行し、要求した各フィールドをテストしてください |
| 推論の要約 | 要約と、暗号化された推論内容は未対応 | OpenAI 様式の推論引き渡しフィールドに依存しないでください |
| Anthropic 形式 | Anthropic のメッセージ形は受け付けられる | Claude の意味を仮定せず、DeepSeek の推論とツール状態の規則を保ってください |
| 視覚 | 画像は、ユーザー入力とツール出力で受け付けられる | ペイロードの大きさ、detail モード、画像数を検証してください |
DeepSeek の Responses ガイドは、metadata、プロンプトテンプレート、truncation、service tier、safety identifier、prompt-cache の key/retention、stream options など、無視されるフィールドも列挙します。静かな無視は、互換の危険です。スキーマが受け付けられることが、欠けた振る舞いを隠せます。アプリケーションが依存する各機能について、適合リクエストを建ててください。OpenAI 互換 API ガイドが、エンドポイントの形と能力を別々に検査する理由を説明します。
OpenAI の現在のモデルは、より広いネイティブの Responses ツール生態系と、管理された状態の機能を提供します。Anthropic のネイティブ API は、成熟した思考ブロックとツール使用の契約を、自分で持ちます。DeepSeek の利点は、一つのモデルが三つの共通方言をすべて受け付けることです。その費用は、交差が、どちらの競合の完全なネイティブ面よりも小さいことです。
視覚の制限と、画像の経済
公式の視覚ガイドは、base64、外部 URL、または Files API を通して、JPEG、PNG、GIF、WebP に対応します。画像はおよそ 1,300×1,300 へ自動でリサイズされ、それぞれ最大 1,024 の入力トークンを使います。low の detail は 512×512 の視野を使います。high と original は、より多くの詳細を残します。auto は現在、original として振る舞います。
| 制限 | 公式の値 |
|---|---|
| リクエスト本体 | 48 MiB |
| インライン、または外部から取得した画像 | 各 32 MiB |
| ファイル ID で参照される画像 | 各 64 MiB |
| リクエストあたりの画像 | 600 |
| 合算した画像バイト | ファイル ID なしで 64 MiB。ファイル ID ありで 200 MiB |
| 長い辺 | 8,192 px。15 枚以上を送るときは 4,096 px |
| 視覚トークンの上限 | 処理のあと、画像あたり 1,024 トークン |
最大の 1,024 視覚トークンでは、キャッシュされていない画像一枚が、付随するテキストと出力の前に、公表された入力料金で約 $0.0001536 のオフピーク、または $0.0003072 のピークを寄与します。この算術は規模の見積もりに有用ですが、画像のリサイズ、キャッシュの振る舞い、実際の視覚トークン使用は、課金を変え得ます。画像が増えると、さもなければテキストやツール履歴を保持できたコンテキストも消費します。
V4.1 Flash は、文書のスクリーンショット、図表、OCR、視覚 Agent の観測に向きます。画像生成モデルではありません。生成された画像には、テキストではなくピクセルを返すよう設計されたモデルとエンドポイントを使ってください。
公式 API の価格を比べる
DeepSeek の価格ページは、9月10日の 04:00 UTC に、次の料金を導入しました。平日のピーク窓は、01:00–04:00 と 06:00–10:00 UTC です。他のすべての平日時と週末は、オフピーク料金を使います。DeepSeek のコンテキストキャッシュは自動なので、「キャッシュされた入力」とは報告されたキャッシュヒットを意味し、ヒットを強制するキャッシュフラグではありません。
OpenAI の料金は、その現在のモデル比較から来ます。Anthropic の料金は、その価格ページから来ます。値は、100万トークンあたりの USD です。Anthropic はキャッシュの書き込みも課金します。ここでは省きます。表が比べるのは、新しい入力、キャッシュの読み、出力だけだからです。
| モデル | コンテキスト / 最大出力 | 新規またはミスの入力 | キャッシュ / 読みの入力 | 出力 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash、オフピーク | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash、ピーク | 1M / 384K | $0.30 | $0.006 | $1.20 |
| Modelflare 上の DeepSeek V4.1 Flash | 1M / 384K のモデル上限 | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
価格は、それ自体では価値ではありません。異なるトークナイザは、同じテキストに異なるトークン数を課金し得ます。Anthropic は、より新しいトークン化が、一部の作業負荷でおよそ 30% 多くのトークンを生み得る、と記しています。モデルは、異なる出力長、再試行、人の修復も要し得ます。最も小さい入力の数の行ではなく、受け入れられた課題あたりの費用を比べてください。
Modelflare の現在の公開カタログは、DeepSeek の二つの時間帯のあいだの、一つの料金を出します。第一者のピーク料金の約 64.5% であり、ピーク窓では 35.5% 低い一方、DeepSeek のオフピーク料金より約 29.0% 上です。列挙されたゲートウェイ料金は、したがって今日、時間帯の調整を持ちません。DeepSeek のオフピーク窓を確実に使える柔軟な作業負荷は、第一者 API を通した方が、なお安いかもしれません。
OpenAI は、入力コンテキストが 272K を越えると、より高い料金を適用します。リクエスト全体が、入力とキャッシュ入力の価格の 2× と、出力価格の 1.5× を使います。この境界は、下の長コンテキストのシナリオで重要です。DeepSeek は、代わりに時間窓を使います。引用した価格表では、Anthropic の列挙された 100万トークンのモデルは、同じ 272K の境界を使いません。
再現できる二つの費用シナリオ
シナリオ A は、100K のキャッシュされていない入力と 10K の出力を持つ、一回のリクエストです。式は 0.1 × input rate + 0.01 × output rate です。キャッシュされた入力、ツール、再試行、税、プロバイダー固有の追加はない、と仮定します。
| モデル | シナリオ A の費用 |
|---|---|
| DeepSeek V4.1 Flash、オフピーク | $0.021 |
| Modelflare 上の DeepSeek V4.1 Flash | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash、ピーク | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
シナリオ B は、900K のキャッシュされた入力、100K の新しい入力、20K の出力を持つ、ウォームキャッシュのリクエストの限界費用です。キャッシュを確立した以前のリクエストは、故意に除きます。式は 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate です。入力コンテキストの合計が 100万トークンなので、OpenAI の、リクエスト全体への長コンテキスト修飾が適用されます。
| モデル | シナリオ B の限界費用 |
|---|---|
| DeepSeek V4.1 Flash、オフピーク | $0.0297 |
| Modelflare 上の DeepSeek V4.1 Flash | $0.0383 |
| DeepSeek V4.1 Flash、ピーク | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
比較は、トークン量を等しく保ちます。品質が等しいとは主張しません。DeepSeek のキャッシュはベストエフォートであり、Anthropic のキャッシュ作成は、自分の書き込み価格と寿命を持ちます。公正な作業負荷のテストは、キャッシュのヒット/ミスのトークン、すべての試行、課金される推論を含む総出力、経過時間、受け入れ率、人の修正の分数を記録します。費用追跡ガイドが、会計の枠を提供します。
オープンウェイトは、セルフホストを小さくしません
Hugging Face のリリースは MIT ライセンスで、vLLM と SGLang のサービング経路を文書化します。この記事のために確認したスナップショットでは、リポジトリは 48 の safetensor シャードと、コミット dba1be0a40aa45a94ad051997016db3960a90277 で約 510.3 GB の Git-LFS ファイルを含んでいました。そのバイト数は、ダウンロードの成果物であり、測られた GPU の RAM ではありません。
システムはなお、552B のバックボーン、196B のホストアドレスされた Engram メモリ、エキスパートの振り分け、FP4/FP8 のキャッシュ経路、RDMA のプリフェッチ、持続する KV の格納を持ちます。DeepSeek のリリースは、2,000 の GPU にストレージクラスタを足す大規模配備を計画するチームに、会社へ連絡するよう招きます。その例が示すのは、完全なサービングシステムの規模です。すべての配備について述べられた最小ではありません。より小さい研究の配備は、量子化や異なる並列を使い得ますが、プロバイダーの API 経済から推論すべきではありません。
オープンウェイトは、チームに、チェックポイントへのアクセス、検査可能性、配備方針への制御を与えます。DeepSeek のカーネル融合、キャッシュ階層、DSpark のスケジューリング、バッチング、公開 API の遅延を、自動では再現しません。セルフホストの計画は、測られたスループット、障害からの回復、遊休容量、ストレージ帯域、運用の労働と比べてください。
Modelflare 上の DeepSeek V4.1 Flash
DeepSeek V4.1 Flash は、Modelflare に載っています。運用者が確認したローンチは、公開の Modelflare 価格カタログ と origin のカタログに、独立に見えます。2026-09-10 15:21 UTC に、両方とも新しい deepseek-v4.1-flash-0910 の記録を出していました。本番の構成は、有効な deepseek-stable の ability と、同じモデルを広告する有効なルートを示していました。
| Modelflare の項目 | 稼働中の値 |
|---|---|
| 送るモデル ID | deepseek-v4.1-flash-0910 |
| 提供 | 公開カタログと、有効なルーティンググループで稼働中 |
| 公開グループ | deepseek-stable |
| 入力価格 | $0.193548 / 1M トークン |
| キャッシュ入力の価格 | $0.003871 / 1M トークン |
| 出力価格 | $0.774194 / 1M トークン |
| エンドポイントの種類 | /v1/chat/completions と /v1/responses |
価格は、稼働中の項目の $0.322580645 という基礎入力係数、0.6 の公開グループ比、0.02 のキャッシュ比、4× の完了比から導かれます。上の二つの計算した作業負荷について、Modelflare の費用はそれぞれ約 $0.0271 と $0.0383 です。現在のモデル ID と料金には、稼働中の DeepSeek V4.1 Flash の価格ページ を使ってください。
証拠の水準は、なお重要です。公開カタログと有効な本番ルートは、製品の提供を確立し、運用者はローンチを明示的に確認しました。15:30 UTC までに、本番の記録は、正確な新しいモデル ID の下で完了した Chat Completions の呼び出しを六つ含み、合計で 216 のプロンプトトークンと 173 の完了トークンでした。それは、認証された Chat Completions の配送と、課金される出力を検証します。遅延や可用性を測るには、なお小さすぎるローンチの標本であり、このルートを通した Responses やマルチモーダルの振る舞いを、独立には証明しません。チームは、本番の仕事を移す前に、正確なエンドポイントで、自分の小さな受け入れリクエストを走らせるべきです。
DeepSeek V4.1 Flash が、実際の利点を持つところ
このモデルは、長い入力、頻繁なツールのターン、予算がすべて重要であるとき、一貫した利点を持ちます。アーキテクチャは、プリフィルとキャッシュの圧力を減らします。API の価格は、それらの節約を、異例に低い公開料金へ変えます。384K の出力上限は、長いパッチや報告に余裕を残します。チェックポイントは、セルフホストの経路を開いたままにします。
| 作業負荷 | V4.1 Flash が強い候補である理由 | 測ること |
|---|---|---|
| リポジトリの Agent | 低いトークン料金での、公開者が報告した強い DeepSWE とターミナルの結果 | 受け入れられた変更、テストの通過率、再試行、修復時間 |
| 長い調査の総合 | 1M の入力、安いキャッシュヒット、384K の出力 | 引用の正しさ、要件の保持、総出力 |
| 視覚文書の Agent | ネイティブの画像、OCR と図表の訓練、共通の Agent API | フィールドの精度、切り抜きと detail の感度、視覚トークンの使用 |
| 大量の自動化 | ピークもオフピークも低い価格。同時実行の上限は 2,500 リクエスト | 待ち行列の時間、429 の率、ツールの失敗、成功あたりの費用 |
| 制御された配備 | MIT のチェックポイントと、文書化された vLLM/SGLang の経路 | ハードウェアの利用率、キャッシュとストレージの帯域、運用費用 |
したがって、最も強い本番の主張は、費用効率の良い長コンテキスト Agentであり、「全体として最良のモデル」ではありません。より安い小さいモデルが幾度かの修復を要するところで、このモデルが、受け入れられた一回の実行で実課題を終えれば、結果では V4.1 が勝ちます。フロンティアのクローズドモデルが、費用の高い失敗を防ぐなら、そのより高いトークン価格は、なお経済的であり得ます。
OpenAI か Anthropic の方が、なおより安全な選択であるところ
アプリケーションが、完全な Responses の生態系、管理された状態、ホストされたツール、または DeepSeek が無視する OpenAI 固有の契約に依存するとき、OpenAI のモデルを選んでください。GPT-5.6 Luna は、より短く、キャッシュされていない作業負荷について、特に近い価格の競争相手です。Terra、Sol、Astra は、はるかに高い定価を、異なる能力の段と、ネイティブのプラットフォーム機能と交換します。
Claude のネイティブなツールと思考の契約、キャッシュの制御、または最も難しい Agent 作業で測られた性能が、トークンの定価より重要であるとき、Anthropic のモデルを選んでください。DeepSeek 自身の表では、Claude Opus 5 が Terminal-Bench 3/4 と Chartography をリードします。Claude Fable 5.1 は、最も要求の高い長い地平の作業に位置付けられますが、新しいトークンあたりも出力トークンあたりも、実質的により高くなります。
安全に関わる動作、または費用の高い動作について、ルートの選択は、評価された失敗の様式と権限の境界に基づくべきであり、ブランドやベンチマークの平均に基づくべきではありません。ルーティングガイドを使い、再試行できる仕事、フォールバック、副作用のある動作を分けてください。
配備のチェックリスト
- 第一者の API には
deepseek-flashを使い、ゲートウェイ固有の写像は別に記録してください。 - high の effort から始め、同じ受け入れ課題の集合の上で low と max を測ってください。プロバイダーをまたいで、名前を等しい計算として写像しないでください。
- 思考モードでツールを使うとき、要求どおりに、完全な
reasoning_contentを返してください。 - 依存するすべての Responses フィールドを監査してください。拒否されたパラメータと、静かに無視されたパラメータには、異なる扱いが要ります。
- キャッシュヒットとキャッシュミスのトークン、出力と推論のトークン、再試行、遅延、最終の受け入れを記録してください。
- キャッシュの経済は、固定された保持の仮定ではなく、観測されたヒットの周りに設計してください。
- マルチモーダルのリクエストを送る前に、画像のバイト、枚数、寸法、detail の制限を強制してください。
- アプリケーション側の認可、ツールの冪等性、出力の検証は、モデルの品質から独立に保ってください。
- ローンチの前に、時間窓の価格、モデルの別名、同時実行の上限を再確認してください。
- 正確なルートの上で、実際に認証されたリクエストを走らせてください。モデルカタログ、または HTTP 200 だけでは、能力の証明ではありません。
よくある質問
DeepSeek V4.1 Flash は、GPT-6 Astra や Claude Fable 5.1 より良いか。 普遍的な主張としては、そうではありません。V4.1 Flash は、価格とオープンウェイトで大きな利点を持ち、プロバイダーが報告した Agent の点数も強いです。DeepSeek 自身は、最大のクローズドモデルが、最も難しい推論と端の場合で優位を保つ、と言います。V4.1 の報告には、同じハーネスでの Astra と Fable の比較がありません。
DeepSeek V4.1 Flash のパラメータはいくつか。 報告は、552B パラメータのバックボーンに、196B の Engram パラメータを足したものを列挙します。プリフィルトークンあたり約 8B のバックボーンパラメータを、デコードされたトークンあたり 16B を活性化します。「合計 552B」とだけ言うと、Engram を省きます。「活性は 748B」と言うのも、誤りです。
コンテキストと出力の上限は何か。 公式の上限は、100万のコンテキストトークンと、最大 384K の出力トークンです。画像の埋め込み、テキスト、ツールの履歴、推論は、どれも関連する予算を消費します。
なぜ Flash と呼ばれるか。 設計が焦点を置くのは、より低いサービング費用です。非対称なプリフィルとデコードの活性化、圧縮された疎な注意、FP4 のグローバル KV、有界の持続再生、投機的デコードです。「Flash」は、すべてのプロンプトや待ち行列の条件で、最低の遅延を約束しません。
公開キャッシュは 72 時間持つか。 そう仮定しないでください。技術報告は、少なくとも 72 時間、グローバル KV が持続する配備設計を記述します。公開 API のガイドは、キャッシュをベストエフォートと呼び、項目は一般に数時間から数日のあと消される、と言います。課金は、観測されたヒットとミスのフィールドを使うべきです。
Responses API は、OpenAI Responses の差し込み代替か。 馴染みの形は受け付けますが、ステートレスであり、複数の OpenAI フィールドとホストされたツールを無視します。必要な、正確な能力の契約をテストしてください。
画像を生成できるか。 画像の入力を理解し、テキストを返します。画像生成モデルではありません。
今日、Modelflare を通して V4.1 Flash を呼べるか。 はい。deepseek-v4.1-flash-0910 を deepseek-stable グループで使い、Chat Completions か Responses を使ってください。これは Modelflare の、リリース日付の入った ID です。第一者の deepseek-flash という別名は、別のプロバイダー契約です。
出典、方法、更新記録
この記事は第一者の出典を優先し、文書化された事実、DeepSeek が報告した評価、計算された例、観測された Modelflare のカタログ状態を分けます。独立したモデルのベンチマークは、走らせていません。費用の計算は、同伴する出典の成果物に保存され、各シナリオはそのトークンベクトルと除外を述べます。言葉のないカバーは、既存の Modelflare の視覚様式による、AI が生成した編集用のイラストです。
一次の参照:DeepSeek V4.1 Flash のリリース、技術報告、モデルカード、価格、思考、Responses、Anthropic 互換、視覚、コンテキストキャッシュ、OpenAI のモデル比較、Anthropic の価格、そしてModelflare の公開カタログ。
2026-09-10 の更新: 公開日の最初のレビューです。第一者のモデル ID、有効になったピークとオフピークの価格、9月14日の別名移行の告知、現在の API の制限、技術報告のアーキテクチャとベンチマークのデータを記録します。同じ日ののちの更新が、deepseek-v4.1-flash-0910 の下で確認された Modelflare のローンチ、稼働中のゲートウェイ価格、計算済みのゲートウェイ費用を足します。実装の前に、変わり得る事実を再確認してください。