Gemini 3.7 Flash 正式發布:參數、效能、價格與橫向比較

依官方資料完整分析 Gemini 3.7 Flash 的 1M 上下文、64K 輸出、能力邊界、API 價格,並與 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 及 Muse Spark 1.2 比較。

Google 於 2026 年 8 月 13 日發布 Gemini 3.7 Flash,距離 Gemini 3.6 Flash 上線只有三週。它已用穩定模型 ID gemini-3.7-flash 正式提供,定位是 Google 目前能力最強的 Flash 模型,重點面向程式開發、Agent、多模態推理與可靠的多步執行。

這次更新的重點不是更大的上下文,也不是公開模型參數量。Gemini 3.7 Flash 仍維持 1M 輸入、64K 輸出這一級,但 Google 公布的結果顯示,它在程式開發、工具呼叫、知識工作、文件理解與電腦操作上都有明顯進步,首發 Token 價格則與 3.6 Flash 相同。

以下把官方規格、Google 公布的基準結果、限時首發價格與 Modelflare 目前的可用狀態分開說明。所有易變資訊核對於 2026 年 8 月 15 日。

Gemini 3.7 Flash 核心參數

項目 官方資訊
發布日期 2026 年 8 月 13 日
API 狀態 正式可用,穩定模型 ID
模型 ID gemini-3.7-flash
基礎模型 基於 Gemini 3.6 Flash,並改進核心演算法
輸入模態 文字、圖片、影片、音訊與 PDF
輸出模態 文字
最大輸入 1,048,576 Token
最大輸出 65,536 Token
思考層級 low、medium、high;文件預設值為 medium
知識截止日期 2026 年 3 月,部分領域可能仍以 2025 年 1 月為限
參數量 未公開
最近文件更新 2026 年 8 月

它支援上下文快取、程式碼執行、預覽版 Computer Use、檔案搜尋、函式呼叫、Google Maps Grounding、Google Search Grounding、結構化輸出、Thinking 與 URL Context,也支援 Batch、Flex 和 Priority 三種消費模式。不支援音訊生成、圖片生成與 Live API。

相較 Gemini 3.6 Flash 實際改了什麼

Gemini 3.7 Flash 是以 3.6 Flash 為基礎的迭代,不是一次上下文或模態規格升級。Google 將提升歸因於核心推理演算法改進,以及正式環境開發者的回饋。

實際變化主要集中在:

  • 程式碼生成與軟體工程的首輪正確率更高;
  • 從截圖、圖片或設計系統生成網頁時,更能遵循設計細節;
  • 多步規劃、工具呼叫、遇到阻礙後的恢復與意圖釐清更穩定;
  • 對金融、法律與生命科學複雜文件的推理更強;
  • 長上下文檢索與 Agent 電腦操作能力提升;
  • 2026 年 12 月 31 日前,Standard 首發價格與 Gemini 3.6 Flash 相同。

最後一點很重要:首發階段的 3.7 並不是更昂貴的 3.6 替代品。是否遷移,主要取決於行為、延遲與相容性,而不是 Token 單價差。

官方 API 價格

下表為付費層美元價格。Token 價格按每 100 萬 Token 計算,快取儲存按每 100 萬 Token 每小時計算。

消費模式 計費項目 2026 年 12 月 31 日前 2027 年 1 月 1 日起
Standard 輸入 $0.75 $1.50
Standard 輸出,包含思考 Token $3.75 $7.50
Standard 快取輸入 $0.075 $0.15
Standard 每小時快取儲存 $0.50 $1.00
Batch 輸入 $0.375 $0.75
Batch 輸出,包含思考 Token $1.875 $3.75
Batch 快取輸入 $0.0375 $0.075
Flex 輸入 $0.375 $0.75
Flex 輸出,包含思考 Token $1.875 $3.75
Flex 快取輸入 $0.0375 $0.075
Priority 輸入 $1.35 $2.70
Priority 輸出,包含思考 Token $6.75 $13.50
Priority 快取輸入 $0.135 $0.27

Google Search Grounding 每月有 5,000 次免費搜尋請求,由 Gemini 3.x 模型共享,之後為每 1,000 次 $14。Google Maps Grounding 同樣共享 5,000 個免費 Prompt,之後每 1,000 次搜尋查詢 $14。

按首發期 Standard 價格計算,10 萬輸入加 1 萬輸出約為 $0.1125,不含快取、工具、儲存與重試。100 萬快取輸入加 10 萬輸出約為 $0.45,不含快取儲存費。首發期結束後,兩個算例都會翻倍。

完整橫向基準比較

Google 2026 年 8 月的模型卡將 Gemini 3.7 Flash 與 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 放在同一張表比較。以下各項皆為數值越高越好,破折號表示模型卡未公布成績。

基準 Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena,WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench,私有集 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2,Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning,不使用工具 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning,使用工具 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2,128K 平均 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench,人類可解組 87.1% 80.6% 87.5% 83.8%
BioMysteryBench,人類困難組 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

這些數字有參考價值,但不能視為一次完全獨立、條件一致的擂台賽。Google 說明,Gemini 成績通常使用預設採樣並按 pass@1 計算;非 Gemini 成績除特別註明外來自各廠商自報,且優先採用最高可用推理層級。部分項目由 Google 自行執行,不同模型的 Harness、工具權限、聚合方式,甚至影片幀數都不完全一致。

能力與表現分析

相較 Gemini 3.6 Flash,這次不是個位數微調:FrontierCode 增加 9.2 個百分點,DeepSWE 增加 16.7 個百分點,AutomationBench 增加 13.4 個百分點,GDP.pdf 增加 12 個百分點,OSWorld 增加 14.1 個百分點,Code Arena 提升 50 Elo,長上下文 GDM-MRCR 從 91.8% 提升到 97.0%。

與其他模型家族相比,結論更細:

  • Gemini 3.7 Flash 在公布表格中領先 FrontierCode、Code Arena、AutomationBench、Harvey LAB-AA、GDP.pdf、LVBench、GDM-MRCR、HLE-Verified 與 LABBench2。
  • GPT-5.6 Terra 仍領先 DeepSWE、兩項 Terminal-bench、不使用工具的 CharXiv、OSWorld,以及 BioMysteryBench 人類困難組。
  • Claude Sonnet 5 領先 Agent's Last Exam,並在 BioMysteryBench 人類可解組略勝。
  • Muse Spark 1.2 領先 GDPVal-AA,並在 Artificial Analysis Intelligence Index 與 GPT-5.6 Terra 並列,但未公布的項目也最多。
  • Gemini 3.7 並非每項都優於 3.6:CharXiv 在使用與不使用工具時都低了 0.7 個百分點。

更實際的結論是:以首發價格來看,3.7 Flash 的能力非常均衡,適合作為程式開發 Agent、瀏覽器或桌面工作流、長文件、多模態分析與高流量知識工作的預設候選。長週期軟體工程和終端 Agent 仍值得與 GPT-5.6 Terra 實測;桌面 Agent 可保留 Claude Sonnet 5 對照;Muse Spark 的知識工作成績很強,但公開比較面還不完整。

參數量、上下文與多模態邊界

Google 未公布總參數量、啟用參數量、專家數量、具體架構、訓練語料規模或訓練算力。官方模型卡只確認 Gemini 3.7 Flash 基於 Gemini 3.6 Flash,並進行演算法改進。任何把特定參數量當作事實的說法都只能算推測。

開發者真正可以依賴的是 API 合約:

  • 1,048,576 輸入 Token 與 65,536 輸出 Token;
  • 支援文字、圖片、影片、音訊與 PDF 輸入,輸出為文字;
  • 支援 lowmediumhigh 三層思考,minimal 會直接報錯;
  • 支援函式呼叫、結構化輸出、搜尋、Maps、程式碼執行、檔案搜尋、URL Context、快取與預覽版 Computer Use;
  • 不支援 Live API、音訊生成與圖片生成。

1M 上下文代表容量,不代表每次都應塞滿。長 Prompt 仍會增加延遲與費用;更強的檢索能力也無法取代權威狀態保留、重複歷史壓縮與工具副作用驗證。

呼叫 Gemini 3.7 Flash

Google 的發布指南使用 Interactions API,並將 medium 列為預設思考層級:

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare 目前透過 OpenAI 相容的 Chat Completions 路由提供這個精確模型 ID:

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

兩個範例使用不同協定。不要假設 Google 原生內建工具或 Interactions 欄位都能透過 OpenAI 相容轉接器使用。

遷移與正式環境注意事項

Google 的 3.7 遷移指南要求移除 temperaturetop_ptop_k,以字串列舉 thinking_level 取代 thinking_budget,並刪除不支援的 candidate_count。多輪 Interactions 工作流應使用伺服器端 previous_interaction_id

替換現有模型前:

  1. 固定使用精確的 gemini-3.7-flash,並拒絕靜默別名替換;
  2. 以固定且不含敏感資訊的真實任務集對照目前模型與 3.7;
  3. 按成功任務成本與總耗時比較 low、medium、high;
  4. 分別測試串流回應、結構化輸出、函式呼叫、多模態、取消與拒答路徑;
  5. 依所用協定保留 Thought Signature 與工具呼叫關聯欄位;
  6. 驗證快取、重試、逾時與重複副作用保護;
  7. 記錄最終模型、路由、輸入、快取輸入、輸出、工具、延遲與扣費;
  8. 在真實流量達到驗收線之前保留回復路由。

HTTP 200 只能證明某次請求完成,不能證明協定完全相容、延遲穩定、工具行為正確,或每個成功任務的總成本更低。

Modelflare 上的 Gemini 3.7 Flash

截至 2026 年 8 月 15 日的正式環境核對,Modelflare 公開的模型與價格目錄已在 gemini-stable 群組中列出精確的 gemini-3.7-flash。目錄顯示支援 Gemini 原生 generateContent 與 OpenAI 相容 Chat Completions,目前未為該模型列出 Responses 路由。

核對時顯示的群組倍率為 0.15x。Google 限時首發價、Modelflare 設定的參考價、群組權限與請求完成後的實際扣費是彼此獨立的事實,也可能分別變動。當前價格應以即時價格頁與一筆已完成的非敏感請求記錄為準。

正式接入時,先建立或更新具備相應群組權限的 Key,固定精確模型 ID,並驗證應用程式實際使用的協定能力,再逐步遷移流量。

結論

Gemini 3.7 Flash 是一次有實際幅度的 3.6 Flash 升級,而且首發階段價格不變。它最突出的價值不是某一個分數,而是覆蓋面:正式程式開發、網頁開發、工具型 Agent、複雜文件、多模態輸入、長上下文與電腦操作都得到提升,同時沒有進入高價模型層級。

它不是每項基準都領先,參數量仍未知,首發折扣也會在 2026 年底結束。更穩妥的做法,是讓 3.7 Flash 與目前承接真實任務的模型執行同一套任務,再按完成率、延遲、重試次數與總成本選擇,而不是只看一個綜合分數。

官方來源與更新記錄

一手來源:

更新記錄:

  • 2026 年 8 月 15 日: 首次發布。已核對規格、能力、基準方法、官方價格、遷移指南與 Modelflare 目錄可用狀態。