Gemini 3.7 Flash 正式發布:參數、效能、價格與橫向比較
依官方資料完整分析 Gemini 3.7 Flash 的 1M 上下文、64K 輸出、能力邊界、API 價格,並與 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 及 Muse Spark 1.2 比較。
Google 於 2026 年 8 月 13 日發布 Gemini 3.7 Flash,距離 Gemini 3.6 Flash 上線只有三週。它已用穩定模型 ID gemini-3.7-flash 正式提供,定位是 Google 目前能力最強的 Flash 模型,重點面向程式開發、Agent、多模態推理與可靠的多步執行。
這次更新的重點不是更大的上下文,也不是公開模型參數量。Gemini 3.7 Flash 仍維持 1M 輸入、64K 輸出這一級,但 Google 公布的結果顯示,它在程式開發、工具呼叫、知識工作、文件理解與電腦操作上都有明顯進步,首發 Token 價格則與 3.6 Flash 相同。
以下把官方規格、Google 公布的基準結果、限時首發價格與 Modelflare 目前的可用狀態分開說明。所有易變資訊核對於 2026 年 8 月 15 日。
Gemini 3.7 Flash 核心參數
| 項目 | 官方資訊 |
|---|---|
| 發布日期 | 2026 年 8 月 13 日 |
| API 狀態 | 正式可用,穩定模型 ID |
| 模型 ID | gemini-3.7-flash |
| 基礎模型 | 基於 Gemini 3.6 Flash,並改進核心演算法 |
| 輸入模態 | 文字、圖片、影片、音訊與 PDF |
| 輸出模態 | 文字 |
| 最大輸入 | 1,048,576 Token |
| 最大輸出 | 65,536 Token |
| 思考層級 | low、medium、high;文件預設值為 medium |
| 知識截止日期 | 2026 年 3 月,部分領域可能仍以 2025 年 1 月為限 |
| 參數量 | 未公開 |
| 最近文件更新 | 2026 年 8 月 |
它支援上下文快取、程式碼執行、預覽版 Computer Use、檔案搜尋、函式呼叫、Google Maps Grounding、Google Search Grounding、結構化輸出、Thinking 與 URL Context,也支援 Batch、Flex 和 Priority 三種消費模式。不支援音訊生成、圖片生成與 Live API。
相較 Gemini 3.6 Flash 實際改了什麼
Gemini 3.7 Flash 是以 3.6 Flash 為基礎的迭代,不是一次上下文或模態規格升級。Google 將提升歸因於核心推理演算法改進,以及正式環境開發者的回饋。
實際變化主要集中在:
- 程式碼生成與軟體工程的首輪正確率更高;
- 從截圖、圖片或設計系統生成網頁時,更能遵循設計細節;
- 多步規劃、工具呼叫、遇到阻礙後的恢復與意圖釐清更穩定;
- 對金融、法律與生命科學複雜文件的推理更強;
- 長上下文檢索與 Agent 電腦操作能力提升;
- 2026 年 12 月 31 日前,Standard 首發價格與 Gemini 3.6 Flash 相同。
最後一點很重要:首發階段的 3.7 並不是更昂貴的 3.6 替代品。是否遷移,主要取決於行為、延遲與相容性,而不是 Token 單價差。
官方 API 價格
下表為付費層美元價格。Token 價格按每 100 萬 Token 計算,快取儲存按每 100 萬 Token 每小時計算。
| 消費模式 | 計費項目 | 2026 年 12 月 31 日前 | 2027 年 1 月 1 日起 |
|---|---|---|---|
| Standard | 輸入 | $0.75 | $1.50 |
| Standard | 輸出,包含思考 Token | $3.75 | $7.50 |
| Standard | 快取輸入 | $0.075 | $0.15 |
| Standard | 每小時快取儲存 | $0.50 | $1.00 |
| Batch | 輸入 | $0.375 | $0.75 |
| Batch | 輸出,包含思考 Token | $1.875 | $3.75 |
| Batch | 快取輸入 | $0.0375 | $0.075 |
| Flex | 輸入 | $0.375 | $0.75 |
| Flex | 輸出,包含思考 Token | $1.875 | $3.75 |
| Flex | 快取輸入 | $0.0375 | $0.075 |
| Priority | 輸入 | $1.35 | $2.70 |
| Priority | 輸出,包含思考 Token | $6.75 | $13.50 |
| Priority | 快取輸入 | $0.135 | $0.27 |
Google Search Grounding 每月有 5,000 次免費搜尋請求,由 Gemini 3.x 模型共享,之後為每 1,000 次 $14。Google Maps Grounding 同樣共享 5,000 個免費 Prompt,之後每 1,000 次搜尋查詢 $14。
按首發期 Standard 價格計算,10 萬輸入加 1 萬輸出約為 $0.1125,不含快取、工具、儲存與重試。100 萬快取輸入加 10 萬輸出約為 $0.45,不含快取儲存費。首發期結束後,兩個算例都會翻倍。
完整橫向基準比較
Google 2026 年 8 月的模型卡將 Gemini 3.7 Flash 與 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 放在同一張表比較。以下各項皆為數值越高越好,破折號表示模型卡未公布成績。
| 基準 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 | 57 |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% | — |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% | 54.9% |
| Code Arena,WebDev Elo | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% | 82.9% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% | — |
| AutomationBench,私有集 | 30.4% | 17.0% | 10.7% | 23.6% | — |
| GDPVal-AA v2,Elo | 1525 | 1422 | 1598 | 1578 | 1628 |
| Harvey LAB-AA | 90.7% | 85.1% | 90.1% | 85.2% | — |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% | 16.0% |
| CharXiv Reasoning,不使用工具 | 84.5% | 85.2% | 77.0% | 85.9% | — |
| CharXiv Reasoning,使用工具 | 88.7% | 89.4% | 88.3% | — | — |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% | — |
| GDM-MRCR v2,128K 平均 | 97.0% | 91.8% | 81.5% | 93.5% | — |
| OSWorld 2.0 | 47.9% | 33.8% | — | 50.2% | — |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% | — |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% | — |
| BioMysteryBench,人類可解組 | 87.1% | 80.6% | 87.5% | 83.8% | — |
| BioMysteryBench,人類困難組 | 43.5% | 41.2% | 34.1% | 49.4% | — |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% | — |
這些數字有參考價值,但不能視為一次完全獨立、條件一致的擂台賽。Google 說明,Gemini 成績通常使用預設採樣並按 pass@1 計算;非 Gemini 成績除特別註明外來自各廠商自報,且優先採用最高可用推理層級。部分項目由 Google 自行執行,不同模型的 Harness、工具權限、聚合方式,甚至影片幀數都不完全一致。
能力與表現分析
相較 Gemini 3.6 Flash,這次不是個位數微調:FrontierCode 增加 9.2 個百分點,DeepSWE 增加 16.7 個百分點,AutomationBench 增加 13.4 個百分點,GDP.pdf 增加 12 個百分點,OSWorld 增加 14.1 個百分點,Code Arena 提升 50 Elo,長上下文 GDM-MRCR 從 91.8% 提升到 97.0%。
與其他模型家族相比,結論更細:
- Gemini 3.7 Flash 在公布表格中領先 FrontierCode、Code Arena、AutomationBench、Harvey LAB-AA、GDP.pdf、LVBench、GDM-MRCR、HLE-Verified 與 LABBench2。
- GPT-5.6 Terra 仍領先 DeepSWE、兩項 Terminal-bench、不使用工具的 CharXiv、OSWorld,以及 BioMysteryBench 人類困難組。
- Claude Sonnet 5 領先 Agent's Last Exam,並在 BioMysteryBench 人類可解組略勝。
- Muse Spark 1.2 領先 GDPVal-AA,並在 Artificial Analysis Intelligence Index 與 GPT-5.6 Terra 並列,但未公布的項目也最多。
- Gemini 3.7 並非每項都優於 3.6:CharXiv 在使用與不使用工具時都低了 0.7 個百分點。
更實際的結論是:以首發價格來看,3.7 Flash 的能力非常均衡,適合作為程式開發 Agent、瀏覽器或桌面工作流、長文件、多模態分析與高流量知識工作的預設候選。長週期軟體工程和終端 Agent 仍值得與 GPT-5.6 Terra 實測;桌面 Agent 可保留 Claude Sonnet 5 對照;Muse Spark 的知識工作成績很強,但公開比較面還不完整。
參數量、上下文與多模態邊界
Google 未公布總參數量、啟用參數量、專家數量、具體架構、訓練語料規模或訓練算力。官方模型卡只確認 Gemini 3.7 Flash 基於 Gemini 3.6 Flash,並進行演算法改進。任何把特定參數量當作事實的說法都只能算推測。
開發者真正可以依賴的是 API 合約:
- 1,048,576 輸入 Token 與 65,536 輸出 Token;
- 支援文字、圖片、影片、音訊與 PDF 輸入,輸出為文字;
- 支援 low、medium、high 三層思考,minimal 會直接報錯;
- 支援函式呼叫、結構化輸出、搜尋、Maps、程式碼執行、檔案搜尋、URL Context、快取與預覽版 Computer Use;
- 不支援 Live API、音訊生成與圖片生成。
1M 上下文代表容量,不代表每次都應塞滿。長 Prompt 仍會增加延遲與費用;更強的檢索能力也無法取代權威狀態保留、重複歷史壓縮與工具副作用驗證。
呼叫 Gemini 3.7 Flash
Google 的發布指南使用 Interactions API,並將 medium 列為預設思考層級:
export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"
curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"model": "gemini-3.7-flash",
"input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
"generation_config": {
"thinking_level": "medium"
}
}'
Modelflare 目前透過 OpenAI 相容的 Chat Completions 路由提供這個精確模型 ID:
export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"
curl "https://origin.modelflare.dev/v1/chat/completions" \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{
"role": "user",
"content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
}
]
}'
兩個範例使用不同協定。不要假設 Google 原生內建工具或 Interactions 欄位都能透過 OpenAI 相容轉接器使用。
遷移與正式環境注意事項
Google 的 3.7 遷移指南要求移除 temperature、top_p 與 top_k,以字串列舉 thinking_level 取代 thinking_budget,並刪除不支援的 candidate_count。多輪 Interactions 工作流應使用伺服器端 previous_interaction_id。
替換現有模型前:
- 固定使用精確的 gemini-3.7-flash,並拒絕靜默別名替換;
- 以固定且不含敏感資訊的真實任務集對照目前模型與 3.7;
- 按成功任務成本與總耗時比較 low、medium、high;
- 分別測試串流回應、結構化輸出、函式呼叫、多模態、取消與拒答路徑;
- 依所用協定保留 Thought Signature 與工具呼叫關聯欄位;
- 驗證快取、重試、逾時與重複副作用保護;
- 記錄最終模型、路由、輸入、快取輸入、輸出、工具、延遲與扣費;
- 在真實流量達到驗收線之前保留回復路由。
HTTP 200 只能證明某次請求完成,不能證明協定完全相容、延遲穩定、工具行為正確,或每個成功任務的總成本更低。
Modelflare 上的 Gemini 3.7 Flash
截至 2026 年 8 月 15 日的正式環境核對,Modelflare 公開的模型與價格目錄已在 gemini-stable 群組中列出精確的 gemini-3.7-flash。目錄顯示支援 Gemini 原生 generateContent 與 OpenAI 相容 Chat Completions,目前未為該模型列出 Responses 路由。
核對時顯示的群組倍率為 0.15x。Google 限時首發價、Modelflare 設定的參考價、群組權限與請求完成後的實際扣費是彼此獨立的事實,也可能分別變動。當前價格應以即時價格頁與一筆已完成的非敏感請求記錄為準。
正式接入時,先建立或更新具備相應群組權限的 Key,固定精確模型 ID,並驗證應用程式實際使用的協定能力,再逐步遷移流量。
結論
Gemini 3.7 Flash 是一次有實際幅度的 3.6 Flash 升級,而且首發階段價格不變。它最突出的價值不是某一個分數,而是覆蓋面:正式程式開發、網頁開發、工具型 Agent、複雜文件、多模態輸入、長上下文與電腦操作都得到提升,同時沒有進入高價模型層級。
它不是每項基準都領先,參數量仍未知,首發折扣也會在 2026 年底結束。更穩妥的做法,是讓 3.7 Flash 與目前承接真實任務的模型執行同一套任務,再按完成率、延遲、重試次數與總成本選擇,而不是只看一個綜合分數。
官方來源與更新記錄
一手來源:
- Google:Introducing Gemini 3.7 Flash
- Google AI:Gemini 3.7 Flash 模型頁
- Google AI:最新模型與遷移指南
- Google AI:Gemini API 價格
- Google DeepMind:Gemini 3.7 Flash 模型卡
- Google DeepMind:評測方法
更新記錄:
- 2026 年 8 月 15 日: 首次發布。已核對規格、能力、基準方法、官方價格、遷移指南與 Modelflare 目錄可用狀態。