Gemini 3.7 Flash 正式发布:参数、性能、价格与横向对比
基于官方资料全面分析 Gemini 3.7 Flash 的 1M 上下文、64K 输出、能力边界、API 价格,并与 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 横向对比。
Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 上线只有三周。它已经以稳定模型 ID gemini-3.7-flash 正式可用,定位是 Google 目前能力最强的 Flash 模型,重点面向编程、Agent、多模态推理和可靠的多步执行。
这次更新的重点并不是更大的上下文,也不是公开了模型参数量。Gemini 3.7 Flash 仍然是 1M 输入、64K 输出这一档,但 Google 公布的结果显示,它在编程、工具调用、知识工作、文档理解和计算机操作上都有明显提升,首发 Token 价格则与 3.6 Flash 相同。
下面会把官方规格、Google 公布的基准结果、限时首发价格和 Modelflare 当前可用状态分开说明。所有易变信息核验于 2026 年 8 月 15 日。
Gemini 3.7 Flash 核心参数
| 项目 | 官方信息 |
|---|---|
| 发布时间 | 2026 年 8 月 13 日 |
| API 状态 | 正式可用,稳定模型 ID |
| 模型 ID | gemini-3.7-flash |
| 基础模型 | 基于 Gemini 3.6 Flash,并改进核心算法 |
| 输入模态 | 文本、图片、视频、音频和 PDF |
| 输出模态 | 文本 |
| 最大输入 | 1,048,576 Token |
| 最大输出 | 65,536 Token |
| 思考档位 | low、medium、high;文档默认值为 medium |
| 知识截止时间 | 2026 年 3 月,部分领域可能仍以 2025 年 1 月为限 |
| 参数量 | 未公开 |
| 最近文档更新时间 | 2026 年 8 月 |
它支持上下文缓存、代码执行、预览版 Computer Use、文件搜索、函数调用、Google Maps Grounding、Google Search Grounding、结构化输出、Thinking 和 URL Context,也支持 Batch、Flex 与 Priority 三种消费模式。不支持音频生成、图片生成和 Live API。
相比 Gemini 3.6 Flash 具体变了什么
Gemini 3.7 Flash 是基于 3.6 Flash 的迭代,不是一次上下文或模态规格升级。Google 将提升归因于核心推理算法的改进,以及生产环境开发者的反馈。
实际变化主要集中在:
- 代码生成和软件工程的首轮正确率更高;
- 从截图、图片或设计系统生成网页时,更能遵循设计细节;
- 多步规划、工具调用、遇阻后的恢复和意图澄清更稳定;
- 对金融、法律和生命科学复杂文档的推理更强;
- 长上下文检索与 Agent 计算机操作能力提升;
- 2026 年 12 月 31 日前,Standard 首发价格与 Gemini 3.6 Flash 相同。
最后一点很关键:首发阶段的 3.7 并不是更贵的 3.6 替代品。是否迁移,主要要看行为、延迟和兼容性,而不是 Token 单价差。
官方 API 价格
下表是付费层美元价格。Token 价格按每 100 万 Token 计算,缓存存储按每 100 万 Token 每小时计算。
| 消费模式 | 计费项 | 2026 年 12 月 31 日前 | 2027 年 1 月 1 日起 |
|---|---|---|---|
| Standard | 输入 | $0.75 | $1.50 |
| Standard | 输出,包含思考 Token | $3.75 | $7.50 |
| Standard | 缓存输入 | $0.075 | $0.15 |
| Standard | 每小时缓存存储 | $0.50 | $1.00 |
| Batch | 输入 | $0.375 | $0.75 |
| Batch | 输出,包含思考 Token | $1.875 | $3.75 |
| Batch | 缓存输入 | $0.0375 | $0.075 |
| Flex | 输入 | $0.375 | $0.75 |
| Flex | 输出,包含思考 Token | $1.875 | $3.75 |
| Flex | 缓存输入 | $0.0375 | $0.075 |
| Priority | 输入 | $1.35 | $2.70 |
| Priority | 输出,包含思考 Token | $6.75 | $13.50 |
| Priority | 缓存输入 | $0.135 | $0.27 |
Google Search Grounding 每月有 5,000 次免费搜索请求,由 Gemini 3.x 模型共享,之后为每 1,000 次 $14。Google Maps Grounding 同样共享 5,000 个免费 Prompt,之后每 1,000 次搜索查询 $14。
按首发期 Standard 价格计算,10 万输入加 1 万输出约为 $0.1125,不含缓存、工具、存储和重试。100 万缓存输入加 10 万输出约为 $0.45,不含缓存存储费。首发期结束后,这两个算例都会翻倍。
完整横向基准对比
Google 2026 年 8 月的模型卡将 Gemini 3.7 Flash 与 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 放在同一张表中比较。以下各项都是数值越高越好,破折号表示模型卡没有公布成绩。
| 基准 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 | 57 |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% | — |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% | 54.9% |
| Code Arena,WebDev Elo | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% | 82.9% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% | — |
| AutomationBench,私有集 | 30.4% | 17.0% | 10.7% | 23.6% | — |
| GDPVal-AA v2,Elo | 1525 | 1422 | 1598 | 1578 | 1628 |
| Harvey LAB-AA | 90.7% | 85.1% | 90.1% | 85.2% | — |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% | 16.0% |
| CharXiv Reasoning,不使用工具 | 84.5% | 85.2% | 77.0% | 85.9% | — |
| CharXiv Reasoning,使用工具 | 88.7% | 89.4% | 88.3% | — | — |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% | — |
| GDM-MRCR v2,128K 平均 | 97.0% | 91.8% | 81.5% | 93.5% | — |
| OSWorld 2.0 | 47.9% | 33.8% | — | 50.2% | — |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% | — |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% | — |
| BioMysteryBench,人类可解组 | 87.1% | 80.6% | 87.5% | 83.8% | — |
| BioMysteryBench,人类困难组 | 43.5% | 41.2% | 34.1% | 49.4% | — |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% | — |
这些数字有参考价值,但不能视为一次完全独立、条件统一的擂台赛。Google 说明,Gemini 成绩通常使用默认采样并按 pass@1 计算;非 Gemini 成绩除特别注明外来自各厂商自报,并优先采用最高可用推理档位。部分项目由 Google 自行运行,不同模型的 Harness、工具权限、聚合方式,甚至视频帧数都不完全相同。
能力与表现分析
相对 Gemini 3.6 Flash,这次提升不是个位数的微调:FrontierCode 增加 9.2 个百分点,DeepSWE 增加 16.7 个百分点,AutomationBench 增加 13.4 个百分点,GDP.pdf 增加 12 个百分点,OSWorld 增加 14.1 个百分点,Code Arena 提升 50 Elo,长上下文 GDM-MRCR 从 91.8% 提升到 97.0%。
和其他模型家族相比,结论更细:
- Gemini 3.7 Flash 在公开表格中领先 FrontierCode、Code Arena、AutomationBench、Harvey LAB-AA、GDP.pdf、LVBench、GDM-MRCR、HLE-Verified 和 LABBench2。
- GPT-5.6 Terra 仍然领先 DeepSWE、两项 Terminal-bench、不使用工具的 CharXiv、OSWorld,以及 BioMysteryBench 人类困难组。
- Claude Sonnet 5 领先 Agent's Last Exam,并在 BioMysteryBench 人类可解组略胜。
- Muse Spark 1.2 领先 GDPVal-AA,并在 Artificial Analysis Intelligence Index 与 GPT-5.6 Terra 并列,但缺失成绩也最多。
- Gemini 3.7 并非每项都胜过 3.6:CharXiv 在使用和不使用工具时都低了 0.7 个百分点。
更实际的结论是:以首发价格来看,3.7 Flash 的能力非常均衡,适合作为编程 Agent、浏览器或桌面工作流、长文档、多模态分析和高并发知识工作的默认候选。长周期软件工程和终端 Agent 仍值得与 GPT-5.6 Terra 实测;桌面 Agent 可保留 Claude Sonnet 5 对照;Muse Spark 的知识工作成绩很强,但公开对比面还不完整。
参数量、上下文与多模态边界
Google 没有公布总参数量、激活参数量、专家数量、具体架构、训练语料规模或训练算力。官方模型卡只确认 Gemini 3.7 Flash 基于 Gemini 3.6 Flash,并做了算法改进。任何把具体参数量当作事实的说法都只能算猜测。
开发者真正可以依赖的是 API 合同:
- 1,048,576 输入 Token 与 65,536 输出 Token;
- 支持文本、图片、视频、音频和 PDF 输入,输出为文本;
- 支持 low、medium、high 三档思考,minimal 会直接报错;
- 支持函数调用、结构化输出、搜索、Maps、代码执行、文件搜索、URL Context、缓存和预览版 Computer Use;
- 不支持 Live API、音频生成和图片生成。
1M 上下文代表容量,不代表应该每次都塞满。长 Prompt 依然会增加延迟和费用;更强的检索能力也不能替代权威状态保留、重复历史压缩和工具副作用校验。
调用 Gemini 3.7 Flash
Google 的发布指南使用 Interactions API,并将 medium 写为默认思考档位:
export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"
curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"model": "gemini-3.7-flash",
"input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
"generation_config": {
"thinking_level": "medium"
}
}'
Modelflare 当前通过 OpenAI 兼容的 Chat Completions 路由提供这个准确模型 ID:
export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"
curl "https://origin.modelflare.dev/v1/chat/completions" \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{
"role": "user",
"content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
}
]
}'
两个示例使用的是不同协议。不要默认 Google 原生内置工具或 Interactions 字段都能通过 OpenAI 兼容适配器使用。
迁移与生产注意事项
Google 的 3.7 迁移指南要求移除 temperature、top_p 和 top_k,用字符串枚举 thinking_level 替代 thinking_budget,并删除不支持的 candidate_count。多轮 Interactions 工作流应使用服务端 previous_interaction_id。
替换现有模型前:
- 固定使用准确的 gemini-3.7-flash,并拒绝静默别名替换;
- 用固定且不含敏感信息的真实任务集对照当前模型和 3.7;
- 按成功任务成本和总耗时比较 low、medium、high;
- 分别测试流式响应、结构化输出、函数调用、多模态、取消和拒答路径;
- 按所用协议保留 Thought Signature 和工具调用关联字段;
- 验证缓存、重试、超时和重复副作用保护;
- 记录最终模型、路由、输入、缓存输入、输出、工具、延迟和扣费;
- 在真实流量达到验收线前保留回滚路由。
HTTP 200 只能证明某次请求完成,不能证明协议完全兼容、延迟稳定、工具行为正确或单个成功任务的总成本更低。
Modelflare 上的 Gemini 3.7 Flash
截至 2026 年 8 月 15 日的生产核验,Modelflare 公开的模型与价格目录已经在 gemini-stable 分组中列出准确的 gemini-3.7-flash。目录显示支持 Gemini 原生 generateContent 和 OpenAI 兼容 Chat Completions,当前没有为该模型列出 Responses 路由。
核验时显示的分组倍率为 0.15x。Google 限时首发价、Modelflare 配置的参考价、分组权限与请求完成后的实际扣费是彼此独立的事实,也可能分别变化。当前价格应以实时价格页和一笔已完成的非敏感请求记录为准。
生产接入时,先创建或更新一个具备对应分组权限的 Key,固定准确模型 ID,并验证应用实际使用的协议能力,再逐步迁移流量。
结论
Gemini 3.7 Flash 是一次有实际幅度的 3.6 Flash 升级,而且首发阶段价格不变。它最突出的价值不是某一个分数,而是覆盖面:生产编程、网页开发、工具型 Agent、复杂文档、多模态输入、长上下文和计算机操作都得到提升,同时没有进入高价模型档位。
它不是每项基准都领先,参数量仍未知,首发折扣也会在 2026 年底结束。更稳妥的做法,是让 3.7 Flash 与当前承接真实任务的模型跑同一套任务,再按完成率、延迟、重试次数和总成本选择,而不是只看一个综合分。
官方来源与更新记录
一手来源:
- Google:Introducing Gemini 3.7 Flash
- Google AI:Gemini 3.7 Flash 模型页
- Google AI:最新模型与迁移指南
- Google AI:Gemini API 价格
- Google DeepMind:Gemini 3.7 Flash 模型卡
- Google DeepMind:评测方法
更新记录:
- 2026 年 8 月 15 日: 首次发布。已核验规格、能力、基准方法、官方价格、迁移指南和 Modelflare 目录可用状态。