Gemini 3.7 Flash 正式发布:参数、性能、价格与横向对比

基于官方资料全面分析 Gemini 3.7 Flash 的 1M 上下文、64K 输出、能力边界、API 价格,并与 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 横向对比。

Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 上线只有三周。它已经以稳定模型 ID gemini-3.7-flash 正式可用,定位是 Google 目前能力最强的 Flash 模型,重点面向编程、Agent、多模态推理和可靠的多步执行。

这次更新的重点并不是更大的上下文,也不是公开了模型参数量。Gemini 3.7 Flash 仍然是 1M 输入、64K 输出这一档,但 Google 公布的结果显示,它在编程、工具调用、知识工作、文档理解和计算机操作上都有明显提升,首发 Token 价格则与 3.6 Flash 相同。

下面会把官方规格、Google 公布的基准结果、限时首发价格和 Modelflare 当前可用状态分开说明。所有易变信息核验于 2026 年 8 月 15 日。

Gemini 3.7 Flash 核心参数

项目 官方信息
发布时间 2026 年 8 月 13 日
API 状态 正式可用,稳定模型 ID
模型 ID gemini-3.7-flash
基础模型 基于 Gemini 3.6 Flash,并改进核心算法
输入模态 文本、图片、视频、音频和 PDF
输出模态 文本
最大输入 1,048,576 Token
最大输出 65,536 Token
思考档位 low、medium、high;文档默认值为 medium
知识截止时间 2026 年 3 月,部分领域可能仍以 2025 年 1 月为限
参数量 未公开
最近文档更新时间 2026 年 8 月

它支持上下文缓存、代码执行、预览版 Computer Use、文件搜索、函数调用、Google Maps Grounding、Google Search Grounding、结构化输出、Thinking 和 URL Context,也支持 Batch、Flex 与 Priority 三种消费模式。不支持音频生成、图片生成和 Live API。

相比 Gemini 3.6 Flash 具体变了什么

Gemini 3.7 Flash 是基于 3.6 Flash 的迭代,不是一次上下文或模态规格升级。Google 将提升归因于核心推理算法的改进,以及生产环境开发者的反馈。

实际变化主要集中在:

  • 代码生成和软件工程的首轮正确率更高;
  • 从截图、图片或设计系统生成网页时,更能遵循设计细节;
  • 多步规划、工具调用、遇阻后的恢复和意图澄清更稳定;
  • 对金融、法律和生命科学复杂文档的推理更强;
  • 长上下文检索与 Agent 计算机操作能力提升;
  • 2026 年 12 月 31 日前,Standard 首发价格与 Gemini 3.6 Flash 相同。

最后一点很关键:首发阶段的 3.7 并不是更贵的 3.6 替代品。是否迁移,主要要看行为、延迟和兼容性,而不是 Token 单价差。

官方 API 价格

下表是付费层美元价格。Token 价格按每 100 万 Token 计算,缓存存储按每 100 万 Token 每小时计算。

消费模式 计费项 2026 年 12 月 31 日前 2027 年 1 月 1 日起
Standard 输入 $0.75 $1.50
Standard 输出,包含思考 Token $3.75 $7.50
Standard 缓存输入 $0.075 $0.15
Standard 每小时缓存存储 $0.50 $1.00
Batch 输入 $0.375 $0.75
Batch 输出,包含思考 Token $1.875 $3.75
Batch 缓存输入 $0.0375 $0.075
Flex 输入 $0.375 $0.75
Flex 输出,包含思考 Token $1.875 $3.75
Flex 缓存输入 $0.0375 $0.075
Priority 输入 $1.35 $2.70
Priority 输出,包含思考 Token $6.75 $13.50
Priority 缓存输入 $0.135 $0.27

Google Search Grounding 每月有 5,000 次免费搜索请求,由 Gemini 3.x 模型共享,之后为每 1,000 次 $14。Google Maps Grounding 同样共享 5,000 个免费 Prompt,之后每 1,000 次搜索查询 $14。

按首发期 Standard 价格计算,10 万输入加 1 万输出约为 $0.1125,不含缓存、工具、存储和重试。100 万缓存输入加 10 万输出约为 $0.45,不含缓存存储费。首发期结束后,这两个算例都会翻倍。

完整横向基准对比

Google 2026 年 8 月的模型卡将 Gemini 3.7 Flash 与 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 放在同一张表中比较。以下各项都是数值越高越好,破折号表示模型卡没有公布成绩。

基准 Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena,WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench,私有集 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2,Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning,不使用工具 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning,使用工具 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2,128K 平均 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench,人类可解组 87.1% 80.6% 87.5% 83.8%
BioMysteryBench,人类困难组 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

这些数字有参考价值,但不能视为一次完全独立、条件统一的擂台赛。Google 说明,Gemini 成绩通常使用默认采样并按 pass@1 计算;非 Gemini 成绩除特别注明外来自各厂商自报,并优先采用最高可用推理档位。部分项目由 Google 自行运行,不同模型的 Harness、工具权限、聚合方式,甚至视频帧数都不完全相同。

能力与表现分析

相对 Gemini 3.6 Flash,这次提升不是个位数的微调:FrontierCode 增加 9.2 个百分点,DeepSWE 增加 16.7 个百分点,AutomationBench 增加 13.4 个百分点,GDP.pdf 增加 12 个百分点,OSWorld 增加 14.1 个百分点,Code Arena 提升 50 Elo,长上下文 GDM-MRCR 从 91.8% 提升到 97.0%。

和其他模型家族相比,结论更细:

  • Gemini 3.7 Flash 在公开表格中领先 FrontierCode、Code Arena、AutomationBench、Harvey LAB-AA、GDP.pdf、LVBench、GDM-MRCR、HLE-Verified 和 LABBench2。
  • GPT-5.6 Terra 仍然领先 DeepSWE、两项 Terminal-bench、不使用工具的 CharXiv、OSWorld,以及 BioMysteryBench 人类困难组。
  • Claude Sonnet 5 领先 Agent's Last Exam,并在 BioMysteryBench 人类可解组略胜。
  • Muse Spark 1.2 领先 GDPVal-AA,并在 Artificial Analysis Intelligence Index 与 GPT-5.6 Terra 并列,但缺失成绩也最多。
  • Gemini 3.7 并非每项都胜过 3.6:CharXiv 在使用和不使用工具时都低了 0.7 个百分点。

更实际的结论是:以首发价格来看,3.7 Flash 的能力非常均衡,适合作为编程 Agent、浏览器或桌面工作流、长文档、多模态分析和高并发知识工作的默认候选。长周期软件工程和终端 Agent 仍值得与 GPT-5.6 Terra 实测;桌面 Agent 可保留 Claude Sonnet 5 对照;Muse Spark 的知识工作成绩很强,但公开对比面还不完整。

参数量、上下文与多模态边界

Google 没有公布总参数量、激活参数量、专家数量、具体架构、训练语料规模或训练算力。官方模型卡只确认 Gemini 3.7 Flash 基于 Gemini 3.6 Flash,并做了算法改进。任何把具体参数量当作事实的说法都只能算猜测。

开发者真正可以依赖的是 API 合同:

  • 1,048,576 输入 Token 与 65,536 输出 Token;
  • 支持文本、图片、视频、音频和 PDF 输入,输出为文本;
  • 支持 lowmediumhigh 三档思考,minimal 会直接报错;
  • 支持函数调用、结构化输出、搜索、Maps、代码执行、文件搜索、URL Context、缓存和预览版 Computer Use;
  • 不支持 Live API、音频生成和图片生成。

1M 上下文代表容量,不代表应该每次都塞满。长 Prompt 依然会增加延迟和费用;更强的检索能力也不能替代权威状态保留、重复历史压缩和工具副作用校验。

调用 Gemini 3.7 Flash

Google 的发布指南使用 Interactions API,并将 medium 写为默认思考档位:

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare 当前通过 OpenAI 兼容的 Chat Completions 路由提供这个准确模型 ID:

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

两个示例使用的是不同协议。不要默认 Google 原生内置工具或 Interactions 字段都能通过 OpenAI 兼容适配器使用。

迁移与生产注意事项

Google 的 3.7 迁移指南要求移除 temperaturetop_ptop_k,用字符串枚举 thinking_level 替代 thinking_budget,并删除不支持的 candidate_count。多轮 Interactions 工作流应使用服务端 previous_interaction_id

替换现有模型前:

  1. 固定使用准确的 gemini-3.7-flash,并拒绝静默别名替换;
  2. 用固定且不含敏感信息的真实任务集对照当前模型和 3.7;
  3. 按成功任务成本和总耗时比较 low、medium、high;
  4. 分别测试流式响应、结构化输出、函数调用、多模态、取消和拒答路径;
  5. 按所用协议保留 Thought Signature 和工具调用关联字段;
  6. 验证缓存、重试、超时和重复副作用保护;
  7. 记录最终模型、路由、输入、缓存输入、输出、工具、延迟和扣费;
  8. 在真实流量达到验收线前保留回滚路由。

HTTP 200 只能证明某次请求完成,不能证明协议完全兼容、延迟稳定、工具行为正确或单个成功任务的总成本更低。

Modelflare 上的 Gemini 3.7 Flash

截至 2026 年 8 月 15 日的生产核验,Modelflare 公开的模型与价格目录已经在 gemini-stable 分组中列出准确的 gemini-3.7-flash。目录显示支持 Gemini 原生 generateContent 和 OpenAI 兼容 Chat Completions,当前没有为该模型列出 Responses 路由。

核验时显示的分组倍率为 0.15x。Google 限时首发价、Modelflare 配置的参考价、分组权限与请求完成后的实际扣费是彼此独立的事实,也可能分别变化。当前价格应以实时价格页和一笔已完成的非敏感请求记录为准。

生产接入时,先创建或更新一个具备对应分组权限的 Key,固定准确模型 ID,并验证应用实际使用的协议能力,再逐步迁移流量。

结论

Gemini 3.7 Flash 是一次有实际幅度的 3.6 Flash 升级,而且首发阶段价格不变。它最突出的价值不是某一个分数,而是覆盖面:生产编程、网页开发、工具型 Agent、复杂文档、多模态输入、长上下文和计算机操作都得到提升,同时没有进入高价模型档位。

它不是每项基准都领先,参数量仍未知,首发折扣也会在 2026 年底结束。更稳妥的做法,是让 3.7 Flash 与当前承接真实任务的模型跑同一套任务,再按完成率、延迟、重试次数和总成本选择,而不是只看一个综合分。

官方来源与更新记录

一手来源:

更新记录:

  • 2026 年 8 月 15 日: 首次发布。已核验规格、能力、基准方法、官方价格、迁移指南和 Modelflare 目录可用状态。