Gemini 3.7 Flash: 사양, 성능, API 가격과 모델 비교

Gemini 3.7 Flash의 1M 컨텍스트, 64K 출력, 기능, 공식 가격을 검증하고 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra, Muse Spark 1.2와 20개 벤치마크로 비교하며 마이그레이션을 설명합니다.

Google은 2026년 8월 13일 Gemini 3.7 Flash를 출시했습니다. Gemini 3.6 Flash 출시 후 불과 3주 만입니다. 안정 모델 ID gemini-3.7-flash로 GA 되었으며, 코딩, Agent, 멀티모달 추론과 신뢰도 높은 다단계 실행을 위한 Google의 가장 강력한 Flash 모델로 소개됩니다.

핵심은 더 큰 컨텍스트나 공개된 파라미터 수가 아닙니다. Gemini 3.7 Flash는 3.6 Flash와 같은 1M 입력, 64K 출력 등급을 유지하면서 코드, 도구 사용, 지식 업무, 문서 이해와 컴퓨터 사용 성능을 크게 높였다고 Google은 보고합니다. 출시 기간 Token 가격도 3.6과 같습니다.

이 글은 공식 사양, Google 공개 벤치마크, 한시적 출시 가격과 Modelflare의 현재 지원을 구분합니다. 변동 가능한 정보는 2026년 8월 15일 확인했습니다.

Gemini 3.7 Flash 핵심 사양

항목 공식 값
출시일 2026년 8월 13일
API 상태 정식 출시, 안정 모델 ID
모델 ID gemini-3.7-flash
기반 Gemini 3.6 Flash 기반 알고리즘 개선
입력 모달리티 텍스트, 이미지, 비디오, 오디오, PDF
출력 모달리티 텍스트
최대 입력 1,048,576 Token
최대 출력 65,536 Token
Thinking 수준 low, medium, high. 문서상 기본값은 medium
지식 기준일 2026년 3월. 일부 분야는 2025년 1월 수준일 수 있음
파라미터 수 비공개
최근 문서 업데이트 2026년 8월

컨텍스트 캐시, 코드 실행, Preview Computer Use, 파일 검색, Function Calling, Google Maps 및 Search Grounding, 구조화 출력, Thinking, URL Context를 지원합니다. Batch, Flex, Priority도 제공합니다. 오디오 생성, 이미지 생성과 Live API는 지원하지 않습니다.

Gemini 3.6 Flash에서 실제로 달라진 점

Gemini 3.7 Flash는 3.6 Flash의 반복 개선판이지 새로운 컨텍스트나 모달리티 등급이 아닙니다. Google은 추론 기반의 알고리즘 개선과 프로덕션 개발자 피드백을 개선 배경으로 설명합니다.

실무 변화는 다음에 집중됩니다.

  • 코드 생성과 소프트웨어 엔지니어링의 첫 시도 정확도 향상;
  • 스크린샷, 이미지, 디자인 시스템을 웹 UI로 구현할 때 디자인 준수 향상;
  • 다단계 계획, 도구 호출, 장애 복구와 의도 확인의 안정성 향상;
  • 금융, 법률, 생명과학의 복잡한 문서 추론 개선;
  • 긴 컨텍스트와 Agent 컴퓨터 사용 능력 향상;
  • 2026년 12월 31일까지 3.6 Flash와 동일한 Standard 출시 가격.

즉 출시 시점의 3.7은 더 비싼 3.6 대체재가 아닙니다. 마이그레이션은 Token 단가 차이보다 동작, 지연과 호환성으로 판단해야 합니다.

공식 API 가격

아래는 유료 등급의 미국 달러 가격입니다. Token은 100만 개 기준, 캐시 저장은 100만 Token·시간 기준입니다.

소비 모드 과금 항목 2026년 12월 31일까지 2027년 1월 1일부터
Standard 입력 $0.75 $1.50
Standard 출력, Thinking Token 포함 $3.75 $7.50
Standard 캐시 입력 $0.075 $0.15
Standard 시간당 캐시 저장 $0.50 $1.00
Batch 입력 $0.375 $0.75
Batch 출력, Thinking Token 포함 $1.875 $3.75
Batch 캐시 입력 $0.0375 $0.075
Flex 입력 $0.375 $0.75
Flex 출력, Thinking Token 포함 $1.875 $3.75
Flex 캐시 입력 $0.0375 $0.075
Priority 입력 $1.35 $2.70
Priority 출력, Thinking Token 포함 $6.75 $13.50
Priority 캐시 입력 $0.135 $0.27

Google Search Grounding은 Gemini 3.x 전체가 월 5,000회의 무료 검색을 공유하고 이후 1,000회당 $14입니다. Google Maps Grounding도 5,000 Prompt를 공유하며 이후 검색 1,000회당 $14입니다.

출시 Standard 가격에서 입력 100K와 출력 10K는 캐시, 도구, 저장, 재시도를 제외하고 약 $0.1125입니다. 캐시 입력 100만과 출력 100K는 저장료를 제외하고 약 $0.45입니다. 출시 기간이 끝나면 두 예시 모두 두 배가 됩니다.

전체 가로 벤치마크 비교

Google의 2026년 8월 모델 카드는 Gemini 3.7 Flash, Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra, Muse Spark 1.2를 비교합니다. 모든 항목은 높을수록 좋으며 대시는 미공개 결과입니다.

벤치마크 Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena, WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench, 비공개 세트 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2, Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning, 도구 없음 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning, 도구 사용 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2, 128K 평균 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench, 사람 풀이 가능 87.1% 80.6% 87.5% 83.8%
BioMysteryBench, 사람에게 어려움 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

이 수치는 유용하지만 완전히 독립적이고 동일 조건인 대회는 아닙니다. Google은 Gemini 결과가 대체로 기본 Sampling의 pass@1이라고 설명합니다. 비 Gemini 결과는 별도 표시가 없으면 공급자 자가 보고이며 가능한 최대 추론 수준을 우선합니다. 일부 평가는 Google이 직접 실행했고 Harness, 도구, 집계, 비디오 프레임 수까지 다릅니다.

능력과 성능 분석

Gemini 3.6 Flash 대비 개선 폭은 넓습니다. FrontierCode +9.2%p, DeepSWE +16.7%p, AutomationBench +13.4%p, GDP.pdf +12%p, OSWorld +14.1%p입니다. Code Arena는 50 Elo, GDM-MRCR은 91.8%에서 97.0%로 상승했습니다.

다른 모델 계열과의 비교는 더 세분화됩니다.

  • Gemini 3.7 Flash가 선두: FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified, LABBench2.
  • GPT-5.6 Terra가 선두: DeepSWE, 두 Terminal-bench, 도구 없는 CharXiv, OSWorld, BioMysteryBench 어려움 그룹.
  • Claude Sonnet 5가 선두: Agent's Last Exam, BioMysteryBench 사람 풀이 가능 그룹.
  • Muse Spark 1.2가 선두: GDPVal-AA. Artificial Analysis는 GPT와 공동 1위지만 미공개 항목이 많습니다.
  • 3.7이 모든 항목에서 3.6보다 높지는 않음: CharXiv는 도구 유무 모두 0.7%p 낮습니다.

실무적으로 3.7 Flash는 출시 가격 대비 균형이 좋습니다. Coding Agent, 브라우저·데스크톱 작업, 긴 문서, 멀티모달 분석과 대규모 지식 업무의 강한 기본 후보입니다. 장기 소프트웨어 개발과 Terminal Agent는 GPT-5.6 Terra, Desktop Agent는 Claude Sonnet 5와 직접 비교할 가치가 있습니다. Muse Spark는 지식 업무가 강하지만 공개 비교 범위가 불완전합니다.

파라미터, 컨텍스트와 멀티모달

Google은 전체·활성 파라미터 수, Expert 수, 세부 아키텍처, 학습 Corpus 규모와 연산량을 공개하지 않았습니다. 공식 모델 카드는 3.7 Flash가 3.6 Flash 기반의 알고리즘 개선판이라고만 밝힙니다. 구체적인 파라미터 수를 사실처럼 말하면 추정입니다.

개발자가 신뢰할 수 있는 것은 API 계약입니다.

  • 입력 1,048,576 Token, 출력 65,536 Token;
  • 텍스트, 이미지, 비디오, 오디오, PDF 입력과 텍스트 출력;
  • low, medium, high. minimal은 오류;
  • Function Calling, 구조화 출력, Search, Maps, 코드 실행, 파일 검색, URL Context, 캐시, Preview Computer Use;
  • Live API, 오디오 생성, 이미지 생성 미지원.

1M 컨텍스트는 용량이지 목표가 아닙니다. 긴 Prompt는 여전히 지연과 비용을 늘립니다. 검색 능력 향상도 권위 있는 상태 보존, 중복 이력 압축과 도구 부작용 검증을 대신하지 않습니다.

Gemini 3.7 Flash 호출

Google 출시 가이드는 Interactions API를 사용하고 medium을 기본값으로 설명합니다.

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare는 현재 OpenAI 호환 Chat Completions로 정확한 모델 ID를 제공합니다.

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

두 예시는 서로 다른 Protocol입니다. Google 네이티브 도구나 Interactions 필드가 OpenAI 호환 Adapter에서 모두 제공된다고 가정하면 안 됩니다.

마이그레이션과 프로덕션 주의사항

Google은 temperature, top_p, top_k 제거, thinking_budget을 문자열 thinking_level로 교체, 미지원 candidate_count 삭제를 요구합니다. 여러 Turn의 Interactions는 서버 측 previous_interaction_id를 사용해야 합니다.

기존 모델을 교체하기 전에:

  1. 정확한 gemini-3.7-flash를 고정하고 조용한 Alias 교체를 거부합니다;
  2. 고정된 비민감 실제 작업을 현재 모델과 3.7에서 재생합니다;
  3. low, medium, high를 성공 작업 비용과 총 시간으로 비교합니다;
  4. Streaming, 구조화 출력, 함수, 멀티모달, 취소, 거부를 따로 검사합니다;
  5. 선택한 Protocol이 요구하는 Thought Signature와 상관 필드를 보존합니다;
  6. 캐시, 재시도, Timeout, 중복 부작용 방지를 확인합니다;
  7. 모델, Route, 입력, 캐시, 출력, 도구, 지연, 과금을 기록합니다;
  8. 실제 Traffic이 기준을 통과할 때까지 Rollback Route를 유지합니다.

HTTP 200은 한 요청이 끝났다는 뜻일 뿐입니다. Protocol 동등성, 안정적인 지연, 올바른 도구 동작, 성공 작업당 비용 절감을 증명하지 않습니다.

Modelflare의 Gemini 3.7 Flash

2026년 8월 15일 프로덕션 확인에서 Modelflare 공개 모델과 가격gemini-stable 그룹에 gemini-3.7-flash를 표시했습니다. Gemini 네이티브 generateContent와 OpenAI 호환 Chat Completions를 지원하며 Responses Route는 표시하지 않았습니다.

표시된 그룹 배율은 0.15x였습니다. Google 한시 가격, Modelflare 기준 가격, 그룹 접근과 완료 요청의 최종 과금은 서로 독립된 사실이며 각각 변경될 수 있습니다. 현재 값은 실시간 가격 페이지와 완료된 비민감 요청을 기준으로 확인해야 합니다.

프로덕션에서는 대상 그룹 Key를 만들거나 갱신하고 정확한 모델 ID와 실제 사용 Protocol 기능을 검증한 뒤 Traffic을 점진적으로 옮깁니다.

결론

Gemini 3.7 Flash는 같은 한시 가격으로 3.6 Flash를 실질적으로 개선합니다. 강점은 폭입니다. 프로덕션 코드, 웹, 도구 Agent, 복잡한 문서, 멀티모달 입력, 긴 컨텍스트와 Computer Use가 Premium 가격대로 이동하지 않고 향상됩니다.

모든 벤치마크에서 1위는 아니고 파라미터 수는 미공개이며 할인은 2026년 말 끝납니다. 실제 작업을 처리하는 현재 모델과 같은 작업으로 비교하고 완료율, 지연, 재시도와 총비용으로 선택하는 것이 합리적입니다.

공식 출처와 업데이트

1차 출처:

업데이트:

  • 2026년 8월 15일: 최초 게시. 사양, 기능, 평가 방법, 공식 가격, 마이그레이션과 Modelflare 제공 상태를 확인했습니다.