Gemini 3.7 Flash: thông số, benchmark, giá và so sánh mô hình

Phân tích đã kiểm chứng về Gemini 3.7 Flash gồm ngữ cảnh 1M, đầu ra 64K, năng lực, giá chính thức, so sánh với 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra, Muse Spark 1.2 và hướng dẫn chuyển đổi.

Google phát hành Gemini 3.7 Flash ngày 13 tháng 8 năm 2026, chỉ ba tuần sau Gemini 3.6 Flash. Mô hình đã GA với ID ổn định gemini-3.7-flash và được định vị là Flash mạnh nhất của Google cho lập trình, agent, suy luận đa phương thức và thực thi nhiều bước đáng tin cậy.

Điểm mới không phải context window lớn hơn hay số tham số được công bố. Gemini 3.7 Flash vẫn thuộc lớp đầu vào 1M và đầu ra 64K như 3.6 Flash, nhưng Google báo cáo cải thiện lớn về code, dùng công cụ, công việc tri thức, tài liệu và điều khiển máy tính. Giá token giới thiệu cũng giữ nguyên.

Bài phân tích tách riêng thông số chính thức, benchmark do Google công bố, giá ra mắt tạm thời và tình trạng trên Modelflare. Dữ liệu có thể thay đổi được kiểm tra ngày 15 tháng 8 năm 2026.

Tổng quan Gemini 3.7 Flash

Thuộc tính Giá trị chính thức
Ngày phát hành 13 tháng 8 năm 2026
Trạng thái API Khả dụng chính thức; ID ổn định
ID mô hình gemini-3.7-flash
Nền tảng Dựa trên Gemini 3.6 Flash với cải tiến thuật toán
Đầu vào Văn bản, hình ảnh, video, âm thanh và PDF
Đầu ra Văn bản
Đầu vào tối đa 1.048.576 token
Đầu ra tối đa 65.536 token
Mức thinking low, medium, high; medium là mặc định trong tài liệu
Mốc kiến thức Tháng 3/2026; một số lĩnh vực có thể dừng ở tháng 1/2025
Số tham số Không công bố
Cập nhật tài liệu gần nhất Tháng 8/2026

Mô hình hỗ trợ context caching, thực thi code, Computer Use preview, tìm tệp, function calling, Google Maps và Search Grounding, structured outputs, thinking và URL Context. Batch, Flex và Priority cũng có sẵn. Không hỗ trợ tạo âm thanh, tạo hình ảnh hay Live API.

Thay đổi thực tế so với Gemini 3.6 Flash

Gemini 3.7 Flash là bản cải tiến từ 3.6 Flash, không phải lớp context hay phương thức mới. Google cho biết tiến bộ đến từ cải thiện thuật toán trong nền tảng suy luận và phản hồi của developer production.

Các thay đổi thực tiễn:

  • độ chính xác lần đầu cao hơn trong sinh code và software engineering;
  • bám thiết kế tốt hơn khi chuyển screenshot, hình ảnh hoặc design system thành giao diện;
  • lập kế hoạch, gọi công cụ, phục hồi khi gặp trở ngại và làm rõ ý định ổn định hơn;
  • suy luận tốt hơn trên tài liệu phức tạp về tài chính, luật và khoa học sự sống;
  • cải thiện long context và agent điều khiển máy tính;
  • cùng giá Standard giới thiệu với 3.6 Flash đến hết ngày 31/12/2026.

Vì vậy ở thời điểm ra mắt, 3.7 không phải bản thay thế đắt hơn của 3.6. Quyết định chuyển đổi chủ yếu dựa trên hành vi, độ trễ và tương thích, không phải chênh lệch giá token.

Giá API chính thức

Giá dưới đây dành cho gói trả phí bằng USD. Token tính theo một triệu; lưu cache tính theo một triệu token mỗi giờ.

Chế độ Hạng mục Đến 31/12/2026 Từ 01/01/2027
Standard Đầu vào $0.75 $1.50
Standard Đầu ra, gồm thinking token $3.75 $7.50
Standard Đầu vào cache $0.075 $0.15
Standard Lưu cache mỗi giờ $0.50 $1.00
Batch Đầu vào $0.375 $0.75
Batch Đầu ra, gồm thinking token $1.875 $3.75
Batch Đầu vào cache $0.0375 $0.075
Flex Đầu vào $0.375 $0.75
Flex Đầu ra, gồm thinking token $1.875 $3.75
Flex Đầu vào cache $0.0375 $0.075
Priority Đầu vào $1.35 $2.70
Priority Đầu ra, gồm thinking token $6.75 $13.50
Priority Đầu vào cache $0.135 $0.27

Google Search Grounding có 5.000 lượt tìm kiếm miễn phí mỗi tháng dùng chung cho Gemini 3.x, sau đó là $14 cho 1.000 lượt. Google Maps Grounding dùng chung 5.000 prompt và áp dụng cùng mức giá sau đó.

Với giá Standard giới thiệu, 100K token đầu vào và 10K đầu ra tốn khoảng $0.1125, chưa gồm cache, công cụ, lưu trữ hoặc retry. Một triệu token cache và 100K đầu ra tốn khoảng $0.45, chưa gồm lưu trữ. Hai ví dụ tăng gấp đôi sau thời gian ưu đãi.

So sánh benchmark ngang đầy đủ

Model card tháng 8/2026 của Google so sánh Gemini 3.7 Flash, Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra và Muse Spark 1.2. Mọi hàng đều càng cao càng tốt; dấu gạch là chưa công bố.

Benchmark Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena, WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench, tập riêng 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2, Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning, không công cụ 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning, có công cụ 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2, trung bình 128K 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench, con người giải được 87.1% 80.6% 87.5% 83.8%
BioMysteryBench, khó với con người 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

Các số liệu hữu ích nhưng không phải giải đấu độc lập cùng điều kiện. Google cho biết kết quả Gemini thường là pass@1 với sampling mặc định. Kết quả ngoài Gemini do nhà cung cấp tự báo nếu không ghi khác, ưu tiên mức reasoning cao nhất. Một số bài do Google tự chạy; harness, công cụ, cách tổng hợp và cả số frame video khác nhau.

Phân tích năng lực và hiệu năng

So với 3.6 Flash, mức tăng khá rộng: FrontierCode +9,2 điểm phần trăm, DeepSWE +16,7, AutomationBench +13,4, GDP.pdf +12, OSWorld +14,1. Code Arena tăng 50 Elo và GDM-MRCR từ 91,8% lên 97,0%.

So sánh giữa các họ mô hình cần chi tiết hơn:

  • Gemini 3.7 Flash dẫn đầu FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified và LABBench2.
  • GPT-5.6 Terra vẫn dẫn DeepSWE, hai Terminal-bench, CharXiv không công cụ, OSWorld và phần BioMysteryBench khó.
  • Claude Sonnet 5 dẫn Agent's Last Exam và nhỉnh hơn ở BioMysteryBench con người giải được.
  • Muse Spark 1.2 dẫn GDPVal-AA và đồng hạng Artificial Analysis, nhưng thiếu nhiều kết quả.
  • 3.7 không hơn 3.6 ở mọi mục: CharXiv thấp hơn 0,7 điểm cả khi có và không có công cụ.

Trong thực tế, 3.7 Flash rất cân bằng ở giá ra mắt. Đây là ứng viên mặc định mạnh cho coding agent, quy trình browser hoặc desktop, tài liệu dài, phân tích đa phương thức và knowledge work quy mô lớn. GPT-5.6 Terra vẫn đáng thử trực tiếp cho software engineering dài hạn và terminal agent; Claude Sonnet 5 cạnh tranh ở desktop; Muse Spark mạnh về knowledge work nhưng dữ liệu so sánh chưa đầy đủ.

Tham số, context và đa phương thức

Google không công bố tổng số hay số tham số active, số expert, chi tiết kiến trúc, kích thước corpus hoặc compute huấn luyện. Model card chỉ nói 3.7 Flash dựa trên 3.6 Flash với cải tiến thuật toán. Mọi con số tham số cụ thể được nêu như sự thật đều là suy đoán.

Phần developer có thể dựa vào là hợp đồng API:

  • 1.048.576 token đầu vào và 65.536 đầu ra;
  • văn bản, hình ảnh, video, âm thanh, PDF đầu vào; văn bản đầu ra;
  • low, medium, high; minimal trả lỗi;
  • function calling, structured output, Search, Maps, thực thi code, tìm tệp, URL Context, cache và Computer Use preview;
  • không Live API, tạo âm thanh hay tạo hình ảnh.

Context 1M là dung lượng, không phải mục tiêu. Prompt dài vẫn tăng độ trễ và chi phí; retrieval tốt hơn không thay thế việc giữ state chuẩn, nén lịch sử lặp và kiểm tra tác dụng phụ của công cụ.

Gọi Gemini 3.7 Flash

Hướng dẫn Google dùng Interactions API và ghi medium là mặc định:

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare hiện cung cấp đúng ID qua Chat Completions tương thích OpenAI:

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

Hai ví dụ dùng giao thức khác nhau. Không nên giả định mọi công cụ native của Google hoặc trường Interactions đều có qua adapter OpenAI.

Chuyển đổi và lưu ý production

Google yêu cầu bỏ temperature, top_p, top_k, thay thinking_budget bằng enum chuỗi thinking_level và xóa candidate_count. Quy trình Interactions nhiều lượt nên dùng previous_interaction_id phía server.

Trước khi thay mô hình:

  1. ghim chính xác gemini-3.7-flash và từ chối thay alias âm thầm;
  2. chạy lại tập nhiệm vụ cố định, không nhạy cảm trên mô hình hiện tại và 3.7;
  3. so sánh low, medium, high theo chi phí nhiệm vụ thành công và tổng thời gian;
  4. kiểm tra riêng streaming, structured output, function, đa phương thức, hủy và refusal;
  5. giữ thought signature và trường tương quan mà giao thức yêu cầu;
  6. xác minh cache, retry, timeout và chống tác dụng phụ trùng lặp;
  7. ghi model, route, input, cache, output, tool, độ trễ và phí cuối;
  8. giữ route rollback đến khi traffic thật đạt ngưỡng.

HTTP 200 chỉ chứng minh một yêu cầu hoàn tất, không chứng minh ngang bằng giao thức, độ trễ ổn định, công cụ đúng hay chi phí mỗi nhiệm vụ thành công thấp hơn.

Gemini 3.7 Flash trên Modelflare

Trong lần kiểm tra production ngày 15 tháng 8 năm 2026, danh mục Mô hình và giá công khai của Modelflare liệt kê gemini-3.7-flash trong nhóm gemini-stable. Danh mục cho biết hỗ trợ generateContent native Gemini và Chat Completions OpenAI, nhưng không có route Responses.

Hệ số nhóm hiển thị là 0.15x. Giá khuyến mại Google, giá tham chiếu Modelflare, quyền nhóm và phí cuối là các dữ kiện độc lập, có thể đổi riêng. Hãy dùng trang giá trực tiếp và một yêu cầu không nhạy cảm đã hoàn tất làm nguồn hiện tại.

Với production, tạo hoặc cập nhật key đủ quyền, dùng đúng ID và xác minh chức năng giao thức thực sự dùng trước khi chuyển traffic.

Kết luận

Gemini 3.7 Flash là nâng cấp đáng kể từ 3.6 Flash với cùng giá tạm thời. Điểm mạnh là độ rộng: code production, web, agent dùng công cụ, tài liệu phức tạp, input đa phương thức, long context và Computer Use đều tăng mà không sang tier giá premium.

Mô hình không thắng mọi benchmark, số tham số chưa biết và ưu đãi kết thúc cuối 2026. Cách hợp lý là so với mô hình đang xử lý nhiệm vụ thật, rồi chọn theo tỷ lệ hoàn thành, độ trễ, retry và tổng chi phí thay vì một chỉ số.

Nguồn chính thức và cập nhật

Nguồn sơ cấp:

Cập nhật:

  • 15 tháng 8 năm 2026: xuất bản lần đầu. Đã kiểm tra thông số, năng lực, phương pháp, giá, chuyển đổi và khả dụng trên Modelflare.