Gemini 3.7 Flash API: giá, benchmark và cách dùng thực chiến 2026

Gemini 3.7 Flash ra mắt 13/8/2026, giá $0.75/$3.75 mỗi triệu token đến hết năm, benchmark coding vượt Claude Sonnet 5, mẹo tiết kiệm 68% chi phí API. Đọc ngay!

Giữa tháng 8/2026 có một tin mà bất kỳ ai đang xây sản phẩm bằng LLM API đều nên đọc kỹ: Google hạ giá model Gemini 3.7 Flash xuống còn $0.75 cho mỗi triệu token đầu vào, rẻ hơn một nửa so với mức giá ra mắt của Gemini 3.6 Flash cách đó chưa đầy ba tuần. Trong bài này, tôi sẽ phân tích giá từng tier, benchmark thật từ model card chính thức của Google DeepMind, và cách tận dụng để giảm chi phí API khi build agent và công cụ coding.

Gemini 3.7 Flash là mô hình AI đa phương thức (text, hình ảnh, audio, video) của Google DeepMind, ra mắt ngày 13/8/2026, được Google định vị là model workhorse thông minh nhất trong dòng Flash, dành riêng cho coding và agent. Điểm đáng chú ý nhất không nằm ở benchmark mà nằm ở chiến lược giá: model mới hơn lại rẻ hơn model cũ tới 50%, một tín hiệu rất rõ của cuộc chiến giá LLM API năm 2026.

Điểm nhanh trước khi đọc tiếp:

  • Giá niêm yết: $0.75 input, $3.75 output mỗi triệu token (đã gồm thinking tokens), chỉ áp dụng đến 31/12/2026, từ 1/1/2027 tăng gấp đôi lên $1.50/$7.50.
  • Batch và Flex: giảm thêm 50% còn $0.375/$1.875, rất hợp bài toán xử lý hàng loạt không cần realtime.
  • Context window 1M token, output tối đa 64K token, nhận text, ảnh, audio, video.
  • Benchmark coding: vượt Claude Sonnet 5 ở FrontierCode 1.1 (43.6% vs 42.7%) trong khi giá rẻ hơn gần 3 lần.
  • Free tier: dùng miễn phí để thử nghiệm, đổi lại dữ liệu được Google dùng để cải thiện sản phẩm.

Gemini 3.7 Flash là gì? Khác gì so với Gemini 3.6 Flash?

Gemini 3.7 Flash là phiên bản kế tiếp của Gemini 3.6 Flash, tập trung cải thiện nền tảng suy luận (reasoning) thay vì mở rộng context hay tăng kích thước model. Theo bài đăng chính thức trên blog Google ngày 13/8/2026, Google gọi đây là model workhorse thông minh nhất của họ cho coding và agent, và khẳng định mức tăng điểm đến từ cải tiến thuật toán chứ không phải model to hơn hay context dài hơn.

Timeline đáng chú ý: Gemini 3.6 Flash ra mắt ngày 21/7/2026, chưa đầy 3,5 tuần sau thì 3.7 Flash xuất hiện với giá chỉ bằng một nửa. Đây là lần đầu tiên trong nhiều năm tôi thấy một model mới ra mắt với giá thấp hơn hẳn thế hệ trước thay vì đắt hơn, và nó cho thấy Google đang chơi đúng bài DeepSeek: chấp nhận biên lợi nhuận mỏng để chiếm thị phần developer.

Về thông số, theo model card của Google DeepMind: context window lên tới 1M token, output tối đa 64K token, hỗ trợ đầu vào text, ảnh, audio và video. Knowledge cutoff là tháng 3/2026. Model cũng hỗ trợ cấu hình thinking linh hoạt, cho phép bạn cân bằng giữa chất lượng, chi phí và độ trễ ngay trong lúc gọi API.

Điểm mấu chốt: nếu bạn đang chạy Gemini 3.6 Flash, nâng cấp lên 3.7 gần như là quyết định hiển nhiên vì cùng mức giá khuyến mãi nhưng chất lượng cao hơn rõ rệt.

Giá API Gemini 3.7 Flash bao nhiêu? Chi tiết từng tier

Giá API Gemini 3.7 Flash được tính theo số token sử dụng, chia làm 4 tier là Standard, Batch, Flex và Priority, tất cả lấy từ trang pricing chính thức của Gemini API (cập nhật 28/8/2026).

  • Standard: $0.75 mỗi triệu token input, $3.75 mỗi triệu token output (đã bao gồm thinking tokens). Mức này chỉ áp dụng đến hết 31/12/2026, từ 1/1/2027 tăng lên $1.50/$7.50.
  • Batch: $0.375 input, $1.875 output, tức giảm đúng 50%. Dành cho tác vụ không cần trả kết quả ngay, ví dụ chạy batch phân loại nội dung, sinh mô tả sản phẩm qua đêm.
  • Flex: cùng mức $0.375/$1.875, cho workload linh hoạt về thời gian, tương tự khái niệm spot instance bên điện toán.
  • Priority: $1.35 input, $6.75 output (gấp 1.8 lần Standard), cho request cần độ trễ thấp ổn định. Từ 1/1/2027 mức này là $2.70/$13.50.
  • Context caching: token đọc từ cache chỉ $0.075 mỗi triệu (rẻ hơn 90% so với input thường), cộng phí lưu trữ $0.50 mỗi triệu token mỗi giờ. Sau 1/1/2027 lần lượt là $0.15 và $1.00.
  • Grounding với Google Search: 5.000 request miễn phí mỗi tháng (dùng chung cho toàn bộ dòng Gemini 3.x), sau đó $14 cho mỗi 1.000 request.
  • Free tier: token input và output miễn phí, nhưng dữ liệu của bạn được dùng để cải thiện sản phẩm của Google.

Mức giá khuyến mãi $0.75/$3.75 cũng được áp dụng trên Gemini Enterprise Agent Platform của Google Cloud đến hết năm 2026, theo trang pricing của nền tảng này. Nếu bạn đang lên budget cho năm 2027, hãy tính theo mức $1.50/$7.50 chứ đừng tính theo mức hiện tại, đây là cái bẫy chi phí phổ biến nhất tôi thấy ở các team mới chuyển sang.

Gemini 3.7 Flash mạnh cỡ nào? Đọc benchmark thật từ model card

Theo model card của Google DeepMind công bố ngày 13/8/2026, Gemini 3.7 Flash dẫn đầu ở phần lớn benchmark coding và agentic so với chính Gemini 3.6 Flash, và cạnh tranh sòng phẳng với Claude Sonnet 5 và GPT-5.6 Terra ở nhiều hạng mục. Các con số dưới đây là nguyên bản từ bảng so sánh trong model card.

  • FrontierCode 1.1 (chất lượng code production): 3.7 Flash đạt 43.6%, so với Claude Sonnet 5 là 42.7%, GPT-5.6 Terra 41.3%, còn Gemini 3.6 Flash chỉ 34.4%.
  • DeepSWE v1.1 (software engineering dài hơi): 65.3%, vượt Sonnet 5 (53.8%) và Muse Spark 1.2 (54.9%), nhưng thua GPT-5.6 Terra (69.6%).
  • Terminal-bench 2.1 (coding qua terminal): 85.8%, vượt Sonnet 5 (80.4%) và Muse (82.9%), thua Terra (87.4%).
  • OSWorld-2.0 (agent dùng máy tính): 47.9%, cao hơn hẳn 3.6 Flash (33.8%), nhưng Terra dẫn đầu với 50.2%.
  • HLE-Verified (suy luận chuyên gia đa ngành): 53.6%, bỏ xa Sonnet 5 (31.0%) và nhỉnh hơn Terra (51.1%).
  • LVBench (hiểu video dài): 85.4%, so với Sonnet 5 chỉ 68.5%.
  • GDM-MRCR v2 (long context 128K): 97.0%, so với Sonnet 5 là 81.5% và Terra 93.5%.
  • Artificial Analysis Intelligence Index: 3.7 Flash đạt 56, Sonnet 5 là 55, Terra và Muse cùng 57.

Điều thú vị nhất nằm ở cột giá ngay trong model card: cùng bảng benchmark đó ghi 3.7 Flash $0.75/$3.75, Sonnet 5 $2/$10, GPT-5.6 Terra $2/$12, Muse Spark 1.2 $1.25/$4.25. Nghĩa là model rẻ nhất lại dẫn đầu ở nhiều benchmark coding, một sự đảo ngược hoàn toàn so với quy luật đắt hơn thì mạnh hơn của năm 2024.

Cách dùng Gemini 3.7 Flash cho coding và agent: 6 mẹo thực chiến

Để tối ưu chi phí khi dùng Gemini 3.7 Flash, bạn cần phối hợp 4 tier giá với caching, grounding và hiểu đúng rate limit, thay vì chỉ gọi Standard cho mọi thứ. Đây là những gì tôi áp dụng khi build agent.

  • Dùng Batch cho mọi thứ không cần realtime: lưu request vào file JSONL rồi chạy batch API, chi phí giảm ngay 50% mà chất lượng không đổi.
  • Bật context caching trong agent loop: các vòng lặp agent thường lặp lại system prompt và lịch sử, cache read $0.075 rẻ hơn 90% so với $0.75, nên tổng chi phí giảm rất nhanh khi context dài.
  • Chỉ dùng Priority khi độ trễ là tiền: ví dụ chatbot đối thoại trực tiếp với khách, còn pipeline nội bộ cứ để Standard hoặc Flex.
  • Chỉnh thinking config theo tác vụ: model hỗ trợ cấu hình suy luận linh hoạt, tác vụ đơn giản có thể tắt bớt thinking để giảm token output.
  • Grounding Google Search cho agent tra cứu: 5.000 request miễn phí mỗi tháng là ngưỡng rất hào phóng cho MVP, sau đó $14/1.000 request; theo tài liệu chính thức, với dynamic retrieval bạn chỉ bị tính phí khi response thực sự chứa grounding URL.
  • Theo dõi spend-based rate limit: tài liệu rate limits (cập nhật 18/8/2026) ghi rõ Tier 1 giới hạn $10 mỗi 10 phút, Tier 2 là $50, Tier 3 là $200. Chi $100 để lên Tier 2, chi $1.000 để lên Tier 3. Priority chỉ nhận 0.3x rate limit tiêu chuẩn, còn Batch giới hạn 100 job đồng thời, file tối đa 2GB.

Chi phí thực tế: agent chạy 100 triệu token mỗi tháng hết bao nhiêu?

Tôi tính một kịch bản agent điển hình: 100 triệu token input mỗi tháng (60% là nội dung lặp lại nên cache được) và 10 triệu token output, theo đúng giá niêm yết trên trang pricing chính thức của Google. Đây là phép tính minh họa, chưa gồm phí lưu trữ cache.

  • Standard thuần: input 100 triệu x $0.75 = $75, output 10 triệu x $3.75 = $37.5, tổng $112.5 mỗi tháng.
  • Standard + context caching: 60 triệu token cached x $0.075 = $4.5, 40 triệu token fresh x $0.75 = $30, output $37.5, tổng $72, giảm 36% so với Standard thuần.
  • Batch + caching: 40 triệu fresh x $0.375 = $15, 60 triệu cached x $0.0375 = $2.25, output 10 triệu x $1.875 = $18.75, tổng $36, giảm tới 68% so với Standard thuần.

Khoản chênh 68% đó chính là lý do các team agent hiện nay bắt buộc phải có lớp caching và batch trong kiến trúc, chứ không phải lựa chọn. Với scale nhỏ hơn, ví dụ 10 triệu input và 1 triệu output mỗi tháng, con số tương ứng chỉ là $11.25 so với $3.6, nhưng tỷ lệ tiết kiệm vẫn giữ nguyên.

Gemini 3.7 Flash hay Claude Sonnet 5, GPT-5.6 Terra: chọn model nào?

Không có model nào thắng tuyệt đối ở mọi hạng mục, nhưng mỗi model có vùng thắng riêng, và 3.7 Flash thắng rõ nhất ở tỷ lệ chất lượng trên giá. Cách chọn thực tế là soi theo tác vụ chính của bạn.

  • Code production thông thường: Gemini 3.7 Flash là lựa chọn hàng đầu nhờ FrontierCode 43.6% với giá chỉ $0.75/$3.75.
  • Tác vụ terminal phức tạp, tự sửa lỗi dài hơi: GPT-5.6 Terra dẫn đầu Terminal-bench 2.1 (87.4%) và DeepSWE (69.6%), nhưng giá cao hơn 2.7 lần, phù hợp khi chất lượng quyết định doanh thu.
  • Agent desktop và OS đa phương thức: Claude Sonnet 5 dẫn đầu Agent's Last Exam (33.3% vs 26.3%), hợp các tác vụ điều khiển ứng dụng.
  • Indie hacker, MVP, ngân sách eo hẹp: Gemini 3.7 Flash với free tier và giá khuyến mãi là lựa chọn an toàn nhất để thử nghiệm trước khi scale.

Một mẹo nhỏ: đừng chọn model theo cảm tính hay theo độ hot, hãy chạy benchmark nhanh trên đúng dữ liệu của bạn rồi nhân với giá. Với hầu hết bài toán coding, kết quả sẽ nghiêng về 3.7 Flash.

Tổng kết: có nên chuyển sang Gemini 3.7 Flash ngay bây giờ?

Gemini 3.7 Flash đang ở thời điểm hiếm hoi mà một model mới vừa mạnh hơn, vừa rẻ hơn model cũ, lại còn có giá khuyến mãi chỉ đến hết 31/12/2026. Nếu bạn đang build agent, công cụ coding hoặc bất kỳ sản phẩm nào nhạy cảm chi phí, đây là lúc thích hợp nhất để thử, vì mức $0.75/$3.75 sẽ không còn vào năm sau.

Ba điều nên ghi nhớ: batch và flex giúp giảm 50% chi phí, context caching giúp giảm thêm, và benchmark thật cho thấy model này cạnh tranh trực tiếp với các model đắt gấp 2.7 lần. Chiến lược giá của Google năm 2026 đã thay đổi cuộc chơi, và người hưởng lợi là developer.

Bạn đã thử Gemini 3.7 Flash trên sản phẩm của mình chưa? Chia sẻ kết quả benchmark hoặc chi phí thực tế ở phần bình luận nhé, tôi rất muốn nghe kinh nghiệm của bạn.

Câu hỏi thường gặp

Gemini 3.7 Flash giá bao nhiêu trên API?

Giá niêm yết là $0.75 mỗi triệu token input và $3.75 mỗi triệu token output (đã gồm thinking tokens), áp dụng đến 31/12/2026. Từ 1/1/2027, giá tăng gấp đôi lên $1.50/$7.50. Tier Batch và Flex chỉ còn $0.375/$1.875.

Gemini 3.7 Flash có miễn phí không?

Có free tier với token đầu vào và đầu ra miễn phí, dùng chung hệ sinh thái Google AI Studio. Điều kiện là dữ liệu của bạn được Google dùng để cải thiện sản phẩm. Khi chuyển sang paid tier, dữ liệu không còn được dùng cho mục đích này.

Gemini 3.7 Flash khác Gemini 3.6 Flash thế nào?

3.7 Flash ra mắt ngày 13/8/2026, khoảng 3,5 tuần sau 3.6 Flash, với giá chỉ bằng một nửa và điểm benchmark cao hơn rõ rệt ở hầu hết tác vụ coding và agentic, ví dụ FrontierCode 1.1 tăng từ 34.4% lên 43.6%.

Gemini 3.7 Flash có tốt hơn Claude Sonnet 5 không?

Trên nhiều benchmark coding, 3.7 Flash nhỉnh hơn Sonnet 5, ví dụ FrontierCode 1.1 đạt 43.6% so với 42.7%, trong khi giá rẻ hơn gần 3 lần. Tuy nhiên Sonnet 5 vẫn dẫn đầu ở một số tác vụ agent phức tạp như Agent's Last Exam (33.3% so với 26.3%).

Cập nhật lần cuối: 08/2026.

No comments yet