0

Google ra mắt Gemini 3.7 Flash: Phân tích benchmark, giá và so sánh với Sonnet 5, Terra

Google ra mắt Gemini 3.7 Flash, mô hình Flash mạnh nhất từ trước đến nay, nhắm thẳng vào coding và quy trình agentic, đạt 43,6% trên FrontierCode 1.1 Main, vượt cả Claude Sonnet 5 (42,7%) và GPT-5.6 Terra (41,3%), trong khi giá giới thiệu chỉ 0,75 USD/triệu input token và 3,75 USD/triệu output token, bằng một nửa giá gốc của 3.6 Flash.

Tóm tắt các điểm chính

  • Gemini 3.7 Flash ra mắt trong lúc mô hình flagship Gemini 3.5 Pro của Google vẫn bị trì hoãn, điều Reuters ghi nhận là một phép thử liệu DeepMind có theo kịp Anthropic và OpenAI hay không.
  • Trên DeepSWE v1.1, benchmark kỹ thuật phần mềm dài hạn, 3.7 Flash đạt 65,3%, tăng mạnh từ 48,6% của 3.6 Flash, nhưng vẫn thua GPT-5.6 Terra ở mức 69,6%.
  • Trên GDM-MRCR v2 ở dải 128k, 3.7 Flash đạt 97,0%, dẫn đầu cả Claude Sonnet 5 (81,5%) và GPT-5.6 Terra (93,5%), với context window 1M token.
  • Giá giới thiệu áp dụng đến hết 31/12/2026, sau đó tăng lên giá tiêu chuẩn 1,50 USD input và 7,50 USD output từ 1/1/2027.
  • Trên AutomationBench, eval nội bộ đo quy trình kinh doanh thực tế, 3.7 Flash đạt 30,4%, vượt xa 3.6 Flash (17,0%) và Claude Sonnet 5 (10,7%).

Gemini 3.7 Flash là mô hình gì?

Gemini 3.7 Flash là mô hình workhorse tầng giữa của Google, được định vị là mô hình Flash mạnh nhất cho coding phức tạp, quy trình agentic và thực thi nhiều bước đáng tin cậy. Mô hình theo sau Gemini 3.6 Flash, ra mắt chỉ ba tuần trước đó, và Google ghi công cho phản hồi từ nhà phát triển cùng các thay đổi thuật toán tạo ra bước nhảy chất lượng này.

Chi tiết Benchmark Chi tiết Benchmark

Mô hình đã general availability qua Gemini API với context window 1M token (1.048.576 input token) và giới hạn output 65.536 token. Mô hình nhận đầu vào văn bản, hình ảnh, video, audio và PDF, chỉ trả ra văn bản. Google cung cấp các mức thinking có thể điều chỉnh gồm low, medium và high, dù API sẽ báo lỗi nếu yêu cầu mức minimal không được hỗ trợ.

Con số benchmark đáng chú ý nhất là DeepSWE v1.1, eval kỹ thuật phần mềm dài hạn, nơi 3.7 Flash đạt 65,3% so với 34,4% của chính nó trên FrontierCode và chỉ 48,6% của 3.6 Flash trên DeepSWE. Đây là mức tăng lớn cho một thế hệ mô hình, đặc biệt khi giá còn giảm theo, một điều bất thường.

Gemini 3.7 Flash có gì mới?

Câu chuyện ở đây là một mô hình Flash mạnh hơn với giá thấp hơn, tuân theo hướng dẫn tốt hơn và cần ít giám sát hơn trong vòng lặp agent.

Gemini 3.7 Flash Features

Coding và giải quyết issue mạnh hơn

Có thể giao cho Gemini 3.7 Flash các công việc debug và refactor khó hơn và kỳ vọng độ chính xác lần đầu cao hơn. Google công bố 43,6% trên FrontierCode 1.1 Main cho chất lượng code sản xuất, tăng từ 34,4% của 3.6 Flash, và 65,3% trên DeepSWE v1.1 cho kỹ thuật phần mềm dài hạn. Với kỹ sư thực tế, điều này nghĩa là ít lần thử lại hơn. Google cho biết mô hình thích ứng tốt hơn với các trở ngại và tuân theo hướng dẫn chính xác hơn, giảm bớt giám sát thủ công vốn khiến các mô hình rẻ hơn tốn kém về mặt thời gian thực tế.

Tạo web app và UI nhanh hơn

Gemini 3.7 Flash tạo layout hoạt động và web app hoàn chỉnh tính năng với ít prompt hơn 3.6 Flash. Trên bảng xếp hạng web development của Code Arena, mô hình đạt 1588 Elo so với 1538 của 3.6 Flash và 1541 của Claude Sonnet 5. Mô hình cũng có thể khớp với một input tham chiếu khi tạo UI, dù tham chiếu đó là một screenshot, một ảnh, hay cả một hệ thống thiết kế đầy đủ.

Thực thi agent nhiều bước tốt hơn

Mô hình đầu tư nhiều nỗ lực hơn vào lập kế hoạch và tool call, đây là nơi các mô hình rẻ thường sụp đổ. Trên AutomationBench, eval nội bộ đo quy trình kinh doanh thực tế, 3.7 Flash đạt 30,4% so với 17,0% của 3.6 Flash và 10,7% của Claude Sonnet 5. Các công cụ tích hợp sẵn qua API gồm caching, code execution, file search, function calling, search grounding, grounding với Google Maps, structured output và URL context. Computer use đã có mặt nhưng vẫn ở dạng preview, nên chưa nên xây agent sản xuất xoay quanh tính năng này.

Cải thiện công việc tài liệu và kiến thức

Gemini 3.7 Flash xử lý các lĩnh vực nhiều kiến thức chuyên sâu như tài chính, luật và khoa học sinh học với reasoning và khả năng hiểu tài liệu tốt hơn. Trên benchmark GDP.pdf đo khả năng hiểu tài liệu PDF chuyên sâu, mô hình đạt 34,0% so với 22,0% của 3.6 Flash, và trên Harvey LAB-AA cho quy trình pháp lý phức tạp đạt 90,7%. Mô hình vẫn chỉ trả ra văn bản, nên không tạo được biểu đồ mà nó đọc, chỉ mô tả hoặc tóm tắt chúng.

Giá thấp hơn cho việc mở rộng quy mô agent

Giá giới thiệu cắt giảm một nửa chi phí vận hành agent dựa trên Flash so với giá ra mắt của 3.6 Flash. Đến hết 31/12/2026, giá là 0,75 USD trên 1M input token và 3,75 USD trên 1M output token, sau đó tăng lên 1,50 USD input và 7,50 USD output từ 1/1/2027. Để so sánh, Claude Sonnet 5 ở mức 2,00 USD input và 10,00 USD output theo bảng benchmark của chính Google, còn GPT-5.6 Terra ở mức 2,00 USD input và 12,00 USD output. Về giá token thô, 3.7 Flash rẻ hơn cả hai với khoảng cách lớn.

Gemini 3.7 Flash đạt benchmark như thế nào so với đối thủ?

Bảng benchmark của Google đặt Gemini 3.7 Flash cạnh 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra và Muse Spark 1.2. Mô hình vượt qua thế hệ trước ở gần như mọi eval, và đấu ngang ngửa với các đối thủ đắt tiền hơn, dù GPT-5.6 Terra vẫn nhỉnh hơn ở một số eval coding agentic.

Chỉ số Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
Giá input/1M 0,75 USD 2,00 USD 2,00 USD
Giá output/1M 3,75 USD 10,00 USD 12,00 USD
FrontierCode 1.1 Main 43,6% 42,7% 41,3%
DeepSWE v1.1 65,3% 53,8% 69,6%
Terminal-bench 2.1 85,8% 80,4% 87,4%
GDP.pdf 34,0% 28,0% 24,7%
GDM-MRCR v2 (128k) 97,0% 81,5% 93,5%

FrontierCode 1.1 Main

FrontierCode 1.1 Main đo chất lượng code sản xuất, thưởng cho code đúng và sẵn sàng triển khai chứ không chỉ đúng cú pháp. Gemini 3.7 Flash đạt 43,6%, vượt Claude Sonnet 5 (42,7%), GPT-5.6 Terra (41,3%), và chính 3.6 Flash (34,4%). Việc một mô hình tầng Flash vượt qua cả hai đối thủ frontier về chất lượng code sản xuất là kết quả nổi bật nhất của lần ra mắt này, đặc biệt khi chỉ tốn một phần ba chi phí token.

DeepSWE v1.1

DeepSWE v1.1 kiểm tra kỹ thuật phần mềm dài hạn, tức các tác vụ nhiều file đòi hỏi duy trì context xuyên suốt nhiều bước. Ở đây, 3.7 Flash đạt 65,3%, một bước nhảy lớn từ 48,6% của 3.6 Flash, nhưng GPT-5.6 Terra vẫn dẫn đầu ở 69,6%, còn Claude Sonnet 5 tụt lại ở 53,8%. Kết luận: 3.7 Flash thu hẹp phần lớn khoảng cách với Terra về coding agentic dài hạn nhưng chưa vượt qua được. Nếu cần trần tuyệt đối cho coding agentic nhiều file, Terra vẫn thắng ở eval cụ thể này.

Terminal-bench 2.1 và 3.0

Terminal-bench đo coding agentic trên terminal, nơi mô hình điều khiển dòng lệnh để hoàn thành tác vụ. Trên Terminal-bench 2.1, 3.7 Flash đạt 85,8% so với 78,0% của 3.6 Flash và 80,4% của Claude Sonnet 5, dù GPT-5.6 Terra dẫn đầu ở 87,4%. Terminal-bench 3.0 mới hơn, đo năng lực agent tổng quát, khó hơn trên diện rộng: 3.7 Flash đạt 14,9%, vượt xa 3.6 Flash (5,4%), gần ngang Claude Sonnet 5 (14,6%), và thua Terra (20,8%). Các con số tuyệt đối thấp này là một phép kiểm tra thực tế hữu ích về việc độ tin cậy agent tổng quát vẫn còn xa mới đạt được.

GDP.pdf và Harvey LAB-AA

GDP.pdf kiểm tra khả năng hiểu tài liệu PDF chuyên sâu, còn Harvey LAB-AA kiểm tra quy trình pháp lý phức tạp. Gemini 3.7 Flash dẫn đầu cả hai: 34,0% trên GDP.pdf so với 28,0% của Claude Sonnet 5 và 24,7% của GPT-5.6 Terra, và 90,7% trên Harvey LAB-AA so với 90,1% của Sonnet 5 và 85,2% của Terra. Nếu khối lượng công việc là phân tích pháp lý hoặc tài chính nặng về tài liệu, đây là nơi mô hình rẻ nhất bảng cũng đồng thời chính xác nhất, một sự kết hợp hiếm gặp.

GDM-MRCR v2 long context

GDM-MRCR v2 (8-needle) đo khả năng truy xuất long-context, kiểm tra liệu mô hình có tìm được nhiều mẩu thông tin bị chôn giấu xuyên suốt một input dài hay không. Ở dải trung bình 128k, 3.7 Flash đạt 97,0%, vượt 3.6 Flash (91,8%), Claude Sonnet 5 (81,5%) và GPT-5.6 Terra (93,5%). Với context window 1M token và khả năng truy xuất 8-needle mạnh nhất bảng, 3.7 Flash là lựa chọn mạnh cho pipeline nhồi tài liệu lớn hoặc bản ghi dài vào một lượt gọi duy nhất.

GPT-5.6 Terra vẫn dẫn đầu ở đâu?

GPT-5.6 Terra vượt Gemini 3.7 Flash trên DeepSWE v1.1 (69,6% so với 65,3%), Terminal-bench 2.1 (87,4% so với 85,8%), Terminal-bench 3.0 (20,8% so với 14,9%), và OSWorld-2.0 computer use agentic (50,2% so với 47,9%). Mô hình chung: Terra giữ lợi thế nhỏ ở các eval coding agentic và terminal khó nhất, trong khi 3.7 Flash thắng về chất lượng code sản xuất, hiểu tài liệu và truy xuất long-context. Lựa chọn nào thắng phụ thuộc vào việc điểm nghẽn là độ tin cậy agent hay chi phí.

Comparison Chart

Gemini 3.7 Flash có giá bao nhiêu và truy cập ở đâu?

Gemini 3.7 Flash đã general availability qua nhiều kênh của Google. API model ID là gemini-3.7-flash, có thể bắt đầu xây dựng trong Google AI Studio, Android Studio, hoặc môi trường agent-first Google Antigravity.

  • Nhà phát triển: Gemini API qua Google AI Studio và Android Studio, quy trình agent trong Google Antigravity.
  • Doanh nghiệp: Gemini Enterprise Agent Platform và ứng dụng Gemini Enterprise.
  • Cá nhân: Gemini Spark, agent cá nhân hoạt động 24/7 trong ứng dụng Gemini, dành cho người dùng Google AI Pro và Ultra tại hơn 160 quốc gia.

Giá là 0,75 USD trên 1M input token và 3,75 USD trên 1M output token đến hết 31/12/2026. Từ 1/1/2027, giá tiêu chuẩn 1,50 USD input và 7,50 USD output có hiệu lực. Lưu ý tạo audio, tạo ảnh và Live API không được hỗ trợ trên mô hình này, computer use vẫn chỉ ở dạng preview.

Kết luận

Gemini 3.7 Flash là Google vừa phát hành nhanh vừa giảm giá trong lúc mô hình flagship Gemini 3.5 Pro vẫn bị trì hoãn. Việc phát hành một mô hình Flash cải tiến chỉ ba tuần sau 3.6 Flash, với giá bằng một nửa chi phí token, đọc như một nỗ lực của công ty để thắng ở tầng giữa, nơi phần lớn khối lượng sản xuất thực tế đang nằm.

Đây là mô hình đáng cân nhắc nếu khối lượng công việc là hiểu tài liệu, code web và app sản xuất, hoặc truy xuất long-context, những nơi mô hình vượt hẳn cả Claude Sonnet 5 và GPT-5.6 Terra trong khi chi phí chỉ bằng một phần nhỏ. Nếu điểm nghẽn là coding agentic terminal khó nhất, Terra vẫn giữ lợi thế hẹp trên DeepSWE và Terminal-bench, và sẽ phải trả giá cao hơn cho trần đó.

Giữa lúc DeepMind tái cấu trúc lãnh đạo và mô hình Pro bị trì hoãn, Google đang dựa vào Flash để chứng minh vẫn có thể cạnh tranh. Trên bảng benchmark vừa công bố, lập luận đó phần lớn đứng vững đối với một mô hình tầng giữa.

Câu hỏi thường gặp

Gemini 3.7 Flash so với Gemini 3.6 Flash cải thiện ra sao?

Gemini 3.7 Flash cải thiện so với 3.6 Flash trên gần như mọi benchmark Google công bố, gồm FrontierCode 1.1 Main (43,6% so với 34,4%), DeepSWE v1.1 (65,3% so với 48,6%), khả năng hiểu tài liệu GDP.pdf (34,0% so với 22,0%), và AutomationBench (30,4% so với 17,0%). Mô hình cũng có giá bằng một nửa giá token ra mắt của 3.6 Flash. Cả hai mô hình chia sẻ cùng context window 1M token.

Có thể truy cập Gemini 3.7 Flash ở đâu?

Nhà phát triển có thể dùng qua Gemini API trong Google AI Studio và Android Studio, hoặc trong môi trường tập trung vào agent Google Antigravity, với model ID gemini-3.7-flash. Doanh nghiệp truy cập qua Gemini Enterprise Agent Platform và ứng dụng Gemini Enterprise. Cá nhân có thể truy cập qua Gemini Spark dành cho người dùng Google AI Pro và Ultra tại hơn 160 quốc gia.

Gemini 3.7 Flash có giá bao nhiêu?

Đến hết 31/12/2026, giá giới thiệu là 0,75 USD trên 1M input token và 3,75 USD trên 1M output token. Từ 1/1/2027, giá tiêu chuẩn tăng lên 1,50 USD trên 1M input token và 7,50 USD trên 1M output token. Mức giá này rẻ hơn cả Claude Sonnet 5 và GPT-5.6 Terra, hai mô hình ở mức 2,00 USD input theo bảng benchmark của Google.

Gemini 3.7 Flash tuân theo tiêu chuẩn an toàn nào?

Gemini 3.7 Flash đi kèm các biện pháp bảo vệ Frontier Safety đã cập nhật chống lạm dụng trong các lĩnh vực hóa học, sinh học, phóng xạ và hạt nhân (CBRN) cũng như tấn công mạng. Google ghi nhận mô hình hoạt động tương tự 3.6 Flash trên các đánh giá an toàn và tông giọng, với tỷ lệ từ chối không chính đáng thấp. Mô hình cũng đáp ứng ngưỡng an toàn trẻ em của Google trong quá trình red teaming.

Gemini 3.7 Flash có tốt hơn GPT-5.6 Terra cho coding không?

Tùy tác vụ. Gemini 3.7 Flash dẫn đầu về chất lượng code sản xuất trên FrontierCode 1.1 (43,6% so với 41,3%), trong khi GPT-5.6 Terra dẫn đầu về coding dài hạn trên DeepSWE v1.1 (69,6% so với 65,3%), Terminal-bench 2.1 (87,4% so với 85,8%), và computer use agentic trên OSWorld. Terra giữ lợi thế hẹp trên các eval agentic khó nhất, nhưng 3.7 Flash chỉ tốn một phần nhỏ chi phí.

Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.


All Rights Reserved

Viblo
Let's register a Viblo Account to get more interesting posts.