MarkTechPost
85

Mô hình

Google ra mắt bộ ba Gemini Flash mới: Tối ưu chi phí và hiệu suất cho tác vụ AI tự hành

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber, tập trung giảm giá thành và tăng tốc độ xử lý token, đặc biệt hỗ trợ mạnh mẽ cho các tác vụ AI tự hành (agentic workloads).

Bản dịch AI

Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber: A Cheaper, More Token-Efficient Flash Tier Built for Agentic Workloads

Các nhà phát triển xây dựng các tác nhân (agent) trong môi trường thực tế cần hiệu suất token cao hơn, độ trễ thấp hơn và hiệu năng đáng tin cậy hơn. Hôm nay, Google đã phát hành ba mô hình Gemini mới. Danh sách bao gồm Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber. Cả ba đều nằm trong phân khúc Flash, được Google tối ưu hóa cho tốc độ, chi phí và các tác vụ tác nhân khối lượng lớn thay vì tập trung vào độ sâu suy luận tối đa.

Gemini 3.6 Flash: chất lượng tốt hơn, ít token hơn, giá thấp hơn

Gemini 3.6 Flash là "cỗ máy" làm việc mặc định mới. Nó được xây dựng dựa trên 3.5 Flash và nhắm đến các tác vụ lập trình, công việc tri thức và các tác vụ đa phương thức. Điểm mấu chốt là hiệu suất. Theo Artificial Analysis Index, 3.6 Flash sử dụng ít hơn 17% token đầu ra so với 3.5 Flash. Trên tiêu chuẩn DeepSWE của Datacurve, Google báo cáo mức giảm lên tới 65%. Mô hình này cũng thực hiện ít bước suy luận và gọi công cụ hơn trong mỗi quy trình làm việc nhiều bước.

Giá cả giảm song hành cùng hiệu suất. Gemini 3.6 Flash có giá 1,50 USD cho mỗi 1 triệu token đầu vào và 7,50 USD cho mỗi 1 triệu token đầu ra. Mức giá đầu ra giảm từ mức 9,00 USD trước đó trên 3.5 Flash. Việc giảm bớt sự dài dòng và giá đầu ra thấp hơn giúp giảm tổng chi phí cho mỗi tác vụ tác nhân.

Những cải thiện về chất lượng đi kèm với những cải thiện về hiệu suất. Trên DeepSWE, 3.6 Flash đạt 49% so với 37% của 3.5 Flash. Trên MLE Bench, nó đạt 63,9% so với 49,7%. Trên OSWorld-Verified, nó đạt 83,0% so với 78,4%. Trên GDPval-AA v2, một tiêu chuẩn về công việc tri thức, nó đạt 1421 điểm so với 1349. Khả năng sử dụng máy tính (computer use) hiện là một công cụ tích hợp phía máy khách thông qua Gemini API và Gemini Enterprise. Các khách hàng sớm như Hebbia và Harvey ghi nhận những cải thiện trong việc phân tích tài liệu, phân tích biểu đồ và dữ liệu, cũng như soạn thảo báo cáo.

Google đang phát hành 3.6 Flash với các biện pháp bảo vệ Frontier Safety nâng cao. Các biện pháp này bao gồm việc ngăn chặn lạm dụng trong các lĩnh vực Hóa học, Sinh học, Phóng xạ và Hạt nhân (CBRN) cũng như tấn công mạng. Thông tin chi tiết đầy đủ có trong thẻ mô hình (model card) của 3.6 Flash.

Công cụ giải thích tương tác bên dưới cho phép bạn so sánh từng mô hình với phiên bản tiền nhiệm và ước tính chi phí token theo khối lượng sử dụng của riêng bạn.

Gemini 3.5 Flash-Lite: mô hình nhanh nhất trong dòng 3.5

Gemini 3.5 Flash-Lite được nhấn mạnh cho các công việc có độ trễ thấp và thông lượng cao. Các trường hợp sử dụng mục tiêu bao gồm tìm kiếm tác nhân và xử lý tài liệu. Theo đo lường của Artificial Analysis, nó chạy ở tốc độ 350 token đầu ra mỗi giây. Giá là 0,30 USD cho mỗi 1 triệu token đầu vào và 2,50 USD cho mỗi 1 triệu token đầu ra.

Mô hình này vượt xa phiên bản 3.1 Flash-Lite trước đó. Trên Terminal-Bench 2.1, nó đạt 54% so với 31%. Trên GDM-MRCR v2, một tiêu chuẩn về ngữ cảnh dài, nó đạt 72,2% so với 60,1%. Trên GDPval-AA v2, nó đạt 1140 điểm so với 642. Đáng chú ý, Flash-Lite cũng đánh bại mô hình 3 Flash cũ hơn ở một số bài kiểm tra. Nó dẫn đầu trên SWE-Bench Pro với 54,2% so với 49,6% và trên OSWorld-Verified với 74,0% so với 65,1%.

Flash-Lite cung cấp các cấp độ tư duy có thể cấu hình: tối thiểu (minimal), thấp (low) và cao hơn (higher). Các nhà phát triển có thể ưu tiên thực thi với chi phí thấp, độ trễ thấp cho các tác vụ khối lượng lớn. Họ cũng có thể kích hoạt các cấp độ tư duy cao hơn cho các khối lượng công việc tác nhân phụ nhiều bước. Khả năng sử dụng máy tính cũng là một công cụ tích hợp tại đây.

Gemini 3.5 Flash Cyber trong CodeMender: các tác nhân giá rẻ giúp tìm và vá lỗi

Gemini 3.5 Flash Cyber là bản phát hành chuyên biệt nhất. Nó được xây dựng trên 3.5 Flash và được tinh chỉnh để tìm kiếm, xác thực và vá các lỗ hổng phần mềm. Tiền đề thiết kế là vấn đề không gian tìm kiếm. Việc tìm ra các lỗ hổng sâu đòi hỏi phải khám phá một không gian tìm kiếm thực thi khổng lồ. Một lệnh gọi duy nhất đến một mô hình khổng lồ sẽ trở thành nút thắt cổ chai.

Câu trả lời là một mô hình giá rẻ được gọi nhiều lần. Bên trong CodeMender, tác nhân bảo mật mã nguồn của Google, nhiều tác nhân 3.5 Flash Cyber chạy song song. CodeMender gọi mô hình này tối đa năm lần, sau đó hợp nhất các kết quả của tác nhân phụ thành một báo cáo duy nhất. Trên tiêu chuẩn CyberGym, thiết lập này đạt hiệu suất cạnh tranh so với các mô hình lớn hơn nhiều.

Các đánh giá nội bộ rất ấn tượng. Trong bài đánh giá Big Sleep của Google, Flash Cyber đã vượt xa 3.5 Flash và 3.6 Flash bản chính. Trên công cụ JavaScript V8, nó đã tìm thấy 55 vấn đề duy nhất được xác nhận với một số lượng lệnh gọi cố định. Con số này so với 47 của 3.5 Flash bản chính và 36 của Claude Opus 4.6. Nó đã phát hiện 10 vấn đề mà hai mô hình kia bỏ lỡ. Trong một thử nghiệm thực tế, nhóm Nghiên cứu Lỗ hổng Đám mây của Google đã sử dụng nó để tìm ra các lỗ hổng thực thi mã từ xa trong các API công khai chỉ trong vòng hai giờ.

Phản ứng được chia thành các luồng dự đoán được. Các nhà phát triển hoan nghênh mức giá và hiệu suất. Mô hình flagship bị trì hoãn đã thu hút những lời chỉ trích gay gắt nhất. Trên Hacker News, một số người cho rằng Google đang quảng cáo quá mức về năng lực mà họ không thể cung cấp một cách đáng tin cậy, viện dẫn những phiên lập trình thực tế gây thất vọng. Việc phát hành hạn chế Flash Cyber đã mở ra một cuộc tranh luận về việc sử dụng kép, đặt câu hỏi ai nên là người nắm giữ các công cụ tìm kiếm lỗ hổng tự động.

Bảng điều khiển bên dưới tổng hợp các cuộc thảo luận đó theo nền tảng. Đây là một bản tổng hợp biên tập định tính, không phải là tập dữ liệu được thu thập tự động, và ghi chú về phương pháp đã được đính kèm.

Tính khả dụng

Gemini 3.6 Flash và 3.5 Flash-Lite đã có sẵn từ hôm nay. Các nhà phát triển có thể truy cập chúng thông qua Gemini API qua Google AI Studio và Android Studio. Gemini 3.6 Flash cũng có trong Google Antigravity và đang được triển khai trên GitHub Copilot. Các doanh nghiệp có thể sử dụng cả hai mô hình trong Gemini Enterprise Agent Platform, với 3.6 Flash có trong ứng dụng Gemini Enterprise. Mọi người đều có thể sử dụng chúng thông qua ứng dụng Gemini, và 3.5 Flash-Lite đang được triển khai trong Google Search. Hãy bắt đầu với Hướng dẫn dành cho nhà phát triển (Developer Guide).

Những điểm chính cần lưu ý

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người đọc.

GoogleGeminiAIMô hình ngôn ngữCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.