The Decoder
85

Mô hình

Google ra mắt bộ ba Gemini Flash mới, nhưng phiên bản chủ lực 3.5 Pro vẫn 'bặt vô âm tín'

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu ba mô hình Gemini Flash mới tối ưu hiệu suất, trong khi phiên bản cao cấp 3.5 Pro vẫn chưa lộ diện, khiến Google dần hụt hơi trong cuộc đua với OpenAI và Anthropic.

Bản dịch AI

Google ships three new Gemini Flash models but its frontier 3.5 Pro remains lost in training

Google đang mở rộng dòng sản phẩm Gemini với hai mô hình Flash và một phiên bản Cyber chuyên dụng. Tuy nhiên, mô hình tiên phong được mong đợi là Gemini 3.5 Pro vẫn chưa xuất hiện.

Google đã công bố ba mô hình mới trong dòng Gemini Flash: 3.6 Flash, 3.5 Flash-Lite và mô hình an ninh mạng 3.5 Flash Cyber. Thông tin quan trọng nằm trong thông báo này là mô hình chủ lực được mong đợi của Google, Gemini 3.5 Pro, vẫn đang được thử nghiệm độc quyền với các đối tác và sẽ được phát hành "ngay khi sẵn sàng".

Google cho biết quá trình tiền huấn luyện cho Gemini 4 đã bắt đầu. Công ty gọi đây là "đợt huấn luyện tham vọng nhất" từ trước đến nay và khẳng định họ "rất phấn khởi với những tiến bộ đạt được". Điều này nghe giống như một nỗ lực xoa dịu dư luận, cho thấy rõ rằng Google hiểu thị trường đang kỳ vọng điều gì nhưng vẫn chưa thể đáp ứng.

Gemini 3.6 Flash đánh đổi hiệu năng đỉnh cao để lấy hiệu suất và mức giá thấp hơn.

Theo đơn vị tổng hợp điểm chuẩn Artificial Analysis Index, Gemini 3.6 Flash dự kiến sẽ sử dụng ít hơn khoảng 17% token đầu ra so với 3.5 Flash. Google cho biết mức tiết kiệm đạt tới 65% trên các bài kiểm tra cụ thể như DeepSWE. Google đã giảm giá xuống còn 1,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra, khiến nó rẻ hơn nhiều so với mô hình 3.1 Pro trước đó, vốn thường xuyên bị 3.6 Flash vượt qua trong các bài kiểm tra điểm chuẩn.

Vier Balkendiagramme vergleichen Gemini 3.1 Pro, 3.5 Flash und 3.6 Flash in DeepSWE v1.1, MLE-Bench, GDPVal-AA v2 und OSWorld-Verified; 3.6 Flash liegt überall vorn.

Google cũng báo cáo những cải thiện so với 3.5 Flash. Điểm DeepSWE tăng từ 37 lên 49%, MLE Bench từ 49,7 lên 63,9% và OSWorld-Verified từ 78,4 lên 83%. Điểm chuẩn công việc tri thức GDPval-AA v2 cải thiện từ 1.349 lên 1.421 điểm.

Computer Use hiện đã là một công cụ tích hợp phía máy khách (client-side) trong Gemini API và Gemini Enterprise. Google cũng đã bổ sung các biện pháp bảo vệ Frontier Safety mạnh mẽ hơn trước việc lạm dụng CBRN và các cuộc tấn công mạng. CBRN đề cập đến các mối đe dọa hóa học, sinh học, phóng xạ và hạt nhân.

Zwei Balkendiagramme zum durchschnittlichen Output-Token-Verbrauch pro Aufgabe: In DeepSWE v1.1 fällt er von 276K auf 97K, im Artificial Analysis Intelligence Index von 28K auf 23K.

Mặc dù đạt được những tiến bộ trong các tác vụ đa phương thức và cửa sổ ngữ cảnh một triệu token, Google vẫn đi sau các mô hình tốt nhất từ các đối thủ cạnh tranh tại Mỹ và Trung Quốc. Logan Kilpatrick, một thành viên trong đội ngũ kỹ thuật, đã phản hồi những chỉ trích trên X rằng mục tiêu rõ ràng là hiệu suất, khả năng sử dụng và chi phí thấp hơn, đồng thời hiệu năng vẫn được cải thiện trong quá trình này.

Gemini 3.5 Flash-Lite nhắm đến khối lượng công việc lớn với chi phí thấp.

Mô hình Gemini 3.5 Flash-Lite nhỏ hơn được tinh chỉnh để có độ trễ thấp và lưu lượng xử lý cao. Theo Artificial Analysis, nó tạo ra 350 token đầu ra mỗi giây. Chi phí là 0,30 USD cho mỗi triệu token đầu vào và 2,50 USD cho mỗi triệu token đầu ra.

Balkendiagramme vergleichen Gemini 3.1 Flash-Lite und 3.5 Flash-Lite in Terminal-bench 2.1 (31,0 % zu 54,0 %) und GDPVal-AA v2 (642 zu 1140).

Google cho biết Flash-Lite vượt qua phiên bản 3 Flash cũ trên một số bài kiểm tra về tác nhân (agentic) và lập trình, bao gồm SWE-Bench Pro và OSWorld-Verified. So với người tiền nhiệm trực tiếp là 3.1 Flash-Lite, điểm số Terminal-Bench 2.1 của nó tăng từ 31 lên 54%.

Balkendiagramme vergleichen Gemini 3 Flash und 3.5 Flash-Lite in SWE-Bench Pro (49,6 % zu 54,2 %) und OSWorld-Verified (65,1 % zu 74,0 %).

Google đã giới thiệu Gemini 3.5 Flash tại hội nghị I/O gần nhất như là trọng tâm trong chiến lược về tác nhân (agent) của mình. Sau đó, công ty đã bổ sung tính năng Computer Use nguyên bản, cho phép mô hình tự vận hành trình duyệt, máy tính để bàn và thiết bị di động.

Mô hình an ninh mạng của Google vẫn bị hạn chế.

Gemini 3.5 Flash Cyber dựa trên 3.5 Flash và được tinh chỉnh cho công việc an ninh mạng. Google đã tích hợp nó vào CodeMender, tác nhân bảo mật mã nguồn của Google DeepMind. Một số tác nhân phụ Flash Cyber hoạt động song song và kết hợp kết quả của chúng thành một báo cáo duy nhất. Trên bài kiểm tra CyberGym, mô hình đạt 83,2%, chỉ kém chưa đầy hai điểm so với GPT-5.5-Cyber của OpenAI với 85,6%, mặc dù đây là một mô hình nhỏ hơn nhiều.

Balkendiagramm zum CyberGym-Benchmark mit fünf Systemen zwischen 83,1 % und 85,6 %; Gemini 3.5 Flash Cyber in CodeMender erreicht 83,2 %.

Đội ngũ Big Sleep của Google đã đưa mô hình này vào làm việc để săn tìm các lỗ hổng nghiêm trọng trong Chrome và Safari, và nó đã vượt qua cả các mô hình Flash tiêu chuẩn lẫn Claude Opus 4.6 của Anthropic. Khi quét các commit trong công cụ JavaScript V8, Flash Cyber đã phát hiện 55 lỗ hổng duy nhất được xác nhận. Bản 3.5 Flash tiêu chuẩn tìm thấy 47, Opus 4.6 tìm thấy 36, và Google cho biết mười trong số các phát hiện của Flash Cyber không xuất hiện trong kết quả của bất kỳ mô hình nào khác.

Trong một thử nghiệm khác, Đội ngũ Nghiên cứu Lỗ hổng Đám mây của Google đã sử dụng mô hình này để quét các API công khai. Nó đã tìm thấy các lỗ hổng thực thi mã từ xa trong vòng hai giờ và tạo ra một mã khai thác (exploit) hoạt động được, qua mặt các biện pháp bảo vệ an ninh.

Google cho biết mô hình này hữu ích cho cả tấn công lẫn phòng thủ, vì vậy công ty đang kiểm soát quyền truy cập rất chặt chẽ. Chỉ các chính phủ và đối tác tin cậy mới có thể sử dụng 3.5 Flash Cyber thông qua CodeMender như một phần của chương trình thí điểm. Google đang cung cấp rộng rãi tác nhân CodeMender dưới dạng bản xem trước thông qua Gemini Enterprise Agent Platform, nhưng phiên bản đó chạy trên các mô hình Gemini tiêu chuẩn. Nó hỗ trợ C/C++, Go, Java, Python, Ruby, Rust và TypeScript.

Mô hình Pro còn thiếu khiến Google tụt hậu so với các đối thủ.

Gemini 3.5 Pro, mô hình tiên phong tiếp theo của Google, vẫn chưa được công khai. OpenAI đã phục vụ phân khúc đó với GPT-5.6 Sol, Anthropic có Fable và Mythos, còn các phòng thí nghiệm Trung Quốc như Moonshot với Kimi K3 và Zhipu với GLM-5.2 đang tiến gần đến hiệu năng tiên phong. Ngay cả Meta gần đây cũng đã phát hành một mô hình vượt trội hơn dòng sản phẩm hiện tại của Google trong việc viết mã.

Thay vì cạnh tranh ở phân khúc cao cấp nhất, Google lại tung ra một bản cập nhật Flash khác tập trung vào hiệu suất và giá rẻ hơn. Theo một báo cáo gần đây của Bloomberg, mô hình chủ lực này đã chậm tiến độ nhiều tháng do công ty đang nỗ lực cải thiện hiệu năng lập trình. Chừng nào 3.5 Pro còn nằm trong giai đoạn thử nghiệm nội bộ, Google vẫn chưa có một mô hình công khai nào đủ sức cạnh tranh ở phân khúc cao cấp nhất của thị trường.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo tiên phong "AI Radar" độc quyền sáu lần một năm, truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay.

GoogleGeminiAICông nghệMô hình ngôn ngữ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.