Mô hình
Google DeepMind ra mắt Gemini 3.8 Flash và bản chuyên dụng Cyber: Cùng một lõi, hai cách tiếp cận
(giờ Việt Nam)
Tóm tắt AI
Google DeepMind vừa giới thiệu Gemini 3.8 Flash và phiên bản Cyber, sử dụng chung nền tảng cốt lõi nhưng được tối ưu hóa khác biệt về cơ chế bảo mật và phương thức truy cập.
Bản dịch AI

Google vừa công bố Gemini 3.8 Flash và Gemini 3.8 Flash Cyber, chỉ ba tuần sau khi ra mắt Gemini 3.7 Flash và đánh dấu bản phát hành Flash thứ ba trong vòng sáu tuần. Cả hai biến thể đều chạy trên cùng một nền tảng trí tuệ cốt lõi, được tinh chỉnh thông qua các vòng lặp tác nhân (agentic loops) chạy dài hạn, liên tục đánh giá các mô hình nền tảng. Điểm khác biệt giữa chúng không nằm ở kiến trúc, mà ở phạm vi an toàn (safety envelope) và đối tượng được phép truy cập.
Liệu mô hình này có thể triển khai được không? Gemini 3.8 Flash hiện đã khả dụng thông qua Gemini API, Google AI Studio, Antigravity, Android Studio và Gemini Enterprise, vì vậy bạn có thể định tuyến lưu lượng truy cập sản xuất vào đó ngay bây giờ. Trọng số (weights) của mô hình là đóng, nên không có tùy chọn tự lưu trữ (self-hosted) hoặc triển khai tại chỗ (on-premises). Gemini 3.8 Flash Cyber hoàn toàn không được triển khai công khai: quyền truy cập được cấp theo từng trường hợp thông qua Chương trình Fairwind mới.
Những thay đổi thực sự trong 3.8 Flash
Nhóm nghiên cứu giải thích rằng 3.8 Flash dựa trên nền tảng 3.7 Flash. Các thông số kỹ thuật không thay đổi: cửa sổ ngữ cảnh 1.048.576 token, đầu ra tối đa 65.536 token, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và đầu ra văn bản. Các cấp độ tư duy (Thinking levels) vẫn giữ nguyên là LOW, MEDIUM và HIGH với mặc định là MEDIUM. Một chi tiết gây lỗi cho bất kỳ ai đang chuyển đổi: MINIMAL không còn được hỗ trợ trên 3.8 Flash và việc thiết lập nó sẽ trả về lỗi xác thực API.
Thay đổi về hành vi mới là điểm mấu chốt. Google mô tả sự cải tiến một cách thẳng thắn: 3.8 Flash làm việc chăm chỉ hơn. Đối với các tác vụ phức tạp, nó thực hiện thêm các bước suy luận và gọi công cụ một cách lặp đi lặp lại, đồng thời có thể tiêu tốn nhiều token hơn ở các cấp độ nỗ lực cao hơn. Hướng dẫn dành cho nhà phát triển của Google thừa nhận rằng điều này mang lại độ chính xác tốt hơn với cái giá là tiêu thụ token cao hơn, và họ khuyến nghị nên tiếp tục sử dụng 3.7 Flash khi hiệu quả tính toán là yếu tố ràng buộc. Đây là một sự thừa nhận trực tiếp hiếm thấy rằng mô hình mới hơn không phải lúc nào cũng là lựa chọn mặc định phù hợp cho mọi khối lượng công việc.
Những cải tiến thể hiện ở đâu
Trên DeepSWE v1.1, một tiêu chuẩn đánh giá kỹ thuật phần mềm dài hạn, Google báo cáo rằng 3.8 Flash vượt trội hơn hầu hết các mô hình tiên phong (frontier models) lớn hơn với chi phí chỉ bằng một phần nhỏ. Nó đạt 54,9% trên HLE-Verified, đồng thời vượt qua 3.7 Flash và các mô hình tiên phong khác trên Vals Finance Agent V2 và Harvey’s Legal Agent Benchmark. Lưu ý rằng kết quả trong lĩnh vực tài chính và pháp lý được báo cáo dưới dạng thắng lợi tương đối, không có điểm số tuyệt đối trong thông báo.
Flash Cyber và lý do tại sao nó bị hạn chế quyền truy cập
Trên CyberGym, tiêu chuẩn đánh giá phát hiện lỗ hổng bảo mật, Google báo cáo hiệu suất ở cấp độ tiên phong, vượt qua cả 3.5 Flash Cyber và các mô hình tiên phong lớn hơn đáng kể, mặc dù không có con số tuyệt đối nào được công bố. Vì CyberGym chủ yếu sử dụng C và C++, Google cũng đã chạy một tiêu chuẩn đánh giá nội bộ trên 20 ngôn ngữ lập trình và báo cáo tỷ lệ thành công trong việc phát hiện lỗ hổng đạt trên 70%.
Đối với việc vá lỗi, CWE-Bench, do Collinear vận hành, xếp hạng Flash Cyber ở mức 47,2% pass@1 so với 47,8% của một mô hình tiên phong hàng đầu. Tuyên bố ở đây là sự ngang bằng gần như tuyệt đối với chi phí thấp hơn đáng kể, và Google định vị nó nằm trên đường biên Pareto (Pareto frontier) thay vì đứng đầu bảng xếp hạng.
Chrome Security báo cáo số lượng bản vá chính xác cao gấp 2,6 lần so với các mô hình thương mại tốt nhất và lớn hơn nhiều. Wiz đo lường mức độ thu hồi (recall) cao hơn từ 7,5 đến 9,7 điểm phần trăm trên tiêu chuẩn đánh giá kiểm thử xâm nhập nội bộ của họ với chi phí thấp hơn từ 2,3 đến 5,2 lần. Nhóm Nghiên cứu Lỗ hổng Đám mây của Google đã tìm thấy một lỗ hổng nền tảng nghiêm trọng trong chưa đầy hai giờ, công việc mà thông thường phải mất hàng tháng.
Google khẳng định rõ ràng rằng họ ưu tiên việc sửa lỗi lỗ hổng hơn là các khả năng tấn công như khai thác. Flash Cyber được trang bị bộ giảm thiểu rủi ro an ninh mạng cho phép nhiều hơn, đó chính xác là lý do tại sao nó bị giới hạn đối với những người bảo vệ đáng tin cậy: các cơ quan chính phủ, nhà vận hành cơ sở hạ tầng trọng yếu và những người bảo trì phần mềm đăng ký thông qua Fairwind.
Giải thích tương tác
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia ML SubReddit với hơn 150 nghìn thành viên của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Sản phẩm mới hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.