Sản phẩm
Google ra mắt Gemini 3.6 Flash: Tối ưu chi phí và tốc độ cho AI Agent doanh nghiệp
(giờ Việt Nam)
Tóm tắt AI
Google vừa giới thiệu Gemini 3.6 Flash và 3.5 Flash-Lite, tập trung giảm độ trễ và chi phí token, giúp các AI Agent vận hành hiệu quả hơn trong môi trường doanh nghiệp.
Bản dịch AI

Google vừa ra mắt Gemini 3.6 Flash và 3.5 Flash-Lite như những "cỗ máy" mới được thiết kế để cắt giảm độ trễ và chi phí token cho các tác nhân AI (AI agents) trong doanh nghiệp.
Bài toán kinh tế khi vận hành các tác nhân phần mềm tự động trong môi trường thực tế phụ thuộc vào một phương trình cố định mà ít nhà cung cấp nào quảng cáo trực tiếp. Một mô hình cần phải suy luận qua các tác vụ đa bước một cách thành thạo, nhưng mỗi token bổ sung mà nó tạo ra trong quá trình đó đều làm tăng chi phí và độ trễ cho một quy trình vốn có thể chạy hàng nghìn lần mỗi giờ.
Các đội ngũ xây dựng tác nhân chạy nền thay vì giao diện trò chuyện cần thông lượng (throughput) là ưu tiên hàng đầu và số lượng tham số là thứ yếu. Câu trả lời của Google, được công bố trong tuần này, đã phân tách sự đánh đổi đó qua ba mô hình: Gemini 3.6 Flash cho lập trình và suy luận đa phương thức, Gemini 3.5 Flash-Lite cho các công việc khối lượng lớn, độ trễ thấp, và một biến thể hạn chế là Gemini 3.5 Flash Cyber được xây dựng để khắc phục lỗ hổng bảo mật.
Các con số đằng sau Gemini 3.6 Flash
Tài liệu dành cho nhà phát triển của Google về 3.6 Flash tập trung vào một con số: ít hơn 17% token đầu ra so với phiên bản 3.5 Flash trước đó, dựa trên các phép đo từ Artificial Analysis Index.
Trong các bài kiểm tra tổng hợp cụ thể, bao gồm cả tiêu chuẩn Datacurve DeepSWE, Google báo cáo mức giảm sử dụng token lên tới 65%. Giá dịch vụ ở mức 1,50 USD/1 triệu token đầu vào và 7,50 USD/1 triệu token đầu ra, định vị mô hình này cho các vòng lặp suy luận chạy liên tục thay vì theo yêu cầu.
Trên DeepSWE, công ty ghi nhận tỷ lệ thành công 49% cho 3.6 Flash so với 37% của phiên bản tiền nhiệm. Trên MLE Bench, điểm số tăng từ 49,7% lên 63,9%, và trên bài kiểm tra GDPval-AA v2 của Google – vốn cố gắng đo lường công việc tri thức thực tế thay vì các câu đố lập trình – 3.6 Flash đạt 1421 điểm so với 1349 điểm của mô hình cũ.
Figma, Hebbia và Harvey đưa mô hình vào ứng dụng thực tế
Figma đã tích hợp 3.6 Flash vào cơ sở hạ tầng tạo mẫu (prototyping) của mình, và theo Matt Colyer, Giám đốc Kỹ thuật Sản phẩm của công ty, mô hình này mang đến cho các nhà phát triển lộ trình nhanh hơn thông qua các lần lặp thiết kế mà không làm giảm chất lượng đầu ra.
Nền tảng công nghệ pháp lý Harvey và công cụ nghiên cứu Hebbia định tuyến dữ liệu qua mô hình này cho các công việc tài liệu đa phương thức: tiếp nhận các hồ sơ tài chính thô, phân tích cấu trúc tài liệu, đọc các biểu đồ nhúng và tạo bản thảo báo cáo để xem xét.
Google cũng tích hợp trực tiếp một công cụ sử dụng máy tính (computer-use tool) phía máy khách vào nền tảng Gemini API và Gemini Enterprise, loại bỏ phần mềm trung gian tùy chỉnh mà các kỹ sư trước đây từng phải xây dựng để cho phép các mô hình hoạt động trên hệ điều hành.
Công ty báo cáo điểm số OSWorld-Verified đạt 83,0%, tăng từ 78,4%, và cho biết các biện pháp bảo vệ cập nhật chống lại việc lạm dụng hóa học, sinh học, phóng xạ và hạt nhân đã cải thiện khả năng chống lại việc bẻ khóa (jailbreaking) mà không làm tăng tỷ lệ từ chối đối với các yêu cầu lành tính.
Một tầng giá rẻ hơn cho các tác nhân chạy nền khối lượng lớn
Gemini 3.5 Flash-Lite nhắm đến một công việc khác: xử lý tài liệu và tìm kiếm tác nhân (agentic search) chạy ở quy mô lớn thay vì đòi hỏi chiều sâu suy luận. Artificial Analysis Index đã đo lường mô hình này ở mức 350 token đầu ra mỗi giây, nhanh nhất trong dòng 3.5 theo Google.
Giá dịch vụ ở mức 0,3 USD/1 triệu token đầu vào và 2,5 USD/1 triệu token đầu ra, đủ rẻ để các đội ngũ kỹ thuật có thể định tuyến các yêu cầu tác nhân phụ đơn giản, khối lượng lớn đến mức tư duy tối thiểu và dành các mức tư duy cao hơn cho công việc đa bước.
Trên bài kiểm tra ngữ cảnh dài GDM-MRCR v2 của Google, Gemini 3.5 Flash-Lite ghi nhận tỷ lệ thành công 72,2% so với 60,1% của phiên bản tiền nhiệm, và điểm số GDPval-AA v2 của nó gần như tăng gấp đôi, từ 642 lên 1140. Mô hình này mang theo cùng một công cụ sử dụng máy tính gốc như 3.6 Flash.
Ngoài ra, Google cho biết Gemini 3.5 Pro vẫn đang trong quá trình thử nghiệm với đối tác trước khi phát hành đầy đủ, và quá trình tiền huấn luyện cho kiến trúc Gemini 4 tiếp theo đã bắt đầu.
Gemini 3.5 Flash Cyber: Mô hình hạn chế để vá lỗi mã nguồn
Các trình quét lỗ hổng tự động hiện nay phát hiện các lỗi nhanh hơn mức hầu hết các đội ngũ bảo mật có thể vá chúng, và khoảng trống đó chính là nơi Google định vị Gemini 3.5 Flash Cyber.
Mô hình này được xây dựng để xác thực và khắc phục các lỗ hổng mã nguồn, và Google báo cáo hiệu suất trên tiêu chuẩn CyberGym cạnh tranh với các mô hình tiên phong (mặc dù họ chưa công bố các số liệu đó chi tiết như các bản phát hành dành cho người tiêu dùng).
Việc phân phối vẫn bị giới hạn cho các chính phủ và đối tác đã được kiểm duyệt thông qua một chương trình thí điểm, một hạn chế mà Google coi là biện pháp bảo vệ để mô hình không tạo ra mã khai thác cho mục đích tấn công.
Bên trong tác nhân bảo mật CodeMender của Google, nhiều phiên bản của 3.5 Flash Cyber chạy song song, kiểm tra chéo các phát hiện của nhau trước khi tạo ra một báo cáo khắc phục duy nhất mà một người đánh giá sẽ phê duyệt.
Các đội ngũ kỹ thuật muốn tích hợp các mô hình mới này có thể truy cập chúng thông qua Gemini API qua Google AI Studio, Android Studio hoặc Gemini Enterprise Agent Platform. Người tiêu dùng cũng có thể truy cập các mô hình mới trong ứng dụng Gemini và 3.5 Flash-Lite cũng đang được triển khai trong Google Search.
Xem thêm: Bristol Myers Squibb mua hệ thống AI của Nvidia để khám phá thuốc

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy xem AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.
AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.