Tin ngành
Google phát triển chip Frozen v2: Tối ưu hóa phần cứng cho Gemini, tăng hiệu suất gấp 10 lần
(giờ Việt Nam)
Tóm tắt AI
Google đang phát triển chip Frozen v2, tích hợp kiến trúc cốt lõi của Gemini trực tiếp vào phần cứng để giảm độ trễ và tiêu thụ năng lượng. Dự kiến ra mắt năm 2028, chip này hứa hẹn tăng hiệu suất xử lý token gấp 6-10 lần so với các dòng chip AI hiện tại của hãng.
Bản dịch AI
Theo tin từ IT ngày 20 tháng 7, tờ The Information dẫn lời các nguồn tin thân cận cho biết Google đang phát triển một dòng chip máy chủ hoàn toàn mới với tên mã "Frozen v2". Đột phá cốt lõi của con chip này nằm ở việc tích hợp trực tiếp kiến trúc tính toán nền tảng của mô hình ngôn ngữ lớn Gemini vào cấp độ phần cứng, từ đó giảm đáng kể mức tiêu thụ năng lượng và độ trễ trong quá trình suy luận AI. Dự kiến, số lượng token mà chip có thể xử lý trên mỗi đơn vị công suất sẽ gấp từ 6 đến 10 lần so với các dòng chip AI tự phát triển hiện tại của Google.

Google hiện đang đối mặt với tình trạng thiếu hụt nghiêm trọng năng lực tính toán AI. Nguồn lực nội bộ căng thẳng đã khiến Google Cloud buộc phải từ chối một số đơn đặt hàng hợp tác từ khách hàng bên ngoài. Việc khởi động dự án Frozen v2 chính là nhằm giải quyết triệt để nút thắt này. Các nguồn tin cho biết, con chip này dự kiến sớm nhất sẽ được triển khai vào năm 2028.
IT lưu ý rằng, tên mã "Frozen" (đóng băng) đã khái quát chính xác triết lý thiết kế của nó: khắc vĩnh viễn một phần logic tính toán của mô hình lớn lên tấm silicon phần cứng. Khác với các loại chip đa năng như GPU của NVIDIA hay TPU của Google, Frozen v2 không phải là chip đa năng mà là chip chuyên dụng được "đo ni đóng giày" cho dòng mô hình Gemini. Trong khi chip đa năng cần thực hiện hàng loạt phán đoán logic theo thời gian thực khi chạy bất kỳ mô hình nào, thì Frozen v2 thông qua việc tích hợp sẵn logic tính toán nền tảng của Gemini, có thể giảm đáng kể các bước tính toán và khối lượng luân chuyển dữ liệu, từ đó đạt được tốc độ phản hồi người dùng nhanh hơn và hứa hẹn hỗ trợ Google ra mắt các kịch bản ứng dụng AI hoàn toàn mới.
Frozen v2 không phải là lần đầu tiên Google thử nghiệm việc "ghi" mô hình AI vào phần cứng. Phiên bản tiền nhiệm của nó do Jeff Dean, Giám đốc khoa học của Google DeepMind dẫn dắt, với kế hoạch khắc trực tiếp toàn bộ trọng số mô hình vào chip. Tuy nhiên, phương án này tồn tại một khiếm khuyết chí mạng: chip chỉ có thể tương thích với một phiên bản duy nhất của Gemini, vòng đời phần cứng cực kỳ ngắn, do đó dự án đã bị gác lại trong nhiều năm.
Frozen v2 đã thực hiện những điều chỉnh then chốt dựa trên phiên bản tiền nhiệm, không còn cố định toàn bộ trọng số mô hình mà chỉ tích hợp logic kiến trúc nền tảng vào chip, đồng thời giữ lại khả năng cập nhật trọng số mô hình tích hợp (các tham số cốt lõi quyết định chất lượng phản hồi của mô hình) để thực hiện các vòng lặp. Tuy nhiên, điều này cũng đồng nghĩa với việc Google đang đặt cược vào việc sẽ tiếp tục sử dụng kiến trúc nền tảng hiện tại của mô hình lớn Gemini; chỉ khi các thế hệ Gemini tiếp theo vẫn duy trì kiến trúc cơ sở nhất quán với thiết kế chip, chúng mới có thể vận hành bình thường trên con chip này.
Hiện tại, đội ngũ kỹ sư vẫn đang hoàn thiện các mô-đun chức năng cốt lõi và phương án phối hợp giữa các thành phần, đồng thời cân nhắc độ sâu của việc tích hợp thông tin mô hình để đạt được sự cân bằng tối ưu giữa tính linh hoạt của phần cứng và hiệu suất vận hành.
Frozen v2 sẽ mở ra một dòng sản phẩm chip tự phát triển hoàn toàn mới, tạo mối quan hệ bổ trợ thay vì thay thế cho bộ xử lý tensor (TPU) hiện có của Google. Năm nay, Google đã ra mắt TPU thế hệ thứ tám và trực tiếp quảng bá tới các khách hàng đám mây, thách thức trực diện vị thế độc quyền của NVIDIA trên thị trường chip AI. Google đã ký hợp đồng trị giá hàng tỷ đô la với Meta để cho thuê năng lực tính toán TPU, đồng thời tích cực đưa TPU đến với các khách hàng đám mây cốt lõi của NVIDIA.
Đáng chú ý, chiến lược tự phát triển chip AI của Google đã bắt đầu cho thấy hiệu quả. Thông qua việc tối ưu hóa thiết kế TPU xung quanh Gemini, Google đã giảm thiểu hiệu quả chi phí vận hành mô hình Gemini, chỉ là lượng thông tin mô hình tích hợp trong TPU ít hơn nhiều so với dòng chip Frozen.
Mặc dù triển vọng công nghệ rất rộng mở, Google hiện chưa có kế hoạch sản xuất hàng loạt Frozen v2 trên quy mô lớn, năng lực sản xuất sẽ thấp hơn nhiều so với TPU. Các nguồn tin tiết lộ rằng, quy mô sản xuất hạn chế cho phép Google trì hoãn việc đưa vào các đối tác thiết kế và gia công bên ngoài. Google coi dòng sản phẩm này là nền tảng thử nghiệm công nghệ, tích lũy kinh nghiệm kỹ thuật để phát triển các loại chip chuyên dụng cao hơn sau khi kiến trúc nền tảng của mô hình lớn trở nên ổn định.
Người phát ngôn của Google phản hồi về vấn đề này rằng, các đội ngũ của công ty "tiếp tục nghiên cứu, thử nghiệm các loại công nghệ đổi mới, nỗ lực đạt được hiệu suất và hiệu quả năng lượng tối ưu cho người dùng và khách hàng doanh nghiệp", đồng thời nhấn mạnh "không phải dự án nghiên cứu nào cũng sẽ được đưa vào sản xuất hàng loạt, nhưng việc khám phá công nghệ toàn diện này là một mắt xích cốt lõi trong lộ trình công nghệ tự phát triển toàn diện của chúng tôi".
Tuyên bố quảng cáo: Các liên kết ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.