Tomer Tunguz Blog (phân tích VC)
92

Thủ thuật

AI nội bộ đã bắt kịp mô hình đám mây: Kỷ nguyên cá nhân hóa trung tâm dữ liệu

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu mới cho thấy AI chạy cục bộ hiện đạt chất lượng tương đương 89% so với các mô hình đám mây hàng đầu, giúp giảm tới 80% năng lượng và 74% chi phí vận hành.

Bản dịch AI

Mainframes became personal. So will your data center.

Các mô hình AI cục bộ (local AI models) hiện đã có thể giải đáp 89% các truy vấn suy luận và trò chuyện hàng ngày tốt ngang ngửa với một mô hình đám mây tiên phong (frontier cloud model). Kết quả này được củng cố trên quy mô rộng lớn với hơn một triệu truy vấn thực tế và hơn 20 mô hình cục bộ được thử nghiệm.

Điều đó có nghĩa là chúng ta đang tạo ra nhiều trí tuệ hơn trên mỗi watt điện năng: đạt được nhiều kết quả công việc hơn từ cùng một lượng electron.

Việc theo dõi hiệu suất tính toán theo thời gian không phải là điều mới mẻ. Định luật Koomey (Koomey’s law) đã chỉ ra rằng sức mạnh tính toán trên mỗi watt tăng gấp đôi sau mỗi 1,5 năm trong nhiều thập kỷ qua, một xu hướng đã thu nhỏ sức mạnh của một máy tính lớn (mainframe) vào trong khung máy của một chiếc laptop.

Cũng giống như hiệu suất trên mỗi watt (performance-per-watt) đã dẫn dắt quá trình chuyển đổi từ máy tính lớn sang PC, chỉ số trí tuệ trên mỗi watt (intelligence-per-watt) sẽ dẫn dắt quá trình chuyển đổi của AI sang các thiết bị biên (edge).

— Jon Saad-Falcon, Avanika Narayan, và cộng sự, “Intelligence per Watt”

Các GPU ngày nay tuân theo một đường cong tăng trưởng chậm hơn, với hiệu suất tăng gấp đôi sau mỗi 2,7 năm trong 15 năm qua, thay vì 1,5 năm như trước.

Tác động mang lại không hề kém phần ấn tượng: tỷ lệ thắng/hòa của mô hình cục bộ tốt nhất so với mô hình tiên phong đã tăng từ 23,2% vào năm 2023 lên 71,3% vào năm 2025, tăng trung bình khoảng 20 điểm phần trăm mỗi năm. Đến năm 2026, khi một mô hình cục bộ được chọn cho tác vụ cụ thể bởi một AI cục bộ khác, con số đó đã tăng lên gần 90%.

Hiệu suất đã cải thiện song hành cùng đường xu hướng: chỉ số trí tuệ trên mỗi watt đã tăng gấp 5,3 lần trong cùng kỳ, trong đó 3,1 lần đến từ các mô hình tốt hơn và 1,7 lần đến từ các con chip tốt hơn. Máy tính nhanh hơn, mô hình thông minh hơn. Và người dùng cuối là bên được hưởng lợi.

Local models match cloud models on 71.3% of queries in 2025, up from 23.2% in 2023; a 2026 bar shows the ensemble-routed ceiling of 89%, a different metric than the single-model trend

Đám mây vẫn đóng vai trò thiết yếu cho các tác vụ suy luận đa bước dài, các lĩnh vực kỹ thuật khó nhất và các khối lượng công việc đòi hỏi quy mô và khả năng xử lý song song. Phần cứng đám mây vẫn giữ ưu thế hơn so với phần cứng cục bộ trong nhiều trường hợp sử dụng. Suy luận trên đám mây mang lại mức tăng hiệu quả năng lượng 40% so với các mô hình cục bộ. Các trung tâm dữ liệu thực hiện xử lý truy vấn theo lô (batch queries) – một thủ thuật mà phần cứng cục bộ phục vụ từng người dùng một chưa thể áp dụng được.

Local AI efficiency improved 18x in 16 months, split between gains from better accelerators and better models

Tuy nhiên, đối với phần lớn công việc tri thức hàng ngày, không có lý do gì để phải gửi truy vấn đến trung tâm dữ liệu. Sự kết hợp giữa các mô hình cục bộ và một bộ định tuyến (router) là đủ cho đại đa số các công việc.

Giải pháp này cũng giúp cắt giảm 80% năng lượng, 77% tài nguyên tính toán và 74% chi phí so với phương án sử dụng hoàn toàn trên đám mây.

Máy tính lớn đã trở thành máy tính cá nhân. Trung tâm dữ liệu của bạn cũng sẽ như vậy.

Jon Saad-Falcon, Avanika Narayan, và cộng sự, “Intelligence per Watt: Measuring Intelligence Efficiency of Local AI,” Đại học Stanford & Together AI, tháng 11 năm 2025. arXiv:2511.07885. Xem thêm tổng quan từ Stanford Hazy Research.

Định luật Koomey, Wikipedia.

Watt đo công suất, tốc độ tiêu thụ năng lượng, còn joule đo chính bản thân năng lượng đó; thước đo gốc của Koomey là số phép tính trên mỗi joule, nhưng xu hướng cơ bản cũng chính là xu hướng mà chỉ số trí tuệ trên mỗi watt hiện đang theo dõi cho các mô hình AI.

Anson Ho, Ege Erdil & Tamay Besiroglu, “Limits to the Energy Efficiency of CMOS Microprocessors,” 2023. arXiv:2312.08595.

71,3% và 89% là hai phép đo khác nhau từ cùng một dữ liệu năm 2025, không phải cùng một con số tại các thời điểm khác nhau. 71,3% là tỷ lệ thắng/hòa của mô hình cục bộ đơn lẻ tốt nhất so với mô hình tiên phong, đây là đường xu hướng mà biểu đồ này vẽ ra (23,2% năm 2023, 48,7% năm 2024, 71,3% năm 2025). 89% là một ngưỡng trần riêng biệt và cao hơn: việc định tuyến mỗi truy vấn đến mô hình cục bộ nào trong số hơn 20 mô hình được thử nghiệm xử lý tốt nhất sẽ vượt trội hơn bất kỳ mô hình đơn lẻ nào từ 16,3 đến 28,8 điểm phần trăm. Mức tăng đó là hiệu ứng lựa chọn: bài báo lưu ý rằng định tuyến cục bộ tận dụng hơn 20 mô hình đa dạng thay vì ba mô hình đám mây tiên phong, vì vậy trên một số tiêu chuẩn đánh giá, tập hợp mô hình cục bộ tốt nhất thậm chí còn vượt qua cả mô hình đám mây tốt nhất. Việc có nhiều ứng viên để lựa chọn, chứ không chỉ là định tuyến thông minh hơn, chính là yếu tố nâng cao độ chính xác. Cả hai con số đều đến từ cùng một nghiên cứu và không có con số nào thay thế con số kia.

Jon Saad-Falcon, Avanika Narayan, và cộng sự, “Intelligence per Watt: Measuring Intelligence Efficiency of Local AI,” Đại học Stanford & Together AI, tháng 11 năm 2025. Các bộ tăng tốc đám mây mang lại hiệu suất trí tuệ trên mỗi watt cao hơn ít nhất 1,4 lần so với các con chip cục bộ chạy cùng các mô hình đó, tương đương với mức chênh lệch hiệu suất khoảng 40%. arXiv:2511.07885.

Most AI Work Can Wait, tomtunguz.com.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.