Nghiên cứu
Tối ưu hóa đường cong hiệu suất cho các mô hình AI tiên tiến
(giờ Việt Nam)
Tóm tắt AI
Microsoft chia sẻ phương pháp kỹ thuật nhằm tối ưu hóa sự cân bằng giữa hiệu suất và chi phí tính toán cho các mô hình AI thế hệ mới, giúp đạt hiệu quả tối đa trên các kiến trúc tiên tiến.
Bản dịch AI

"Tokenmaxxing" (tối đa hóa token) là câu chuyện của vài tháng qua, nhưng hiệu quả sử dụng token mới là trọng tâm lớn tiếp theo của toàn ngành. Làm thế nào để chúng ta đạt được hiệu suất tốt nhất trên mỗi token đầu tư và kết quả thực tế tốt nhất cho khách hàng trên mỗi đô la chi phí?
Để xây dựng một công ty tiên phong, bạn phải tối ưu hóa hiệu suất tiên phong so với chi phí. Việc lựa chọn vị trí bạn muốn nằm trên đường cong đó là rất quan trọng. Bằng cách đồng tối ưu hóa các mô hình, hệ thống điều khiển (harness) và RLE của mình, bạn có thể chọn một điểm trên đường cong phù hợp với công ty của mình.
Trong hầu hết các trường hợp, các mô hình tổng quát tiên phong không cần thiết cho mọi tác vụ. Bằng cách tinh chỉnh các mô hình cho một sản phẩm cụ thể, bạn có thể duy trì hoặc thậm chí vượt qua hiệu suất tiên phong, đồng thời giảm đáng kể chi phí token.
Đây là nơi chúng tôi đã tập trung cỗ máy "leo đồi" (hill-climbing) MAI của mình trong quý vừa qua và kết quả đạt được rất ấn tượng. Tuần này, chúng tôi đã phát hành MAI-Cyber-1-Flash được tối ưu hóa cho hệ thống MDASH của mình.
Kết hợp lại, hệ thống này đã đứng vị trí số 1 trên bảng xếp hạng CyberGym hàng đầu – đánh bại Mythos với cách biệt 12 điểm phần trăm – ở mức chi phí chỉ bằng 50%. Và đáng chú ý là chúng tôi cũng vận hành nó trên các chip H100.
Nó được thiết kế để xử lý hiệu quả tới 90% các tác vụ, nhờ đó MDASH có thể dành riêng các mô hình lớn và đắt đỏ nhất trong hệ thống của chúng tôi (trong trường hợp này là GPT 5.4) cho 10% các vấn đề đặc biệt khó khăn thực sự cần đến chúng.
Như Satya đã đề cập hôm nay trong cuộc họp báo cáo thu nhập quý 4, kể từ quý trước, chúng tôi đã ra mắt hơn một chục mô hình mới trong các lĩnh vực hình ảnh, giọng nói, phiên âm, lập trình và bảo mật. Chúng hiện đang cung cấp sức mạnh cho nhiều sản phẩm được sử dụng rộng rãi nhất của Microsoft để duy trì hoặc cải thiện chất lượng trong khi sử dụng ít token hơn đáng kể, trong nhiều trường hợp tiết kiệm được 50-90% chi phí GPU:
Hơn thế nữa, bằng cách đồng thiết kế các mô hình với chip xử lý của riêng mình, chúng tôi đang thấy hiệu suất trên mỗi watt tốt hơn 40% khi chạy các mô hình MAI trên Maia 200.
Nhưng lợi ích không chỉ dừng lại ở chi phí. Đó còn là khả năng phục hồi. Mọi doanh nghiệp hiện nay đều phải giả định rằng bất kỳ mô hình nào mà họ phụ thuộc vào đều có thể biến mất do sự cố bảo mật, sự không thống nhất về kinh doanh hoặc chính sách, hay những thay đổi về địa chính trị.
Mọi mô hình trong một sản phẩm hoặc hệ thống tác nhân (agentic system) đều phải có khả năng thay thế được, và điều đó chỉ khả thi khi bạn xây dựng hệ thống điều khiển, ngữ cảnh, bộ nhớ và không gian hành động độc lập với một dòng mô hình duy nhất. Đó chính là cỗ máy "leo đồi" mà chúng tôi đã xây dựng.
Chúng tôi tin rằng đây là sự khởi đầu của một đường cong hiệu suất thực sự mới. Hình dạng của nó đại diện cho một hệ thống thay vì một mô hình đơn lẻ, và việc di chuyển trên đường cong này mang lại chất lượng tốt hơn, chi phí thấp hơn và nhiều lựa chọn hơn.
Đây là một mùa hè làm việc vất vả nhưng tuyệt vời của cả đội ngũ. Chúng tôi nhận thức rõ rằng mọi thứ mới chỉ bắt đầu và chúng tôi còn rất nhiều điều phải học hỏi. Nhưng hướng đi đã rõ ràng, chúng tôi đang "leo đồi" để đẩy giới hạn trên đường cong chi phí-kết quả, và chúng tôi sẽ tiếp tục chia sẻ những gì mình học được trên chặng đường này. Sẽ còn nhiều điều thú vị sắp tới.



Bài viết được AI dịch và tổng hợp tự động từ Microsoft AI: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.