Sản phẩm
Artificial Analysis ra mắt Optima: Công cụ tùy chỉnh đánh giá hiệu năng AI bằng dữ liệu riêng
(giờ Việt Nam)
Tóm tắt AI
Nền tảng Optima cho phép người dùng xây dựng các bài kiểm tra AI dựa trên dữ liệu và kịch bản thực tế, giúp so sánh chính xác chất lượng, chi phí và tốc độ của các mô hình ngôn ngữ.
Bản dịch AI

Optima cho phép người dùng xây dựng các bộ tiêu chuẩn đánh giá (benchmark) tùy chỉnh và so sánh các mô hình AI dựa trên chất lượng, chi phí và tốc độ cho các trường hợp sử dụng cụ thể của họ.
Artificial Analysis, đơn vị nổi tiếng với các đánh giá LLM độc lập và các bộ benchmark như GDPval-AA và AA-Briefcase, vừa ra mắt một nền tảng mới có tên là Optima. Tiền đề của nền tảng này rất đơn giản: các bộ benchmark công khai thường so sánh các mô hình dựa trên những tác vụ và tiêu chí định sẵn, nhưng chúng không nhất thiết cho thấy mô hình nào hoạt động tốt nhất cho một trường hợp sử dụng cụ thể. Optima hướng tới việc thu hẹp khoảng cách đó bằng các so sánh được thiết kế riêng cho từng quy trình làm việc cá nhân.
Theo Artificial Analysis, người dùng có thể tự xây dựng các bộ benchmark bằng cách sử dụng dữ liệu, quy trình làm việc hoặc mô tả về trường hợp sử dụng của riêng họ, sau đó chạy chúng trên các mô hình hàng đầu hiện nay và so sánh kết quả về chất lượng, chi phí trên mỗi tác vụ và thời gian trên mỗi tác vụ. Optima hiện đã sẵn sàng để sử dụng.
Ba con đường để tạo ra một bộ benchmark tùy chỉnh
Optima chấp nhận nhiều loại tài liệu nguồn. Người dùng có thể tải lên các tập dữ liệu đánh giá hiện có từ tệp của riêng họ hoặc từ Hugging Face, cũng như các dấu vết (traces) của AI agent từ các nền tảng như Arize, Braintrust hoặc Langfuse. Artificial Analysis cho biết, các nhà phát triển cũng có thể cài đặt một kỹ năng (skill) giúp thu thập thông tin từ môi trường lập trình và các phiên làm việc trước đây của họ.
Những người dùng không có loại dữ liệu đó có thể mô tả trường hợp sử dụng dự kiến và cung cấp các đầu vào/đầu ra mẫu. Sau đó, Optima sẽ đề xuất các đầu vào thử nghiệm, tiêu chí đánh giá và các tác vụ ví dụ. Người dùng có thể xem xét và tinh chỉnh những đề xuất này thông qua phản hồi trước khi chạy benchmark thực tế.
Có hai phương pháp chấm điểm khả dụng: đánh giá dựa trên thang điểm (rubric-based) so với các tiêu chí khách quan, hoặc phương pháp so sánh cặp (pairwise comparison) mà Artificial Analysis cũng đang sử dụng cho các bộ benchmark như GDPval-AA và AA-Briefcase. Trong phương pháp so sánh cặp, người dùng trước tiên đánh giá một mẫu các cặp phản hồi và chỉ ra câu trả lời mà họ ưu tiên. Sau đó, Optima sẽ suy ra bảng xếp hạng đầy đủ trên toàn bộ tập dữ liệu thử nghiệm từ những ưu tiên đó.
Chi phí và tốc độ trở thành các chỉ số so sánh hàng đầu
Ngoài chất lượng mô hình thô, Optima còn theo dõi chi phí trên mỗi tác vụ và thời gian trên mỗi tác vụ như các chiều so sánh độc lập. Điều này giúp người dùng kiểm tra xem liệu sự cải thiện về hiệu suất có thực sự xứng đáng với chi phí cao hơn hoặc thời gian xử lý lâu hơn của một mô hình nhất định hay không.
Đối với các ứng dụng AI agent, giá token thô đơn thuần không nói lên nhiều điều. Một mô hình rẻ hơn có thể dẫn đến tổng chi phí cao hơn nếu nó cần thực hiện nhiều lần thử, thất bại thường xuyên hơn hoặc đòi hỏi thêm công việc chỉnh sửa. Chi phí trên mỗi tác vụ hoàn thành thường là con số có ý nghĩa hơn.
Theo Artificial Analysis, những người thử nghiệm sớm đã xây dựng các bộ benchmark cho các AI agent trong lĩnh vực tài chính và kế toán để tìm ra mô hình nào có thể cắt giảm chi phí gấp mười lần mà không làm giảm đáng kể chất lượng. Những người khác đã thử nghiệm xem mô hình nào phù hợp nhất với phong cách viết của luật sư hoặc xác định chính xác nhất các thành phần trong một tập dữ liệu hình ảnh độc quyền.
Theo Artificial Analysis, khi xây dựng và chạy các bộ benchmark, Optima chỉ tính phí chi phí token thực tế của các mô hình được sử dụng, không tính thêm phụ phí. Các đánh giá dựa trên thang điểm có giá 0,125 USD cho mỗi tiêu chí trên mỗi mô hình, và các đánh giá so sánh cặp có giá 0,375 USD cho mỗi lần so sánh. Khi bắt đầu tạo benchmark, mỗi lần chạy benchmark và mỗi vòng đánh giá, nền tảng sẽ giữ một số dư dựa trên ước tính chi phí. Việc thanh toán sau đó sẽ dựa trên mức sử dụng thực tế và chi phí đánh giá phát sinh.
Tại sao các bộ benchmark đa năng lại thiếu hiệu quả
Optima giải quyết một vấn đề nổi cộm với các bộ benchmark AI. Một phân tích của Epoch AI cho thấy kết quả benchmark phụ thuộc vào các chi tiết triển khai hiếm khi được công khai. Cách diễn đạt câu lệnh (prompt) và cài đặt nhiệt độ (temperature) khác nhau khiến cùng một mô hình đạt điểm số khác biệt đáng kể tùy thuộc vào cấu hình. Đối với các bộ benchmark cho AI agent như SWE-bench, việc chỉ cần thay đổi "scaffold" (tức là phần mềm điều khiển và môi trường công cụ của agent) đã tạo ra sự khác biệt lên tới 15 điểm phần trăm.
Một nghiên cứu rộng hơn xem xét 445 bài báo về benchmark từ các hội nghị AI hàng đầu đã tìm thấy nhiều vấn đề mang tính hệ thống hơn. Hầu hết các nghiên cứu đều có điểm yếu về phương pháp luận ở ít nhất một lĩnh vực, bao gồm định nghĩa không rõ ràng, mẫu không đại diện và thiếu kiểm chứng thống kê. Chỉ khoảng 10% các bộ benchmark được nghiên cứu sử dụng các tác vụ thực tế hoàn chỉnh phản ánh các kịch bản ứng dụng thực tế. Các khái niệm chính như suy luận (reasoning) hoặc căn chỉnh (alignment) thường được định nghĩa kém, làm hạn chế độ tin cậy của bất kỳ kết luận nào được rút ra từ chúng.
Optima có thể giải quyết vấn đề các bộ benchmark chung không nắm bắt được một trường hợp sử dụng cụ thể. Tuy nhiên, những thách thức sâu sắc hơn về phương pháp luận trong việc đánh giá vẫn còn đó. Ngay cả với một bộ benchmark được thiết kế riêng cho các tác vụ của bạn, tính hữu dụng của nó vẫn phụ thuộc vào việc các khả năng mục tiêu được xác định chính xác đến mức nào, các trường hợp thử nghiệm có tính đại diện ra sao, và việc đánh giá được triển khai cũng như ghi lại như thế nào.
Có một giới hạn khác cần lưu ý. Ngay cả chi phí và thời gian trên mỗi tác vụ cũng không cho bạn biết đầu ra đó thực sự có giá trị như thế nào đối với doanh nghiệp. Một quy trình làm việc AI rẻ và nhanh vẫn có thể không hiệu quả nếu kết quả của nó cần phải làm lại nhiều hoặc mang lại ít giá trị cho quy trình mà nó tham gia.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.