OpenRouter: Announcements
88

Sản phẩm

OpenRouter ra mắt Ori Eval: Công cụ tự động chọn mô hình AI tối ưu cho dự án của bạn

(giờ Việt Nam)

Tóm tắt AI

OpenRouter giới thiệu Ori Eval, một tác nhân AI tự động quét mã nguồn và chạy đánh giá trên hơn 500 mô hình để tìm ra lựa chọn phù hợp nhất cho nhu cầu cụ thể của lập trình viên.

Bản dịch AI

Ori Eval: Prove the Best Model for What You're Building

Khi ngày càng có nhiều ứng dụng bổ sung chức năng AI, việc lựa chọn mô hình nào cho những gì bạn đang xây dựng vẫn là một bài toán khó, thậm chí còn khó hơn khi có hơn 500 mô hình để bạn lựa chọn.

Hiện tại, việc cố gắng tìm ra mô hình tốt nhất cho dự án của bạn thường dựa trên cảm tính, hoặc một bài đăng trên tweet (vốn cũng dựa trên cảm tính), hoặc kiểm tra các bảng xếp hạng (benchmarks), hoặc thậm chí bạn chẳng có phương pháp cụ thể nào cả.

Có thể bạn đang kiểm tra điểm số benchmark, đọc các thảo luận về mô hình mới nhất từ Trung Quốc. Các mô hình mới ra mắt hàng tuần, bạn bị choáng ngợp, và chính vì bị choáng ngợp, bạn không đưa ra lựa chọn nào (hoặc tệ hơn là đưa ra lựa chọn sai lầm).

Dù các tài nguyên trên có hữu ích đến đâu, không gì có thể cho bạn biết mô hình đó hoạt động như thế nào trong ứng dụng của bạn, trên hệ thống của bạn, trên dữ liệu của bạn và trên các câu lệnh (prompts) của bạn.

Cho đến hôm nay.

Tại OpenRouter, chúng tôi hiểu rõ về các mô hình.

Điều chúng tôi rút ra được là không có mô hình nào là tốt nhất tuyệt đối - chỉ có mô hình tốt nhất cho những gì bạn đang xây dựng.

Ori Eval giúp bạn tìm ra mô hình duy nhất đó và chứng minh điều đó cho bạn.

Để bắt đầu, hãy nói với agent của bạn:

Ori Eval sẽ hướng dẫn bạn cách chọn mô hình tốt nhất cho những gì bạn đang xây dựng như một người bạn kỹ sư thân thiện và giàu kinh nghiệm - không cần kinh nghiệm đánh giá (eval) trước đó.

Tóm tắt

Đặt câu hỏi, nhận câu trả lời (kèm bằng chứng)

Để sử dụng Ori Eval, bạn chỉ cần nói với coding agent yêu thích của mình:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval và làm theo hướng dẫn trong kết quả trả về.

Agent của bạn sẽ chuyển yêu cầu cho Ori Eval. Ori Eval khám phá codebase của bạn và đưa ra các câu hỏi. Trước khi chạy bất kỳ đánh giá nào, nó sẽ làm việc với bạn để xác định điều gì quan trọng đối với bạn — chi phí, hiệu suất, độ trễ, tốc độ, độ chính xác khi gọi công cụ (tool call), v.v. Sau đó, nó chọn ra 5 mô hình mới nhất phù hợp với yêu cầu của bạn và xác nhận lại với bạn.

Sau khi đã thu thập tất cả các yêu cầu cần thiết, Ori Eval sẽ viết một tệp review.eval.ts, chạy agent của bạn với các mô hình ứng viên song song và trả về một bảng kết quả:

Đề xuất đi kèm với lý do: ví dụ, tỷ lệ bắt lỗi hàng đầu trong tiêu chí chi phí mô hình của bạn, và lựa chọn tối ưu nếu khối lượng đánh giá lỗi tăng lên.

Đừng lo lắng nếu bạn chưa từng viết eval trước đây.

Viết các eval tốt không hề dễ dàng, đó là lý do tại sao chúng tôi xử lý phần khó chịu đó thay cho bạn.

Ori Eval quét codebase của bạn để tìm mọi nơi mà mô hình đang chạy và hiển thị cho bạn những gì nó tìm thấy: phạm vi sử dụng, tệp tin chính xác và mô hình bạn đang sử dụng ở đó. Sau đó, nó hỏi bạn muốn eval bao phủ những phần nào và điều gì quan trọng nhất với bạn: độ chính xác, tốc độ, chi phí hay thứ gì khác?

Khi Ori Eval hoàn tất việc phỏng vấn bạn, nó sẽ viết tệp eval từ các câu trả lời của bạn và chạy nó.

Dễ dàng như vậy thôi.

Điểm số nhất quán, chạy lần nào cũng như lần nào

Vì Ori Eval là một agent, nó có thể cố định hệ thống (harness), mô hình và nỗ lực trong suốt quá trình chạy. Nó cũng được tinh chỉnh sẵn: chúng tôi đã chọn sẵn hệ thống và mô hình hoạt động tốt nhất cho công việc đánh giá, vì vậy bạn không cần phải làm điều đó.

Một bài đánh giá (eval) kiểm tra ba điều

Tệp eval là một tệp *.eval.ts chạy với bun test. Nó kiểm tra các công cụ mà agent đã gọi, các công cụ nó đã bỏ qua và chất lượng của câu trả lời:

Đối với các câu trả lời mở, một LLM-as-a-judge (LLM đóng vai trò giám khảo) sẽ chấm điểm đầu ra. Ori Eval giúp bạn thiết lập tiêu chí chấm điểm và điểm số tối thiểu, vì vậy ngay cả những câu hỏi mở hóc búa cũng có thể được đánh giá.

Mọi lỗi đều trở thành thứ bạn có thể kiểm thử

Hãy nói với Ori Eval về một lỗi bằng ngôn ngữ thông thường: ví dụ, một nhân viên hỗ trợ đang hoàn tiền mà không kiểm tra đơn hàng trước — một vấn đề khá lớn.

Ori Eval viết một eval khẳng định rằng lookup_order phải được gọi. Eval thất bại chứng minh rằng lỗi đó tồn tại. Sau đó, bạn sửa agent và eval sẽ vượt qua. Khẳng định này vẫn nằm trong bộ kiểm thử của bạn, vì vậy bạn sẽ luôn có thể bắt được lỗi đó.

Ngăn chặn hồi quy (regressions) và chạy lại khi lĩnh vực này thay đổi

Thêm ori eval vào quy trình GitHub Actions. Nó thoát giống như bun test, vì vậy các eval thất bại cũng sẽ làm hỏng bản build, và lỗi hồi quy sẽ không bao giờ lọt vào môi trường production.

Vì những gì Ori Eval viết chỉ là mã nguồn, bạn cũng có thể dễ dàng lên lịch để chúng chạy định kỳ. Một trong những người thử nghiệm beta sớm của chúng tôi hiện chạy so sánh mô hình hàng tháng. Khi một mô hình mới ra mắt và nó hoạt động tốt hơn mô hình hiện tại trong codebase của bạn, một PR sẽ được mở, và tất cả những gì bạn phải làm là merge nó và tận hưởng mọi lợi ích mà không cần phải suy nghĩ nhiều.

Bắt đầu

Nói với coding agent của bạn:

Chỉ vậy thôi.

Kỹ năng này cài đặt Ori (coding agent đã được tinh chỉnh của chúng tôi), yêu cầu bạn đăng nhập, phỏng vấn bạn và chạy eval. Nếu bạn sử dụng OpenRouter MCP server, hãy chạy /spawn-ori-eval thay thế và bỏ qua URL.

Để cài đặt Ori thủ công:

Sau đó chạy ori login. Việc chạy các eval cũng cần có Bun.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.