MarkTechPost
85

Sản phẩm

Supabase ra mắt bộ công cụ mã nguồn mở đánh giá năng lực lập trình của các AI Agent

(giờ Việt Nam)

Tóm tắt AI

Supabase giới thiệu Supabase Evals, khung đánh giá các AI lập trình như Claude Code hay Codex thông qua các tác vụ thực tế như xây dựng schema và sửa lỗi RLS, đi kèm bảng xếp hạng công khai.

Bản dịch AI

Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

Supabase vừa mã nguồn mở Supabase Evals, bộ tiêu chuẩn và khung đánh giá khả năng của các AI agent được xây dựng bằng Supabase. Công cụ này chạy các coding agent như Claude Code, Codex và OpenCode trên các tác vụ thực tế, chẳng hạn như xây dựng schema, gỡ lỗi Edge Function bị lỗi hoặc sửa chính sách RLS bị hỏng, sau đó chấm điểm kết quả. Nó cung cấp dữ liệu cho bảng xếp hạng công khai tại supabase.com/evals và một bộ kiểm thử hồi quy nội bộ được theo dõi hàng ngày.

Có thể triển khai được không?

Có, ngay hôm nay. supabase/evals được công khai theo giấy phép Apache-2.0 và chạy cục bộ thông qua pnpm.

Cách thức hoạt động của bộ công cụ

Supabase đã xác định ba khía cạnh: sản phẩm (database, auth, storage, edge-functions, realtime, cron, queues, vectors, data-api), chủ đề (RLS, security, migrations, SQL, SDK, observability, self-hosting, tests, declarative-schema) và giai đoạn (build, deploy, investigate, resolve). Sau đó, họ chọn tập hợp kịch bản nhỏ nhất chạm đến từng khía cạnh một lần, dựa trên các ticket hỗ trợ, báo cáo lỗi và các issue trên GitHub.

Các kịch bản được chia thành hai bộ. Các kịch bản Benchmark bao gồm phạm vi rộng và được công khai. Các kịch bản Regression bao gồm các kiểu lỗi đã biết, được làm mới hàng ngày và không làm thay đổi điểm số đã công bố.

Mỗi kịch bản chạy trên một môi trường thực tế. Khung này khởi động một stack giống như môi trường hosted và một dự án CLI cục bộ trong các container, vì vậy các agent sẽ gọi trực tiếp vào MCP server và CLI thực tế. Một runtime platform-lite cung cấp bề mặt tương thích với Management API được hỗ trợ bởi @supabase/lite. Việc chấm điểm kết hợp giữa các kiểm tra xác định (deterministic) và LLM-as-a-judge. Các agent được phép thử lại một lần trước khi chấm điểm.

Mỗi thư mục eval chứa PROMPT.md (tác vụ và frontmatter), EVAL.ts (bộ chấm điểm) và các trạng thái khởi đầu tùy chọn remote/ và local/. Việc gửi một workspace local/ hoặc khai báo interface: cli sẽ khởi động một Docker sandbox với CLI thực tế đã được cài đặt.

Kết quả thu được

Các agent vượt qua hầu hết các kịch bản mà không cần nạp thêm kỹ năng (skill). Ở giai đoạn Build, cả Opus 5 và Kimi K3 đều đạt 100% mà không cần hỗ trợ. Các kỹ năng đã giúp thu hẹp khoảng cách còn lại: Sonnet 5 tăng từ 78% lên 100%, GPT-5.6 Sol từ 89% lên 100% và GPT-5.4 mini từ 78% lên 89%.

Ba điểm yếu đã xuất hiện. Các agent tự viết migration thay vì sử dụng declarative schema, dẫn đến việc cần cập nhật hướng dẫn kỹ năng. Các agent xác thực auth thủ công thay vì sử dụng @supabase/server, dẫn đến việc cần có hướng dẫn chọn gói thư viện. Và việc sử dụng tài liệu (docs) khác biệt rõ rệt: Codex / GPT-5.6 đọc khoảng 8 trang tài liệu mỗi kịch bản so với khoảng 2 trang của Claude Code, vốn chỉ kiểm tra tài liệu trong chưa đầy 40% số kịch bản ngay cả khi đã nạp kỹ năng.

Những điểm chính cần lưu ý

Hãy xem chi tiết kỹ thuật và GitHub Repo. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar, v.v. của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.

SupabaseAI lập trìnhMã nguồn mởĐánh giá AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.