Hacker News: AI bài nổi bật
85

Thủ thuật

So sánh GPT-5.6 Luna và GPT-6 Astra: Liệu mô hình giá rẻ 1,2 USD có đủ sức review code?

(giờ Việt Nam)

Tóm tắt AI

Entelligence thử nghiệm khả năng review code trên 50 PR công khai. Kết quả cho thấy GPT-6 Astra đạt độ chính xác 96% với chi phí 5,66 USD, trong khi GPT-5.6 Luna dù rẻ hơn đáng kể (0,2 USD) nhưng chỉ đạt độ chính xác 74%.

Bản dịch AI

GPT-5.6 Luna vs GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?

GPT-5.6 Luna có chi phí 0,20 USD cho mỗi triệu input token và 1,20 USD cho mỗi triệu output token. GPT-6 Astra có chi phí lần lượt là 10 USD và 50 USD. Đối với cùng một pull request, một lượt đánh giá của Luna tốn 0,0041 USD còn Astra tốn 0,113 USD, chênh lệch gấp 28 lần.

Bài viết trước của chúng tôi đã so sánh Astra với GPT-5.6 Sol. Lần này, chúng tôi muốn biết bạn sẽ phải đánh đổi những gì nếu mọi pull request đều được xử lý bởi mô hình rẻ nhất.

Câu trả lời ngắn gọn

Luna đã tìm thấy 69 lỗi được xác thực trên 50 pull request, trong khi Astra tìm thấy 92 lỗi. Luna tốn 0,20 USD cho toàn bộ quá trình chạy, còn Astra tốn 5,66 USD. Luna đưa ra kết quả sai thường xuyên hơn, với 24 trong số 93 phát hiện không vượt qua được bước xác thực (so với 4 trong số 96 của Astra), và nó chỉ tìm thấy 9 trong số 24 lỗi bảo mật, trong khi Astra tìm thấy 19.

Nhận định của chúng tôi: Với mức giá đó, Luna đủ tốt để phát hiện các lỗi logic thông thường hàng ngày, nhưng chúng tôi sẽ không để nó tự mình đánh giá các đoạn mã liên quan đến xác thực hoặc phân quyền.

Cách chúng tôi thực hiện

Chúng tôi tái sử dụng thiết lập từ bài viết so sánh Astra và Sol để đảm bảo các con số có thể đối chiếu với nhau.

Các pull request được sử dụng là 50 PR chuẩn công khai trong tổ chức AI-Code-Review-Evals, mỗi dự án Cal.com, Sentry, Discourse, Keycloak và Grafana đóng góp 10 PR. Mỗi PR đều chứa các lỗi được đưa vào so với một nhánh cơ sở sạch.

Luna và Astra nhận cùng một prompt trên cùng các diff. Prompt yêu cầu tìm các lỗi về tính đúng đắn, bảo mật, đồng thời (concurrency), tài nguyên và xử lý lỗi, đồng thời loại trừ các đề xuất về phong cách, đặt tên, tài liệu và kiểm thử. Mỗi mô hình đều trả về các phát hiện có cấu trúc.

Quy trình xác thực hoạt động tương tự như trước đây. Đối với mỗi pull request, các phát hiện từ Astra, Sol, Luna và các bình luận từ người đánh giá Entelligence công khai được đưa vào một danh sách ẩn danh. GPT-6 Astra và GPT-5.6 Sol sẽ đánh giá danh sách đó một cách độc lập dựa trên diff, nhóm các lỗi trùng lặp và quyết định xem mỗi vấn đề có phải là lỗi thực sự hay không. Một vấn đề chỉ được coi là đã xác thực khi cả hai giám khảo đều công nhận nó là lỗi thực. Họ đã đồng thuận với 91% các phát hiện và có 143 lỗi riêng biệt vượt qua được bước kiểm định của cả hai.

Việc bổ sung các phát hiện của Luna đã làm thay đổi tập dữ liệu mà các giám khảo xem xét, vì vậy mọi thứ đã được đánh giá lại từ đầu. Số lượng lỗi xác thực của Astra thay đổi từ 91 trong bài viết trước thành 92 trong bài này, và của Sol từ 107 thành 108. Astra cũng là một trong hai giám khảo, điều này có thể tạo ra một chút ưu thế cho nó. Phần hạn chế sẽ đề cập kỹ hơn về vấn đề này.

Kết quả

GPT-5.6 Luna

GPT-6 Astra

Lỗi đã xác thực

69

92

Phát hiện được đưa ra

93

96

Độ chính xác (Precision)

74%

96%

Tổng chi phí, 50 PR

0,20 USD

5,66 USD

Chi phí cho mỗi lỗi xác thực

0,0030 USD

0,061 USD

Thời gian trung bình mỗi lượt đánh giá

23 giây

36 giây

Số lượng output token trung bình mỗi lượt đánh giá

2.104

688

Scatter of total cost against verified bugs on a log cost axis. Luna at $0.20 and 69 bugs, Sol at 108 bugs, Astra at $5.66 and 92 bugs

Luna tìm thấy số lỗi xác thực bằng 75% so với Astra với chi phí chỉ bằng 3,6%. Tính trên mỗi lỗi xác thực, Astra tốn kém gấp 20 lần.

Luna viết số lượng output token mỗi lượt đánh giá gấp 3,1 lần so với Astra nhưng vẫn có chi phí rẻ hơn nhiều, vì giá output của nó thấp hơn 42 lần. Nó cũng nhanh hơn, với 23 giây mỗi lượt đánh giá so với 36 giây của Astra.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.