So sánh GPT-5.6 Luna và GPT-6 Astra: Liệu mô hình giá 1,20 USD có đủ sức đánh giá mã nguồn?
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Tác giả đã sử dụng 50 PR (Pull Request) chuẩn công khai từ tổ chức AI-Code-Review-Evals để so sánh hiệu suất đánh giá mã nguồn giữa GPT-5.6 Luna và GPT-6 Astra với cùng một câu lệnh (prompt) chuyên tìm lỗi. 50 PR này đến từ Cal.com, Sentry, Discourse, Keycloak và Grafana (mỗi nguồn 10 PR), tất cả đều được tạo ra bằng cách chèn lỗi vào các nhánh cơ sở sạch. Kết quả: Luna phát hiện được 69 lỗi, Astra phát hiện 92 lỗi; chi phí cho toàn bộ quy trình của Luna là 0,20 USD, trong khi Astra tốn 5,66 USD. Trong 93 phát hiện của Luna, có 24 lỗi không được xác nhận (độ chính xác 74%), còn Astra có 4 lỗi không được xác nhận trong tổng số 96 phát hiện (độ chính xác 96%).
Phương thức xác thực như sau: Các phát hiện từ Astra, Sol, Luna và các bình luận đánh giá công khai từ Entelligence được tổng hợp vào một danh sách ẩn danh. GPT-6 Astra và GPT-5.6 Sol sẽ đối chiếu với các diff (phần mã thay đổi) để đưa ra phán quyết; chỉ khi cả hai giám khảo cùng xác nhận thì lỗi đó mới được tính là hợp lệ. Hai mô hình thống nhất với nhau ở 91% các phát hiện, tổng cộng có 143 lỗi khác nhau được xác nhận. Tác giả lưu ý rằng việc bổ sung các phát hiện của Luna đã làm thay đổi tập dữ liệu mà giám khảo nhìn thấy, do đó tất cả đã được đánh giá lại: số lỗi xác nhận của Astra thay đổi từ 91 lên 92, của Sol từ 107 lên 108. Vì Astra cũng đóng vai trò là một trong hai giám khảo, kết quả có thể hơi nghiêng về phía mô hình này.
Xét theo kho mã nguồn, tại Sentry, Discourse và Grafana, số lỗi được xác nhận giữa Luna và Astra chênh lệch không quá hai; tại Cal.com khoảng cách lớn hơn với tỉ lệ 21 so với 30; Keycloak có khoảng cách lớn nhất khi Luna tìm được 6 lỗi xác nhận còn Astra tìm được 14, với độ chính xác của Luna tại Keycloak chỉ đạt 50% so với 93% của Astra. Theo loại lỗi, ở nhóm dữ liệu và logic, Luna đạt 39 so với 47 của Astra; nhóm đồng thời (concurrency) là 10 so với 13; nhóm bảo mật, Luna tìm được 9 trong tổng số 24 lỗi, còn Astra tìm được 19. Trong 143 lỗi được xác nhận, 44 lỗi được cả hai mô hình cùng phát hiện, 48 lỗi chỉ Astra tìm thấy và 25 lỗi chỉ Luna tìm thấy.
Các hạn chế được tác giả liệt kê bao gồm: ngoại trừ 10 PR lặp lại, mỗi mô hình chỉ đánh giá mỗi PR một lần, và việc chạy lại cho thấy kết quả có thể thay đổi giữa các lần thực thi; Astra vừa là thí sinh vừa là giám khảo nên dù yêu cầu Sol đồng ý có thể giảm bớt sai lệch nhưng không thể loại bỏ hoàn toàn; tất cả PR đều có trước thời điểm cắt dữ liệu huấn luyện của cả hai mô hình, do đó yêu cầu phân tách theo ngày tháng của độc giả không thể thực hiện; cả hai mô hình chỉ nhìn thấy diff, không có lịch sử kho lưu trữ, sơ đồ gọi hàm hay dữ liệu thực tế; số lỗi xác nhận chỉ là giới hạn dưới của các lỗi tồn tại. Tác giả cũng cho biết, nếu chạy cả hai mô hình trên mỗi PR, với tổng chi phí 5,86 USD (5,66 USD của Astra cộng 0,20 USD của Luna), có thể phát hiện 117 trong số 143 lỗi xác nhận (82%), tức là tìm thêm được 25 lỗi so với chỉ dùng Astra.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T3 · 15/09 · 08:34.
Diễn biến mới nhất
Xem chi tiết toàn cảnh sự việc tại đây.
Dòng thời gian đưa tin
Đang hiện 2 bài · tất cả · mới trước
T3 · 15/09
Đánh giá của Entelligence về GPT-5.6 Luna so với GPT-6 Astra: Liệu mô hình rẻ hơn 28 lần có thể đảm đương việc đánh giá mã nguồn?
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)Entelligence sử dụng 50 PR công khai từ AI-Code-Review-Evals để so sánh khả năng đánh giá mã nguồn giữa GPT-5.6 Luna và GPT-6 Astra.
So sánh GPT-5.6 Luna và GPT-6 Astra: Liệu mô hình giá 1,20 USD có đủ sức đánh giá mã nguồn?
Hacker News: AI bài nổi bậtEntelligence so sánh năng lực đánh giá mã nguồn của GPT-5.6 Luna và GPT-6 Astra trên 50 PR chuẩn công khai với cùng một câu lệnh. Kết quả: Luna tìm được 69 lỗi đã xác nhận (Astra là 92), tổng chi phí là 0,20 USD so với 5,66 USD, độ chính xác lần lượt là 74% và 96%.