IT Home
85

Nghiên cứu

Nghiên cứu mới từ Đại học Cardiff: AI vẫn chưa thể chấm điểm bài tập thay thế giáo viên

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu cho thấy ChatGPT chấm điểm bài luận thiếu ổn định, thường cho điểm cao hơn thực tế và không thể thay thế sự đánh giá chính xác của con người.

Bản dịch AI

Theo tin từ IT ngày 24 tháng 8, trích dẫn báo cáo từ Phys.org cùng ngày, một nghiên cứu mới từ Đại học Cardiff và Đại học Melbourne đã phát hiện ra rằng trí tuệ nhân tạo tạo sinh (GenAI) hiện vẫn chưa thể đánh giá các bài luận của sinh viên một cách đáng tin cậy như giảng viên con người.

Các nhà nghiên cứu đã sử dụng hai phiên bản của ChatGPT để chấm điểm 50 bài luận của sinh viên chuyên ngành khoa học sinh học nhằm kiểm tra khả năng đánh giá bài tập của các mô hình ngôn ngữ lớn (LLM). ChatGPT được yêu cầu chấm điểm các bài luận này dựa trên 7 tiêu chí, đồng thời các nhà nghiên cứu cũng áp dụng 4 phương pháp nhắc lệnh (prompt) khác nhau, sau đó so sánh kết quả của mô hình với điểm trung bình và mức độ biến động điểm số từ các giám khảo là con người.

Tiến sĩ William Kay từ Trường Khoa học Sinh học thuộc Đại học Cardiff chỉ ra rằng: "Kết quả nghiên cứu cho thấy điểm số do mô hình đưa ra có sự biến động rất lớn và không thể dự đoán chính xác điểm số của con người. Có sự khác biệt rõ rệt khi GenAI và con người cùng chấm một tập bài luận. Nếu chỉ nhìn vào tổng điểm, kết quả của cả hai tương đối gần nhau; nhưng một khi đi sâu vào từng tiêu chí đánh giá và từng bài luận cụ thể, khoảng cách giữa điểm số của mô hình lớn và con người trở nên khá rõ ràng."

Ngoại trừ một trường hợp, điểm trung bình do các mô hình AI đưa ra nhìn chung đều cao hơn so với điểm của con người. Về điểm trung bình, khoảng cách lớn nhất giữa mô hình AI và con người lên tới 16,1 điểm; xét riêng từng bài luận, khoảng cách này có thể lên tới 40 điểm.

IT được biết, Tiến sĩ William Kay cũng phát hiện ra rằng AI thường có xu hướng hạ thấp điểm của các bài luận xuất sắc và nâng điểm của các bài làm kém, dẫn đến việc điểm số bị tập trung một cách hệ thống vào mức trung bình.

Kết quả nghiên cứu cho thấy, ít nhất là ở giai đoạn hiện tại, ngay cả khi đã được huấn luyện với lượng dữ liệu khổng lồ, AI vẫn không thể đưa ra điểm số đáng tin cậy và tương đương với con người đối với các bài luận mang tính chủ quan cao. "Các mô hình lớn mà chúng tôi thử nghiệm hiện không phù hợp để thay thế giáo viên trong việc dự đoán điểm số bài tập cho sinh viên."

Các nhà nghiên cứu chỉ ra rằng, lĩnh vực giáo dục đại học thực sự rất quan tâm đến việc liệu các mô hình lớn có thể tận dụng khả năng nhận dạng mẫu để giúp việc chấm điểm bài tập khách quan hơn, đồng thời tăng hiệu quả chấm bài và giảm áp lực cho giảng viên hay không. Tuy nhiên, nghiên cứu này cho thấy hiện tại chưa phải là lúc thích hợp để thực hiện điều đó.

Ngoài ra, việc gửi bài tập của sinh viên vào các công cụ AI mà không có sự đồng ý rõ ràng của họ còn liên quan đến các vấn đề đạo đức; các mô hình lớn cũng không thể và không nên bị phụ thuộc trong việc chấm điểm các bài luận dài của sinh viên. "Khi các mô hình lớn tiếp tục phát triển, khả năng bắt chước phán đoán của con người trong tương lai có thể sẽ được cải thiện. Nhưng xét từ nghiên cứu này, để điểm số do AI đưa ra thực sự nhất quán với đánh giá của con người e rằng không hề dễ dàng."

AI trong giáo dụcChatGPTĐánh giá AINghiên cứu khoa họcCông nghệ giáo dục
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.