The Decoder: AI News
85

Nghiên cứu

Nghiên cứu tại ĐH Bocconi: GPT-4o giúp nâng điểm bài tập, nhưng lại làm lộ lỗ hổng trong cách đánh giá năng lực

(giờ Việt Nam)

Tóm tắt AI

Thí nghiệm trên 1.053 sinh viên cho thấy GPT-4o giúp bài làm logic và phong phú hơn, nhưng cũng đặt ra nghi vấn liệu điểm số cao là nhờ tư duy thực sự hay chỉ là khả năng tối ưu hóa cấu trúc của AI.

Bản dịch AI

The skills that earn top grades are the ones AI can fake best

ChatGPT đã cải thiện đáng kể kết quả học tập của sinh viên, trong khi một phương pháp can thiệp giảng dạy đã khuyến khích các giải pháp đa dạng và khác biệt hơn. Liệu AI có thực sự cải thiện khả năng học tập hay không vẫn là một câu hỏi còn bỏ ngỏ.

Điều gì tạo nên một bài làm tốt của sinh viên và AI có thể cải thiện những phần nào trong đó? Một thí nghiệm ngẫu nhiên với 1.053 sinh viên năm nhất tại Đại học Bocconi cho thấy GPT-4o đã giúp sinh viên đạt điểm cao hơn đáng kể trong một bài tập kinh doanh. Một bài học ngắn về tư duy nhân quả không làm tăng điểm số theo cách truyền thống, nhưng nó thúc đẩy sinh viên hướng tới các giải pháp đa dạng hơn và tư duy sâu sắc hơn về nguyên nhân, giả định cũng như cách thức các đề xuất của họ thực sự vận hành.

GPT-4o mang lại sự cải thiện lớn cho kết quả được chấm điểm

Vào tháng 11 năm 2025, 13 lớp của một khóa học quản trị nhập môn đã được chia ngẫu nhiên thành bốn nhóm: nhóm đối chứng, nhóm học bài học về tư duy nhân quả, nhóm được quyền truy cập GPT-4o và nhóm kết hợp cả hai. Sinh viên phải viết các đề xuất tiếp thị cho cửa hàng lưu niệm của trường đại học với độ dài tối đa 180 từ. Bài học bao gồm logic nhân quả mạch lạc, tính có thể kiểm chứng (falsifiability) và cách một hành động được đề xuất có thể dẫn đến kết quả mong muốn.

Sinh viên sử dụng GPT-4o đạt điểm cao hơn gần một điểm trên thang điểm 1-5. Câu trả lời của họ chứa trung bình nhiều hơn khoảng hai ý tưởng, mạch lạc hơn về mặt logic và sát với các đề xuất của ba chuyên gia trong ngành hơn. Ngay cả sau khi các nhà nghiên cứu kiểm soát các yếu tố như chất lượng lập luận, số lượng ý tưởng, sự đa dạng của ý tưởng và các đặc tính văn bản, lợi thế của GPT-4o vẫn có thể đo lường được. Các tác giả cho rằng điều này là do chất lượng nội dung cao hơn, chứ không phải do kiến thức của sinh viên tăng lên.

Bài học về tư duy nhân quả không làm tăng điểm số theo cách truyền thống. Bài làm của những sinh viên này thực tế có điểm trung bình thấp hơn một chút, nhưng họ thường xuyên giải thích lý do tại sao một hành động đề xuất lại hiệu quả và trong điều kiện nào nó có thể thất bại. Họ cũng tạo ra nhiều ý tưởng đa dạng hơn, khác biệt so với những gì bạn bè cùng lớp viết.

Việc kết hợp bài học với GPT-4o không mang lại thêm bất kỳ sự cải thiện nào cho điểm số truyền thống. Về các chỉ số tư duy nhân quả, hai phương pháp này bổ sung cho nhau và sự đa dạng ý tưởng cao hơn từ nhóm học bài học vẫn được duy trì.

ChatGPT access and critical thinking training had complementary effects on student work. ChatGPT alone mainly improved traditional scores, while the teaching intervention fostered causal reasoning and

Thang điểm chấm bài ưu tiên các câu trả lời thông thường

Nhiều ý tưởng hơn, lập luận mạch lạc hơn và sự đa dạng ý tưởng lớn hơn trong một câu trả lời đều tương quan với điểm số cao hơn. Tuy nhiên, tính có thể kiểm chứng mạnh hơn, giải thích chi tiết hơn về cách thức hoạt động của các hành động được đề xuất và sự khác biệt lớn hơn so với ý tưởng của các sinh viên khác lại tương quan với điểm số thấp hơn.

Điều đó không có nghĩa là tính nguyên bản bị phạt trên diện rộng. Đối với bài tập này, điểm số truyền thống chủ yếu khen thưởng các câu trả lời được cấu trúc tốt và nằm trong phạm vi giải pháp dự kiến. Các tác giả kết luận rằng tính đa dạng và nguyên bản cần được đưa vào tiêu chí chấm điểm một cách rõ ràng nếu muốn chúng được tính đến.

Nhưng các hệ thống chấm điểm hiện nay đo lường sự trau chuốt, cấu trúc và tính đầy đủ, chứ không phải khả năng học tập và hiểu biết. Điều đó khiến việc sử dụng AI như một công cụ gian lận trở nên dễ dàng.

Những gì nghiên cứu không chỉ ra được

Không có bài kiểm tra theo dõi nào yêu cầu sinh viên chứng minh những gì họ thực sự hiểu hoặc ghi nhớ mà không có ChatGPT. Các tác giả thừa nhận rõ ràng rằng vẫn chưa rõ liệu lợi thế từ GPT đến từ kiến thức mà sinh viên thực sự đạt được hay chỉ đơn giản là phản ánh kết quả đầu ra tốt hơn nhờ sự hỗ trợ của AI. Nghiên cứu cho thấy kết quả được chấm điểm cải thiện trong bài tập này, chứ không phải khả năng học tập được cải thiện.

Thí nghiệm chỉ xem xét sinh viên năm nhất tại một trường đại học duy nhất khi thực hiện một nhiệm vụ tiếp thị hẹp. Việc phân ngẫu nhiên diễn ra trên 13 lớp thay vì riêng lẻ giữa tất cả 1.053 sinh viên.

Điểm hiệu suất chính đến từ những người chấm điểm là con người, những người không biết mỗi văn bản thuộc về nhóm nào. Một số thước đo bổ sung như tư duy nhân quả và sự đa dạng ý tưởng được đánh giá bằng cách sử dụng các mô hình từ OpenAI và Anthropic.

OpenAI cung cấp công nghệ đang được nghiên cứu và đã tham gia vào quá trình nghiên cứu. Một số tác giả làm việc tại OpenAI hoặc đã từng được thuê ở đó trong quá trình nghiên cứu.

Các nghiên cứu khác đặt câu hỏi về những gì còn đọng lại sau khi AI không còn được sử dụng

Nghiên cứu cho đến nay cho thấy rõ ràng rằng vấn đề không nằm ở việc sinh viên có sử dụng AI hay không, mà là liệu nó hỗ trợ tư duy của chính họ hay thay thế nó. Khi AI thay thế tư duy, sinh viên sẽ chịu thiệt thòi.

Một nghiên cứu bao gồm hơn 500.000 điểm số đại học tại Mỹ cho thấy điểm số cao sau khi ChatGPT ra mắt tăng mạnh nhất ở các khóa học nặng về viết lách và lập trình với phần bài tập về nhà lớn. Các thí nghiệm có kiểm soát cho thấy sau khi AI bị loại bỏ, những người tham gia thực hiện kém hơn nhóm đối chứng. Sự sụt giảm mạnh nhất xảy ra ở những người chủ yếu sử dụng GPT để lấy câu trả lời trực tiếp.

Một nghiên cứu kéo dài 30 tháng trên hơn 26.000 sinh viên ở Trung Quốc cho thấy mô hình tương tự trong một khoảng thời gian dài hơn. Bài tập về nhà được hoàn thành tốt hơn và nhanh hơn với AI, nhưng điểm thi lại giảm. Trong các kỳ thi tuyển sinh sau đó, kết quả thấp hơn từ 18 đến 24 phần trăm trong dài hạn. Những sinh viên dành thời gian cho bài tập về nhà tương đương với những người không sử dụng AI, dù có quyền truy cập AI, đã không cho thấy sự sụt giảm tương tự.

Bất chấp bằng chứng ngày càng tăng này, OpenAI coi các kết quả chủ yếu là một thách thức đối với các hệ thống chấm điểm: nếu AI có thể tạo ra các bài làm trau chuốt, giống như chuyên gia, thì sản phẩm cuối cùng đơn thuần nói lên ít điều về những gì sinh viên thực sự hiểu. Các tác giả ủng hộ việc "khen thưởng sinh viên vì tạo ra các bài làm phản ánh tính nguyên bản, khả năng lập luận và xem xét nhiều phương pháp tiếp cận, thay vì chỉ là những câu trả lời thông thường hoặc trau chuốt nhất". Điều đó có thể đúng, nhưng thay đổi hệ thống chấm điểm có khả năng đồng nghĩa với việc thay đổi toàn bộ hệ thống giáo dục đi kèm.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

Giáo dụcAIGPT-4oĐánh giá năng lựcNghiên cứu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.