Tin ngành
Microsoft và UIUC ra mắt StudentSim: Dùng 'học sinh ảo' để tối ưu hóa AI gia sư
(giờ Việt Nam)
Tóm tắt AI
StudentSim tạo ra các bản sao kỹ thuật số của học sinh để cung cấp phản hồi nhanh, giúp AI gia sư học tập hiệu quả hơn. Hệ thống này vượt trội hơn cả GPT-4o trong việc mô phỏng lỗi sai và dự đoán hành vi học tập thực tế.
Bản dịch AI

Việc đào tạo một gia sư AI với một nhóm học sinh đông đảo và đa dạng là "cực kỳ tốn kém và mất thời gian", các tác giả viết trong bài báo của họ. Kết quả là, những cải tiến đối với các gia sư này đã tụt hậu so với những tiến bộ của các mô hình AI.
Các nhà nghiên cứu đề xuất sử dụng các bản sao kỹ thuật số của học sinh để cung cấp phản hồi nhanh chóng thay cho các em. Hệ thống của họ, được gọi là StudentSim, xây dựng một bản sao riêng biệt cho từng học sinh, ngay cả khi chỉ có rất ít dữ liệu về bài làm của người đó.
Các bản sao học sinh cần phải biết mắc lỗi và học hỏi từ sự hướng dẫn.
Theo các nhà nghiên cứu, các phương pháp hiện có chỉ giải quyết được một trong hai kỹ năng cần thiết. Một số mô hình học từ dữ liệu học sinh thực tế và tái tạo hành vi của học sinh một cách đáng tin cậy, nhưng chúng không thể sử dụng các giải thích của gia sư. Những mô hình khác là các mô hình ngôn ngữ được nhắc (prompt) để đóng vai học sinh. Chúng sẵn sàng làm theo các gợi ý của gia sư nhưng không thể mô phỏng được khả năng của học sinh mà chúng đại diện.
StudentSim biến cả hai kỹ năng này thành các mục tiêu có thể đo lường được. Nó đo lường mức độ tương đồng giữa câu trả lời của bản sao với câu trả lời của học sinh, bao gồm cả những lỗi sai điển hình, và mức độ sẵn sàng sửa đổi câu trả lời sau khi được gia sư hỗ trợ. Việc đào tạo gia sư cần cả một điểm khởi đầu thực tế và một học sinh mô phỏng biết phản hồi lại sự hướng dẫn.
Đào tạo theo hai giai đoạn giúp tận dụng dữ liệu học sinh hạn chế.
Trở ngại lớn nhất của các nhà nghiên cứu là thiếu dữ liệu. Trong tập dữ liệu viết tiếng Anh, học sinh trung bình chỉ viết ba bài luận, và hơn hai phần ba số học sinh viết từ năm bài trở xuống. Các nhà nghiên cứu cho biết, việc đào tạo một bản sao trực tiếp trên quá ít ví dụ như vậy sẽ thất bại vì mô hình bị quá khớp (overfit) với các ví dụ đó.

Thay vào đó, StudentSim đào tạo theo hai giai đoạn. Đầu tiên, một mô hình cơ sở học từ dữ liệu tổng hợp của tất cả học sinh trong một môn học. Nó học các lỗi phổ biến và cách học sinh sửa đổi câu trả lời sau gợi ý của gia sư.
Sau đó, các nhà nghiên cứu tùy chỉnh mô hình đó cho từng học sinh cụ thể bằng cách sử dụng ít ỏi các hồ sơ hiện có của người đó. Trên tất cả các môn học, hệ thống sử dụng mô hình ngôn ngữ Qwen3-4B-Instruct của Alibaba làm nền tảng.
StudentSim vượt trội hơn GPT-5.4 trong các môn cờ vua, tiếng Anh và toán học.
Các nhà nghiên cứu đã thử nghiệm phương pháp này trên 60 học sinh trong các môn cờ vua, tiếng Anh như một ngoại ngữ và toán học. Họ sử dụng các tập dữ liệu công khai chứa hồ sơ từ những người học thực tế. StudentSim vượt trội hơn mô hình ngôn ngữ GPT-5.4 lớn hơn trong cả ba môn học khi GPT-5.4 được yêu cầu đóng vai học sinh. Trong môn cờ vua, StudentSim dự đoán nước đi tiếp theo của người chơi chính xác gấp đôi và gần như luôn tuân theo sự hướng dẫn sửa lỗi. GPT-5.4 và các mô hình cờ vua chuyên dụng đều bị tụt lại phía sau.

Các nhà nghiên cứu cho biết mỗi phương pháp hiện có đều có điểm yếu riêng. GPT-5.4 tuân theo các gợi ý nhưng không tái tạo được những lỗi sai cụ thể của học sinh. Các mô hình cờ vua khớp với hành vi của người chơi nhưng không thể hiểu các gợi ý bằng lời và thường bỏ qua chúng. Trong một thế cờ, ba người chơi thực tế đã chọn ba nước đi khác nhau. StudentSim tái tạo được lựa chọn của từng người chơi, trong khi một mô hình cờ vua lại dự đoán cùng một nước đi có khả năng xảy ra cao nhất cho cả ba. GPT-5.4 đã sai cả ba trường hợp.
Đào tạo với một học sinh mô phỏng giúp cải thiện gia sư cờ vua.
Như một bằng chứng về khái niệm khác, các nhà nghiên cứu đã sử dụng một bản sao học sinh để cải thiện một gia sư cờ vua. Các kỳ thủ chuyên nghiệp đã đánh giá ba phiên bản: một phiên bản không qua đào tạo này, một phiên bản được đào tạo với GPT-5.4 đóng vai học sinh, và một phiên bản được đào tạo với StudentSim.
Gia sư được đào tạo bằng StudentSim đạt điểm cao nhất trên cả ba tiêu chí. Nó mắc ít lỗi thực tế nghiêm trọng nhất và nhận được điểm cao nhất về chất lượng giải thích cũng như khả năng thích ứng với từng học sinh. Trong trường hợp này, học sinh ưu tiên các câu hỏi hướng dẫn họ đi đến lời giải hơn là các chỉ dẫn trực tiếp.
Gia sư được đào tạo với GPT-5.4 đạt điểm thấp hơn về độ chính xác thực tế so với gia sư không nhận được bất kỳ sự đào tạo bổ sung nào.
Các nhà nghiên cứu cho biết đây chỉ là bằng chứng về khái niệm, không phải là tuyên bố đã xây dựng được gia sư tốt nhất. Cờ vua hoạt động như một trường hợp thử nghiệm vì một công cụ có thể đánh giá khách quan liệu một nước đi có tốt hay không trong bất kỳ thế cờ nào. Viết luận và toán học mở khó hơn vì chúng thiếu các hàm chấm điểm đáng tin cậy cho các câu trả lời tự do.
Tiếp theo, nhóm nghiên cứu muốn mô hình hóa cách học sinh tiếp thu, ghi nhớ và quên kiến thức qua nhiều phiên thực hành. Mã nguồn hiện đã có trên GitHub.
Các nhà nghiên cứu đã sử dụng các tác nhân AI để tái tạo khoảng 1.000 người thực vào năm 2024, dựa trên các cuộc phỏng vấn kéo dài hai giờ với mỗi người tham gia. Một nghiên cứu riêng biệt cho thấy các bản sao này có thể dễ mắc lỗi như thế nào. Chín mô hình ngôn ngữ mở được giao nhiệm vụ bắt chước hành vi người dùng trên X, Bluesky và Reddit đã trở nên kém chính xác hơn về nội dung khi chúng nghe có vẻ giống con người hơn.
Microsoft cũng đang thử nghiệm các gia sư AI với học sinh thực tế. Trong một dự án thí điểm tại Nigeria, học sinh đã làm việc với Copilot hai lần một tuần trong sáu tuần. Mức tăng điểm kiểm tra của các em tương đương với gần hai năm học tập bổ sung.
OpenAI và Google cung cấp các chế độ học tập riêng thông qua Study Mode và Guided Learning. Những chế độ này dựa trên các chỉ dẫn hệ thống và các mô hình được tinh chỉnh để giảng dạy, nhưng không mô hình nào duy trì hồ sơ của từng người học cụ thể. Nếu không có sự thích ứng đó, sự hỗ trợ của AI có thể gây hại đến hiệu suất. Các nghiên cứu cho thấy người dùng thực hiện kém hơn sau khi nhận sự hỗ trợ ngắn hạn từ AI so với những người tự làm việc ngay từ đầu.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.