Hugging Face: Blog
85

Tin ngành

TutorMoments: Liệu gia sư AI có biết khi nào nên hỗ trợ, khi nào nên để học sinh tự xoay xở?

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu từ AllenAI giới thiệu bộ dữ liệu TutorMoments, giúp tối ưu hóa thời điểm gia sư AI can thiệp để hỗ trợ học sinh hiệu quả mà không làm mất đi tư duy độc lập.

Bản dịch AI

TutorMoments: Do AI tutors know when to help and when to hold back?

Quay lại các bài viết

📄 Báo cáo kỹ thuật: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 Dữ liệu: https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 Mã nguồn: https://github.com/allenai/tutormoments

TutorMoments social copy - Google Docs-image-1 (2)

Hôm nay, chúng tôi giới thiệu bản xem trước của TutorMoments, một khung đánh giá để đo lường liệu các LLM tiên tiến có thể cân bằng một trong những sự đánh đổi khó khăn nhất trong giáo dục hay không: khi nào nên can thiệp để giúp đỡ học sinh và khi nào nên lùi lại để học sinh tự mình thực hiện nhiều công việc hơn.

TutorMoments là một phương pháp đánh giá dựa trên việc phát lại (replay-based), được xây dựng từ các phiên gia sư toán 1-kèm-1 thực tế. Các giáo viên toán giàu kinh nghiệm xem xét các bản ghi chép được thu thập từ một chương trình gia sư tại Hoa Kỳ và đánh dấu những thời điểm mà gia sư phải lựa chọn giữa việc làm cho bài toán trở nên dễ dàng hơn để bắt đầu hoặc thúc đẩy học sinh tự mình tư duy nhiều hơn. Sau đó, TutorMoments lấy bản ghi chép cho đến thời điểm quyết định đó, chuyển nó cho một mô hình ngôn ngữ và để mô hình này tiếp quản vai trò gia sư trong một phiên mô phỏng – với học sinh được đóng vai bởi một mô hình ngôn ngữ khác – để xem LLM gia sư sẽ làm gì.

Chỉ với chỉ dẫn "hãy gia sư thật tốt", chúng tôi nhận thấy các mô hình có xu hướng giúp đỡ quá mức bằng cách hỗ trợ quá nhiều và hiếm khi thúc đẩy học sinh tư duy sâu hơn. Việc làm rõ sự đánh đổi (khi nào nên giúp đỡ so với khi nào nên lùi lại) trong câu lệnh (prompt) của gia sư giúp cải thiện hiệu suất, nhưng nó không xóa bỏ được khoảng cách so với việc gia sư bởi con người – những người luôn điều chỉnh phù hợp với từng thời điểm, và các LLM vẫn khác biệt rất lớn về độ tin cậy khi đưa ra quyết định đó.

Là một phần trong cam kết nghiên cứu mở, chúng tôi phát hành bộ dữ liệu gồm các bản ghi chép gia sư đã được ẩn danh, mã nguồn để chạy quy trình phát lại của chúng tôi, và các bản phát lại của mô hình gia sư tại những thời điểm then chốt mà chúng tôi đã đánh giá để đảm bảo tính tái lập. Chúng tôi hy vọng TutorMoments mang đến cho các nhà giáo dục, nhà nghiên cứu và các đội ngũ xây dựng AI gia sư một cách sắc bén hơn để đặt câu hỏi về việc mô hình xử lý các quyết định sư phạm quan trọng nhất như thế nào—và giúp lĩnh vực này xây dựng các gia sư có khả năng thích ứng với từng học sinh thay vì làm thay công việc cho họ.

Điều gì tạo nên một gia sư giỏi?

Nếu bạn nhờ một gia sư toán giỏi giúp đỡ, bạn có thể sẽ nhận lại một câu hỏi như: "Em biết gì về yêu cầu của bài toán này?". Đó không phải là sự thiếu giúp đỡ – một phần của việc giảng dạy hiệu quả là chẩn đoán xem học sinh thực sự biết gì và cung cấp sự hỗ trợ đúng đắn cho họ ngay tại thời điểm đó. Việc tình nguyện hỗ trợ ngay lập tức sẽ tước đi của học sinh quá trình tư duy trí tuệ giúp họ học hỏi. Đôi khi sự hỗ trợ là cần thiết; những lúc khác, điều hiệu quả nhất lại là một cú hích để củng cố sự hiểu biết bằng cách giải thích một câu trả lời đúng.

Tuy nhiên, các mô hình ngôn ngữ được huấn luyện để trở nên hữu ích, và một trợ lý hữu ích thường có xu hướng làm phần khó thay cho bạn—giải thích khái niệm, liệt kê các bước và hướng dẫn bạn đến câu trả lời. Trong một phiên gia sư, điều đó có thể cắt ngắn quá trình "nỗ lực hiệu quả" (productive struggle)—sự giải quyết vấn đề đầy nỗ lực, đôi khi gây nản lòng mà nghiên cứu giáo dục từ lâu đã gắn liền với sự hiểu biết sâu sắc hơn.

Hầu hết các tiêu chuẩn đánh giá (benchmark) cho các mô hình ngôn ngữ đóng vai trò gia sư đều không nắm bắt được sự căng thẳng này. Chúng có xu hướng khen thưởng một hành vi cụ thể – ví dụ như không bao giờ đưa ra câu trả lời cho một bài toán, hoặc luôn đưa ra gợi ý – mà không tính đến việc liệu đó có phải là nước đi đúng đắn cho vị trí thực tế của học sinh trong quá trình hiểu bài hay không. Nhưng gia sư giỏi không phải là một hành vi cố định duy nhất mà bạn có thể xác định trên diện rộng. Đó là một quyết định dựa trên sự phán đoán: học sinh này cần gì, ngay lúc này, đối với bài toán này?

Cách thức hoạt động của TutorMoments

TutorMoments được xây dựng dựa trên dữ liệu gia sư thực tế. Bộ dữ liệu chúng tôi phát hành, TutorMoments-Preview, gồm 462 bản ghi chép văn bản đã được ẩn danh từ các phiên gia sư toán 1-kèm-1 thực tế với học sinh Hoa Kỳ từ lớp 2 đến lớp 7, với hơn 1.500 thời điểm then chốt được giáo viên chú giải và hàng nghìn chú giải văn bản tự do từ 27 giáo viên tại Hoa Kỳ. Các bản ghi chép đến từ một chương trình gia sư cường độ cao mà học sinh chủ yếu theo học tại các trường thuộc Title I, được chia sẻ theo điều khoản nghiên cứu đã được phụ huynh và người giám hộ đồng ý; tất cả dữ liệu đã được loại bỏ các chi tiết định danh, trước tiên bởi nhà cung cấp và sau đó thông qua một quy trình xử lý bổ sung có nhận diện toán học.

Tất cả các chú giải đều đến từ các giáo viên toán giàu kinh nghiệm, những người được chúng tôi yêu cầu đọc các bản ghi chép và đánh dấu các thời điểm học tập then chốt—ghi chú lại những gì đang diễn ra, gia sư đã làm gì và điều đó tác động thế nào đến học sinh. Mỗi thời điểm then chốt là một điểm quyết định nơi gia sư phải cân nhắc giữa việc tạo giàn giáo (scaffolding - làm cho bài toán dễ tiếp cận hơn) so với việc thúc đẩy sự nghiêm ngặt (đòi hỏi học sinh tư duy khó hơn).

TutorMoments hoạt động bằng cách tạm dừng bản ghi chép tại một trong những thời điểm then chốt đó và chuyển phiên làm việc cho một mô hình ngôn ngữ, mô hình này sẽ tiếp quản vai trò gia sư trong năm lượt tương tác với một học sinh mô phỏng. Chúng tôi gọi mỗi phần tiếp nối do mô hình tạo ra này là một bản phát lại (replay). Sau đó, một quy trình chấm điểm dựa trên LLM sẽ đánh giá mỗi bản phát lại dựa trên ba yếu tố: liệu mô hình có (1) tạo giàn giáo khi học sinh cần hỗ trợ, (2) thúc đẩy sự nghiêm ngặt khi học sinh sẵn sàng cho thử thách cao hơn, và (3) tránh tạo giàn giáo quá mức (giảm bớt thử thách nhiều hơn mức cần thiết).

Quy trình chấm điểm bắt đầu từ một "sự thật nền" (ground truth) do giáo viên xác định: đối với mỗi thời điểm then chốt, liệu nó đòi hỏi tạo giàn giáo hay đòi hỏi một cú hích cho sự nghiêm ngặt. Nhiều giáo viên đã chú giải mỗi thời điểm, và khi họ không đồng ý, chúng tôi lấy nhãn đa số—nếu ba giáo viên chú giải một thời điểm và hai người yêu cầu sự nghiêm ngặt trong khi một người yêu cầu tạo giàn giáo, thì sự thật nền là sự nghiêm ngặt. Một bộ phân loại LM riêng biệt được xác thực dựa trên các chú giải của giáo viên sau đó sẽ quyết định xem hành động thực tế của gia sư có khớp với yêu cầu của thời điểm đó hay không—một lượt tương tác "phù hợp" có nghĩa là hành động được phân loại của gia sư (tạo giàn giáo, thúc đẩy sự nghiêm ngặt, hoặc tạo giàn giáo quá mức) khớp với những gì giáo viên đánh giá là thời điểm đó yêu cầu.

Kết quả sơ bộ

Chúng tôi đã chạy bảy LLM thông qua TutorMoments bằng cách sử dụng hai câu lệnh: một câu lệnh đơn giản không đưa ra hướng dẫn thực sự – nó chỉ yêu cầu mô hình sử dụng những gì nó biết về việc gia sư giỏi để phản hồi học sinh – và một câu lệnh nhận thức đánh giá (evaluation-aware prompt) làm rõ sự đánh đổi giữa tạo giàn giáo, tạo giàn giáo quá mức và thúc đẩy sự nghiêm ngặt. Mỗi mô hình được chấm điểm dựa trên các thời điểm then chốt được rút ra từ các bản ghi chép gia sư, được chia đều giữa các thời điểm mà tạo giàn giáo là cách tiếp cận đúng và các thời điểm đòi hỏi sự nghiêm ngặt.

Mọi con số trong bảng là xếp hạng từ 0 đến 1 – tỷ lệ các thời điểm liên quan mà mô hình đã thực hiện hành động phù hợp – vì vậy điểm số cao hơn có nghĩa là mô hình đưa ra quyết định đúng thường xuyên hơn. Ví dụ, 0,50 về sự nghiêm ngặt phù hợp có nghĩa là mô hình đã thúc đẩy sự nghiêm ngặt trong một nửa số thời điểm đòi hỏi điều đó.

Một vài điều cần lưu ý khi đọc điểm số:

Gia sư con người là một tham chiếu tự nhiên, không phải là mức trần. Chúng tôi không coi gia sư con người là mô hình thực hành lý tưởng—ngay cả những gia sư giàu kinh nghiệm cũng đưa ra những lựa chọn không tối ưu tại một thời điểm nhất định. Được chấm điểm theo cùng một cách tại cùng các điểm quyết định, các gia sư con người trong bản ghi chép của chúng tôi đạt 0,458 (tạo giàn giáo phù hợp), 0,182 (sự nghiêm ngặt phù hợp) và 0,496 (tránh tạo giàn giáo quá mức)—tất cả đều thấp hơn điểm số theo câu lệnh nhận thức đánh giá của các mô hình và nằm trong khoảng điểm số của câu lệnh đơn giản. Nhưng đây không phải là khẳng định rằng AI gia sư vượt trội hơn giáo viên con người. Những người chú giải đã đặc biệt tìm kiếm những thời điểm mà việc gia sư có thể đã diễn ra tốt hơn, vì vậy bộ dữ liệu tập trung vào các cơ hội bị bỏ lỡ thay vì thực hành lý tưởng.

Điểm số đo lường hành vi của gia sư, không phải việc học. Các bản phát lại sử dụng một học sinh "oracle" (giả định) mô phỏng, vì vậy các con số phản ánh cách một mô hình hành động tại một điểm quyết định—chứ không phải liệu một học sinh thực sự có học được hay không.

Sự nghiêm ngặt khó đo lường hơn tạo giàn giáo. Quy trình chấm điểm phát hiện các cú hích về sự nghiêm ngặt kém tin cậy hơn, và có ít thời điểm nghiêm ngặt hơn (260) so với các thời điểm tạo giàn giáo (738) trong các chú giải cơ sở.

TutorMoments social copy - Google Docs-image-2 (1)

Mô hình rõ ràng nhất trong bảng là mức độ quan trọng của câu lệnh: mọi mô hình đều đạt điểm cao hơn khi sử dụng câu lệnh nhận thức đánh giá so với câu lệnh đơn giản. Điều đó cho thấy hành vi "trợ lý hữu ích" mặc định của một mô hình là chưa đủ để gia sư tốt. Nhưng việc làm rõ sự đánh đổi trong câu lệnh cũng chỉ có giới hạn—mặc dù nó nâng cao mọi điểm số, các mô hình vẫn khác biệt rất lớn trong cách chúng diễn giải câu lệnh nâng cao và ngay cả những mô hình đạt điểm cao nhất vẫn còn nhiều dư địa để cải thiện.

Chúng tôi cũng phân tích các nước đi mà gia sư đã thực hiện trong mỗi kịch bản. Trong khi việc gợi ý khuyến khích các mô hình thúc đẩy sự nghiêm ngặt, chúng sử dụng ít chiến lược hơn con người, thường dựa vào việc yêu cầu học sinh giải thích câu trả lời của mình. Ngược lại, gia sư con người sử dụng các chiến lược đa dạng hơn và có nhiều khả năng lùi lại để học sinh làm việc độc lập hơn.

Hạn chế và các bước tiếp theo

TutorMoments vẫn đang trong giai đoạn đầu phát triển và có một số hạn chế ở giai đoạn này. Hạn chế lớn nhất là đánh giá tự động cung cấp cho chúng ta tín hiệu về cách một mô hình hành xử tại một điểm quyết định, nhưng nó không thể thay thế cho các nghiên cứu với học sinh thực tế và kết quả học tập thực tế. Bộ dữ liệu cũng còn hẹp: dựa trên bối cảnh Hoa Kỳ, chủ yếu là toán tiểu học và trung học cơ sở, được chú giải bởi một nhóm giáo viên duy nhất. Những phát hiện của chúng tôi có thể không khái quát hóa được cho các môn học, cấp lớp hoặc bối cảnh khác.

Chúng tôi chia sẻ bản xem trước này để thu thập phản hồi trong khi chúng tôi xây dựng một bộ dữ liệu đa phương thức lớn hơn, quy trình chấm điểm mạnh mẽ hơn và phân tích sâu hơn.

Lời cảm ơn

Dự án này đã được thực hiện một phần nhờ sự hỗ trợ từ Gates Foundation và Learning Commons.

Giáo dục AIGia sư AIAllenAIHọc tập cá nhân hóaTutorMoments
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.