Thủ thuật
Tại sao tư duy coi LLM chỉ là 'máy dự đoán token tiếp theo' đã lỗi thời?
(giờ Việt Nam)
Tóm tắt AI
Tác giả lập luận rằng việc coi LLM chỉ là máy dự đoán token là cách hiểu phiến diện. Với sự hỗ trợ của RLHF và RLVR, các mô hình hiện nay đã vượt xa khả năng bắt chước văn bản thuần túy, hoạt động giống như các cỗ máy tìm kiếm giải pháp tối ưu thay vì chỉ sao chép dữ liệu huấn luyện.
Bản dịch AI
Blog của gmcgoldr
Xem hồ sơ GitHub của tôi
Nói một cách chính xác, nhận định “LLM là các bộ dự đoán token tiếp theo” không sai, nhưng chưa đầy đủ. Đó là một phép xấp xỉ bậc không khá ổn và có cơ sở thực tế: các mô hình ngôn ngữ dựa trên transformer phát ra các token theo cơ chế tự hồi quy (autoregressively):
Điều này chắc chắn có hình thái của thứ mà bạn có thể gọi là bộ dự đoán token tiếp theo. Trong quá trình tiền huấn luyện (pre-training), mô hình liên tục lấy một số token trước đó, nhìn vào token thực sự theo sau chúng và làm cho token đó có khả năng được lấy mẫu tiếp theo cao hơn. Về mặt khái niệm, vòng lặp huấn luyện trông giống như thế này:
Tất nhiên, make_more_likely (làm cho có khả năng hơn) đang đảm nhận một khối lượng công việc khổng lồ ở đây. Bên dưới lớp vỏ đó là các hàm mất mát (loss functions), gradient và cập nhật tham số, nhưng đối với bài viết này, chúng ta chỉ quan tâm đến hiệu quả tổng hợp của chúng: token thực sự xuất hiện tiếp theo trở nên có khả năng xảy ra cao hơn.
Điều quan trọng là mọi actual_next_token (token tiếp theo thực tế) đều đến từ một chuỗi hiện có trong training_data (dữ liệu huấn luyện). Có lẽ công bằng khi nói rằng mô hình cơ sở (base model) cũng hoạt động như một bộ dự đoán token tiếp theo: nó được huấn luyện để dự đoán các token tiếp theo khi chúng xuất hiện trong dữ liệu huấn luyện của nó.
Nhưng các LLM mà chúng ta sử dụng không chỉ là các mô hình cơ sở. Chúng đã được hậu huấn luyện (post-trained), và một phần quan trọng của quá trình hậu huấn luyện hiện đại là học tăng cường với phần thưởng có thể kiểm chứng (reinforcement learning with verifiable rewards - RLVR). Trong quá trình tiền huấn luyện, mô hình chỉ học từ các chuỗi đã tồn tại trong dữ liệu huấn luyện. Trong quá trình RLVR, mô hình khám phá bằng cách tạo ra các chuỗi mới và học hỏi từ kết quả của chúng. Về mặt khái niệm, vòng lặp huấn luyện RLVR trông giống như thế này:
make_more_likely đang thực hiện cùng một loại công việc trong cả hai vòng lặp, nhưng vì một lý do cơ bản khác nhau. Trong quá trình tiền huấn luyện, nó làm cho một actual_next_token có khả năng xảy ra cao hơn vì token đó đã xuất hiện trong dữ liệu huấn luyện. Trong quá trình RLVR, nó làm cho một explored_next_token (token tiếp theo được khám phá) có khả năng xảy ra cao hơn vì chuỗi được khám phá chứa nó đã mang lại phần thưởng cao.
Vì vậy, mặc dù một LLM đã qua hậu huấn luyện vẫn có hình thái của một bộ dự đoán token tiếp theo, phát ra từng token một, nhưng nó không còn chỉ học bằng cách dự đoán văn bản hiện có. Nó còn học từ các chuỗi mới được tạo ra thông qua quá trình tự khám phá của chính nó.
Phép ẩn dụ về cờ vua
Một công cụ chơi cờ giúp làm rõ sự khác biệt này hơn. Hãy tưởng tượng hai hệ thống cờ vua.
Hệ thống thứ nhất được huấn luyện trên một cơ sở dữ liệu lớn các ván đấu của các đại kiện tướng. Nó học các mô hình về cách các đại kiện tướng phản ứng với các vị trí bàn cờ khác nhau. Với một vị trí mới, nó dự đoán nước đi mà một đại kiện tướng có khả năng sẽ thực hiện tiếp theo. Đó là một bộ dự đoán nước đi tiếp theo.
Hệ thống thứ hai là một công cụ chơi cờ lý tưởng đã khám phá mọi ván đấu có thể xảy ra. Từ quá trình khám phá toàn diện đó, nó biết xác suất chiến thắng từ mọi vị trí bàn cờ có thể. Với một vị trí, nó chọn nước đi dẫn đến xác suất chiến thắng cao nhất. Không giống như hệ thống đầu tiên, nó không chỉ được huấn luyện trên các ván đấu mà các đại kiện tướng đã chơi. Nó còn học từ các ván đấu do chính nó tự khám phá và tạo ra.
Gọi hệ thống thứ hai là “bộ dự đoán nước đi tiếp theo” sẽ rất kỳ lạ. Nó không cố gắng dự đoán nước đi nào xuất hiện tiếp theo trong một tập dữ liệu. Nó đang cố gắng chọn một nước đi để giành chiến thắng.
Suy nghĩ kết luận
Tôi đã không đề cập đến các kỹ thuật hậu huấn luyện khác trong bài viết này, nhưng chúng cũng rất quan trọng. Ví dụ, học tăng cường từ phản hồi của con người (RLHF) chuyển hướng mô hình từ việc bắt chước dữ liệu tiền huấn luyện nói chung sang việc mô phỏng một trợ lý hữu ích. Và như chúng ta đã thấy trong bài viết này, RLVR còn tiến xa hơn nữa: nó cho phép một LLM khám phá và học hỏi từ những ý tưởng chưa từng thấy trong dữ liệu huấn luyện của nó.
Đó là lý do tại sao “bộ dự đoán token tiếp theo” là một mô hình tư duy sai lệch. Nó mô tả hình thái của cơ chế, token này được phát ra sau token kia, trong khi bỏ qua những gì mà cơ chế đó mã hóa. Một mô phỏng về một trợ lý hữu ích và kiến thức được khám phá thông qua quá trình tìm tòi đều có thể được mã hóa trong cùng một vòng lặp dự đoán token tiếp theo.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.