Nathan Lambert: Interconnects
92

Sản phẩm

Cẩm nang hậu huấn luyện (Post-training) mới nhất: 5 bài học thực chiến từ chuyên gia

(giờ Việt Nam)

Tóm tắt AI

Nathan Lambert vừa ra mắt cuốn sách đúc kết kinh nghiệm nhiều năm trong việc huấn luyện các mô hình mã nguồn mở, cung cấp 5 nguyên tắc cốt lõi giúp kỹ sư tối ưu hóa quy trình hậu huấn luyện.

Bản dịch AI

5 useful things you'll learn in my post-training textbook

Sau vài năm dài đằng đẵng dành thời gian để ghi chép lại những bài học từ việc huấn luyện các mô hình mở, cuốn sách về hậu huấn luyện (post-training) của tôi cuối cùng đã hoàn thành! Sách được xuất bản bởi Manning với tựa đề Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs.

Kể lại câu chuyện về cuốn sách này là một cách hữu ích để giải thích lý do tại sao bạn có thể muốn sở hữu một bản sao.

Cuốn sách khởi đầu từ một trang web nơi tôi muốn ghi lại các phương pháp hậu huấn luyện then chốt mà dường như không có tài liệu trực tuyến nào giải thích về chúng. Nếu có, tôi cũng không thể tìm thấy. Tình trạng này xảy ra với nhiều chủ đề hơn bạn tưởng, ngay cả khi hậu huấn luyện đã trở nên phổ biến vào năm 2024 (thời điểm tôi mua tên miền) và vẫn tiếp diễn cho đến ngày nay. Các chủ đề như rejection sampling, outcome reward models và character training là những ví dụ điển hình. Điều này đã giúp trang web trở nên khá phổ biến, vì đây vẫn là một trong số ít những nơi thảo luận về các chủ đề này theo cách nền tảng và trực quan.

Ngoài ra, phần lớn cuốn sách tập trung vào việc truyền tải các trực giác và lịch sử. Phần lớn ngành công nghiệp LLM được định hình bởi các kỹ thuật cốt lõi không thay đổi nhiều trong vài năm qua. Cuốn sách này là nỗ lực của tôi nhằm giải thích bằng ngôn ngữ đơn giản lý do tại sao hậu huấn luyện lại hiệu quả, những đánh đổi mà mọi người cần thực hiện để làm đúng, và những quan niệm sai lầm mà mọi người thường mắc phải. Để làm được điều này, một số bài đăng blog nền tảng cũ hơn trên Interconnects đã được biên soạn lại để xâu chuỗi câu chuyện đằng sau các chủ đề toán học then chốt. Vì lý do này, phần lớn văn phong giải thích có lẽ mang tính cá nhân hơn so với một cuốn sách giáo khoa thông thường.

Đây chính là cuốn sách mà tôi đã rất muốn đọc khi mới bắt đầu vài năm trước! Với việc ngày càng có nhiều người hỏi tôi những câu hỏi cơ bản về hậu huấn luyện — thực tế là một cộng đồng đang tăng trưởng nhanh chóng — tôi tin rằng cuốn sách này sẽ được đón nhận nồng nhiệt. Tôi vẫn thường xuyên sử dụng cuốn sách này và nghe các nhà nghiên cứu kỳ cựu trong ngành chia sẻ rằng họ cũng làm như vậy. Vì thế, đây không phải là cuốn sách dành cho người mới bắt đầu — nó phù hợp hơn với những ai đã hoàn thành bằng cử nhân ngành Khoa học máy tính — nhưng nếu bạn nắm vững nó, bạn sẽ vượt xa trong thế giới quan về hậu huấn luyện.

Chia sẻ

Cuốn sách cũng được cung cấp miễn phí trực tuyến và đi kèm với một khóa học đầy đủ kéo dài 12 giờ (slide + video trên YouTube), một cơ sở mã nguồn đơn giản với các bài tập gợi ý, và các so sánh hoàn thiện mô hình. Sách đang được giảm giá 50% cho đến ngày 19 tháng 8 trên Manning với mã PBLambert.

Mua sách của tôi từ Manning

Mua sách của tôi trên Amazon

Vâng, tiêu đề của cuốn sách này có hơi lỗi thời một chút — tôi đã rút ra được vài bài học và trải qua vài cuộc tranh luận trong quá trình xuất bản — nhưng tôi đảm bảo nội dung vẫn rất mới mẻ. Tôi thường xuyên tham khảo cuốn sách cho công việc nghiên cứu của mình và nghe bạn bè nói rằng họ cũng làm điều tương tự. Tôi đã thêm một phần về on-policy distillation vào phút chót! Sách hiện đang được vận chuyển từ Manning và Amazon Mỹ, và từ Amazon Anh vào tháng 10.

Xét về số từ hoặc số trang, cuốn sách dành khoảng 25% nội dung cho RL. Điều này có vẻ hợp lý. Nếu có một điều mà cuốn sách này thực hiện được, đó là dạy mọi người cách tư duy về các thuật toán RL khác nhau. Trực giác này, từ định lý policy-gradient đến PPO và các phiên bản hiện đại như GSPO và CISPO, là yếu tố then chốt để hiểu liệu một thuật toán mới là giả mạo hay có tiềm năng (không có thuật toán mới nào được chứng minh là đúng ngay từ đầu).

Dưới đây là một ví dụ về trực giác mà bạn sẽ có thể nắm bắt sau khi đọc xong.

Ví dụ, đây là một hình ảnh thú vị mà chúng tôi đã lặp lại để hiểu về cơ chế cắt (clipping) trong PPO. Suy cho cùng, mục tiêu thay thế (surrogate objective) của PPO rút gọn lại thành sáu vùng. Chúng có thể được coi là hai gradient, khi lợi thế (advantage) cho một token là dương hoặc âm, tùy thuộc vào giá trị hiện tại của tỷ lệ chính sách (policy ratio). Đối với một mẫu riêng lẻ trong một chuỗi hoàn thiện, nó nằm ở đâu đó trên biểu đồ này. Nếu đó là bước gradient đầu tiên trong batch, nó bắt đầu tại 1 trên trục x (gradient luôn chảy), sau đó tùy thuộc vào cách tỷ lệ cập nhật sau khi thay đổi hành vi chính sách RL, gradient sẽ giữ nguyên hoặc trở thành 0 (đó là mục đích của các đối số cắt).

Figure 5: Visualization of the PPO objective J(\theta) as a function of the policy ratio \rho(\theta), for both positive and negative advantage. Within each panel, the three ratio regions are annotate

Trực giác này phản ánh rất sát cách các hệ thống được thiết kế để quản lý gradient và các vấn đề số học mà chúng thường gây ra. Phần về policy-gradient tập trung vào toán học khá kỹ lưỡng, bao gồm tất cả các thuật toán mà bạn có thể đã nghe nói đến trong 3 năm qua:

Đạo hàm Policy Gradient

Vanilla Policy Gradient

REINFORCE

REINFORCE Leave One Out (RLOO)

Proximal Policy Optimization (PPO)

Hiểu về mục tiêu PPO

Hàm giá trị và PPO

Group Relative Policy Optimization (GRPO)

Group Sequence Policy Optimization (GSPO)

Clipped Importance Sampling Policy Optimization (CISPO)

So sánh các thuật toán

Hầu hết RL hiện đại là một bài toán hệ thống nhằm cân bằng một vài vấn đề — dữ liệu off-policy đến mức nào, sự không khớp giữa huấn luyện và suy luận, và thông lượng (throughput). Thiết kế hệ thống cốt lõi, RL bất đồng bộ với các GPU riêng biệt cho người học (các GPU thực hiện các bước gradient) và các tác nhân (các GPU tạo ra các rollout trong môi trường), đã duy trì tương tự trong vài năm qua.

Các tác vụ đại lý (Agentic tasks) chỉ đang bổ sung thêm cơ sở hạ tầng trên nền tảng của những nguyên tắc cơ bản này. Cuốn sách được thiết kế để trở thành tài liệu đơn giản nhất để bắt đầu từ con số 0 về kiến thức RL cho LLM và sẵn sàng bắt tay vào tinh chỉnh các hệ thống. Nó bắt đầu với những điều cơ bản, chẳng hạn như giải thích dạng tổng quát của việc triển khai một thuật toán RL:

pg_loss = -advantages * ratio

Nó tiếp tục dạy bạn về tổng hợp hàm mất mát (loss aggregation) — ý tưởng đã khai sinh ra DAPO và Dr. GRPO như những biến thể GRPO sơ khai, quan trọng — và lấy mẫu quan trọng bị cắt (truncated importance sampling) — kỹ thuật được sử dụng để giúp PPO hoạt động trong các thí nghiệm RL ban đầu.

Kiến thức cơ bản về Policy-Gradient

Đánh đổi trong tổng hợp hàm mất mát

Hệ thống RL bất đồng bộ

Lấy mẫu quan trọng bị cắt

Ví dụ: PPO

Ví dụ: GRPO

Chia sẻ

Việc biết được một lĩnh vực đã hình thành như thế nào luôn khiến tôi thấy thú vị. Khi bạn trở thành một chuyên gia, việc hiểu rõ lịch sử lĩnh vực của mình hơn bất kỳ ai là điều cho phép bạn đưa ra những dự đoán tốt nhất (Bill Gurley cũng đưa ra lời khuyên tương tự trong cuốn sách gần đây của ông). Trong thời điểm các nền tảng của học sâu đang được xây dựng, như transformer, cốt lõi của hậu huấn luyện hiện đại cũng được sinh ra trong lĩnh vực căn chỉnh (alignment). Cuốn sách sẽ đưa bạn đi qua 3 kỷ nguyên: khi các nhà nghiên cứu học cách thực hiện RL trên các tùy chọn (preferences) nói chung cho đến khoảng năm 2018, dành vài năm học cách áp dụng nó vào các mô hình ngôn ngữ từ 2019 đến 2022, và từ năm 2023 trở đi là khai thác các ví dụ được thiết lập bởi ChatGPT. Giống như những người tiên phong trong việc mở rộng quy mô LLM, những người đã tạo ra lĩnh vực này một thập kỷ trước xứng đáng nhận được sự ghi nhận to lớn cho cách mà sự tiến bộ hiện đại đã diễn ra.

hậu huấn luyệnmô hình mởkỹ thuật AItài liệu AIphát triển AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Nathan Lambert: Interconnects. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.