Thủ thuật
Dwarkesh đối thoại cùng Noam Brown: Hệ thống đa tác nhân, căn chỉnh và khả năng tự cải tiến của AI
(giờ Việt Nam)
Tóm tắt AI
Nhà nghiên cứu Noam Brown từ OpenAI chia sẻ góc nhìn chuyên sâu về tương lai của hệ thống đa tác nhân, các thách thức trong căn chỉnh AI và tiềm năng của việc tự cải tiến đệ quy.
Bản dịch AI

Tập mới với Noam Brown.
Chúng tôi thảo luận về multi-agent (đa tác nhân), Navier-Stokes, và việc sự bùng nổ tiến bộ toán học hiện nay cho chúng ta biết điều gì về những gì sẽ xảy ra khi bạn tự động hóa nghiên cứu AI.
Chúng tôi cũng thảo luận về cách làm thế nào để biết liệu các mô hình có thực sự được căn chỉnh (aligned) hay không trước khi chúng ta bắt đầu RSI (tự cải thiện đệ quy).
Xem trên YouTube; nghe trên Apple Podcasts hoặc Spotify.
Jane Street đã quan tâm đến AI từ lâu hơn bạn nghĩ, và không chỉ trong lĩnh vực giao dịch. Năm 2011, một năm trước khi AlexNet ra đời và hơn một thập kỷ trước khi ChatGPT được tung ra, họ đã tổ chức cuộc tranh luận FOOM đầu tiên giữa Eliezer Yudkowsky và Robin Hanson về việc liệu AI có dẫn đến một vụ nổ trí tuệ hay không. Hiện tại, Jane Street đang xem xét lại câu hỏi này với một hội đồng mới: Daniel Kokotajlo, Ege Erdil, Ryan Greenblatt và Jaime Sevilla, do Ron Minsky chủ trì tại San Francisco vào tháng 10 này. Tôi kỳ vọng đây sẽ là một cuộc trò chuyện thực sự xuất sắc. Đăng ký tại janestreet.com/dwarkesh
Grok Bot giúp việc bàn giao công việc trở nên vô cùng dễ dàng. Nó chạy trên đám mây riêng, nơi nó tự cài đặt các công cụ cần thiết để xử lý các tác vụ từ đầu đến cuối. Đối với podcast, chúng tôi sử dụng Grok Bot để hỗ trợ sản xuất video. Bạn có thể đã nhận thấy các quảng cáo của chúng tôi có các hình ảnh động về các trang web thực tế. Để đạt được độ chính xác từng pixel như vậy, trước đây chúng tôi phải tự chạy một quy trình làm việc phức tạp qua nhiều bước. Bây giờ, chúng tôi chỉ cần để Grok Bot xử lý. Tuyệt vời nhất là Grok Bot đã học được tất cả các thông số kỹ thuật và tùy chọn của chúng tôi, vì vậy chúng tôi không cần phải mô tả lại tác vụ mỗi lần nữa! Hãy tự mình trải nghiệm Grok Bot tại x.ai/bot
Antithesis mang đến cho bạn sự tự tin của một bộ kiểm thử (test suite) khổng lồ mà không cần phải thực sự viết nó. Giả sử bạn đang thực hiện một đợt tái cấu trúc backend lớn: việc xây dựng đủ các bài kiểm thử để tin tưởng vào nó có thể mất hàng tuần. Antithesis giải quyết vấn đề này bằng cách chạy phần mềm của bạn qua vô số thế giới mô phỏng, chèn các lỗi và săn tìm các thất bại. Trên bất kỳ PR nào, bạn có thể điều chỉnh để quyết định chính xác mức độ kiểm thử mà bạn muốn. Và vì mỗi lần chạy đều hoàn toàn xác định (deterministic), các tác nhân có thể phân nhánh ngay khi lỗi xuất hiện, tua lại, kiểm tra bộ nhớ và phát lại, tất cả trong khi bài kiểm thử gốc vẫn tiếp tục chạy. Tìm hiểu thêm tại antithesis.com/dwarkesh
(00:00:00) – Multi-agent và Navier-Stokes
(00:15:28) – Các công ty AI sẽ vận hành như thế nào?
(00:22:02) – Tiến bộ toán học cho chúng ta biết gì về tự cải thiện đệ quy (recursive self improvement)
(00:40:22) – Hugging Face và sự căn chỉnh (alignment)
(01:01:18) – Khoảng cách giữa mô hình nội bộ và bên ngoài
(01:08:34) – Chain of thought (chuỗi suy nghĩ) đang bị suy giảm
(01:14:12) – Làm sao để biết khi nào vấn đề căn chỉnh đã được giải quyết?
Dwarkesh Patel
Hôm nay, tôi đang trò chuyện với Noam Brown, một nhà nghiên cứu tại OpenAI. Anh ấy là một trong những người đóng góp nền tảng cho những gì đã trở thành o1 và các mô hình suy luận. Hiện tại, anh ấy đang làm việc về các hệ thống multi-agent. Nhân tiện, tuần trước các bạn đã thông báo rằng mình đã giải được một trong các bài toán Millennium Prize bằng một hệ thống gồm 10.000 tác nhân AI khác nhau, tiêu tốn 130 tỷ token trong 88 giờ.
Một trong những lý do tôi muốn trò chuyện với bạn là vì bạn là một trong những người đầu tiên, có lẽ là hai hoặc ba năm trước, đã suy nghĩ về việc các mô hình suy luận sẽ cho phép chúng ta nhìn thấy tương lai như thế nào. Bởi vì nếu bạn mở rộng quy mô tính toán suy luận (inference compute), bạn có thể thấy các khả năng cơ bản của các mô hình sẽ như thế nào trong vài năm tới.
Tôi cảm thấy bạn đang ở vị trí tương tự lúc này để giúp chúng tôi hiểu các khả năng trong tương lai sẽ trông như thế nào, dựa trên sự mở rộng quy mô khổng lồ về số lượng tác nhân mà chúng ta có thể thực hiện ngay bây giờ.
Noam Brown
Cách tôi suy nghĩ về vấn đề này là khi bạn vẽ biểu đồ hiệu suất của các mô hình suy luận này với test-time compute (tính toán trong thời gian kiểm thử) trên trục x và hiệu suất trên hầu hết mọi tiêu chuẩn suy luận trên trục y, bạn sẽ thấy một mô hình rất rõ ràng: các mô hình này càng mất nhiều thời gian để suy nghĩ về câu trả lời, chúng càng làm tốt hơn. Đây là một điều rất tự nhiên. Con người cũng vậy. Nếu bạn làm bài thi SAT và chỉ có 5 phút để hoàn thành toàn bộ bài thi, bạn sẽ không làm tốt lắm. Nếu bạn có 5 giờ, bạn có thể sẽ làm tốt hơn nhiều.
Các mô hình AI cũng khá tương tự. Chúng sẽ dành thời gian đó để độc thoại với chính mình, tìm hiểu mọi thứ, xem xét các trường hợp khác nhau, loại trừ các khả năng khác nhau và xây dựng dựa trên một số khám phá trước đó của chúng.
Vấn đề là khi bạn đẩy điều đó đi xa hơn nữa, bạn sẽ gặp phải nút thắt cổ chai về độ trễ (latency). Bạn không muốn ngồi chờ ba năm để nhận được phản hồi. Vì vậy, những gì bạn có thể làm là điều mà rất nhiều người đang thực hiện: song song hóa. Họ tập hợp một nhóm người. Nếu bạn định thành lập một công ty, bạn muốn tập hợp một nhóm người lại với nhau để có thể đi nhanh hơn. Với các mô hình AI này cũng vậy. Việc có nhiều tác nhân cùng làm việc trên một thứ gì đó sẽ giúp ích vì chúng có thể đi nhanh hơn.
Vì vậy, multi-agent là một cách để mở rộng quy mô test-time compute theo hướng song song thay vì hoàn toàn tuần tự. Nó kém hiệu quả hơn vì không phải một tác nhân đơn lẻ nào cũng có toàn bộ ngữ cảnh. Nhưng đó là một cách rất hiệu quả để mở rộng quy mô test-time compute nếu được thực hiện tốt.
Dwarkesh Patel
Tôi sẽ hỏi một loạt các câu hỏi ngây ngô. Đây là một mô hình chưa được phát hành, vì vậy chúng ta chưa công khai thấy các hệ thống này hoạt động như thế nào. Tôi chỉ có một vài điểm bối rối về các đặc tính định tính của những hệ thống như vậy.
Tôi bị sốc bởi quy mô nỗ lực nhận thức mà bạn có thể tập trung trong một khoảng thời gian ngắn như vậy. Hãy nghĩ về 130 tỷ token là gì. Nếu đó là một con người duy nhất suy nghĩ như một công việc toàn thời gian, nối tiếp nhau, 130 tỷ token sẽ tương đương với một người suy nghĩ trong 4.000 năm. Tám giờ một ngày, làm việc một tuần bình thường. Bắt đầu từ thời Sumer cổ đại cho đến ngày nay, một con người suy nghĩ tuần tự lâu như vậy, được tập trung lại trong 88 giờ.
Tôi cảm thấy về mặt định tính, đó là một cân nhắc cực kỳ quan trọng. Tôi ngạc nhiên rằng không có sự sụt giảm hiệu suất do song song hóa (parallelization penalty) lớn hơn. Bạn có thể chỉ cần 10.000 tác nhân cộng tác. Có lẽ vì các tác nhân cộng tác tốt hơn con người, chúng đang đi nhanh hơn nhiều. Chúng thực sự có thể cộng tác hiệu quả ở quy mô lớn như vậy. Hoặc có lẽ là có một sự sụt giảm hiệu suất do song song hóa đáng kể.
Noam Brown
Hãy nói về sự sụt giảm hiệu suất do song song hóa, sau đó chúng ta có thể nói về những thứ định tính. Sự thật là chúng ta chưa có nền khoa học vững chắc về việc mở rộng quy mô multi-agent lên mức này. Khi chúng tôi phát hành 5.6, tôi nghĩ đó là lần đầu tiên chúng tôi có một hệ thống multi-agent thực sự trong các mô hình của mình. Chúng tôi thực sự đã hiển thị một số biểu đồ trong bài đăng trên blog về hiệu suất mở rộng của các hệ thống multi-agent, vì chúng tôi có nó như một tùy chọn. Đó là Ultra Mode. Mặc định là bốn tác nhân, nhưng bạn có thể đặt cao hơn.
Trong biểu đồ, chúng tôi hiển thị hiệu suất trông như thế nào trên một số tiêu chuẩn cho một tác nhân, cho bốn tác nhân làm việc cùng nhau, cho 16 tác nhân làm việc cùng nhau. Nó phụ thuộc vào tiêu chuẩn, nhưng đối với một số tiêu chuẩn, bạn thấy rằng nếu bạn có bốn tác nhân làm việc trên cùng một vấn đề, nó được hoàn thành nhanh gấp đôi. Vì có bốn tác nhân làm việc trong thời gian bằng một nửa, bạn phải trả gấp đôi chi phí để nhận được câu trả lời nhanh gấp đôi. Nếu bạn tăng lên 16 tác nhân, bạn sẽ thấy một mô hình tương tự. Nó kém hiệu quả hơn một chút, nhưng bạn vẫn tiếp tục thấy hiệu suất đó.
Dwarkesh Patel
Đó là sự tăng tốc thời gian tuần tự tuyến tính hay sự tăng tốc dưới tuyến tính (sublinear) khi bạn tăng số lượng tác nhân song song?
Noam Brown
Nó hơi dưới tuyến tính một chút, mặc dù nó phụ thuộc rất nhiều vào vấn đề. Ví dụ, toán học khá là có thể song song hóa. Nó không phải là thứ dễ song song hóa nhất, nhưng nó rất có thể song song hóa. Tìm kiếm trên web, những thứ như thực hiện một báo cáo Deep Research nơi bạn phải xem qua một loạt các nguồn, là cực kỳ có thể song song hóa. Tôi nghi ngờ rằng một thứ gì đó như viết tiểu thuyết sẽ rất khó song song hóa. Bạn có lẽ sẽ không thấy lợi ích lớn từ việc có 10.000 tác nhân cùng viết một cuốn tiểu thuyết, giống như việc bạn có lẽ sẽ không nhận được lợi ích lớn từ việc có 10.000 người cùng viết một cuốn tiểu thuyết vậy.
Vì vậy, hiệu suất phụ thuộc vào lĩnh vực. Chúng tôi đo lường nó lên đến khoảng 16 tác nhân trong các bài đăng trên blog đã xuất bản. Vấn đề là rất khó để đẩy nền khoa học đó lên 10.000 tác nhân vì nó quá đắt đỏ.
Dwarkesh Patel
Các bạn vừa làm điều đó trong một ngày cuối tuần.
Noam Brown
Nhưng đó chỉ là một điểm dữ liệu. Chúng tôi không biết một tác nhân đơn lẻ sẽ mất bao lâu để giải Navier-Stokes, vì chúng tôi chưa thực hiện thí nghiệm đó. Có lẽ chúng tôi sẽ làm, nhưng đó cũng chỉ là một điểm dữ liệu mà thôi.

Bài viết được AI dịch và tổng hợp tự động từ Dwarkesh Patel: Podcast & Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.