Tin ngành
Cựu chuyên gia RL của ByteDance, Tiến sĩ Tôn Bằng, gia nhập StarDust Intelligence để thúc đẩy AI vật lý
(giờ Việt Nam)
Tóm tắt AI
Tiến sĩ Tôn Bằng, cựu chuyên gia học tăng cường tại ByteDance và lãnh đạo trung tâm tác tử tại Tencent Robotics X, đã chính thức gia nhập StarDust Intelligence nhằm hoàn thiện hệ sinh thái công nghệ Physical AI.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
02/09/2026 14:06:50 Nguồn: QbitAI
Ngày 2 tháng 9, Tiến sĩ Tôn Bằng (Sun Peng), cựu chuyên gia về học tăng cường (Reinforcement Learning) tại ByteDance và cựu lãnh đạo Trung tâm Tác nhân thông minh (Agent Center) tại Robotics X của Tencent, đã chính thức gia nhập StarDust Intelligence.
Ngày 2 tháng 9, Tiến sĩ Tôn Bằng, cựu chuyên gia về học tăng cường tại ByteDance và cựu lãnh đạo Trung tâm Tác nhân thông minh tại Robotics X của Tencent, đã chính thức gia nhập StarDust Intelligence. Ông sẽ tập trung phụ trách mảng nghiên cứu phát triển công nghệ và khám phá ứng dụng trong lĩnh vực học tăng cường cho robot.
Trong hai năm qua, các mô hình nền tảng cho robot chủ yếu giải quyết vấn đề "liệu có làm được hay không". Tuy nhiên, khi robot chuyển từ giai đoạn Demo sang triển khai thực tế và thương mại hóa, vấn đề đang chuyển dịch sang "liệu có thể thực hiện ổn định hay không". Làm thế nào để robot liên tục điều chỉnh chiến lược dựa trên kết quả thực thi thực tế cũng là yếu tố khiến học tăng cường quay trở lại tâm điểm chú ý của ngành.
Tôn Bằng đã gắn bó lâu năm với lĩnh vực học tăng cường (RL), tác nhân thông minh (Agent) và học tăng cường đa tác nhân (MARL), sở hữu kinh nghiệm nghiên cứu và thực tiễn công nghiệp trải dài từ học tăng cường cho robot, hệ thống RL phân tán quy mô lớn đến học tăng cường cho các mô hình lớn. Sự gia nhập của ông sẽ củng cố thêm vị thế của StarDust Intelligence trong mảng học tăng cường cho robot, đồng thời tạo sự phối hợp với các mô hình AI, hệ điều hành hiện thân (Embodied OS) và robot truyền động bằng dây (rope-driven robot), thúc đẩy robot học tập liên tục và không ngừng tiến hóa trong thế giới thực.
Theo tìm hiểu, sau khi gia nhập StarDust Intelligence, Tôn Bằng sẽ tiếp tục mở rộng đội ngũ học tăng cường cho robot, thúc đẩy việc nâng cao năng lực kỹ thuật và triển khai ứng dụng liên quan.

Từ Tencent đến ByteDance: Hơn một thập kỷ chuyên sâu về học tăng cường
Tiến sĩ Tôn Bằng tốt nghiệp Đại học Thanh Hoa, sau đó tiếp tục nghiên cứu sau tiến sĩ tại Đại học Cornell và Đại học Rutgers. Trong hơn mười năm qua, các nghiên cứu và thực tiễn công nghiệp của ông luôn xoay quanh học tăng cường và tác nhân thông minh, dần mở rộng từ học tăng cường cho robot sang hệ thống RL quy mô lớn và hậu huấn luyện mô hình lớn, hình thành nền tảng kỹ thuật kết hợp giữa nghiên cứu thuật toán và kỹ thuật hệ thống.
Trong thời gian đầu làm việc tại AI Lab và phòng thí nghiệm Robotics X của Tencent, Tôn Bằng từng giữ chức vụ lãnh đạo Trung tâm Tác nhân thông minh, triển khai các nghiên cứu về học tăng cường sâu và điều khiển robot. Ông từng sử dụng học tăng cường sâu và đối kháng để huấn luyện robot có bánh xe, đạt được khả năng bám đuổi mục tiêu chủ động từ đầu đến cuối (end-to-end); đồng thời phát triển các tác nhân AI cho trò chơi "StarCraft" là TStarBots và TStarBotX, đạt được những thành tựu quan trọng trong nghiên cứu môi trường trò chơi phức tạp bằng học tăng cường đa tác nhân (MARL).
Sau khi gia nhập ByteDance, Tôn Bằng đã mở rộng thực tiễn kỹ thuật từ thuật toán sang kỹ thuật hệ thống RL quy mô lớn. Ông chủ trì phát triển cơ sở hạ tầng học tăng cường cốt lõi ByteRL, hỗ trợ huấn luyện hiệu quả cho nhiều AI trò chơi tự phát triển. Đội ngũ của ông từng giành chức vô địch cuộc thi AI thẻ bài chiến thuật tại IEEE CoG 2023, và AI cho trò chơi "Hearthstone" do ông phát triển đã thể hiện trình độ cạnh tranh vượt qua cả những người chơi hàng đầu trong ngành.
Với sự trỗi dậy của các mô hình ngôn ngữ lớn (LLM), Tôn Bằng tiếp tục mở rộng những tích lũy về học tăng cường sang hậu huấn luyện LLM. Trong thời gian làm việc tại Byte AI Lab/ByteResearch, với tư cách là trưởng dự án, ông đã tham gia nghiên cứu và công bố phương pháp tinh chỉnh tăng cường ReFT (Reinforced Fine-Tuning) cùng tác nhân suy luận toán học DeltaProver; đồng thời tham gia sâu vào quá trình RLHF và tiền huấn luyện mô hình trong đội ngũ Seed, tích lũy kinh nghiệm chuyên sâu về căn chỉnh mô hình, tăng cường suy luận và lĩnh vực Agent.
Từ học tăng cường cho robot, hệ thống RL quy mô lớn, đến hậu huấn luyện mô hình lớn, lộ trình kỹ thuật của Tôn Bằng trong hơn mười năm qua luôn xoay quanh một vấn đề cốt lõi: Làm thế nào để tác nhân thông minh không ngừng học hỏi thông qua tương tác và phản hồi từ môi trường, đồng thời liên tục tối ưu hóa chiến lược của chính mình. Ngày nay, khi AI tiến từ thế giới số vào thế giới vật lý thực, năng lực này đang tìm thấy điểm rơi mới trong lĩnh vực trí tuệ hiện thân (Embodied AI).
Nhậm chức tại StarDust Intelligence: Tăng cường vòng lặp hậu huấn luyện cho robot
Đối với StarDust Intelligence, trong khi đang thúc đẩy xây dựng hệ thống công nghệ toàn diện "Mô hình AI + Embodied OS + Robot truyền động bằng dây", sự gia nhập của Tôn Bằng chính là mắt xích quan trọng để củng cố giai đoạn "sau huấn luyện" cho các mô hình robot.
Ngay từ khi thành lập, StarDust Intelligence đã kiên trì với triết lý "Design for AI", cho rằng cơ thể robot, dữ liệu và mô hình AI không nên được thiết kế tách rời. Trong vài năm qua, tư duy này đã dần hình thành một vòng lặp khép kín hoàn chỉnh bao gồm mô hình nền tảng và mô hình thương mại, tác nhân cộng sinh (front-end Agent) và hậu huấn luyện bằng học tăng cường.
Dòng mô hình nền tảng Lumo của StarDust Intelligence liên tục thúc đẩy khả năng hiểu, dự đoán và tạo hành động của robot đối với môi trường. Trong đó, Lumo-1 giúp robot hiểu được "tại sao" đằng sau các hành động; Lumo-2, với tư cách là mô hình hành động thế giới ẩn (implicit world action model) đầu tiên dành cho gia đình, đã tiên phong đưa vào Latent World Dynamics, dự đoán thế giới tương lai trong không gian ẩn trước khi tạo ra hành động. Tác nhân Philia ở phía trước tập trung vào bộ nhớ dài hạn, quản lý tác vụ, phối hợp đa robot và tương tác tự nhiên. Trong khi đó, học tăng cường – với tư cách là mắt xích quan trọng để mô hình nền tảng tiến tới triển khai thực tế quy mô lớn – đảm nhận nhiệm vụ giải quyết bài toán làm thế nào để robot học hỏi từ tương tác thực tế và phản hồi tác vụ, từ đó không ngừng tối ưu hóa chiến lược hành vi của chính mình.
Những tích lũy lâu năm của Tôn Bằng trong lĩnh vực học tăng cường cho robot, hệ thống RL quy mô lớn, cũng như RLHF, tinh chỉnh tăng cường và Agent cho mô hình lớn sẽ tiếp tục củng cố năng lực kỹ thuật của StarDust Intelligence ở mắt xích này. Trong tương lai, ông sẽ tham gia xây dựng các mô hình hiện thân, học tăng cường cho robot và hệ thống hậu huấn luyện của StarDust, khám phá cách thức kết hợp các phương pháp hậu huấn luyện bằng học tăng cường đã được kiểm chứng trong kỷ nguyên mô hình lớn với việc thực thi trên robot thực tế, vòng lặp dữ liệu và triển khai dài hạn.
Chia sẻ về việc gia nhập StarDust Intelligence, Tôn Bằng cho biết: "Trong hơn mười năm qua, tôi luôn làm việc với học tăng cường và tác nhân thông minh, đồng thời chứng kiến quá trình học tăng cường chuyển mình từ điều khiển robot, trò chơi phức tạp sang hậu huấn luyện mô hình lớn. Giờ đây, tôi rất muốn mang những tích lũy này trở lại thế giới vật lý. StarDust Intelligence đã sở hữu nền tảng kỹ thuật hoàn chỉnh từ thân robot, Embodied OS đến mô hình AI. Điều tôi mong đợi nhất sắp tới là cùng đội ngũ đưa học tăng cường hòa nhập sâu hơn vào quá trình huấn luyện và triển khai robot thực tế, để robot không chỉ 'học được một tác vụ', mà còn có thể thực hiện tác vụ ngày càng tốt hơn qua từng lần thực thi và phản hồi thực tế."
Bài viết này do StarDust Intelligence cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền thuộc về tác giả, không được phép sao chép hoặc sử dụng dưới bất kỳ hình thức nào nếu chưa được ủy quyền, mọi hành vi vi phạm sẽ bị xử lý theo pháp luật.





Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.