MarkTechPost
85

Nghiên cứu

Induction Labs ra mắt Photon-1: Mô hình AI học chiến lược từ video không cần nhãn hành động

(giờ Việt Nam)

Tóm tắt AI

Photon-1 là mô hình MoE 106B tham số có khả năng học chiến lược ẩn chỉ qua video thô, vượt trội hơn Gemini 3.1 Flash-Lite với chi phí tính toán thấp hơn đáng kể.

Bản dịch AI

Induction Labs Photon-1 Simulates Desktops, Plays Checkers, and Models Billiard Physics From One Pretraining Run

Hầu hết các tác nhân (agent) học từ video đều cần biết hành động nào đã tạo ra từng khung hình. Induction Labs lập luận rằng yêu cầu này chính là nút thắt cổ chai. Tuần trước, họ đã ra mắt imagination models, một kiến trúc mô hình nền tảng được huấn luyện trước trên video thô mà hoàn toàn không cần nhãn hành động.

Hệ thống thử nghiệm của họ là Photon-1, một mô hình transformer mixture-of-experts (MoE) thưa thớt 106B-A5B, được huấn luyện trên 18 năm video mô phỏng thao tác máy tính. Trên một bộ tiêu chuẩn đánh giá (benchmark) nội bộ về khả năng sử dụng máy tính, Induction Labs báo cáo rằng Photon-1 vượt qua Gemini 3.1 Flash-Lite trong khi sử dụng ít tài nguyên tính toán huấn luyện trước hơn nhiều và chi phí vận hành rẻ hơn khoảng 3 lần.

Imagination model thực sự làm gì?

Một imagination model dự đoán các khung hình tương lai theo cơ chế tự hồi quy (autoregressive) bằng mục tiêu dự đoán token tiềm ẩn tiếp theo (next-latent-token-prediction). Nó không tạo ra pixel trong quá trình huấn luyện trước. Mọi thứ đều được mô hình hóa trong một không gian biểu diễn đã học.

Điểm quan trọng cần lưu ý là: việc dự đoán các trạng thái tương lai dạy cho mô hình cách hoàn thành nhiệm vụ, mặc dù nó không bao giờ nhìn thấy hành động nào trong quá trình huấn luyện trước. Induction Labs gọi đây là chính sách ngầm (implicit policy). Mô hình học các khái niệm về những gì con người đang làm, thay vì học nhãn cho từng cú nhấp chuột.

Thủ thuật nén giúp mô hình mở rộng quy mô

Kiến trúc này phụ thuộc vào một bộ mã hóa thị giác (vision encoder) sử dụng kỹ thuật lượng tử hóa vô hướng hữu hạn (FSQ). Mỗi khung hình được nén thành 960 token rời rạc. Mỗi token là một vector 8 chiều. Mỗi chiều nhận một trong năm giá trị: −1, −1/2, 0, 1/2, 1. Điều đó tạo ra một bộ mã (codebook) gồm 5⁸ mã khả thi.

Kết quả mã hóa là khoảng 2,2 KB mỗi khung hình. Induction Labs báo cáo mức nén tốt hơn gấp 100 lần so với các biểu diễn OCR và mô hình đa phương thức hiện có, trong khi vẫn bảo toàn được văn bản, bố cục và các thay đổi trạng thái.

Để đạt được tốc độ đó, Photon-1 sử dụng bộ mã hóa tiềm ẩn vi sai (differential latent encoder). Nó mã hóa các khung hình video theo cặp, vì vậy các biến tiềm ẩn mô tả sự khác biệt giữa các khung hình thay vì nội dung của từng khung hình.

Dữ liệu và tài nguyên tính toán huấn luyện trước

Tập dữ liệu bắt đầu từ một chỉ mục nội bộ gồm 2 tỷ video công khai. Việc lọc đã giảm con số đó xuống còn khoảng 2 triệu bản ghi màn hình máy tính. Một mô hình phát hiện khung hình chính (keyframe) nội bộ giúp loại bỏ các khung hình dư thừa.

Tập dữ liệu cuối cùng gồm 575 triệu khung hình, được lấy mẫu ở tốc độ 1 khung hình/giây. Con số này tương đương với 552 tỷ token, hay khoảng 18 năm video. Photon-1 được huấn luyện trước từ đầu trong một epoch duy nhất.

Việc huấn luyện mô hình MoE 106B-A5B với ngữ cảnh 32K tiêu tốn khoảng 30.000 giờ GPU H200, tương đương 4,4×10²² FLOPs huấn luyện. Nhóm nghiên cứu đã triển khai huấn luyện bằng PyTorch với các kernel hợp nhất tùy chỉnh cho bộ mã hóa thị giác và các lớp MoE, duy trì mức MFU (Model FLOPs Utilization) toàn trình là 40%. Ba con số này nhất quán với nhau: 30.000 giờ H200 ở mức 40% MFU cho ra kết quả gần như chính xác là 4,3×10²².

Từ trí tưởng tượng đến hành động

Induction Labs đã tinh chỉnh (finetune) Photon-1 trên chưa đầy 35.000 quỹ đạo sử dụng máy tính để dạy định dạng hành động và hướng dẫn. Các token sử dụng máy tính đặc biệt cho phép mô hình phát ra các hành động. Khi suy luận, Photon-1 dự đoán trạng thái của khung hình tiếp theo trước, sau đó xuất ra hành động để đạt được trạng thái đó.

Tiếp theo là học tăng cường trực tuyến (online reinforcement learning). Các lượt chạy thử (rollouts) diễn ra theo thời gian thực trên các máy ảo ở quy mô lớn, và kết quả được xác minh bằng lập trình để tạo ra phần thưởng. Các máy ảo Linux chạy năm môi trường máy tính để bàn (LXQt, Xfce, MATE, GNOME và Plasma), mỗi môi trường có một tài khoản Google cho các ứng dụng web yêu cầu đăng nhập và một bản sao ChatGPT nội bộ không giới hạn tốc độ.

So sánh về tài nguyên tính toán và chi phí

*Được tính theo tỷ lệ token đầu vào trên đầu ra là 10:1, mà Induction Labs cho biết là phù hợp với các bài kiểm tra sử dụng máy tính của họ.

Hai lưu ý cần được đặt cạnh bảng đó. Thứ nhất, con số về Gemini là ước tính thận trọng của riêng Induction Labs, giả định 8B tham số hoạt động và 25T token huấn luyện trước. Nếu nhìn nhận theo giá trị thực tế, tỷ lệ này là khoảng 27 lần, không phải con số 30 lần như tiêu đề; Induction Labs tuyên bố "ít nhất 30 lần" dựa trên cơ sở rằng con số thực của Gemini có khả năng cao hơn và mô hình đó có thể đã được chưng cất (distilled). Thứ hai, bộ tiêu chuẩn đánh giá là nội bộ và chưa được công bố, vì vậy kết quả hiện chưa thể tái lập độc lập.

Chi phí hòa vốn của riêng Photon-1 trên phần cứng của Induction Labs là 0,06 USD cho mỗi 1 triệu token đầu vào và 0,60 USD cho mỗi 1 triệu token đầu ra, không sử dụng giải mã suy đoán (speculative decoding).

Liệu nó có khả năng tổng quát hóa ngoài máy tính để bàn không?

Đây là bài kiểm tra thú vị hơn, vì Photon-1 chỉ mới thấy video sử dụng máy tính. Nhóm nghiên cứu đã tinh chỉnh nó trên các lĩnh vực không có trong quá trình huấn luyện trước và so sánh với hai mô hình cơ sở: một mô hình cơ sở bộ mã hóa thị giác với cùng kiến trúc và kích thước nhưng không có huấn luyện trước bằng imagination, và một mô hình cơ sở LLM (Ling-flash-2.0 từ Inclusion AI, được huấn luyện trước trên 20T token).

Trên 20.000 ván cờ đam trong Open Checkers Archive 2.0, Photon-1 đã đánh bại cả hai mô hình cơ sở về khả năng mô phỏng thế giới và chất lượng nước đi. Trên 10.000 ván bida được tạo tổng hợp mô phỏng ở tốc độ 5 khung hình/giây, nó tạo ra sai số tuyệt đối trung bình là 0,47 so với công cụ vật lý chuẩn (ground-truth), so với 1,15 của mô hình cơ sở LLM và 1,44 của mô hình cơ sở bộ mã hóa thị giác.

Photon-1 cũng tiếp thu các tiên nghiệm của con người từ video huấn luyện trước. Sau khi học tăng cường (RL), nó đã học cách sử dụng bản sao ChatGPT trong máy ảo để soạn thảo tài liệu và trả lời các câu hỏi kiến thức, điều khiển LLM theo cách mà một người sẽ làm.

Những điểm chính cần lưu ý

Hãy xem bài viết kỹ thuật đầy đủ từ Induction Labs và luồng thông báo trên X. Mọi công lao cho nghiên cứu này thuộc về các nhà nghiên cứu của dự án.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.

AIHọc máyPhoton-1Mô hình nền tảngInduction Labs
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.