Mô hình
GPT-6 thúc đẩy xu hướng Recurrent Transformer: Alibaba đã đón đầu từ sớm
(giờ Việt Nam)
Tóm tắt AI
Kiến trúc Recurrent Transformer đang trở thành tâm điểm nhờ GPT-6, trong khi Alibaba đã sớm khẳng định vị thế với hai bài báo nghiên cứu quan trọng tại các hội nghị hàng đầu.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
05-09-2026 23:07:08 Nguồn: QbitAI
Nắm trong tay hai bài báo tại hội nghị hàng đầu
Ngay khi GPT-6 Astra vừa ra mắt, "recurrent depth" (độ sâu tuần hoàn) bỗng chốc trở nên cực kỳ hot chỉ sau một đêm!
Thông tin này được The Information tiết lộ đầu tiên, cho biết Astra đã sử dụng kỹ thuật "độ sâu tuần hoàn" này:
Cho phép cùng một nhóm các lớp Transformer chạy lặp đi lặp lại, giúp tăng độ sâu tính toán mà không cần tăng số lượng tham số tương ứng.
?? Mô hình không cần phải tiếp tục "phình to" một cách điên cuồng mà vẫn có thể bắt các tham số hiện có làm việc nhiều vòng hơn, lại có chuyện tốt như vậy sao.

Không nằm ngoài dự đoán, tranh cãi nhanh chóng nổ ra...
Vì quá trình tuần hoàn diễn ra trong hidden state (trạng thái ẩn), các bước trung gian không nhất thiết được viết thành chuỗi suy nghĩ (chain-of-thought) mà con người có thể đọc được, liệu điều này có khiến việc giám sát mô hình trở nên khó khăn hơn không?
OpenAI vì thế đã bị các chuyên gia an toàn AI đồng loạt chỉ trích, thậm chí có lúc buộc Giám đốc khoa học Jakub Pachocki phải đích thân lên tiếng phản hồi.
Jakub Pachocki cũng tiết lộ rằng ông đang chuẩn bị một bài viết chi tiết để giải thích toàn bộ sự việc.

Trong lúc chờ đợi bài viết đó, hãy cùng hướng sự chú ý trở lại với chính các mô hình Recurrent Transformer:
Liệu chạy thêm vài vòng tuần hoàn có thực sự giúp mô hình mạnh hơn không?
Giới học thuật thực ra đã sớm vấp phải vấn đề này.
Với cùng một mức tài nguyên tính toán, các mô hình tuần hoàn giúp tiết kiệm tham số thường không đạt hiệu quả bằng Transformer thông thường.
Thứ kìm hãm nó là một vấn đề vô cùng thực tế:
"Dư thừa tính toán" (Computational redundancy).
Điều thú vị là Alibaba đã công bố các bài báo liên quan từ 11 tháng trước, nhắm thẳng vào vấn đề này.
Một bài báo về MeSH giải quyết cách quản lý thông tin bên trong vòng lặp, tấn công vào bài toán nan giải của ngành là "vòng lặp vô ích" (recurrent idling).
Một bài báo về SpiralFormer đi sâu vào vấn đề độ chi tiết "tính toán với độ chính xác bao nhiêu" giữa các vòng lặp, giúp mỗi vòng tính toán đều được sử dụng hiệu quả nhất.
Ứng viên kiến trúc thế hệ tiếp theo phải vượt qua cửa ải "dư thừa tính toán"
Lý do Recurrent Transformer khiến mọi người phấn khích là vì nó cung cấp một "cách thức tăng sức mạnh" mới cho các mô hình ngôn ngữ lớn.
Trước đây, Scaling dựa vào việc chồng thêm tham số, 24 lớp cần 24 bộ tham số; giờ đây, 8 bộ tham số chạy 3 lần cũng có thể hoàn thành độ sâu tính toán của 24 lớp.
Hiệu quả có đuổi kịp được hay không thì cần thực nghiệm chứng minh, nhưng số lượng tham số cần lưu trữ thì quả thực đã giảm đi.
Đổi độ sâu tính toán lấy quy mô tham số, nếu bài toán này giải được, không gian tưởng tượng sẽ vô cùng rộng lớn.
Thực tế, trước Astra, Claude Mythos đã từng tạo nên một làn sóng về kiến trúc tuần hoàn.
Khi đó, điểm thu hút nhất chính là thành tích trong bài kiểm tra tìm kiếm đồ thị (graph search).
Trong bài kiểm tra ngữ cảnh từ 256K đến 1M của GraphWalks BFS, Mythos Preview đạt 80,0%, trong khi GPT-5.4 đạt 21,4% và Opus 4.6 của chính hãng đạt 38,7%.
Điểm số của Mythos Preview gần gấp bốn lần GPT-5.4.

Bài kiểm tra này có thể hiểu là cung cấp cho mô hình một mạng lưới quan hệ phức tạp, yêu cầu nó xuất phát từ điểm bắt đầu và tìm kiếm các nút kết nối theo từng lớp.
Tìm được một nhóm, ghi nhớ kết quả, rồi tiếp tục tìm kiếm sâu hơn, điều này đòi hỏi khả năng xử lý thông tin liên tục qua nhiều bước.
Trùng hợp thay, thế mạnh của kiến trúc tuần hoàn chính là xử lý thông tin liên tục qua nhiều vòng trong hidden state.
Vì vậy, ngay khi kết quả của Mythos được công bố, thế giới bên ngoài đã nhanh chóng liên kết hai điều này với nhau.
Còn việc nó có thực sự sử dụng kiến trúc tuần hoàn hay không, phía chính thức không nói rõ, câu trả lời đành để dư luận tự suy đoán.
Tuy nhiên, từ Mythos đến Astra, điều mọi người kỳ vọng thực chất là cùng một thứ:
Mô hình không cần phải liên tục lớn lên mà vẫn có thể nâng cao năng lực nhờ tính toán nhiều vòng bên trong.
Điều này cũng khiến kiến trúc tuần hoàn trở thành một trong những lộ trình ứng viên cho các mô hình lớn hiệu quả thế hệ tiếp theo.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.