Thủ thuật
Sebastian Raschka phân tích kiến trúc Looped Transformer và chuỗi suy luận ẩn trên GPT-6 Astra
(giờ Việt Nam)
Tóm tắt AI
Sau khi GPT-6 Astra ra mắt với khả năng xử lý hình ảnh và sử dụng máy tính vượt trội, chuyên gia Sebastian Raschka đã giải mã các tin đồn về kiến trúc Looped Transformer và cơ chế suy luận ẩn bên trong mô hình này.
Bản dịch AI

Rất nhiều sự kiện đã diễn ra trong vài tuần qua. Tôi tin chắc rằng GPT-6 Astra của OpenAI hiện đang là tâm điểm chú ý của mọi người. Đặc biệt là những suy nghĩ về hiệu năng của nó, các khía cạnh về "looped transformer" (transformer lặp)/độ sâu hồi quy, và những tin đồn rằng Astra đang "ẩn" dấu vết suy luận (tức là chuỗi suy nghĩ - chain of thought) của mình.
Vì vậy, trong bài viết này, tôi muốn bắt đầu với một vài ấn tượng sơ lược về Astra và những suy nghĩ về hướng đi của tất cả những điều này. Sau đó, tôi sẽ thảo luận chi tiết về "looped transformers" là gì, và làm thế nào (hay đúng hơn là liệu) điều này có liên quan đến việc ẩn đi các chuỗi suy nghĩ hay không.
Cuối cùng, sau khi đề cập đến những kiến thức cơ bản về looped transformer, tôi muốn làm nổi bật một số thông tin chuyên sâu mới từ các bài báo nghiên cứu gần đây về chủ đề này.
Trước hết, hãy bắt đầu với những điều cơ bản. Trước khi đi sâu vào các tin đồn về kiến trúc và tài liệu nghiên cứu liên quan, hãy để tôi tóm tắt ngắn gọn một số quan sát và thông tin thú vị về GPT-6 Astra.
Tuần trước, GPT-6 Astra mới của OpenAI đã được ra mắt với sự đón nhận nồng nhiệt. Tôi đã sử dụng nó trong vài ngày qua, và đây là một mô hình cực kỳ xuất sắc, có lẽ là mô hình tốt nhất mà tôi từng dùng tính đến thời điểm viết bài này. Nhưng chính xác thì nó đã cải thiện những gì và cải thiện như thế nào?
Astra là mô hình tốt nhất mà tôi từng sử dụng cho đến nay, và nó đặc biệt vượt trội trong các tác vụ kết xuất (rendering) 3D và hoạt ảnh (so với các mô hình khác). Ý tôi là, mặc dù nó vượt xa người tiền nhiệm GPT-5.6 trong hầu hết mọi danh mục (viết lách, toán học, lập trình, v.v.), nhưng nó đặc biệt thể hiện rõ điều đó khi nói đến các bản demo đồ họa.
Chúng ta cũng có thể thấy điều này phản ánh qua các bảng xếp hạng (benchmarks). Ví dụ, GPT-6 Astra thực sự rất giỏi về toán học và lập trình, như được hiển thị bên dưới.
Một trong những điểm nổi bật (không hiển thị trong hình) là Astra cũng đạt 99,9% trên bảng xếp hạng ARC-AGI-3 (GPT-5.6 Sol chỉ đạt 7,8%), vốn đo lường sự kết hợp giữa việc giải các câu đố logic và khả năng tổng quát hóa. Tuy nhiên, các bảng xếp hạng về toán học, lập trình và sử dụng máy tính lại thú vị hơn vì chúng gần gũi với thực tế sử dụng hơn.
Quay lại với Artificial Analysis Coding Agent Index v1.4 (góc dưới bên phải trong hình trước), vốn kết hợp nhiều tác vụ lập trình đại lý (agentic coding tasks), GPT-6 Astra rõ ràng đang ở vị trí tiên phong, nhưng không vượt xa quá nhiều. Điều này cũng có thể thấy trong Artificial Analysis Intelligence Index tổng quát được hiển thị bên dưới, vốn kết hợp nhiều loại tác vụ khác nhau, không chỉ riêng các tác vụ lập trình.

Hiện nay, ưu điểm lớn của các bảng xếp hạng Artificial Analysis là chúng độc lập và do đó có thể đáng tin cậy hơn một chút so với các bảng xếp hạng tự đánh giá bởi chính các nhà phát triển mô hình.
Cơ chế kiểm thử (harness setup) phụ thuộc vào từng bảng xếp hạng. Ví dụ, GDPval-AA và AA-Briefcase sử dụng bộ khung Stirrup tối giản, mã nguồn mở của họ trên các LLM khác nhau mà họ so sánh. Trong Intelligence Index v4.2 hiển thị ở trên, Terminal-Bench v2.1 sử dụng Terminus 2, và τ³-Banking sử dụng bộ khung τ-Bench. Coding Agent Index riêng biệt cũng so sánh các bộ khung đại lý lập trình khác nhau.
Đối với các đánh giá sử dụng chung một bộ khung, điều này giúp việc so sánh trở nên công bằng hơn (apples-to-apples). Đồng thời, trong quá trình huấn luyện, các mô hình thường được phát triển với một bộ khung chính (và ít được tinh chỉnh trên các bộ khung khác). Thêm vào đó, bộ khung chính thường được phát triển để phù hợp và khuếch đại thế mạnh của mô hình đó.
Vì vậy, một số đánh giá về đại lý có thể đánh giá thấp hiệu suất thực tế của Astra trong bộ khung chính của nó. Mức độ ảnh hưởng của điều này đến điểm số Intelligence Index cần được kiểm chứng bằng cách so sánh Astra trên các bộ khung khác nhau với cùng một tác vụ.
Một lưu ý nhỏ, như một đồng nghiệp gần đây đã gợi ý cho tôi (cũng được khuyến nghị bởi trưởng nhóm Claude Code), có lẽ không phải là ý tưởng tồi khi xóa (/lưu trữ) một số nội dung trong các tệp AGENTS.md và SKILL.md hiện có của bạn, vì các LLM mới hơn đã trở nên hiệu quả hơn trong việc hiểu câu lệnh (prompt) và giải quyết vấn đề. Việc "cầm tay chỉ việc" quá mức có thể hạn chế không cần thiết các mô hình mới hơn và dẫn đến các giải pháp kém hiệu quả hơn.
Tất nhiên, tôi không gợi ý rằng không bao giờ sử dụng các tệp SKILL.md nữa, vì đối với một số quy trình làm việc, chúng có thể cải thiện hiệu quả khi tái sử dụng, giúp mô hình không phải tìm hiểu lại từ đầu. Nhưng điều tôi muốn nói là một số quy trình không cần phải mô tả quá chi tiết, và các mô tả "cũ" có thể không còn lý tưởng nữa, trong khi LLM có thể tự đưa ra các giải pháp tốt hơn. Vì vậy, có lẽ đã đến lúc cập nhật hoặc tạo lại các tệp hướng dẫn đó.
GPT-6 Astra dường như cực kỳ mạnh mẽ trong các tác vụ hình ảnh và kết xuất. Khi các tác vụ này liên quan đến việc tương tác với giao diện người dùng đồ họa, chúng cũng thể hiện khả năng sử dụng máy tính, nghĩa là mô hình vận hành phần mềm trên máy tính cục bộ của bạn thông qua ứng dụng Codex/ChatGPT.
Sử dụng máy tính là nơi mô hình thực sự tỏa sáng so với các mô hình khác, và bất cứ thứ gì liên quan đến đồ họa cũng tạo ra các bản demo thú vị và trực quan trên các nền tảng mạng xã hội. Có rất nhiều ví dụ về các bản demo ấn tượng ngoài kia, từ việc mô hình kết xuất thành phố New York trong Blender cho đến các chuyến tham quan nhà ảo.
Để chọn một ví dụ, bên dưới là sự so sánh nơi tôi yêu cầu GPT-6 Astra bản Medium và High vẽ lại bức ảnh của tôi trong phiên bản trình duyệt của MS Paint bằng cách sử dụng chuột trên máy tính của tôi (không dùng Extra High và Max, vì tôi không muốn lãng phí hết token của mình:)).
Điều này làm nổi bật không chỉ khả năng nghệ thuật của mô hình mà quan trọng hơn là khả năng sử dụng các công cụ trên máy tính của người dùng (trong trường hợp này là Paint; bạn có thể thấy mô hình sử dụng giao diện thông qua con trỏ chuột).
Đây không phải là mô hình đầu tiên có khả năng sử dụng máy tính tổng quát bên trong một bộ khung. Ví dụ, tôi đã sử dụng thành công các mô hình GPT cho một số tác vụ giao diện người dùng (ví dụ: các tác vụ liên quan đến chi phí trong Excel) từ đầu năm nay. Tuy nhiên, sử dụng máy tính là một khả năng tương đối mới, được kích hoạt bởi bộ khung, và thường cảm giác vẫn chưa thực sự hoàn thiện. Điều này cũng dễ hiểu. LLM là các mô hình ngôn ngữ, vì vậy đương nhiên những thành quả dễ đạt được nhất là viết lách, lập trình và sử dụng các API và CLI.
Đồng thời, có rất nhiều công cụ và phần mềm chưa hỗ trợ CLI, và thay vì chờ đợi ai đó thiết kế giao diện đó, tại sao không cải thiện các mô hình để sử dụng giao diện người dùng đồ họa (và như đã đề cập trước đó, điều này tạo ra các bản demo đẹp mắt và ấn tượng)? Điều này có phần tương tự như sự phát triển của robot hình người. Chắc chắn, robot hình người không phải là loại robot hiệu quả nhất, ví dụ như tại dây chuyền lắp ráp, nơi đã có các loại máy chuyên dụng. Nhưng chúng rất linh hoạt.
Vì vậy, tôi kỳ vọng những tháng (hoặc năm) tới cũng sẽ là kỷ nguyên tinh chỉnh khả năng sử dụng máy tính trên cả lớp LLM và lớp bộ khung đại lý. Nghĩa là, ngoài các khả năng hiện tại và việc mở rộng khả năng toán học và lập trình, các mô hình sẽ được huấn luyện với tư duy ngày càng tập trung vào việc sử dụng máy tính. Và điều này cũng sẽ giúp LLM trở nên dễ tiếp cận hơn đối với các tác vụ máy tính hàng ngày bên ngoài thế giới công nghệ (”Này ChatGPT, làm ơn làm tờ khai thuế giúp tôi”:))
Xu hướng sử dụng máy tính cũng phù hợp với báo cáo gần đây rằng OpenAI đã mua hàng chục nghìn chiếc Mac Mini và Mac Studio để phục vụ Học tăng cường (Reinforcement Learning). Ở đây, các máy Mac không được sử dụng để huấn luyện trực tiếp các mô hình (tốt hơn là nên dùng GPU cho việc đó) mà để cung cấp môi trường macOS trong quá trình huấn luyện, giúp mô hình học cách sử dụng hệ điều hành đó và các công cụ bên trong nó.
Vậy, việc huấn luyện sử dụng máy tính trên các máy Mac đó hoạt động như thế nào? Tóm lại, các máy Mac (hay chính xác hơn là hệ điều hành macOS của chúng) đóng vai trò là môi trường mà mô hình có thể tương tác trong quá trình huấn luyện.
Quy trình làm việc cơ bản trông như sau:
Đưa ra câu lệnh cho mô hình bằng cách giao cho nó một tác vụ, chẳng hạn như “mở ứng dụng xyz và làm abc”.
Cung cấp cho nó ảnh chụp màn hình của giao diện macOS (việc này thường được thực hiện bởi bộ khung).
LLM sau đó dự đoán các hành động chuột/bàn phím (nhấp chuột, nhấn phím, cuộn, v.v.).
Thực thi các hành động đó trên máy Mac (một lần nữa, việc này được thực hiện bởi bộ khung).
Cung cấp ảnh chụp màn hình mới của môi trường sau khi thực hiện các hành động ở bước trước.
Lặp lại các bước 2-5 cho đến khi tác vụ thành công hoặc thất bại.
Sử dụng các tín hiệu thành công/thất bại và các bộ kiểm chứng (hoặc bộ chấm điểm) làm phản hồi huấn luyện, bao gồm cả học tăng cường trong giai đoạn hậu huấn luyện; điều này tương tự như Học tăng cường với Phần thưởng có thể kiểm chứng (RLVR).

Một lần nữa, máy Mac ở đây chủ yếu là môi trường chứ không phải là máy để chạy hoặc cập nhật mô hình trong quá trình huấn luyện. Mô hình có khả năng nằm trên các GPU NVIDIA và được cung cấp dữ liệu qua API đến máy Mac nói trên. Nhân tiện, CEO của NVIDIA đã đề cập rằng GPT-6 Astra được huấn luyện trên khoảng 100.000 GPU Grace Blackwell.
Trọng tâm vào việc huấn luyện sử dụng máy tính được thảo luận trong phần trước không phải là một sự thay đổi mô hình cơ bản trong quy trình huấn luyện. GPT-6 Astra (và có lẽ bất kỳ LLM nào trong tương lai gần) vẫn là một mô hình suy luận. Điều này có nghĩa là LLM được huấn luyện bằng học tăng cường với phần thưởng có thể kiểm chứng (RLVR) và tạo ra các dấu vết suy luận trung gian (chuỗi suy nghĩ).
Nhưng tôi sẽ thảo luận về các khía cạnh mô hình suy luận của GPT-6 Astra (đặc biệt là liên quan đến việc ẩn các chuỗi suy nghĩ) ở phần sau của bài viết này.
Mặc dù vậy, khoảng hai ngày trước khi mô hình chính thức ra mắt, tạp chí tin tức The Information đã xuất bản một bài báo đưa tin rằng, theo một số thông tin nội bộ, Astra đang sử dụng một khái niệm gọi là "độ sâu hồi quy" (recurrent depth) hoặc "looped transformers".
Vì kiến trúc LLM nằm trong lĩnh vực chuyên môn và niềm đam mê của tôi, tôi đã tạo một video bài giảng ngắn giải thích cơ chế looped transformer nói chung và giải đáp bình luận về các chuỗi suy luận ẩn, bạn có thể tìm thấy bên dưới.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.