Mô hình
GPT-5.6 tự tối ưu hóa chính mình: Kỷ nguyên AI tự tiến hóa đã bắt đầu
(giờ Việt Nam)
Tóm tắt AI
OpenAI vừa giới thiệu cơ chế tự cải tiến mới, cho phép mô hình AI tự nâng cấp hiệu suất mà không cần sự can thiệp trực tiếp từ con người.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
30-07-2026 15:51:14 Nguồn: QbitAI
"Bí kíp" RSI của OpenAI đã xuất hiện!
Henry đưa tin từ QbitAI
QbitAI | Kênh chính thức QbitAI
"Bí kíp" RSI của OpenAI đã xuất hiện!
Ngay sau khi Jensen Huang lên tiếng kêu gọi mở quyền truy cập trọng số (weights), OpenAI cũng bất ngờ trở nên "Open" hơn bao giờ hết~
Trong báo cáo kỹ thuật mới nhất, họ đã tiết lộ một phần "tâm pháp" về RSI (AI tự tiến hóa đệ quy):
Để GPT-5.6 tự mình cải tiến hệ thống vận hành cho chính nó.

Theo báo cáo, GPT-5.6 đã được đưa vào môi trường sản xuất thực tế của OpenAI để phân tích lưu lượng truy cập trực tuyến, điều chỉnh định tuyến yêu cầu, thậm chí trực tiếp viết lại Kernel cấp thấp và tối ưu hóa các mô hình giải mã suy luận (speculative decoding).
Nhờ chuỗi thao tác này, chi phí dịch vụ end-to-end của OpenAI đã giảm 20% và hiệu suất tạo Token cũng tăng hơn 15%.
Đáng chú ý, trong số năm tác giả công bố công trình này có Philippe Tillet – "cha đẻ" của Triton lừng danh.
Năm 2021, khi OpenAI ra mắt Triton 1.0, mục tiêu là giúp những người không biết CUDA vẫn có thể viết được các chương trình GPU đạt trình độ chuyên gia.
Năm năm sau, GPT-5.6 đã bắt đầu sử dụng Triton để tự viết lại mã nguồn cấp thấp chạy trên GPU của chính nó.
Từ việc dạy con người viết Kernel, đến việc để mô hình tự sửa Kernel cho mình, cảm giác này thực sự ngày càng giống RSI.

(Phải nói rằng, không trách được tại sao Lilian Weng lại quay về mái nhà xưa. Muốn làm RSI thì vẫn phải ở OpenAI thôi).
"Bí kíp" RSI, bắt đầu từ tối ưu hóa cấp thấp
Điều khiến sự việc này đáng chú ý chính là nó đã mang hơi hướng của RSI.
RSI hay còn gọi là tự cải tiến đệ quy, nói một cách đơn giản là:
Để AI bước vào một vòng lặp phản hồi "cải tiến AI" – sau khi năng lực tăng lên ở vòng này, nó sẽ quay lại thúc đẩy quá trình nâng cấp ở vòng tiếp theo.
Tất nhiên, GPT-5.6 hiện vẫn còn rất xa mới đạt đến mức RSI hoàn chỉnh, nơi GPT tự động huấn luyện thế hệ GPT tiếp theo.
Nhưng nó đã bắt đầu tham gia vào việc tối ưu hóa môi trường vận hành của chính mình: mô hình không chỉ là công cụ được kỹ sư triển khai và gọi lệnh, mà dần trở thành kỹ sư tự cải tạo hệ thống mô hình.
Cụ thể, nó đã thực hiện bốn việc.
1. Phân tích lưu lượng sản xuất thực tế của OpenAI.
GPT-5.6 tìm kiếm sự mất cân bằng tải giữa các máy chủ và nút dịch vụ khác nhau, đồng thời thử nghiệm các chiến lược định tuyến mới để phân bổ yêu cầu đến các vị trí phù hợp hơn.
2. Viết lại và tối ưu hóa Kernel sản xuất.
GPT-5.6 đi sâu vào quá trình forward pass của mô hình, tìm kiếm các phần có thể tính toán trước, lược bỏ hoặc thực thi song song, sau đó thông qua Codex để viết lại các Triton và Gluon Kernel trong môi trường sản xuất.
3. Tối ưu hóa hệ thống giải mã suy luận của chính mình.
GPT-5.6 thiết kế các phương án cho mô hình dự thảo (draft model) của mình và tự động chạy hàng trăm thí nghiệm để kiểm tra các kích thước, cấu trúc và đặc trưng mô hình khác nhau.
Trong quá trình huấn luyện, nó còn liên tục giám sát các thí nghiệm và chủ động can thiệp khi xảy ra lỗi phần cứng hoặc sự bất ổn trong huấn luyện.
4. Tự tìm kiếm các tham số triển khai tối ưu cho các tác vụ khác nhau.
Đối mặt với các tải công việc khác nhau như hội thoại ngắn, ngữ cảnh dài, tác vụ mã nguồn, GPT-5.6 sẽ tự động tìm kiếm sự kết hợp tối ưu hơn cho batching, sharding và quản lý KV Cache.
Kết nối bốn việc này lại, những gì GPT-5.6 tham gia không còn là một tác vụ mã nguồn đơn lẻ, mà là một vòng lặp phản hồi kỹ thuật thực sự:
Quan sát hệ thống sản xuất, tìm kiếm điểm nghẽn, đề xuất phương án, chạy thí nghiệm, xử lý lỗi và triển khai các cải tiến hiệu quả trở lại hệ thống đang vận hành chính nó.
Con người vẫn nằm trong vòng kiểm soát
Tất nhiên, RSI chưa đến nhanh như vậy, con người vẫn đang đứng trong vòng lặp, hay còn gọi là human in the loop.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.