MarkTechPost
92

Nghiên cứu

ByteDance và Đại học Thanh Hoa ra mắt CUDA Agent: Hệ thống AI tối ưu hóa mã nguồn GPU

(giờ Việt Nam)

Tóm tắt AI

CUDA Agent là hệ thống học tăng cường giúp LLM tự động viết mã CUDA, đạt tốc độ vượt trội gấp 2.11 lần so với torch.compile và tỷ lệ thành công lên tới 98.8%.

Bản dịch AI

ByteDance Seed and Tsinghua AIR Introduces CUDA Agent: A Large-Scale Agentic RL System for CUDA Kernel Generation

ByteDance Seed và Tsinghua AIR đã ra mắt CUDA Agent, một hệ thống học tăng cường (reinforcement learning) dựa trên tác nhân (agentic), giúp huấn luyện mô hình ngôn ngữ lớn viết các GPU kernel vượt trội hơn trình biên dịch. Khoảng cách mà nó nhắm đến tuy hẹp nhưng lại rất khó giải quyết: các mô hình tiên tiến hiện nay đã có thể tạo ra mã CUDA chính xác, nhưng chúng lại tạo ra mã CUDA chạy chậm. Trên KernelBench, mô hình cơ sở Seed1.6 vượt qua 74,0% các tác vụ nhưng chỉ chạy nhanh hơn torch.compile ở 27,2% trong số đó, với tốc độ trung bình nhân (geometric-mean) là 0,69×, nghĩa là các kernel của nó trung bình chậm hơn so với những gì trình biên dịch tự tạo ra. CUDA Agent thu hẹp khoảng cách đó bằng cách đặt mô hình vào một môi trường phát triển CUDA thực tế với các công cụ profiling, kiểm tra tính chính xác và một sandbox bị khóa quyền, sau đó huấn luyện nó bằng PPO trong 150 bước với ngữ cảnh 131.072 token. Kết quả là tỷ lệ vượt qua đạt 98,8% và tỷ lệ chạy nhanh hơn torch.compile đạt 96,8% trên bộ benchmark gồm 250 tác vụ, với tốc độ trung bình nhân đạt 2,11× so với trình biên dịch — cao hơn khoảng 40 điểm so với Claude Opus 4.5 và Gemini 3 Pro ở phân khúc Level-3 khó nhất.

Liệu nó có thể triển khai được không?

Một phần, nhưng tác nhân đã huấn luyện không được phát hành công khai. Nó được xây dựng trên Seed1.6, một mô hình MoE độc quyền với 23 tỷ tham số hoạt động và tổng cộng 230 tỷ tham số, và bài báo không cung cấp trọng số (weights). Những gì được công khai bao gồm: bộ dữ liệu CUDA-Agent-Ops-6K, đặc tả SKILL.md cùng các công thức phần thưởng và khởi động (warm-up).

Những công ty nào có thể sử dụng: Chỉ riêng sandbox profiling đã sử dụng 128 GPU NVIDIA H20, điều này khiến việc tái lập hoàn toàn chỉ nằm trong khả năng của các phòng thí nghiệm tiên tiến, các đơn vị cung cấp GPU cloud và các đội ngũ hạ tầng lớn. Các đội ngũ quy mô trung bình vẫn có thể áp dụng các thành phần — bộ dữ liệu, phần thưởng cột mốc, các ràng buộc chống hack phần thưởng, đặc tả kỹ năng — trên nền tảng một mô hình cơ sở mã nguồn mở.

Các ngành và ứng dụng: Hạ tầng AI và phục vụ suy luận (inference serving), GPU cloud, xe tự lái, giao dịch định lượng, chẩn đoán hình ảnh y tế và hệ thống gợi ý — bất cứ nơi nào các fused kernel nằm trên lộ trình quan trọng về độ trễ (latency-critical path). Các ứng dụng bao gồm hợp nhất các chuỗi toán tử mà torch.compile xử lý kém, cắt giảm chi phí trên mỗi token và tinh chỉnh lại các kernel qua các thế hệ GPU.

Tổng hợp dữ liệu

Nhóm nghiên cứu thu thập các toán tử tham chiếu từ các thư viện torch và transformers. Sau đó, một LLM lấy mẫu tối đa năm lớp toán tử torch và xếp chồng chúng thành một lớp hợp nhất (fused layer). Một bộ lọc chỉ giữ lại các toán tử thực thi được ở cả chế độ eager và compile, có tính tất định, tạo ra đầu ra không cố định và chạy trong khoảng từ 1 ms đến 100 ms ở chế độ eager. Các mẫu có độ tương đồng AST trên 0,9 với bất kỳ tác vụ nào trong KernelBench đều bị loại bỏ. Kết quả là CUDA-Agent-Ops-6K: 6.000 mẫu, trong đó 83,77% là các tổ hợp gồm hai toán tử.

Môi trường và phần thưởng

Vòng lặp tác nhân mô phỏng các công cụ của OpenHands — Bash, Read/Write, Edit/MultiEdit, Glob, Grep, NotebookEdit, BashOutput, KillBash — theo mô hình ReAct. Các chỉ dẫn CUDA được gửi dưới định dạng Agent Skills. SKILL.md hướng dẫn mô hình profiling mô hình PyTorch, viết lại model_new.py bằng các kernel tùy chỉnh, biên dịch trong sandbox GPU và lặp lại cho đến khi kernel nhanh hơn ít nhất 5% so với torch.compile tại atol=1e-2, rtol=1e-2.

Việc hack phần thưởng được ngăn chặn bằng năm biện pháp: các tập lệnh xác thực và profiling bị khóa quyền, các trình quản lý ngữ cảnh cấm sử dụng dự phòng torch.nn.functional, kiểm tra với năm đầu vào ngẫu nhiên, profiling với đồng bộ hóa thiết bị và khởi động (warm-up), và không có công cụ tìm kiếm web.

Phần thưởng là rời rạc thay vì là một tỷ lệ tăng tốc thô. r ∈ {−1, 1, 2, 3}: −1 nếu thất bại về tính chính xác, 3 nếu kernel vượt qua cả eager và torch.compile hơn 5%, 2 nếu chỉ vượt qua eager, và 1 cho các trường hợp còn lại.

Kết quả

Bảng 1, tổng quan: tỷ lệ vượt qua 98,8%, 98,4% nhanh hơn eager, 96,8% nhanh hơn torch.compile, với tốc độ trung bình nhân lần lượt là 2,60× và 2,11×. Level 2 (các chuỗi toán tử) là phân khúc mạnh nhất: 100% vượt qua, 100% tỷ lệ nhanh hơn, 2,80× so với torch.compile. Level 3 đạt 94,0% vượt qua, 90,0% tỷ lệ nhanh hơn và 1,52×, cao hơn khoảng 40 điểm so với Claude Opus 4.5 (50,0%) và Gemini 3 Pro (52,0%) về tỷ lệ nhanh hơn so với trình biên dịch.

Một điểm không nhất quán: phần tóm tắt và giới thiệu nêu tỷ lệ nhanh hơn lần lượt là 100% / 100% / 92% cho các Level 1–3, trong khi Bảng 1 báo cáo 97,0% / 100,0% / 90,0%. Bảng 1 là bảng kết quả chính.

Các thử nghiệm cắt bỏ (ablations) cho thấy kết quả rõ ràng. Việc loại bỏ vòng lặp tác nhân làm giảm tỷ lệ nhanh hơn so với trình biên dịch từ 96,8% xuống 14,1%. Phần thưởng tăng tốc thô đạt 60,4%, không có RFT đạt 49,8% kèm theo sự sụp đổ phần thưởng, không có tiền huấn luyện giá trị (value pretraining) đạt 50,9% kèm theo các quỹ đạo chạy mất kiểm soát.

Các nghiên cứu tình huống cho thấy những gì chính sách học được. Một phép nhân ma trận đường chéo (diagonal matmul) được viết lại thành phép chia tỷ lệ theo hàng (row-wise scaling): 24,04× so với torch.compile. Một chuỗi matmul-divide-sum-scale được sắp xếp lại và hợp nhất: 24,04×. Một ResNet BasicBlock với BatchNorm được gộp vào phép tích chập và cudnnConvolutionBiasActivationForward: 3,59×.

Những điểm chính cần lưu ý

Hãy xem Bài báo, Trang dự án và Bộ dữ liệu. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC Trang Hugging Face HOẶC Ra mắt sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.