HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 40/100

Nghiên cứu

TaH2: Tối ưu hóa khả năng mở rộng khi suy luận với Adaptive Looped Transformers

(giờ Việt Nam)

Tóm tắt AI

TaH2 cải thiện hiệu suất mô hình bằng cách áp dụng các vòng lặp thích ứng, chỉ tập trung tính toán vào các token cần thiết. Phương pháp này giúp tăng đáng kể độ chính xác trên AIME với chi phí tính toán tối ưu hơn so với các mô hình truyền thống.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các mô hình Looped transformers đã cho thấy hiệu quả tham số đầy hứa hẹn nhờ việc tái sử dụng các lớp cho tính toán ẩn. Các nghiên cứu trước đây so sánh các mô hình có vòng lặp (looped) và không có vòng lặp (non-looped) dựa trên số lượng tham số tương đương hoặc FLOPs trên mỗi token. Tuy nhiên, theo hiểu biết của chúng tôi, việc liệu vòng lặp có cải thiện khả năng mở rộng trong thời gian kiểm thử (test-time scaling) khi độ dài đầu ra tăng lên hay không vẫn chưa được khám phá đầy đủ. Thông qua việc hậu huấn luyện các mô hình Looped transformers, chúng tôi nghiên cứu độ dốc giữa độ chính xác và tính toán, được đo bằng mức tăng độ chính xác trên mỗi lần tăng gấp đôi FLOPs giải mã trong thời gian kiểm thử. Chúng tôi nhận thấy rằng các mô hình Looped transformers hiện có thường tạo ra độ dốc cao hơn so với mô hình cơ sở không có vòng lặp, nhưng lại hoạt động kém hiệu quả hơn ở mức tính toán tương đương. Trong khi vòng lặp độ sâu cố định tiêu tốn thêm các vòng lặp cho mọi token, phân tích của chúng tôi cho thấy nhiều token không được hưởng lợi từ các vòng lặp bổ sung này. Do đó, chúng tôi đề xuất TaH2, cho phép mô hình tập trung các vòng lặp bổ sung vào những token thực sự được hưởng lợi từ việc lặp. TaH2 thực hiện hậu huấn luyện đồng thời phần khung (backbone) và bộ quyết định vòng lặp thông qua giám sát độ sâu nhìn trước (lookahead depth supervision), sử dụng các nhãn trực tuyến để chỉ ra liệu việc lặp thêm có cải thiện dự đoán hay không. TaH2 cải thiện cả hiệu suất và độ chính xác đạt được của khả năng mở rộng trong thời gian kiểm thử. Trên các bài kiểm tra AIME đầy thách thức, TaH2 cải thiện độ dốc độ chính xác-tính toán thêm 53% (2,74 so với 1,79) so với mô hình cơ sở không có vòng lặp, vượt qua độ chính xác cao nhất của mô hình cơ sở khoảng 3,4 điểm ở mức tính toán kiểm thử tương đương. Khi độ sâu vòng lặp tối đa tăng lên, các mô hình có vòng lặp hiện tại phần lớn bị chững lại, trong khi mức tăng của TaH2 so với mô hình cơ sở không có vòng lặp tiếp tục tăng từ +2,8 điểm ở độ sâu 2 lên +3,9 điểm ở độ sâu 8. Mã nguồn của chúng tôi có sẵn tại đường dẫn https này.

Chủ đề:Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG)
Các lớp MSC:68T50, 68T07, 68T05
Các lớp ACM:I.2.7; I.2.6; I.2.8
Trích dẫn là:arXiv:2609.35748 [cs.CL]
(hoặc arXiv:2609.35748v1 [cs.CL] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.35748 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Yichen You [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 17:56:55 UTC (847 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

TaH2: Tối ưu hóa khả năng mở rộng khi suy luận với Adaptive Looped Transformers | AIHOT.vn