Nghiên cứu
FlyBy: Giúp mô hình suy luận nhỏ biết khi nào cần 'cầu cứu' các model mạnh hơn
(giờ Việt Nam)
Tóm tắt AI
FlyBy là khung làm việc cho phép các mô hình 4B-8B tự chẩn đoán giới hạn tri thức để truy vấn các model lớn hơn khi cần, giúp tối ưu hóa hiệu suất suy luận mà không cần tăng kích thước mô hình.
Chính văn · Bản dịch AI
Tóm tắt: Mở rộng quy mô tính toán tại thời điểm suy luận (test-time computation) là một phương pháp mạnh mẽ để cải thiện khả năng lập luận của các mô hình ngôn ngữ, đặc biệt hấp dẫn đối với các mô hình lập luận nhỏ (sRM) có chi phí vận hành thấp. Tuy nhiên, liệu việc suy nghĩ thêm có phải lúc nào cũng là thao tác đúng đắn? Bằng cách can thiệp vào các trạng thái lập luận trung gian trên hai dòng mô hình và nhiều quy mô khác nhau, chúng tôi nhận thấy rằng việc tự tinh chỉnh (self-refinement) chủ yếu củng cố xác suất vào các giải pháp đã có thể đạt được từ trạng thái hiện tại, thay vì tạo ra các giải pháp mới. Những can thiệp này cho thấy hai dạng thất bại: nút thắt cổ chai về thực thi (execution bottlenecks), nơi lộ trình đúng có thể đạt được và việc phản tư có thể khôi phục nó, và nút thắt cổ chai về tri thức (knowledge bottlenecks), nơi thông tin bên ngoài phù hợp giúp lộ trình đó trở nên khả thi. Dựa trên sự phân biệt này, chúng tôi giới thiệu FlyBy, một khung truy vấn chọn lọc, và huấn luyện các biến thể 4B và 8B để lập luận trước, chẩn đoán những gì chưa được giải quyết, và tại nút thắt cổ chai về tri thức, sẽ truy vấn các mô hình mạnh hơn có tri thức tham số vượt xa chính nó. Quá trình tinh chỉnh có giám sát (supervised fine-tuning) khởi động hành động truy vấn đa tầng, và học tăng cường nhận thức chi phí (cost-aware reinforcement learning) hiệu chỉnh việc có nên truy vấn hay không, hỏi những gì và chi phí bao nhiêu. Trên 1.158 bài toán khó qua sáu bộ tiêu chuẩn đánh giá, FlyBy-4B đạt 45,96% pass@8, vượt qua Qwen3-14B (41,64%) với chi phí vận hành thấp hơn 2,7 lần, đồng thời vượt trội hơn Qwen3-8B về pass@1 (16,85% so với 15,31%). Việc mở rộng lên FlyBy-8B tiếp tục cải thiện pass@8 lên 51,81%.
| Bình luận: | bản in trước (preprint) |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.34327 [cs.AI] |
| (hoặc arXiv:2609.34327v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.34327 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Chanuk Lee [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 05:07:24 UTC (956 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.