Tin ngành
Apple giới thiệu DSAS: Phương pháp mới giúp kiểm soát hành vi mô hình AI linh hoạt hơn
(giờ Việt Nam)
Tóm tắt AI
Apple ra mắt DSAS, khung điều hướng kích hoạt thích ứng giúp tách biệt thời điểm và cách thức can thiệp vào mô hình, cho phép điều chỉnh hành vi AI chính xác mà không làm giảm hiệu suất.
Bản dịch AI

Tác giả: Alex Ferrando de las Morenas†, Xavier Suau Cuadros, Jordi Gonzàlez Sabaté†, Pau Rodríguez Lopez
Activation steering (điều hướng kích hoạt) đã nổi lên như một phương pháp mạnh mẽ để dẫn dắt hành vi của các mô hình tạo sinh hướng tới những kết quả mong muốn, chẳng hạn như giảm thiểu độc hại. Tuy nhiên, hầu hết các phương pháp hiện có đều áp dụng can thiệp đồng nhất trên mọi đầu vào, làm suy giảm hiệu suất mô hình khi việc điều hướng là không cần thiết. Chúng tôi giới thiệu Dynamically Scaled Activation Steering (DSAS), một khung điều hướng bất khả tri về phương pháp (method-agnostic), giúp tách biệt thời điểm điều hướng và cách thức điều hướng. DSAS điều chỉnh linh hoạt cường độ của các phép biến đổi điều hướng hiện có trên các lớp và đầu vào, chỉ can thiệp mạnh khi phát hiện hành vi không mong muốn. Tại thời điểm tạo văn bản, DSAS tính toán các hệ số tỷ lệ phụ thuộc vào ngữ cảnh để điều chỉnh chọn lọc cường độ của bất kỳ phương pháp điều hướng nào. Chúng tôi cũng chỉ ra cách DSAS có thể được tối ưu hóa đồng thời từ đầu đến cuối (end-to-end) cùng với hàm điều hướng. Khi kết hợp với các phương pháp điều hướng hiện có, DSAS liên tục cải thiện đường cong Pareto so với việc chỉ sử dụng điều hướng đơn thuần, đạt được sự cân bằng tốt hơn giữa việc giảm thiểu độc hại và bảo toàn tính hữu dụng. Chúng tôi cũng chứng minh tính tổng quát của DSAS bằng cách áp dụng nó vào một mô hình khuếch tán văn bản-thành-ảnh (text-to-image diffusion model), cho thấy cách điều hướng thích ứng cho phép điều biến các khái niệm cụ thể. Cuối cùng, DSAS tạo ra chi phí tính toán tối thiểu trong khi cải thiện khả năng diễn giải, xác định chính xác những token nào cần điều hướng và mức độ điều hướng là bao nhiêu. Mã nguồn sẽ được cung cấp trên Github.
Các bài đọc liên quan và cập nhật.
Bài báo này đã được chấp nhận tại Workshop on Unifying Representations in Neural Models (UniReps) tại NeurIPS 2025.
Các phương pháp activation steering trong các mô hình ngôn ngữ lớn (LLMs) đã nổi lên như một cách hiệu quả để thực hiện các cập nhật có mục tiêu nhằm nâng cao ngôn ngữ được tạo ra mà không cần lượng lớn dữ liệu thích ứng. Chúng tôi đặt câu hỏi liệu các đặc trưng được phát hiện bởi các phương pháp activation steering có thể diễn giải được hay không. Chúng tôi xác định các neuron chịu trách nhiệm cho các... cụ thể.
Đọc thêm
*Đóng góp ngang nhau
Trong bối cảnh của một hệ thống trợ lý giọng nói, steering (điều hướng) đề cập đến hiện tượng người dùng đưa ra một lệnh tiếp nối nhằm hướng dẫn hoặc làm rõ lượt tương tác trước đó. Chúng tôi đề xuất STEER, một mô hình phát hiện điều hướng dự đoán liệu một lượt tương tác tiếp nối có phải là nỗ lực của người dùng nhằm điều hướng lệnh trước đó hay không. Việc xây dựng tập dữ liệu huấn luyện cho các trường hợp sử dụng điều hướng đặt ra nhiều thách thức do vấn đề khởi động lạnh (cold-start problem). Để khắc phục điều này, chúng tôi...
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.