Nghiên cứu
Khi việc 'lãng quên' không tốn phí: Tối ưu hóa học máy bằng cách loại bỏ dữ liệu ít ảnh hưởng
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu của Apple đề xuất phương pháp mới giúp giảm chi phí tính toán khi xóa dữ liệu trong mô hình học máy bằng cách xác định và bỏ qua các điểm dữ liệu có ảnh hưởng không đáng kể, thay vì xử lý toàn bộ tập dữ liệu như trước đây.
Bản dịch AI

Tác giả: Udi Wieder, Vitaly Feldman, Robert Fisher, Anat Kleiman†
Khi những lo ngại về quyền riêng tư dữ liệu trong học máy ngày càng gia tăng, khả năng "học quên" (unlearn) hoặc loại bỏ các điểm dữ liệu cụ thể khỏi các mô hình đã huấn luyện trở nên quan trọng hơn bao giờ hết. Mặc dù các phương pháp học quên tiên tiến (state of the art) đã xuất hiện để giải quyết vấn đề này, chúng thường xử lý tất cả các điểm trong tập dữ liệu cần quên (forget set) một cách như nhau. Trong nghiên cứu này, chúng tôi thách thức cách tiếp cận đó bằng cách đặt câu hỏi liệu các điểm có tác động không đáng kể đến quá trình học của mô hình có thực sự cần phải loại bỏ hay không. Thông qua phân tích so sánh các hàm ảnh hưởng (influence functions) trên các tác vụ ngôn ngữ và thị giác máy tính, chúng tôi xác định được các tập con của dữ liệu huấn luyện có tác động không đáng kể đến đầu ra của mô hình. Tận dụng thông tin này, chúng tôi đề xuất một khung làm việc học quên hiệu quả giúp giảm kích thước tập dữ liệu trước khi thực hiện học quên, từ đó tiết kiệm đáng kể tài nguyên tính toán (lên đến khoảng 50%) trên các ví dụ thực nghiệm thực tế.
Các bài đọc liên quan và cập nhật.
Khi những lo ngại về quyền riêng tư dữ liệu trong học máy ngày càng gia tăng, khả năng học quên—hay loại bỏ—các điểm dữ liệu cụ thể khỏi các mô hình đã huấn luyện trở nên quan trọng hơn bao giờ hết. Mặc dù các phương pháp học quên tiên tiến (state-of-the-art) đã xuất hiện để giải quyết vấn đề này, chúng thường xử lý tất cả các điểm trong tập dữ liệu cần quên một cách như nhau. Trong nghiên cứu này, chúng tôi thách thức cách tiếp cận đó bằng cách đặt câu hỏi: liệu các điểm có tác động không đáng kể đến quá trình học của mô hình có cần phải loại bỏ hay không? Thông qua một phân tích so sánh…
Đọc thêm
*= Đóng góp ngang nhau
Khôi phục các không gian con tuyến tính từ dữ liệu là một tác vụ cơ bản và quan trọng trong thống kê và học máy. Được thúc đẩy bởi tính không đồng nhất trong các thiết lập Học liên kết (Federated Learning), chúng tôi nghiên cứu một công thức cơ bản của bài toán này: phân tích thành phần chính (PCA), với trọng tâm là xử lý nhiễu bất thường. Dữ liệu của chúng tôi đến từ n người dùng, với mỗi người dùng i đóng góp các mẫu dữ liệu từ một phân phối d-chiều với giá trị trung bình μi…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.