Nghiên cứu
Khi giảm chiều dữ liệu gặp khoa học mạng: Ứng dụng đồ thị kNN của UMAP trong phân tích dữ liệu
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu của Apple khai thác đồ thị kNN từ thuật toán UMAP để phân tích cấu trúc dữ liệu phức tạp. Bằng cách áp dụng các thuật toán đồ thị như PageRank, phương pháp này giúp nhận diện các điểm dữ liệu quan trọng và cấu trúc phân tầng hiệu quả như các kỹ thuật chuyên dụng.
Bản dịch AI

Tác giả: Duen Horng (Polo) Chau, Donghao Ren, Fred Hohman, Dominik Moritz
Mặc dù UMAP được sử dụng rộng rãi để khám phá dữ liệu đa chiều, các quy trình làm việc điển hình thường chỉ tập trung vào kết quả nhúng (embedding) ở không gian thấp hơn, mà bỏ qua đồ thị k-nearest-neighbor (kNN) phong phú mà UMAP xây dựng ở bên trong. Đồ thị này mã hóa cấu trúc đa tạp (manifold) của dữ liệu trong không gian đa chiều gốc trước khi bị biến dạng bởi phép chiếu 2D của UMAP. Chúng tôi chứng minh tiềm năng chưa được khai thác của biểu diễn nội tại này, cho thấy cách các thuật toán đồ thị tiêu chuẩn khi áp dụng vào đồ thị này có thể nâng cao khả năng thấu hiểu dữ liệu: (1) PageRank xác định các điểm dữ liệu đại diện, (2) k-core decomposition tiết lộ các vùng lõi dày đặc so với vùng ngoại vi thưa thớt, và (3) clustering coefficient phát hiện các vùng lân cận gắn kết chặt chẽ với các điểm dữ liệu có độ tương đồng cao. Thông qua đánh giá định lượng và định tính trên MNIST và Fashion MNIST, chúng tôi cho thấy các phân tích dựa trên đồ thị này không chỉ thực tiễn mà còn có tính cạnh tranh hoặc bổ trợ cho các phương pháp chuyên dụng (ví dụ: k-medoids để chọn mẫu đại diện, HDBSCAN để phân cụm dựa trên mật độ).
Các bài đọc liên quan và cập nhật.
Học tự giám sát (Self-supervised learning - SSL) trên đồ thị tạo ra các biểu diễn nút và đồ thị (tức là các embedding) có thể được sử dụng cho các tác vụ hạ nguồn như phân loại nút, phân cụm nút và dự đoán liên kết. Graph SSL đặc biệt hữu ích trong các tình huống có ít hoặc không có dữ liệu được gán nhãn. Các phương pháp SSL hiện có chủ yếu tuân theo mô hình đối lập (contrastive) hoặc tạo sinh (generative), mỗi loại đều vượt trội trong các tác vụ khác nhau: các phương pháp đối lập thường hoạt động tốt trên…
Đọc thêm
Việc đưa các bộ nhớ (memory bank) vào kiến trúc xử lý ngôn ngữ tự nhiên giúp tăng năng lực của mô hình bằng cách trang bị cho nó dữ liệu bổ sung tại thời điểm suy luận (inference). Trong bài báo này, chúng tôi phát triển dựa trên kNN-LM, vốn sử dụng một mô hình ngôn ngữ được huấn luyện trước kết hợp với tìm kiếm kNN toàn diện thông qua dữ liệu huấn luyện (memory bank) để đạt được kết quả tối tân (state-of-the-art). Chúng tôi nghiên cứu liệu có thể cải thiện hiệu suất của kNN-LM bằng cách thay vào đó huấn luyện một LM với kiến thức…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.