Apple Machine Learning Research
85

Tin ngành

Glyph: Hệ thống AI của Apple giúp tự động hóa mô tả và phân loại dữ liệu doanh nghiệp

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu Glyph, hệ thống AI sử dụng các tác nhân thông minh để tự động tạo mô tả cột và gắn nhãn dữ liệu nhạy cảm. Hệ thống kết hợp nhiều chiến lược xử lý song song, giúp cải thiện đáng kể độ chính xác trong việc phân loại và quản trị dữ liệu doanh nghiệp.

Bản dịch AI

Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs

Tác giả: Kostia Kudriavtsev, Parvez Rafi, Sha Sundaram

Các hồ dữ liệu doanh nghiệp (enterprise data lakes) tích lũy các bảng dữ liệu nhanh hơn tốc độ con người có thể ghi chép hoặc phân loại chúng, dẫn đến tình trạng các cột dữ liệu bị thiếu mô tả và không được gán nhãn quản trị. "Khoản nợ tài liệu" này làm suy yếu khả năng khám phá dữ liệu, kiểm soát truy cập và tuân thủ quy định. Chúng tôi giới thiệu Glyph, một hệ thống thực tế giải quyết hai vấn đề song hành: tạo mô tả cột và chú thích loại cột để phân loại dữ liệu, thông qua các tác nhân LLM (LLM agents) phối hợp được điều phối dưới dạng các đồ thị có trạng thái (stateful graphs). Descriptor (bộ mô tả) dựa trên mã nguồn của pipeline tạo ra từng cột, được truy xuất theo yêu cầu từ GitHub doanh nghiệp thông qua vòng lặp suy luận-hành động (active Retrieval-Augmented Generation). Tagger (bộ gắn nhãn) gán các nhãn từ một Ontology Phân loại Dữ liệu gồm 275 nhánh bằng cách chạy song song ba chiến lược bổ trợ (bộ gắn nhãn mô tả, bộ gắn nhãn regex theo dòng nghiệp vụ, và bộ gắn nhãn siêu dữ liệu dựa trên một bộ mã hóa tương phản (contrastive encoder) đã được tinh chỉnh trên cơ sở dữ liệu vector), sau đó hợp nhất các kết quả đã xếp hạng bằng phương pháp Reciprocal Rank Fusion (RRF). Chúng tôi tinh chỉnh một bộ mã hóa siêu dữ liệu MiniLM 6 lớp với mục tiêu tương phản trong batch, giúp nâng cao khả năng truy xuất cùng nhãn trên tập dữ liệu kiểm thử từ NDCG@10 0.55 lên 0.92 (MAP@100 0.19 → 0.90) so với bộ mã hóa cơ sở thông thường. Chúng tôi báo cáo chất lượng gắn nhãn đa nhãn (multi-label) end-to-end theo mục tiêu F2 có trọng số recall trên ba nhóm đánh giá, thực hiện phân tách (ablation) để cô lập từng chiến lược và phương pháp hợp nhất RRF, đồng thời nêu bật các quyết định kỹ thuật giúp Glyph khác biệt so với các nghiên cứu chú thích loại cột trước đây và các trình quét giá trị/regex thương mại: thiết kế không phụ thuộc vào giá trị và dựa trên mã nguồn, nguồn gốc dữ liệu (provenance) cho từng nhãn, và khả năng suy giảm hiệu năng có kiểm soát (graceful degradation). Tất cả những yếu tố này giúp việc lập danh mục bằng LLM đa tác nhân trở nên minh bạch và có thể vận hành như một dịch vụ thực tế.

Các bài đọc liên quan và cập nhật.

Khả năng diễn giải tự động (automated interpretability) hướng tới việc chuyển đổi các đặc trưng của mô hình ngôn ngữ lớn (LLM) thành các mô tả mà con người có thể hiểu được. Tuy nhiên, các mô tả đặc trưng bằng ngôn ngữ tự nhiên này thường mơ hồ, thiếu nhất quán và đòi hỏi phải dán nhãn lại thủ công. Để giải quyết vấn đề này, chúng tôi giới thiệu semantic regexes (biểu thức chính quy ngữ nghĩa), các mô tả ngôn ngữ có cấu trúc về đặc trưng của LLM. Bằng cách kết hợp các thành phần cơ bản nắm bắt các mẫu đặc trưng ngôn ngữ và ngữ nghĩa với các bộ điều chỉnh để tạo ngữ cảnh,…

Đọc thêm

Chúng tôi trình bày một nghiên cứu thực nghiệm về việc nhúng lời bài hát vào một đặc trưng có chiều cố định phục vụ mục đích gắn nhãn âm nhạc. Năm phương pháp tính toán biểu diễn ở cấp độ token và bốn phương pháp ở cấp độ văn bản đã được huấn luyện trên một tập dữ liệu quy mô công nghiệp gồm hàng chục triệu bài hát. Chúng tôi so sánh phương pháp lấy trung bình đơn giản của các embedding được huấn luyện trước với các kiến trúc thần kinh hiện đại dựa trên mạng hồi quy và cơ chế chú ý (attention). Đánh giá trên phạm vi rộng…

Đọc thêm

AppleQuản trị dữ liệuAI doanh nghiệpLLMPhân loại dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.