Apple Machine Learning Research
85

Nghiên cứu

Apple giới thiệu GH-ESD: Phương pháp phát hiện lỗi mô hình cho các tác vụ thị giác máy tính

(giờ Việt Nam)

Tóm tắt AI

Apple ra mắt GH-ESD, một phương pháp mới giúp phát hiện lỗi hệ thống trong các tác vụ nhận diện và phân đoạn đối tượng, khắc phục hạn chế của các kỹ thuật cũ vốn chỉ tập trung vào phân loại hình ảnh.

Bản dịch AI

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

Tác giả: Wei Zhang*, Chaoqun Wang*, Zixuan Guan, Ping Sheng Kao, Pengfei Zhao, Peng Wu, Sifeng He

Những lỗi hệ thống của các mô hình thị giác trên các tập con có tính nhất quán về ngữ nghĩa, được gọi là các "error slice" (lát cắt lỗi), đã bộc lộ những hạn chế về độ bền vững và khả năng đánh giá. Các phương pháp khám phá slice hiện có chủ yếu mô hình hóa các slice dưới dạng các cụm trong không gian biểu diễn hoặc sự kết hợp của các thuộc tính được xác định trước. Mặc dù hiệu quả đối với phân loại cấp độ hình ảnh, các công thức này lại không đủ cho các tác vụ cấp độ thực thể như phát hiện và phân đoạn đối tượng, nơi các lỗi thường phát sinh từ các mô hình thị giác dựa trên ngữ cảnh quan hệ và nền tảng không gian. Chúng tôi đề xuất GH-ESD (Grounded Hypothesis-Driven Error Slice Discovery), một khung làm việc "tạo và kiểm chứng" giúp tái cấu trúc việc khám phá slice thành việc tạo giả thuyết có căn cứ và kiểm chứng thống kê. GH-ESD xây dựng các giả thuyết lỗi quan hệ bằng cách sử dụng các tiền đề từ LLM và bằng chứng thị giác thực tế, khám phá các slice giả thuyết ở cấp độ thực thể thông qua các Vision Language Models, và kiểm chứng chúng thông qua phân tích xu hướng thống kê trên các lỗi ở cấp độ thực thể. Chúng tôi cũng giới thiệu GESD (Grounded Error Slice Dataset), một bộ tiêu chuẩn mới cho việc khám phá slice lỗi ở cấp độ thực thể, cung cấp các slice được chuyên gia xác định và có căn cứ không gian, bắt nguồn từ các lỗi phát hiện và phân đoạn. Các thử nghiệm mở rộng cho thấy GH-ESD liên tục vượt trội hơn các phương pháp cơ sở, cải thiện Precision@10 thêm 0,10 (0,73 so với 0,63) trên bộ tiêu chuẩn GESD cho các tác vụ phát hiện, đồng thời hỗ trợ cả các kịch bản phân đoạn. GH-ESD xác định các slice có thể diễn giải được, giúp tạo điều kiện cho các cải tiến mô hình mang tính thực tiễn.

* Đóng góp ngang nhau.

Các bài đọc và cập nhật liên quan.

Các nghiên cứu gần đây đã chỉ ra rằng mạng thần kinh sâu được hưởng lợi từ học đa tác vụ (multi-task learning) thông qua việc học một biểu diễn chung trên nhiều tác vụ liên quan. Tuy nhiên, hiệu suất của các hệ thống như vậy phụ thuộc vào trọng số tương đối giữa các hàm mất mát (loss) khác nhau trong quá trình huấn luyện. Các nghiên cứu trước đây về lược đồ trọng số hàm mất mát giả định rằng các thực thể đều có độ khó như nhau đối với tất cả các tác vụ. Để phá vỡ giả định này, chúng tôi để quá trình huấn luyện quyết định...

Đọc thêm

Trong nghiên cứu này, chúng tôi kết nối hai khái niệm riêng biệt cho thích nghi miền không giám sát (unsupervised domain adaptation): căn chỉnh phân phối đặc trưng giữa các miền bằng cách sử dụng ranh giới quyết định đặc thù của tác vụ và thước đo Wasserstein. Sliced Wasserstein discrepancy (SWD) mà chúng tôi đề xuất được thiết kế để nắm bắt khái niệm tự nhiên về sự khác biệt giữa đầu ra của các bộ phân loại đặc thù tác vụ. Nó cung cấp một sự hướng dẫn có ý nghĩa về mặt hình học để phát hiện các mẫu mục tiêu mà...

Đọc thêm

AppleThị giác máy tínhNghiên cứu AIMachine LearningObject Detection
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.