Thủ thuật
Phân loại bằng LLM thực chất là kỹ thuật đặc trưng: Kết hợp LLM với hồi quy logistic
(giờ Việt Nam)
Tóm tắt AI
Thay vì dùng LLM trực tiếp làm bộ phân loại thiếu độ tin cậy, tác giả đề xuất sử dụng kết quả từ LLM như một đặc trưng đầu vào cho các mô hình học máy truyền thống như hồi quy logistic để tối ưu hóa hiệu suất.
Bản dịch AI
Việc sử dụng LLMs-as-classifiers (LLM làm bộ phân loại), tức là áp dụng các câu lệnh (prompt) vào một ngữ cảnh để trả về một nhãn, thực sự rất khó làm việc. Điều này đặc biệt gây khó chịu vì chúng thường hoạt động khá hiệu quả.
Nhưng hãy xem xét một số yếu tố mà chúng ta mong muốn ở một bộ phân loại và đánh giá xem LLM-as-classifier đáp ứng được đến đâu:
LLM có sẵn một số thông tin tiên nghiệm (prior information) có thể không phù hợp với phân phối dữ liệu của chúng ta. Ví dụ, LLM sẽ không biết liệu chúng ta đang thử nghiệm trên một quần thể mà lớp dương tính (positive class) hiếm gặp hay một quần thể phong phú nơi lớp dương tính phổ biến hơn. Tôi đoán bạn có thể cung cấp ngữ cảnh đó, nhưng giờ đây bạn phải sửa đổi nó cho mỗi quần thể mới và như đã nêu ở điểm đầu tiên, không rõ liệu điều này có được kết hợp một cách thích hợp vào phán đoán của LLM hay không.
Những thất bại này không phải lỗi của LLM: nó không được thiết kế như một bộ phân loại và thực tế không có cơ chế nào để thực hiện những việc này một cách hợp lý. Nhưng đó chỉ là vì chúng ta đang suy nghĩ sai lệch về vấn đề…
Với một khung làm việc (framework) phù hợp khai thác sức mạnh của LLM, chúng ta có thể tận dụng sức mạnh của LLM với sự tiện lợi của các thuật toán ML truyền thống. Để biết những gì có thể đạt được, hãy cân nhắc việc bao bọc (wrap) kết quả của LLM bằng một mô hình hồi quy logistic đơn giản:
\[ p(y = 1 \mid x) = \sigma(\alpha + \beta \cdot LLM(x)) \]
Lưu ý rằng trong trường hợp đặc biệt khi \(\beta \rightarrow \infty\), điều này về cơ bản khôi phục lại bộ phân loại LLM của chúng ta!! Nhưng đó là một chính sách chọn tham số ngớ ngẩn. Thay vào đó, chúng ta nên thực hiện cách tiếp cận thông thường là ước tính các tham số bằng dữ liệu huấn luyện. Điều này sau đó sẽ quy về hai trường hợp và chúng ta chỉ cần các ước tính thực nghiệm.
\[ p(y = k \mid LLM(x) = 1) = \frac{\sum_{i} I(y_{i} = k \text{ and } LLM(x_{i}) = 1)}{\sum_{i} I(LLM(x_{i}) = 1)} \]
Bây giờ hãy xem xét lại các yêu cầu (desiderata) của chúng ta:
Chúng ta về cơ bản đã khôi phục lại tất cả các đặc tính tốt mà chúng ta mong muốn từ mô hình của mình! Liệu chúng ta có thể tiến xa hơn nữa không?
Phân loại bằng LLM thực chất là kỹ thuật đặc trưng (feature engineering) rất tốt.
Giả sử chúng ta không hài lòng với hiệu suất của bộ phân loại: chúng ta nên làm gì? Trong trường hợp LLM-as-classifier, lựa chọn duy nhất của chúng ta là thử thay đổi câu lệnh (prompt). Đây là một công việc bí ẩn mà trên internet có rất nhiều lời khuyên nhưng lại thiếu sự sáng suốt. Chúc bạn may mắn.
Từ quan điểm của ML, cách để bạn cải thiện mô hình của mình là:
Trường hợp thử nghiệm: Phát hiện mỉa mai (Irony Detection)
Hãy làm cho điều này cụ thể hơn bằng một ví dụ. Chúng ta sẽ sử dụng tập dữ liệu SemEval 2018 Task 3, một bộ sưu tập gồm 4618 tweet (3834 huấn luyện / 784 kiểm tra) được dán nhãn mỉa mai bởi các chuyên gia. Mỉa mai là một ví dụ phù hợp cho bài viết này vì đây là một tác vụ NLP mà LLM rõ ràng có tín hiệu thực sự và chúng ta được hưởng lợi từ kiến thức thế giới được nhúng ngầm trong LLM.
Câu lệnh của chúng ta yêu cầu mô hình đưa ra phán đoán nhị phân về sự mỉa mai, và chúng ta chạy nó trên tất cả các tweet cùng một lúc dưới dạng một công việc hàng loạt (batch job):
Hiệu suất
Chúng ta nhận được hiệu suất sau đây chỉ từ câu lệnh này:
Thực sự rất đáng kinh ngạc khi nó hoạt động tốt như vậy ở chế độ one-shot. Bạn sẽ không mong đợi điều này có thể thực hiện được mà không cần học hỏi, đó chính là điều thú vị về LLM. Tất nhiên, nó vẫn khá bình thường: điểm Brier khá tệ vì chúng ta không có hiệu chuẩn (thực tế, việc đoán ngẫu nhiên cũng cho điểm Brier là 0.25).
Các yêu cầu (Desiderata)
Hiệu chuẩn (Calibration)
Chúng ta có thể làm tốt hơn với hồi quy logistic, vốn đạt được sự hiệu chuẩn (mặc dù lưu ý rằng nó không ảnh hưởng đến thứ tự nên F1 vẫn giữ nguyên).
Thêm đặc trưng (Features)
Hãy xem xét một số đặc trưng LLM bổ sung. Trước tiên, hãy nhìn nhanh vào các trường hợp phân loại sai (chúng giống nhau từ cả hai mô hình):
Dựa trên điều này, hãy sửa đổi câu lệnh của chúng ta như sau:
Chúng ta cũng sẽ bắt đầu thêm vào một số đặc trưng tất định (deterministic features) mà chúng ta có thể tính toán:
Vậy chúng ta có thấy sự cải thiện không? Chúng ta so sánh ba mô hình lồng nhau: chỉ có phán quyết, phán quyết + tất cả đặc trưng LLM, phán quyết + tất cả đặc trưng (LLM + dựa trên quy tắc).
Chúng ta thấy lợi ích rõ ràng từ mỗi cấp độ đặc trưng bổ sung, bao gồm cả các đặc trưng tất định nằm ngoài LLM.
Khả năng diễn giải (Interpretability)
Hình ảnh về hệ số cho thấy mô hình thực sự dựa vào những đặc trưng nào, khi kiểm soát tất cả các đặc trưng khác:
Hình 1: Các hệ số hồi quy logistic (± 1 SE), được sắp xếp theo |hệ số|.
So sánh với các kết quả đã công bố
Cách tiếp cận của chúng ta so sánh thế nào với các tài liệu đã công bố về tập dữ liệu này?
Bảng 1: Điểm F1 trên tập kiểm tra SemEval 2018 Task 3A.
Chúng ta thấy rằng bộ phân loại LLM ban đầu của chúng ta vượt qua người chiến thắng cuộc thi một cách dễ dàng (0.747 so với 0.705). Với góc nhìn kỹ thuật đặc trưng, chúng ta có các khoảng tin cậy (CI) chồng lấp với trạng thái hiện đại (SOTA) sau cuộc thi, mà không cần gì ngoài hồi quy logistic trên các đặc trưng được trích xuất từ LLM.
Kết luận
Việc đưa LLM vào khuôn khổ để phục vụ đáng tin cậy như các bộ phân loại là một công việc khó khăn nhưng có khả năng tạo ra tác động lớn. Ngày càng có nhiều nghiên cứu dựa vào LLM để phân loại: như bài "How People Use ChatGPT" sử dụng LLM để phân loại các cuộc hội thoại với LLM, hoặc cuộc "điều tra rác" (slop-vestigation) về sự cố Huggingface. Chúng ta sẽ cần phải đạt được kết quả chất lượng cao từ những công cụ này.
May mắn thay, ngày càng có nhiều bài báo đưa ra quan điểm này.
Cá nhân tôi quan tâm đến việc nghiên cứu các bộ phân loại tác nhân (agentic classifiers). Thay vì một tập đặc trưng cố định hoặc câu lệnh phân loại, bạn trao quyền cho LLM tự điều tra. LLM có thể sử dụng các đặc trưng của quá trình điều tra làm đặc trưng khi phân loại: về cơ bản là tự chấm điểm về sự chặt chẽ và toàn diện của quá trình điều tra. Và với một tập kiểm tra đáng tin cậy, chúng ta có thể đưa ra các suy luận có giá trị thống kê về kết quả!
Điều này xuất hiện với các mô hình đa phương thức (multimodal) mà thậm chí không sử dụng hình ảnh. ↩︎
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.