MarkTechPost
85

Thủ thuật

Phân tích cảm xúc IMDb: Từ TF-IDF đến DistilBERT LoRA, hiệu chuẩn và học bán giám sát

(giờ Việt Nam)

Tóm tắt AI

Hướng dẫn xây dựng quy trình phân tích cảm xúc toàn diện, so sánh mô hình cơ sở TF-IDF với DistilBERT tinh chỉnh bằng LoRA, đồng thời ứng dụng kỹ thuật hiệu chuẩn và học bán giám sát để tối ưu hóa độ chính xác.

Bản dịch AI

IMDb Sentiment Analysis with DistilBERT LoRA, TF-IDF Baselines, Calibration, Interpretability, Robustness Testing, and Semi-Supervised Learning

Trong bài hướng dẫn này, chúng ta sẽ phát triển một quy trình phân tích cảm xúc (sentiment analysis) từ đầu đến cuối (end-to-end) bằng cách sử dụng bộ dữ liệu Stanford NLP IMDb Large Movie Review, đồng thời so sánh phương pháp học máy cổ điển với kỹ thuật tinh chỉnh (fine-tuning) transformer hiệu quả về tham số. Chúng ta bắt đầu bằng việc thiết lập một môi trường có khả năng tái lập và kiểm định bộ dữ liệu về thứ tự lớp, độ lệch độ dài bài đánh giá, dữ liệu trùng lặp và các nhiễu từ quá trình tiền xử lý trước khi huấn luyện mô hình cơ sở (baseline) mạnh mẽ bằng TF-IDF và Logistic Regression. Sau đó, chúng ta tinh chỉnh DistilBERT với LoRA thông qua PEFT, đánh giá mô hình bằng các chỉ số accuracy, macro-F1, ROC-AUC, ma trận nhầm lẫn (confusion matrices) và đường cong ROC, đồng thời xem xét việc lựa chọn ngưỡng và hiệu chỉnh xác suất (probability calibration) thông qua Expected Calibration Error và phân tích độ tin cậy. Ngoài các chỉ số chính, chúng ta còn nghiên cứu các lỗi dự đoán tự tin (confident errors), hiệu suất theo độ dài bài đánh giá, kỹ thuật occlusion saliency ở cấp độ từ ngữ, và việc cắt bớt phần đầu so với phần cuối (head-versus-tail truncation) để hiểu cách mô hình đưa ra dự đoán và những hạn chế về ngữ cảnh dài ảnh hưởng đến hiệu suất như thế nào. Cuối cùng, chúng ta sử dụng tập dữ liệu IMDb không nhãn để thực hiện gán nhãn giả (pseudo-labeling) dựa trên độ tin cậy, so sánh mô hình bán giám sát thu được với mô hình cơ sở, và lưu lại mô hình transformer đã hợp nhất để tái sử dụng cho việc suy luận cảm xúc.

Chúng ta cấu hình môi trường Colab, cài đặt các thư viện cần thiết, áp dụng bản sửa lỗi tương thích PEFT–torchao và thiết lập các hạt giống (seeds) xác định để đảm bảo tính tái lập của các thí nghiệm. Chúng ta tải bộ dữ liệu Stanford IMDb, xáo trộn và lấy mẫu phụ (subsample) các tập huấn luyện và kiểm tra, đồng thời kiểm tra sự cân bằng lớp, phân phối độ dài bài đánh giá, dữ liệu trùng lặp và các nhiễu HTML. Chúng ta cũng trực quan hóa độ dài bài đánh giá và tần suất nhãn để hiểu cấu trúc bộ dữ liệu trước khi xây dựng bất kỳ mô hình nào.

Chúng ta huấn luyện một mô hình cơ sở TF-IDF và Logistic Regression mạnh mẽ, sau đó kiểm tra các n-gram có ảnh hưởng nhất (cả tích cực và tiêu cực) để thiết lập một điểm tham chiếu có thể giải thích được. Tiếp theo, chúng ta mã hóa (tokenize) các bài đánh giá IMDb và cấu hình DistilBERT với các bộ điều hợp (adapters) LoRA, chỉ cập nhật một tập hợp con nhỏ các tham số của mô hình trong khi vẫn giữ nguyên phần khung (backbone). Chúng ta sử dụng Hugging Face Trainer với các kỹ thuật dynamic padding, early stopping, mixed precision và nhiều chỉ số đánh giá để tinh chỉnh transformer một cách hiệu quả.

Chúng ta đánh giá mô hình DistilBERT-LoRA đã tinh chỉnh bằng các chỉ số phân loại, ma trận nhầm lẫn và đường cong ROC, đồng thời so sánh trực tiếp hiệu suất ROC-AUC của nó với mô hình cơ sở TF-IDF. Chúng ta quét qua các ngưỡng phân loại để xác định xem ngưỡng xác suất mặc định là 0.5 có mang lại độ chính xác tốt nhất trên tập đánh giá hay không. Chúng ta cũng tính toán Expected Calibration Error và xây dựng biểu đồ độ tin cậy (reliability diagram) để đo lường mức độ tương quan giữa độ tin cậy dự đoán của mô hình với độ chính xác thực tế.

Chúng ta kiểm tra các dự đoán sai mà mô hình tự tin nhất và nhóm các bài đánh giá theo độ dài để xác định các kiểu lỗi liên quan đến việc cắt bớt dữ liệu và các ví dụ khó. Chúng ta hợp nhất các bộ điều hợp LoRA vào mô hình gốc và áp dụng kỹ thuật leave-one-word-out occlusion để ước tính những từ ngữ nào thúc đẩy các dự đoán cá nhân hướng tới cảm xúc tích cực hoặc tiêu cực. Sau đó, chúng ta so sánh các dự đoán dựa trên phần đầu và phần cuối của các bài đánh giá dài để xác định xem thông tin cảm xúc mạnh nhất nằm ở đâu.

Chúng ta sử dụng transformer đã tinh chỉnh để tạo các nhãn giả có độ tin cậy cao cho các ví dụ từ tập dữ liệu không nhãn của IMDb và thêm các ví dụ này vào tập huấn luyện TF-IDF. Chúng ta so sánh bộ phân loại đã được tăng cường với mô hình cơ sở ban đầu để đo lường xem việc tự huấn luyện bán giám sát (semi-supervised self-training) có cải thiện độ chính xác dự đoán hay không. Cuối cùng, chúng ta lưu mô hình DistilBERT và tokenizer đã hợp nhất, chạy suy luận cảm xúc trên các bài đánh giá tùy chỉnh và tóm tắt hiệu suất của tất cả các mô hình đã phát triển trong suốt bài hướng dẫn.

Tóm lại, chúng ta đã phát triển một quy trình phân loại cảm xúc chặt chẽ, vượt xa việc chỉ tinh chỉnh một transformer và báo cáo độ chính xác. Chúng ta đã thiết lập một mô hình cơ sở TF-IDF cạnh tranh, huấn luyện DistilBERT hiệu quả với LoRA, và đánh giá cả chất lượng dự đoán lẫn độ tin cậy xác suất, đồng thời xác định cách độ dài bài đánh giá, việc cắt bớt dữ liệu và các lỗi tự tin ảnh hưởng đến hiệu suất trong thực tế. Chúng ta cũng giải thích các dự đoán cá nhân thông qua kỹ thuật occlusion-based saliency, kiểm tra xem thông tin cảm xúc tập trung ở gần đầu hay cuối các bài đánh giá dài, và mở rộng học có giám sát với các nhãn giả có độ tin cậy cao từ bộ dữ liệu không nhãn.

Xem TOÀN BỘ MÃ NGUỒN tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Ra mắt sản phẩm hoặc Hội thảo trực tuyến (Webinar), v.v.? Hãy kết nối với chúng tôi.

Sana Hassan, thực tập sinh tư vấn tại Marktechpost và là sinh viên chương trình bằng kép tại IIT Madras, có niềm đam mê áp dụng công nghệ và AI để giải quyết các thách thức thực tế. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, cô mang đến một góc nhìn mới mẻ cho sự giao thoa giữa AI và các giải pháp trong đời sống.

NLPDistilBERTLoRAPhân tích cảm xúcHọc máy
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.