Thủ thuật
Ứng dụng RAG đa phương thức cho slide thuyết trình: Xây dựng và đánh giá với GPT-4V
(giờ Việt Nam)
Tóm tắt AI
Hướng dẫn xây dựng hệ thống RAG đa phương thức hỗ trợ hỏi đáp nội dung trên slide bằng GPT-4V, kèm theo các phương pháp triển khai và mẫu LangChain thực tế.
Bản dịch AI

Các liên kết chính
Động lực
Retrieval augmented generation (RAG) là một trong những khái niệm quan trọng nhất trong phát triển ứng dụng LLM. Nhiều loại tài liệu có thể được đưa vào cửa sổ ngữ cảnh (context window) của LLM, cho phép tạo ra các trợ lý trò chuyện tương tác hoặc hỏi đáp. Mặc dù phần lớn các ứng dụng RAG hiện nay tập trung vào văn bản, nhưng một lượng lớn thông tin lại được truyền tải dưới dạng nội dung trực quan. Ví dụ, các bộ slide thường được sử dụng cho nhiều mục đích, từ thuyết trình cho nhà đầu tư đến truyền thông nội bộ công ty. Với sự ra đời của các LLM đa phương thức (multi-modal) như GPT-4V, giờ đây chúng ta đã có thể triển khai RAG trên nội dung trực quan thường thấy trong các bộ slide. Dưới đây, chúng tôi trình bày hai cách khác nhau để giải quyết vấn đề này. Chúng tôi chia sẻ một bộ benchmark công khai để đánh giá RAG trên các bộ slide và sử dụng nó để làm nổi bật sự đánh đổi giữa các phương pháp này. Cuối cùng, chúng tôi cung cấp một template để tạo nhanh các ứng dụng RAG đa phương thức cho slide.
Thiết kế
Nhiệm vụ này tương tự như các ứng dụng RAG trên tài liệu văn bản: truy xuất (các) slide liên quan dựa trên câu hỏi của người dùng và chuyển chúng đến một LLM đa phương thức (GPT-4V) để tổng hợp câu trả lời. Có ít nhất hai cách tiếp cận chung cho vấn đề này.
(1) Multi-modal embeddings: Trích xuất các slide dưới dạng hình ảnh, sử dụng các mô hình nhúng đa phương thức (multi-modal embeddings) để nhúng từng hình ảnh, truy xuất (các) slide hình ảnh liên quan dựa trên đầu vào của người dùng, và chuyển những hình ảnh đó cho GPT-4V để tổng hợp câu trả lời. Chúng tôi đã từng phát hành một cookbook cho phương pháp này với Chroma và OpenCLIP embeddings.
(2) Multi-vector retriever: Trích xuất các slide dưới dạng hình ảnh, sử dụng GPT-4V để tóm tắt từng hình ảnh, nhúng các bản tóm tắt hình ảnh kèm liên kết đến hình ảnh gốc, truy xuất hình ảnh liên quan dựa trên sự tương đồng giữa bản tóm tắt hình ảnh và đầu vào của người dùng, và cuối cùng chuyển những hình ảnh đó cho GPT-4V để tổng hợp câu trả lời. Chúng tôi đã từng phát hành một cookbook cho phương pháp này với multi-vector retriever.
Sự đánh đổi giữa các phương pháp này rất rõ ràng: multi-modal embeddings có thiết kế đơn giản hơn, phản ánh những gì chúng ta làm với các ứng dụng RAG dựa trên văn bản, nhưng các tùy chọn còn hạn chế và có một số câu hỏi về khả năng truy xuất các biểu đồ hoặc bảng biểu trông có vẻ tương tự nhau về mặt thị giác. Ngược lại, việc sử dụng bản tóm tắt hình ảnh tận dụng các mô hình nhúng văn bản đã hoàn thiện và có thể mô tả các biểu đồ hoặc hình ảnh với độ chi tiết đáng kể. Tuy nhiên, thiết kế này lại chịu sự phức tạp và chi phí cao hơn cho việc tóm tắt hình ảnh.
Đánh giá
Để đánh giá các phương pháp này, chúng tôi đã chọn một bài thuyết trình báo cáo thu nhập gần đây của Datadog như một bộ slide thực tế với sự kết hợp giữa các yếu tố trực quan và định tính. Chúng tôi tạo một benchmark LangChain công khai nhỏ cho bộ slide này với 10 câu hỏi: bạn có thể xem tài liệu đánh giá trên benchmark này tại đây và tại đây.
Như một bước kiểm tra tính hợp lý (sanity check), chúng ta có thể thấy rằng việc truy xuất slide dựa trên mô tả bằng ngôn ngữ tự nhiên về nội dung slide là hoàn toàn khả thi (xem mã nguồn bên dưới tại đây).
Các cặp câu hỏi-trả lời trong benchmark của chúng tôi dựa trên nội dung trực quan của các slide. Chúng tôi đã đánh giá hai phương pháp RAG nêu trên bằng LangSmith và so sánh với RAG sử dụng trích xuất văn bản (Top K RAG (chỉ văn bản)).
Phương pháp
Điểm số (Độ chính xác CoT)
Top k RAG (chỉ văn bản)
20%
Multi-modal embeddings
60%
Multi-vector retriever kèm tóm tắt hình ảnh
90%
LangSmith cung cấp chế độ xem so sánh, nơi chúng ta có thể xem xét kết quả của từng thử nghiệm cạnh nhau. Đây là trang công khai nơi các lượt đánh giá có thể được so sánh chi tiết. Hình ảnh bên dưới hiển thị chế độ xem so sánh lượt chạy.
Sử dụng phân tích so sánh ở trên, chúng ta có thể so sánh nội dung được truy xuất cho từng câu hỏi. Các slide này cung cấp cái nhìn sâu sắc về mọi cặp câu hỏi - trả lời trong tập đánh giá cùng với các dấu vết (traces) LangSmith liên quan.
Thông tin chi tiết
Triển khai
Để hỗ trợ việc thử nghiệm ứng dụng RAG đa phương thức cho trường hợp sử dụng này, chúng tôi đang phát hành một template sử dụng cả Chroma và OpenCLIP multi-modal embeddings. Điều này giúp việc bắt đầu trở nên cực kỳ dễ dàng: chỉ cần tải lên một bài thuyết trình và làm theo tệp README (chỉ cần hai lệnh để xây dựng vectorstore và chạy playground). Dưới đây, chúng ta có thể thấy playground trò chuyện tương tác (bên trái) trên bài thuyết trình thu nhập của Datadog với dấu vết LangSmith (bên phải) hiển thị việc truy xuất slide chính xác.
Kết luận
Các LLM đa phương thức có tiềm năng khai thác nội dung trực quan trong các bộ slide cho các ứng dụng RAG. Chúng tôi đã xây dựng một bộ đánh giá benchmark công khai gồm các cặp câu hỏi-trả lời trên một bộ slide thuyết trình nhà đầu tư của Datadog (tại đây). Chúng tôi đã thử nghiệm RAG đa phương thức bằng hai phương pháp trên benchmark này. Chúng tôi nhận thấy cả hai đều vượt trội hơn hiệu suất của RAG chỉ dùng văn bản. Chúng tôi đã xác định được sự đánh đổi giữa các phương pháp cho RAG đa phương thức: việc tóm tắt văn bản của từng slide có thể cải thiện khả năng truy xuất nhưng phải trả giá bằng việc tạo trước các bản tóm tắt cho từng slide. Các mô hình đa phương thức có khả năng có mức hiệu suất tối đa cao hơn, nhưng các tùy chọn hiện tại còn hơi hạn chế và trong thử nghiệm của chúng tôi, chúng hoạt động kém hơn so với tóm tắt văn bản. Để hỗ trợ việc thử nghiệm và triển khai các ứng dụng RAG đa phương thức, chúng tôi cũng đang phát hành một template.





Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.