Nghiên cứu
Netflix thử nghiệm GenRec: Mô hình ngôn ngữ thay thế thuật toán gợi ý truyền thống
(giờ Việt Nam)
Tóm tắt AI
Netflix phát triển GenRec, hệ thống gợi ý dựa trên LLM giúp cải thiện chất lượng xếp hạng 1,6% và giảm 40 lần dữ liệu gắn nhãn so với các thuật toán thủ công hiện tại.
Bản dịch AI
Netflix đã đặt công cụ gợi ý nội dung vốn đã hoạt động nhiều năm của mình lên bàn cân so sánh với một mô hình ngôn ngữ và cho biết họ đã thu được kết quả tốt hơn. Hệ thống này, được gọi là GenRec, chỉ cần một phần nhỏ dữ liệu huấn luyện được gán nhãn so với hệ thống cũ.
Theo một bài đăng trên blog từ đội ngũ kỹ thuật của Netflix, hệ thống gợi ý hiện tại của hãng dựa vào hàng nghìn đặc trưng (features) được thiết kế thủ công về người dùng, tiêu đề nội dung và các tương tác. Sự phức tạp đó khiến việc tích hợp các loại nội dung mới như trò chơi, chương trình trực tiếp hoặc podcast, cũng như mở rộng sang các khu vực mới trên giao diện Netflix trở nên tốn kém. Tuy nhiên, các mô hình ngôn ngữ có sẵn (off-the-shelf) cũng chưa sẵn sàng cho việc gợi ý nội dung. Chúng thường quá ưu tiên các nội dung phổ biến, "ảo tưởng" ra các tiêu đề không tồn tại trong danh mục và bỏ qua các quy tắc kinh doanh.
GenRec được thiết kế để lấp đầy khoảng trống đó. Netflix huấn luyện một mô hình độc quyền theo hai giai đoạn. Đầu tiên, một mô hình ngôn ngữ mở (open-weight) chưa được đặt tên sẽ được tinh chỉnh (fine-tuned) trên dữ liệu của Netflix để hiểu về danh mục nội dung và hành vi người dùng. Sau đó, một vòng huấn luyện chuyên biệt thứ hai sẽ biến mô hình cơ sở đó thành một bộ xếp hạng gợi ý. Giai đoạn thứ hai này được cập nhật thường xuyên hơn để bắt kịp các tiêu đề mới và sự thay đổi trong sở thích người dùng.

Lịch sử xem trở thành văn bản thuần túy
Thay vì mã hóa dữ liệu người dùng thành các vectơ số dày đặc, Netflix chuyển đổi chúng thành văn bản thuần túy. Các hành động như phát nội dung, thời lượng xem, lượt thích hoặc không thích, thêm vào danh sách và bỏ dở giữa chừng trở thành một dạng đối thoại giữa người dùng và hệ thống gợi ý. Mô hình tự nắm bắt các khuôn mẫu như sở thích thể loại hoặc sự thay đổi trong mối quan tâm của người dùng, thay vì phải thông qua các đặc trưng được thiết kế thủ công.

Một phiên bản văn bản đầy đủ của mọi tương tác sẽ vượt quá cửa sổ ngữ cảnh (context window) của mô hình, vì vậy Netflix lọc dữ liệu rất quyết liệt. Các sự kiện có tín hiệu cao như các phiên xem dài sẽ được giữ lại chi tiết, trong khi các lượt chạm ngắn hoặc cuộn nhanh sẽ bị loại bỏ và các phiên xem liên tục (binge) sẽ được tóm tắt lại. Để ngăn mô hình gợi ý các tiêu đề không thực sự tồn tại, Netflix bổ sung một thành phần riêng biệt chỉ chấm điểm các mục có trong danh mục thực tế.

GenRec chạy trên vLLM ở chế độ mà mô hình đọc đầu vào một lần và chấm điểm tất cả các ứng viên trong một lượt duy nhất mà không cần tạo ra bất kỳ văn bản nào. Điều này giúp kiểm soát chi phí hiệu quả.
Những cải thiện nhỏ nhưng có ý nghĩa thống kê vững chắc
So với hệ thống sản xuất đã được tinh chỉnh qua nhiều năm, GenRec mang lại chất lượng xếp hạng tốt hơn khoảng 1,6% trong môi trường ngoại tuyến (offline). Nó cần ít hơn khoảng 40 lần các ví dụ được gán nhãn trong giai đoạn huấn luyện thứ hai để đạt được kết quả đó. Sự so sánh này chỉ áp dụng cho giai đoạn cụ thể này, không phải cho toàn bộ dữ liệu huấn luyện.

Đối với thử nghiệm trực tuyến (online), Netflix đã thực hiện một thí nghiệm A/B kéo dài bốn tuần trên khoảng mười phần trăm lưu lượng truy cập của mình, giới hạn ở các bề mặt gợi ý được tính toán trước. Một chỉ số ngắn hạn theo dõi hành vi người dùng trên màn hình chính đã tăng 0,115% và một chỉ số cốt lõi dài hạn đã cải thiện 0,006%. Theo Netflix, cả hai mức tăng này đều quá lớn để có thể coi là ngẫu nhiên.

Việc tinh chỉnh chuyên biệt cho gợi ý ở Giai đoạn 2 giúp tăng thêm 35 đến 50 phần trăm hiệu suất so với mô hình cơ sở. Khi mô hình cơ sở đã cũ hai tuần, khoảng cách đó nới rộng lên khoảng 80 phần trăm, vì mô hình cơ sở không còn phản ánh được các tiêu đề mới và sở thích đã thay đổi. Các mô hình gợi ý rất nhanh bị lỗi thời.
Kỹ thuật ngữ cảnh thay thế kỹ thuật đặc trưng
Netflix coi GenRec là một phần của sự chuyển dịch rộng lớn hơn, vốn cũng đang xuất hiện trong các công trình như PLUM, GLIDE và OneRec-Think. Thay vì xây dựng các kiến trúc tùy chỉnh cho từng tác vụ gợi ý, một mô hình ngôn ngữ duy nhất có thể xử lý nhiều trường hợp sử dụng. Công việc chuyển từ việc xây dựng ngày càng nhiều đặc trưng sang việc quyết định tín hiệu nào cần đưa vào đầu vào của mô hình và đưa vào bao nhiêu. Cơ sở hạ tầng cũng đang chuyển dịch sang các máy chủ GPU và các công cụ LLM.
Đội ngũ Netflix gọi GenRec là "một bước đi sớm nhưng đầy hứa hẹn" và mô tả hệ thống này là một giải pháp thay thế mạnh mẽ cho các mô hình gợi ý truyền thống. Việc thay thế hoàn toàn hệ thống hiện tại vẫn chưa được đặt ra.
Netflix đã sử dụng học máy ngoài các danh sách gợi ý trong nhiều năm. Quay lại năm 2020, công ty đã mô tả cách các đồ thị tri thức (knowledge graphs) và bản đồ tương đồng dự đoán danh mục nội dung mà một tiêu đề dự kiến sẽ phù hợp và số lượng khán giả mà nó có thể đạt được ở mỗi quốc gia. Vào thời điểm đó, mô hình ngôn ngữ BERT của Google chỉ xử lý các tóm tắt tiêu đề do con người viết và cung cấp các biểu diễn mà máy có thể đọc được cho các mô hình hạ nguồn. Netflix cũng đã bắt đầu xây dựng các mô hình riêng cho quy trình sản xuất và đôi khi phát hành công khai, chẳng hạn như khung VOID để xóa các đối tượng khỏi video.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.