Thủ thuật
Thung lũng Silicon mạnh tay dọn dẹp 'rác' AI: Google và Spotify xóa hàng chục triệu nội dung
(giờ Việt Nam)
Tóm tắt AI
Các ông lớn công nghệ đang quyết liệt loại bỏ nội dung rác do AI tạo ra, với hàng chục triệu bài hát trên Spotify và hàng trăm nghìn kênh YouTube bị xóa bỏ nhằm làm sạch hệ sinh thái số.
Bản dịch AI
Theo giờ Bắc Kinh ngày 18 tháng 8, tờ *The New York Times* đưa tin, nội dung rác AI kém chất lượng đang tràn lan: Google Search đầy rẫy các công thức nấu ăn "pizza keo dán", các trang sản phẩm trên Amazon tràn ngập tiểu sử giả mạo, còn bảng tin Facebook thì ngập tràn hình ảnh "Chúa Jesus tôm".

Với sự phát triển không ngừng của các chatbot và công cụ tạo video, "bãi rác kỹ thuật số" này đã lan rộng ra các nền tảng công nghệ lớn, không chỉ làm giảm chất lượng nội dung có giá trị mà còn gây ô nhiễm toàn bộ hệ sinh thái thông tin.
Không thể chịu đựng thêm được nữa
Hiện nay, Thung lũng Silicon đã bắt đầu dọn dẹp đống rác này. Nền tảng phát nhạc trực tuyến Spotify cho biết, năm ngoái họ đã xóa 75 triệu nội dung tải lên hàng loạt, các bài hát trùng lặp và những bản nhạc "kiểu rác" khác, con số này chiếm một phần đáng kể trong toàn bộ thư viện âm nhạc của họ. LinkedIn vào tháng 7 cho biết, "nội dung rác AI là mối quan tâm hàng đầu của tất cả chúng ta" và đã phát triển một nút bấm để người dùng báo cáo loại nội dung này. Các nhà nghiên cứu tại Google, công ty mẹ của YouTube, đã mô tả cách dịch vụ video này xóa bỏ 130.000 kênh chất lượng thấp trong vòng sáu tháng.
Trên khắp Internet, các công ty công nghệ đang thực hiện một cuộc "tổng vệ sinh nội dung rác tạo sinh". Nhiều công ty hiện đang quá tải vì chính những nội dung rác này lại được sinh ra từ các công cụ AI của họ. Các ứng dụng nhắn tin di động, trang web đánh giá nhà hàng, kho lưu trữ học thuật và nền tảng hẹn hò đều đang xóa hoặc làm giảm sự hiện diện của nội dung rác do AI tạo ra, trong đó nhiều bên dựa vào cùng một công nghệ để thực hiện việc dọn dẹp này.
Mọi người dần trở nên mệt mỏi với những tác động của AI đối với môi trường, cũng như áp lực mà nó mang lại cho việc làm và sức khỏe tâm thần. Aidan Walker, nhà sáng tạo nội dung kiêm nghiên cứu viên về xu hướng trực tuyến tại Quỹ Carnegie vì Hòa bình Quốc tế (một tổ chức tư vấn nghiên cứu các vấn đề toàn cầu), cho biết nội dung rác AI chỉ là một "vết thương đang mưng mủ" khác.
"Người dùng ngày càng bất mãn với điều này," ông nói, "dư luận đã thay đổi rõ rệt, vì vậy các công ty này cuối cùng cũng bắt đầu nhìn nhận nghiêm túc về những vấn đề này."

AI tạo sinh hiện có thể tạo ra hình ảnh, âm thanh và video ngày càng chân thực, nhưng chỉ một phần trong đó có thể được gọi là "nội dung rác".
Các công ty công nghệ chủ yếu nhắm vào những nội dung "giật tít" chất lượng thấp, loại nội dung có chi phí sản xuất rẻ, dễ lan truyền, tốc độ tiêu thụ nhanh và nhanh chóng bị lãng quên. Chúng giống như thời trang nhanh chèn ép thị trường thời trang cao cấp, hay giống như "thịt hồng" (pink slime) thay thế cho những miếng bít tết chất lượng cao.
Các nhà nghiên cứu châu Âu năm ngoái đã viết rằng, nếu không được kiểm soát, đầm lầy nội dung tổng hợp trên mạng này có thể "bóp nghẹt sự sáng tạo của con người, ăn mòn các giá trị văn hóa và phá hủy diễn ngôn công cộng".
Nội dung rác AI (slop) đã tràn lan đến mức nhà xuất bản từ điển Merriam-Webster đã chọn nó là từ của năm 2025. Dịch vụ phát trực tuyến Deezer của Pháp cho biết vào mùa xuân năm nay, gần một nửa số bản nhạc được cập nhật vào hệ thống của họ mỗi ngày là do AI tạo ra, trong đó nhiều bài chưa từng được người dùng nghe qua. Nội dung do AI tạo ra chiếm hơn một phần ba số lượng tải lên trên Apple Music.
Adam Mosseri, người đứng đầu Instagram, cuối tháng trước cho biết việc theo dõi "phương tiện truyền thông thực" sớm muộn gì cũng sẽ "thực tế hơn so với việc theo dõi phương tiện truyền thông giả". Ngay trước khi ông đưa ra quan điểm này, Meta - công ty mẹ của Instagram - đã ra mắt một bảng tin video hoàn toàn do AI tạo ra, kết quả là bị nhiều người chế giễu là một nơi trưng bày nội dung rác.
Tạo ra nội dung rác trước
Ngày nay, nhiều công ty công nghệ đang nỗ lực quản lý nội dung rác AI cũng chính là những công ty đã tạo ra nó. Tháng 7 năm nay, Meta cam kết ủng hộ một công ước châu Âu nhằm làm cho nội dung do AI tạo ra dễ nhận biết hơn thông qua các phương pháp như phát hiện, đánh dấu và dán nhãn. Cùng tháng đó, công ty này cũng phát hành một công cụ tạo hình ảnh tự động đưa các tài khoản Instagram công khai vào làm nguồn dữ liệu tham khảo. Sau khi vấp phải sự phản đối dữ dội từ người dùng trong ba ngày liên tiếp, Meta đã gỡ bỏ tính năng này.
"Nội dung rác AI là con dao hai lưỡi, bởi vì nhiều nền tảng thực sự đã đạt được sự gia tăng tương tác của người dùng nhờ nó," Paul Shovlin, chuyên gia AI tại Đại học Ohio cho biết, "nhưng sau đó, nó dần trở thành một gánh nặng vì các nền tảng tràn ngập quá nhiều 'vật thể trôi nổi và rác thải', khiến người dùng hiện nay rất khó tìm thấy nội dung chất lượng cao mà họ thực sự mong muốn."
Ví dụ, Google đã hoàn toàn đón nhận AI, tích hợp mô hình Gemini vào email, bản đồ, dịch vụ du lịch và hoạt động tìm kiếm. Theo một thử nghiệm do Kapwing - nền tảng chỉnh sửa video trực tuyến dựa trên AI - thực hiện năm ngoái, hơn 20% các video ngắn đầu tiên mà YouTube đề xuất cho người dùng mới là nội dung rác do AI tạo ra.
Kapwing ước tính rằng một trong những kênh nội dung rác AI phổ biến nhất trên YouTube có thu nhập hàng năm lên tới 4,25 triệu USD. Kênh này sau đó đã bị đình chỉ tham gia chương trình kiếm tiền của YouTube. CEO YouTube Neal Mohan đã viết trong một bài đăng trên blog rằng "quản lý nội dung rác AI" là ưu tiên hàng đầu của năm nay.
Gần đây, các nhà nghiên cứu của Google cũng bắt đầu nghiên cứu thách thức này. Thay vì đánh giá từng video, họ phân tích tốc độ tải lên, các mẫu lặp đi lặp lại và các mô hình khác có thể cho thấy sự lạm dụng hành vi phối hợp. Các nhà nghiên cứu đã phát hiện ra 50.000 cụm tài khoản và xóa bỏ chúng. Tuy nhiên, một số chuyên gia truyền thông kỹ thuật số lo ngại rằng phương pháp này có thể can thiệp quá mức, đồng thời gây tổn hại đến những người sáng tạo hợp pháp đăng tải nội dung với số lượng lớn.
YouTube cho biết trong một tuyên bố: "Mặc dù nghiên cứu học thuật giúp thúc đẩy sự hiểu biết của ngành về vấn đề này, nhưng nó không phản ánh các biện pháp bảo vệ đa tầng mà chúng tôi thực hiện để thực thi chính sách nền tảng. Điều này bao gồm các cơ chế bảo vệ mạnh mẽ để đảm bảo rằng những người sáng tạo sử dụng công cụ AI và tạo nội dung cho các mục đích chính đáng sẽ không bị ảnh hưởng."
Các công ty khác cũng đang thử nghiệm nhiều chiến lược khác nhau để đối phó với nội dung rác AI, bao gồm việc huy động chính người dùng của họ để giúp nhận diện. Tháng 10 năm ngoái, nền tảng xã hội Pinterest đã cập nhật hệ thống, cho phép người dùng giới hạn số lượng bài đăng do AI tạo ra mà họ nhìn thấy. TikTok cho biết họ đang thử nghiệm một tính năng tại Mỹ cho phép mọi người điều chỉnh lượng nội dung AI hiển thị. Công ty cũng cho biết đã tự động gắn nhãn hơn 3 tỷ video do AI tạo ra. Trong 3 tháng đầu năm nay, TikTok đã xóa hơn 377.000 video do vi phạm chính sách AI của mình.
Theo dữ liệu từ công ty khởi nghiệp phát hiện AI Pangram, trên nền tảng mạng xã hội X của Elon Musk, gần một nửa số bài đăng dài hơn 50 từ là do AI tạo ra. Nikita Bier, người vừa rời vị trí giám đốc sản phẩm của X trong tháng này, đã viết rằng để đối phó với "lượng lớn nội dung rác AI và phản hồi rác", nền tảng mạng xã hội này đã cấm các ứng dụng khuyến khích bot đăng nội dung thông qua trả phí trong năm nay.
Chris Best, CEO của Substack, viết vào tháng trước: "Hiện nay ngày càng khó để phân biệt cái gì là thật trên Internet. Các nền tảng thưởng cho nội dung giả mạo sẽ dẫn đến một cuộc đua xuống đáy về chất lượng." Nền tảng bản tin này sau đó đã thông báo ra mắt công cụ phát hiện AI của riêng mình, được hỗ trợ kỹ thuật bởi Pangram, nhằm quét các phản hồi, bình luận và bài đăng dài hơn 100 từ để xác định xem nội dung đó có khả năng là do con người viết hay được hỗ trợ bởi AI.
Tuy nhiên, một số tác giả bản tin phàn nàn rằng công cụ này đã đánh giá sai các bài đăng do con người viết thành do AI tạo ra, không tính đến vai trò hỗ trợ mà AI có thể đóng trong quá trình sáng tạo, đồng thời gây áp lực không cần thiết cho các tác giả, buộc họ phải tự chứng minh sự trong sạch của mình trước một chỉ số không minh bạch.
Mùa xuân năm nay, Camille François, nhà nghiên cứu về công nghệ kỹ thuật số độc hại tại Đại học Columbia, đã tổ chức một sự kiện "Salon nội dung rác" với gần hai mươi chuyên gia AI tại Menlo Park, California, để thảo luận về những khó khăn trong việc nhận diện và phân loại nội dung rác AI, cũng như những thách thức quản trị đi kèm.
"Những chiến lược ứng phó rời rạc này cho thấy chúng ta đang đối mặt với một vấn đề mang tính hệ thống trong môi trường thông tin, chứ không chỉ là một loại nội dung tồi tệ gọi là rác AI. Chúng ta không thể chỉ đơn giản định nghĩa nó rồi xóa bỏ," Tiến sĩ François nói trong một cuộc phỏng vấn, "Suy cho cùng, AI là một công cụ sáng tạo, nó có nhiều mặt. Những nền tảng xử lý không tốt sẽ chứng kiến người dùng rời bỏ và chuyển sang nơi khác."
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.