Thủ thuật
Nhà khoa học đoạt giải Turing cảnh báo: Lạm dụng dữ liệu tổng hợp là sai lầm lớn của ngành AI
(giờ Việt Nam)
Tóm tắt AI
Rich Sutton cảnh báo việc phụ thuộc vào dữ liệu tổng hợp thay vì dữ liệu thực tế là sai lầm nghiêm trọng. Ông ủng hộ việc để AI học hỏi thông qua tương tác với môi trường thực tế thay vì chỉ dựa vào dữ liệu nhân tạo.
Bản dịch AI
Theo tin từ IT ngày 19 tháng 8, Rich Sutton, một trong những người tiên phong đứng sau các công nghệ then chốt của làn sóng trí tuệ nhân tạo hiện nay, cho rằng lộ trình mà các "ông lớn" công nghệ đang theo đuổi để duy trì sự phát triển của AI đang tồn tại những vấn đề nghiêm trọng.

Trong chương trình podcast của Sequoia Capital phát sóng vào thứ Ba vừa qua, nhà khoa học máy tính người Canada và cũng là chủ nhân giải thưởng Turing này cho biết, ngành công nghiệp AI đang ngày càng phụ thuộc vào dữ liệu tổng hợp (synthetic data), và điều này có thể đang dẫn dắt cả ngành đi sai hướng.
Khi được hỏi liệu việc sử dụng dữ liệu tổng hợp có giúp các mô hình ngôn ngữ lớn (LLM) tiếp tục mở rộng quy mô hay không, Sutton thẳng thắn trả lời: "Đây chắc chắn là một sai lầm lớn. Có lẽ đây sẽ trở thành bài học kinh nghiệm quan trọng tiếp theo."
Dữ liệu tổng hợp là thông tin được tạo ra nhân tạo bởi các thuật toán hoặc mô hình AI, thay vì được thu thập từ dữ liệu thô trong thế giới thực. Khi các công ty AI không ngừng tìm kiếm trên internet và các nguồn dữ liệu huấn luyện mới, sức hấp dẫn của dữ liệu tổng hợp ngày càng tăng. Ví dụ, việc huấn luyện xe tự lái có thể sử dụng hình ảnh ô tô do máy tính tạo ra, còn các hệ thống phát hiện gian lận AI có thể sử dụng hồ sơ giao dịch ngân hàng giả định.
Ở một khía cạnh nào đó, các "ông lớn" công nghệ cũng đồng tình với quan điểm của Sutton.
Các công ty công nghệ lớn đang tìm mọi cách để có thêm dữ liệu thực. OpenAI trước đó đã công khai tìm kiếm các tập dữ liệu độc quyền, quy mô lớn với hy vọng có được những dữ liệu không dễ dàng thu thập từ internet để huấn luyện mô hình AI. Đầu tuần này, Google đã đồng ý chi 10 triệu USD (theo chú thích của IT: tỷ giá hiện tại khoảng 67,569 triệu Nhân dân tệ) để mua lại dữ liệu nội bộ và phần mềm của hãng hàng không đã phá sản Spirit Airlines, điều này làm nổi bật giá trị ngày càng tăng của dữ liệu thực độc quyền đối với việc huấn luyện AI.
Trong podcast hôm thứ Ba, Sutton cho rằng dữ liệu do con người tạo ra không thể thay thế hoàn toàn dữ liệu thực.
Ông lấy hành vi của con người làm ví dụ để giải thích: "Chúng ta không thể tạo ra dữ liệu tổng hợp cho suy nghĩ của người khác," ông nói.
Sutton ưu tiên sử dụng dữ liệu trải nghiệm thực tế, tức là thông tin mà các tác nhân AI (AI agents) thu được thông qua việc tương tác với môi trường thực, quan sát những gì thực sự xảy ra và không ngừng học hỏi từ kết quả của các hành động đó.
"Bạn không thể dự đoán cách máy bay không người lái tương tác với môi trường trong thế giới vật lý thực thông qua dữ liệu tổng hợp," Sutton nói. Ông cũng chỉ ra rằng trong động cơ của robot luôn tồn tại các biến số như ma sát và hao mòn. "Thế giới này vô cùng phức tạp, bất kỳ mô phỏng nào về nó cũng chỉ là cái nhìn phiến diện."
Hiện nay, triết lý này đã trở thành định hướng phát triển của một công ty khởi nghiệp.
Tháng trước, Sutton cùng cựu sinh viên của mình là Khurram Javed đã đồng sáng lập Oak Lab. Công ty khởi nghiệp này đang phát triển các tác nhân AI có khả năng liên tục học hỏi từ những trải nghiệm của chính mình, thay vì chủ yếu dựa vào các tập dữ liệu khổng lồ đã được chuẩn bị sẵn.
Hiện tại, Oak Lab vẫn chưa công bố vòng gọi vốn hoặc thông tin về các nhà đầu tư.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.