Thủ thuật
Nvidia, Palantir hạn chế dùng Anthropic Fable: Khủng hoảng niềm tin dữ liệu tại các phòng thí nghiệm AI
(giờ Việt Nam)
Tóm tắt AI
Do chính sách lưu trữ nhật ký 30 ngày của Anthropic, các tập đoàn lớn như Nvidia, Palantir và Booz Allen Hamilton đang siết chặt hoặc cấm sử dụng công cụ Fable vì lo ngại rò rỉ dữ liệu nhạy cảm.
Bản dịch AI

Nvidia thậm chí không tin tưởng giao cho Anthropic các công việc nhạy cảm dù họ là nhà đầu tư
Đối với các công ty lo ngại về sở hữu trí tuệ, đó là một rào cản không thể chấp nhận. Theo The Information, Nvidia hiện chỉ sử dụng Fable cho các tác vụ ít nhạy cảm hơn như các dự án mã nguồn mở. Đối với các công việc nội bộ như giám sát chuỗi cung ứng bằng AI, công ty sử dụng các mô hình Nemotron của riêng mình. Justin Boitano, Phó chủ tịch phụ trách Enterprise AI của Nvidia, chia sẻ với The Information: "Là một công ty, chúng tôi tin rằng ZDR [Zero Data Retention - Không lưu trữ dữ liệu] nên được bật theo mặc định". Nvidia đã đầu tư vào Anthropic, được cho là có kế hoạch tiếp tục làm như vậy và cung cấp phần cứng cho công ty này để phát triển mô hình.
Theo The Information, Booz Allen Hamilton, một trong những người dùng sớm nhất mô hình Mythos của Anthropic, đã cấm nhân viên sử dụng Fable cho công việc liên quan đến phần mềm an ninh mạng độc quyền. CTO Bill Vass cho biết: "Chúng tôi hơi lo ngại rằng [Fable] có thể đang học hỏi từ một số mã nguồn của chúng tôi".
Palantir đang chặn việc triển khai Fable thông qua phần mềm của chính họ đến khách hàng cho đến khi Anthropic đưa ra các cam kết không lưu trữ dữ liệu (zero-data-retention) không thể thu hồi, theo báo cáo của The Information. CEO Alex Karp đã phát biểu tại một sự kiện khách hàng rằng các công ty đã quá mệt mỏi với việc bị các phòng thí nghiệm AI "bóc lột". Karp trước đây cũng từng lên tiếng về sự thiếu tin tưởng của mình. Lập trường của Palantir cũng mang tính tư lợi, vì công ty muốn khách hàng chạy các mô hình AI thông qua nền tảng được cho là bảo mật của họ thay vì đi trực tiếp đến các nhà cung cấp.
Sau phản ứng từ khách hàng và động thái của OpenAI vào tháng 8 về việc cho phép khách hàng GPT-5.6 Cyber lưu trữ nhật ký bảo mật trên máy chủ riêng, Anthropic đã làm theo với một chương trình tương tự được triển khai cho một số khách hàng chọn lọc vào mùa thu này.
Không lưu trữ dữ liệu vẫn để lại những lỗ hổng
Ngay cả với chính sách không lưu trữ dữ liệu, các phòng thí nghiệm vẫn có thể học hỏi từ cách dịch vụ của họ được sử dụng. Theo The Information, cả OpenAI và Anthropic đều thu thập siêu dữ liệu (metadata) và dữ liệu sử dụng kỹ thuật từ các khách hàng doanh nghiệp. OpenAI gọi dữ liệu này là "đã được phi định danh" (de-identified), nghĩa là nó đã bị loại bỏ các thông tin có thể truy ngược lại từng khách hàng cá nhân.
OpenAI tuyên bố trên trang web của mình rằng họ chạy dữ liệu doanh nghiệp thông qua các bộ phân loại tự động và công cụ bảo mật "để hiểu rõ hơn cách các dịch vụ của chúng tôi được sử dụng". Công ty viết rằng các phân loại thu được là siêu dữ liệu về dữ liệu doanh nghiệp "nhưng không chứa bất kỳ dữ liệu doanh nghiệp nào". Theo The Information, một số khách hàng không chắc chắn chính xác siêu dữ liệu đó bao gồm những gì và cho rằng mức độ minh bạch hiện tại là chưa đủ.
Việc huấn luyện trên dữ liệu người dùng diễn ra theo những cách mà các công ty không muốn tiết lộ
John Schulman, đồng sáng lập OpenAI, người từng làm việc ngắn hạn tại Anthropic và hiện đang làm việc tại Thinking Machines, gần đây đã vạch ra các cách khác nhau mà các công ty AI có thể huấn luyện trên dữ liệu người dùng. Phổ này trải dài từ việc tiền huấn luyện trực tiếp trên dữ liệu người dùng (vốn có rủi ro cao về việc tái tạo nội dung), đến việc chưng cất các mô hình lớn thành các mô hình nhỏ hơn, và xây dựng các tác vụ học tăng cường từ "dấu vết người dùng" (user traces).
Cách tiếp cận cuối cùng có rủi ro tái tạo nội dung thấp nhưng vẫn có thể trích xuất IP (sở hữu trí tuệ) của khách hàng. Schulman cho biết nó trải dài từ vô hại ("sử dụng phản hồi rõ ràng của người dùng trong việc huấn luyện mô hình phần thưởng") đến xâm lấn ("tải lên môi trường lập trình và lịch sử commit của người dùng để biến thành các môi trường học tăng cường"). Ông nói thêm: "Việc phi định danh rất yếu", người dùng có thể bị truy ngược lại "chỉ với một lượng nhỏ dữ liệu" và nó không bảo vệ được trước việc rò rỉ IP.
Nhà nghiên cứu AI Sarah Hooker, người từng làm việc tại Cohere và Google DeepMind, mô tả một lỗ hổng tương tự. Có những "kỹ thuật dữ liệu tổng hợp thông minh có thể tạo ra dữ liệu tương đương về mặt phân phối trong khi vẫn bảo vệ quyền riêng tư". Nói cách khác, ngay cả khi một phòng thí nghiệm AI không sử dụng dữ liệu gốc trực tiếp, họ có thể trích xuất các mô hình thống kê để đạt được kết quả tương tự.
Hooker cảnh báo các công ty: "Nếu bạn là một công ty có IP, bạn có một khoảng thời gian hạn hẹp để xây dựng trí tuệ riêng tận dụng IP của mình. Nếu không, bạn đang tiếp sức cho một phòng thí nghiệm tiên phong, nơi sớm muộn gì cũng sẽ xâm phạm vào lĩnh vực của bạn".
Trong một bài đăng tiếp theo, Schulman đã rút lại phần nào quan điểm đó. Ông cho biết việc huấn luyện trên dữ liệu người dùng "cực kỳ khó có khả năng" đóng góp nhiều vào việc tăng cường năng lực tiên phong. Những thành quả đó chủ yếu đến từ việc mở rộng quy mô tiền huấn luyện và học tăng cường. Dữ liệu người dùng hữu ích hơn trong việc tìm ra các chế độ lỗi hoặc các tình huống khó tái tạo với những người gắn nhãn thuê.
Tuy nhiên, ông nói thêm rằng "các công ty mô hình khác nhau về mức độ tích cực trong việc huấn luyện trên dữ liệu người dùng (và việc tải lên các kho lưu trữ không phải là giả thuyết)". Đó có thể là một sự ám chỉ đến các công cụ lập trình AI như Codex hoặc Cursor, nơi người dùng kết nối trực tiếp kho mã nguồn của họ với các dịch vụ. Schulman kêu gọi "các quy chuẩn mạnh mẽ hơn về việc công khai cách các công ty huấn luyện trên dữ liệu người dùng".
Vụ việc Buckmaster đã biến vấn đề niềm tin thành hiện thực
Schulman đã lên tiếng sau khi nhà toán học Tristan Buckmaster đưa ra những cáo buộc nghiêm trọng chống lại OpenAI. Buckmaster và đồng tác giả Levent Alpöge đã sử dụng các mô hình AI để đạt được tiến bộ trong các phương trình Navier-Stokes, tải lên các bản nháp của họ thông qua Codex của OpenAI. Ngay sau đó, OpenAI đã trình bày bước đột phá của riêng mình bằng cách sử dụng cùng một lộ trình giải pháp khác thường đó.
Ban đầu, OpenAI thừa nhận rằng họ không thể loại trừ khả năng dữ liệu ẩn danh có nguồn gốc từ việc sử dụng sản phẩm của họ đã góp phần cải thiện các mô hình. Sau một cuộc điều tra nội bộ, công ty đã cập nhật bài đăng của mình, nói rằng các câu lệnh Codex của Buckmaster trong hai tháng trước khi xuất bản vào ngày 8 tháng 9 năm 2026 "không thể ảnh hưởng đến hệ thống theo bất kỳ cách nào, kể cả thông qua việc huấn luyện". Tuy nhiên, vụ việc cho thấy niềm tin giữa doanh nghiệp, giới học thuật và các phòng thí nghiệm AI thực sự mong manh đến mức nào.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.