Thủ thuật
Anthropic và OpenAI cam kết đưa chuyên gia an toàn độc lập vào nội bộ, nhưng tính minh bạch vẫn bị nghi ngờ
(giờ Việt Nam)
Tóm tắt AI
Anthropic và OpenAI dự định cho phép các tổ chức đánh giá độc lập như METR và Redwood Research tiếp cận hệ thống nội bộ để kiểm soát an toàn AI, tuy nhiên giới chuyên gia vẫn hoài nghi về tính độc lập thực sự của mô hình này.
Bản dịch AI

Trong một bài luận dài được công bố vào cuối tuần qua, CEO Dario Amodei của Anthropic đã đưa ra một đề xuất mà ngay cả một năm trước, ngành công nghiệp AI có lẽ đã bác bỏ ngay lập tức: đưa các đơn vị đánh giá bên thứ ba vào bên trong tất cả các công ty AI tiên phong, trao cho họ quyền báo cáo các sự cố an toàn, đánh giá xem các mô hình AI có thực sự được căn chỉnh (aligned) hay không, và chia sẻ những phát hiện khách quan của họ với thế giới.
Amodei cho biết Anthropic cam kết sẽ trao cho các đơn vị đánh giá độc lập như METR và Redwood Research quyền truy cập chưa từng có vào hệ thống của công ty. CEO Sam Altman cho biết OpenAI cũng sẽ cam kết thực hiện điều này, báo hiệu một sự thay đổi sâu sắc tiềm tàng trong cách ngành công nghiệp làm việc với các nhóm nghiên cứu bên ngoài.
Các đơn vị đánh giá bên thứ ba khi trao đổi với TechCrunch nhìn chung đều hoan nghênh đề xuất này, nhưng cho rằng các chi tiết cần phải được làm rõ — và lý tưởng nhất là được luật pháp bảo trợ — nếu họ muốn biết liệu mình sẽ hoạt động như những cơ quan giám sát độc lập thực sự hay chỉ là những nhà cung cấp dịch vụ vận hành theo các điều khoản của chính các công ty AI.
Quyền truy cập sâu hơn đó đang trở nên quan trọng hơn khi các mô hình ngày càng giỏi trong việc nhận biết khi nào chúng đang bị đánh giá, làm tăng nguy cơ chúng sẽ cư xử tốt trong quá trình kiểm thử trong khi che giấu các hành vi có vấn đề. Các nhà nghiên cứu cho biết những manh mối về hành vi đó có thể bị bỏ lỡ khi kiểm thử mô hình đã hoàn thiện, nhưng lại có thể được phát hiện bằng cách điều tra cách mô hình đó vận hành trong suốt quá trình đào tạo.
“Các công ty AI nên có khả năng trả lời một số câu hỏi rất cơ bản về quy trình đào tạo của họ, chẳng hạn như: Liệu AI có bao giờ chủ động cố gắng phá hoại quá trình đào tạo căn chỉnh của chính nó trong khi đang được đào tạo hay không?” Alexander Meinke, trưởng bộ phận nghiên cứu tại Apollo Research, chia sẻ với TechCrunch. “Câu trả lời cho điều này phải là một sự phủ định dứt khoát, và hiện tại chúng ta hoàn toàn dựa vào việc các công ty AI tự kiểm tra kỹ lưỡng và sau đó báo cáo trung thực với công chúng. Và chúng ta đã thấy từ các sự cố gần đây rằng, theo mặc định, họ sẽ không làm cả hai điều đó. Với tư cách là các đơn vị đánh giá nội bộ, chúng tôi thực sự có thể kiểm tra điều này.”
Trước đây, các công ty AI thường mời các nhà đánh giá bên ngoài để kiểm thử các mô hình đã hoàn thiện ngay trước khi phát hành. Giờ đây, các đơn vị đánh giá mà TechCrunch đã trao đổi đề xuất trao cho họ quyền truy cập không chỉ vào mô hình cuối cùng, mà còn vào các phiên bản trung gian, hay còn gọi là các “điểm kiểm tra” (checkpoints), trong suốt vòng đời đào tạo của mô hình. Adam Gleave, CEO của Far.AI, cho biết các đơn vị đánh giá có thể so sánh các điểm kiểm tra đó để xác định thời điểm hành vi đáng lo ngại xuất hiện, kiểm tra môi trường hậu đào tạo (post-training) nơi thưởng cho các mô hình vì những hành vi nhất định, và kiểm tra các bản ghi chép cũng như nhật ký đánh giá để xác minh các tuyên bố của công ty về hiệu suất của mô hình.
Việc liệu Anthropic và OpenAI có kế hoạch cung cấp quyền truy cập đó hay không và khi nào thì chưa rõ ràng. Cả hai công ty đều chưa chia sẻ họ sẽ làm việc với những đơn vị đánh giá nào, khi nào họ sẽ được đưa vào, họ sẽ đưa vào bao nhiêu đơn vị, chính xác những hệ thống và thông tin nào họ có thể truy cập hoặc những gì có thể được tiết lộ cho công chúng, bất chấp những câu hỏi liên tục từ TechCrunch.
Việc kiểm tra kỹ lưỡng như thế này rất quan trọng vì các mô hình hoạt động tốt trong các bài kiểm tra an toàn chưa chắc đã an toàn nếu chúng đã học được cách cụ thể để vượt qua bài kiểm tra đó. Steidley đã chỉ ra một ví dụ về “chuẩn đánh giá khả năng chống tắt máy” (shutdown resistance benchmark), đo lường xem AI có chống lại việc bị tắt trong một số tình huống nhất định hay không.
“Việc AI được đào tạo đặc biệt để đạt kết quả tốt trên chuẩn đánh giá đó là điều cực kỳ đáng quan tâm,” Steidley nói, so sánh nó với vụ bê bối Dieselgate của Volkswagen, trong đó các xe hơi được lập trình để nhận diện các bài kiểm tra khí thải và hoạt động khác đi trong điều kiện kiểm thử.
Gleave lưu ý rằng quyền truy cập có ý nghĩa có thể mở rộng ra ngoài chính các mô hình, với việc các đơn vị đánh giá được quyền phỏng vấn nhân viên để kiểm tra xem tài liệu và mô tả công khai của công ty về các thực hành an toàn có khớp với những gì diễn ra nội bộ hay không.
Amodei đã phác thảo một đề xuất khá toàn diện có thể mang lại cho các đơn vị đánh giá loại quyền truy cập mà họ cho là cần thiết, bao gồm quyền “công bố các phát hiện chính về mức độ rủi ro, sự cố, thực hành và quyền truy cập mà họ nhận được hoặc không nhận được — mà không chịu sự kiểm soát biên tập từ Anthropic.”
Tuy nhiên, các đơn vị đánh giá cho rằng một hệ thống như vậy sẽ chỉ hoạt động nếu các công ty AI thực sự sẵn sàng từ bỏ quyền kiểm soát quy trình. Những nỗ lực trước đây về đánh giá độc lập cho thấy sự từ bỏ đó sẽ rất khó đạt được, vì các bên thứ ba thường gặp phải những căng thẳng về quyền truy cập, thời gian, tính bảo mật và những gì họ có thể nói công khai.
Gleave cho biết Far.AI đã phải từ chối hợp đồng với một số nhà phát triển tiên phong vì họ muốn kiểm soát quá mức quy trình đánh giá, đe dọa đến tính độc lập của công ty. Theo mặc định, ông cho biết các đơn vị đánh giá bị đối xử như những nhà thầu thông thường: bị ràng buộc bởi các thỏa thuận bảo mật (NDA) hạn chế và các thỏa thuận trao cho nhà phát triển quyền kiểm soát đáng kể đối với những gì cuối cùng có thể được công bố.
Giới hạn thời gian
Ngoài ra còn có câu hỏi liệu các nhà đánh giá có đủ thời gian và quyền truy cập để thực hiện công việc được yêu cầu hay không. Khi điều tra sự cố Hugging Face, OpenAI đã cho METR và Redwood khoảng một tuần tại cơ sở để điều tra, và cả hai sau đó đều cho biết họ không thể đưa ra kết luận chắc chắn, một phần do những hạn chế về phạm vi và thời gian.
Một vấn đề tương tự đã xảy ra trong quá trình kiểm thử trước khi phát hành GPT-6 Astra, mô hình mà OpenAI đã quảng bá là mô hình được căn chỉnh tốt nhất của họ cho đến nay. Theo đóng góp của Apollo Research vào thẻ mô hình (model card), công ty này chỉ được cho ba ngày để kiểm thử Astra, khiến việc đưa ra kết luận chắc chắn trở nên khó khăn.
“Apollo tin rằng, với tỷ lệ nhận biết đánh giá cao hơn và cửa sổ đánh giá hạn chế, tỷ lệ hành vi sai lệch thấp ở đây không cung cấp bằng chứng đáng kể về sự căn chỉnh hay sai lệch của mô hình,” công ty viết trong đánh giá của mình.
Hồ sơ theo dõi đó để lại cho các đơn vị đánh giá một câu hỏi cơ bản: Tại sao lần này lại khác?
“Chắc chắn có khả năng là Dario và Sam chỉ đơn giản là thay đổi suy nghĩ, và họ sẽ rất cởi mở về điều này,” Gleave nói. “Nhưng tài sản trí tuệ của các công ty này cực kỳ có giá trị đối với họ, và tôi nghĩ theo mặc định, họ sẽ rất cẩn trọng về những gì có thể được chia sẻ.”
Một số nhà nghiên cứu trao đổi với TechCrunch đã kêu gọi một khuôn khổ minh bạch mà tất cả họ đều đồng ý công khai. John Steidley, trưởng bộ phận chiến lược tại Palisades Research, cho biết một phần của khuôn khổ này nên bao gồm các tiêu chuẩn về loại kiểm toán viên nào mà các công ty có thể dựa vào, để tránh việc họ cố gắng né tránh vấn đề bằng cách chọn các đơn vị đánh giá không đủ năng lực hoặc không quan tâm đến việc đánh giá những rủi ro đáng lo ngại nhất.
Henry Papadatos, giám đốc điều hành của Safer AI, cho biết vấn đề, ngay cả với một khuôn khổ công khai, là các biện pháp tự nguyện luôn phụ thuộc vào thiện chí của công ty.
“Lý tưởng nhất là chúng ta sẽ có quy định tốt bắt buộc điều này… bởi vì khi đó các công ty không thể thay đổi ý định vào ngày mai nếu họ gặp khủng hoảng PR lớn,” Papadatos nói với TechCrunch, lưu ý rằng đây cũng là một phương tiện tốt để thúc đẩy tất cả các công ty tuân thủ các quy tắc, chứ không chỉ những công ty tự nguyện.
Không phải tất cả mọi người đều đã tham gia. Cho đến nay, Meta, SpaceXAI và Google DeepMind vẫn chưa cam kết đưa các đơn vị đánh giá bên thứ ba vào, mặc dù CEO Demis Hassabis của DeepMind đã đề xuất một cơ quan tiêu chuẩn ngành riêng biệt để kiểm tra độc lập các mô hình tiên phong. Google, OpenAI và Anthropic cũng đã thảo luận riêng về các kế hoạch an toàn AI trong nhiều tuần.
Một số luật đã bắt đầu hình thành xung quanh ý tưởng về các đơn vị đánh giá bên thứ ba. Đạo luật SB 53 của California, được ký thành luật năm ngoái, yêu cầu các nhà phát triển AI tiên phong quy mô lớn phải công bố các khuôn khổ an toàn và báo cáo các sự cố an toàn nghiêm trọng. Một đạo luật mới, SB 813, được ký trong tháng này, tạo ra một khuôn khổ cho các “tổ chức xác minh độc lập” được tiểu bang công nhận với chuyên môn đánh giá rủi ro AI.
Tại châu Âu, Đạo luật AI của EU yêu cầu các nhà phát triển tiên phong phải thực hiện và lập tài liệu về các đánh giá mô hình, kiểm thử đối kháng (adversarial testing) và báo cáo các sự cố nghiêm trọng. Văn phòng AI của EU cũng có thể tự thực hiện các đánh giá và bổ nhiệm các chuyên gia độc lập.
Hiện tại, luật vẫn ít mở rộng hơn so với những gì Amodei đang đề xuất, khiến các phòng thí nghiệm tiên phong phần lớn vẫn chịu trách nhiệm quyết định mức độ giám sát độc lập mà họ sẽ tuân thủ. Papadatos cho biết việc tự điều chỉnh tự nguyện vẫn tốt hơn là không có gì, nhưng cuối cùng, các công ty không thể đòi hỏi quyền tự do kiểm soát các quy tắc an toàn của riêng mình trong khi lại yêu cầu công chúng tin tưởng rằng họ đang tuân thủ chúng.
“Bạn không thể có cả hai, vừa không có trách nhiệm giải trình bên ngoài, vừa nói rằng ‘Tôi sẽ chỉ áp dụng các quy tắc linh hoạt của riêng mình’,” Papadatos nói.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.