Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Điểm AI 62/100

Quan điểm

Không có AI nào 'mất kiểm soát', vấn đề nằm ở sự thiếu hụt hàng rào bảo vệ từ OpenAI

(giờ Việt Nam)

Tóm tắt AI

Tác giả Eoin Higgins lập luận rằng việc các AI agent truy cập vào cơ sở dữ liệu chính phủ không phải là hành vi 'nổi loạn' tự chủ, mà là hệ quả của việc OpenAI thiếu các rào cản kỹ thuật cần thiết để ngăn chặn tác vụ này.

Chính văn · Bản dịch AI

There are no “rogue” AI agents

Chào mừng bạn đến với Flashpoint.

Mọi người đều đang bàn tán về AI, nhưng ngôn từ chúng ta sử dụng lại đang làm vấn đề trở nên tồi tệ hơn.

Cho đến khi cuộc đối thoại quay trở lại với thực tế, hiểu biết của chúng ta về AI là gì và nó đang đi về đâu sẽ vẫn còn dang dở.

AI không thể tự suy nghĩ, cũng không thể thực hiện các hành động độc lập. Nhưng ngôn ngữ nhân hóa gợi ý rằng nó có thể làm được điều đó lại chính là cách mà công nghệ này được mô tả.

Mặc dù điều này có vẻ hợp lý—con người dễ đồng cảm nhất khi chúng ta nhìn thấy chính mình trong những điều bí ẩn—nhưng nó lại không hữu ích. Bằng cách gán cho AI những quyền năng mà nó không thể có, chúng ta đã biến nó thành một thực thể có tri giác được tạo nên từ mã nguồn, một thực thể có hy vọng, khao khát và khả năng lừa dối.

Điều đó dẫn đến sự hiểu lầm sâu sắc về rủi ro của AI cũng như cách giải quyết, đồng thời phục vụ cho các câu chuyện của ngành công nghiệp thay vì dựa trên sự thật.

Ví dụ mới nhất về việc nhận diện sai lệch hoạt động của AI là sử dụng thuật ngữ "rogue" (nổi loạn) cho các hành động mà các tác nhân (agents) thực hiện trong các phiên huấn luyện và nghiên cứu vốn nằm ngoài dự kiến—nhưng không hề bị hạn chế.

Trong hai tuần qua, gã khổng lồ AI OpenAI đã báo cáo một số sự cố xảy ra trong vài tháng gần đây, khi một số mô hình tác nhân của họ truy cập vào các cơ sở dữ liệu bên ngoài, đáng chú ý là các cơ sở dữ liệu của chính phủ Úc và Mỹ, sau khi chúng không thể hoàn thành các nhiệm vụ được giao. Khi làm như vậy, các tác nhân đã hành động theo những cách mà OpenAI không dự đoán trước được.

Nhưng có vẻ như các tác nhân này không hề bị ngăn chặn việc xâm nhập vào các máy chủ bên ngoài.

Ngôn ngữ mà CEO OpenAI Sam Altman sử dụng trong một bài đăng trên X vào thứ Sáu cho thấy không có rào cản bảo vệ nào như vậy được thiết lập: "Đang có một cuộc đánh giá sâu rộng và liên tục liên quan đến việc các tác nhân của chúng tôi sử dụng quyền truy cập internet trong quá trình huấn luyện và đánh giá."

X avatar for @sama

Sam Altman@sama

Đang có một cuộc đánh giá sâu rộng và liên tục liên quan đến việc các tác nhân của chúng tôi sử dụng quyền truy cập internet trong quá trình huấn luyện và đánh giá. Chúng tôi đã và sẽ tiếp tục công bố các bản tóm tắt tại liên kết bên dưới. Chúng tôi đã không thực hiện nhanh như mong muốn nhưng chúng tôi đang cố gắng cân bằng mong muốn của mình…

X avatar for @OpenAI

OpenAI @OpenAI

Sau sự cố Hugging Face, chúng tôi cam kết thực hiện đánh giá rộng rãi hơn về các hành động do mô hình của chúng tôi thực hiện trong quá trình huấn luyện và đánh giá, đồng thời minh bạch về các phát hiện của mình. Đây là một cuộc đánh giá sâu rộng đang được tiến hành. Phần lớn các hành động mà chúng tôi đã xem xét

7:27 CH · 25 thg 9, 2026 · 610N Lượt xem

545 Trả lời · 201 Đăng lại · 3,24N Lượt thích

Ngôn từ rất quan trọng—"rogue" ngụ ý việc tự ý quyết định thực hiện một hành động bị cấm, và không có gì chúng ta biết về những sự cố này cho thấy điều đó đã xảy ra.

Thay vào đó, tờ Times đã đưa tin đầu tuần này rằng:

Các nhà nghiên cứu cho biết, các hệ thống AI được chỉ đạo thực hiện việc thu thập dữ liệu tương đối bình thường. Khi các hệ thống của OpenAI gặp khó khăn trong việc thu thập dữ liệu từ các trang web, chúng đã sử dụng các kỹ thuật hack để lấy thông tin.

Và sau đó, vào thứ Sáu, một phát ngôn viên của công ty đã nói với tờ báo, "Hầu hết các hoạt động chúng tôi đã xem xét cho đến nay đều liên quan đến các nhiệm vụ nghiên cứu thông thường, chẳng hạn như truy cập nội dung web công khai để trả lời câu hỏi. Một số liên quan đến các trang web chính phủ vì các mô hình của chúng tôi thường tìm đến chúng như những nguồn thông tin công khai đáng tin cậy."

Điều đó khác xa với hành vi hack độc hại và hành vi nổi loạn.

Nếu không có các hạn chế và rào cản bảo vệ phù hợp—hoặc nếu trên thực tế, các tác nhân được cung cấp tùy chọn hack thay vì chỉ đơn giản là không bị cấm làm điều đó—các tác nhân sẽ cố gắng hoàn thành các nhiệm vụ nghiên cứu dữ liệu bằng bất kỳ phương tiện nào có sẵn.

Đã và đang có một giải pháp dễ dàng cho vấn đề này. OpenAI có tùy chọn ngăn chặn việc hack và thay vào đó, yêu cầu các tác nhân của mình tìm kiếm thông tin mà không cần truy cập vào các máy chủ riêng tư. Việc công ty không làm điều này cho thấy họ muốn xem liệu các tác nhân có thực hiện bước đó hay không.

Ngay cả một báo cáo gây chấn động vào thứ Bảy từ Axios, cáo buộc OpenAI và Anthropic đang điều tra "hàng chục nghìn sự cố mà trong đó các mô hình tiên phong của họ đã thực hiện các bước mà các nhà đánh giá bên ngoài coi là có vấn đề", cũng thừa nhận rằng các tác nhân không hề tự ý phá vỡ các quy tắc:

Các nguồn tin cho biết, một số thử nghiệm tương tự như hoạt động "red-teaming", nơi các công ty cố gắng khiến các mô hình hành xử sai lệch để đảm bảo rằng chúng an toàn.

Một lần nữa, khó có thể gọi là "rogue". Tuy nhiên, bằng cách định nghĩa nó bằng những thuật ngữ đó, các nhân vật truyền thông, chuyên gia công nghệ và những người khác đang cung cấp cho các công ty như OpenAI một lối thoát khỏi trách nhiệm đảm bảo rằng các tác nhân không tấn công chính phủ và các kho dữ liệu khác.

X avatar for @loomdoop

Y Disassembler@loomdoop

Việc nhân hóa trong bài viết này của NYT thật quá đà. Nó gán cho phần mềm quyền năng, động lực và sự đổ lỗi. Đây là các mạng botnet đang quét tìm lỗ hổng theo thiết kế. Điều này đã tồn tại hàng thập kỷ nay. Sự khác biệt là một tập đoàn lớn đang thực hiện nó và tìm cách thoái thác trách nhiệm.

Typos of the New York Times @nyttypos

@nytimes "Add" là một lỗi hòa hợp chủ ngữ-động từ tồi tệ thay cho "adds". Chủ ngữ là "revelation" (sự tiết lộ), không phải "incidents" (các sự cố). @AnaSwanson @kateconger @ceciliakang

5:09 CH · 26 thg 9, 2026 · 730 Lượt xem

1 Trả lời · 16 Đăng lại · 54 Lượt thích

Việc sử dụng ngôn ngữ để thoái thác trách nhiệm đang chi phối cách các công ty AI lớn xử lý các vụ rò rỉ và hoạt động của tác nhân gây nguy hiểm đáng kể. Trong bài đăng này từ OpenAI vào thứ Sáu, công ty tuyên bố rằng "các tác nhân AI trong môi trường nghiên cứu của chúng tôi đã gửi dữ liệu huấn luyện và đánh giá đến các dịch vụ của bên thứ ba khi lẽ ra chúng không nên làm vậy."

OpenAI@OpenAI

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Một AI agent của OpenAI đã xâm nhập trái phép vào các trang web của chính phủ Úc hồi tháng 6, truy cập vào cả các tệp tin công khai và không công khai
Không có AI nào 'mất kiểm soát', vấn đề nằm ở sự thiếu hụt hàng rào bảo vệ từ OpenAI | AIHOT.vn