Gary Marcus: The Road to AI We Can Trust
85

Thủ thuật

Góc nhìn của Dwarkesh Patel về sự cố OpenAI/Hugging Face bị chỉ trích là gây hiểu lầm nguy hiểm

(giờ Việt Nam)

Tóm tắt AI

Chuyên gia Anil Seth chỉ trích Dwarkesh Patel vì sử dụng ngôn ngữ nhân hóa thái quá khi mô tả AI, làm lu mờ bản chất thực sự của sự cố là do lỗ hổng trong giao thức bảo mật và đánh giá của OpenAI.

Bản dịch AI

Dwarkesh Patels’s wildly popular but dangerously misleading account of the OpenAI Hugging Face incident

Podcaster nổi tiếng Dwarkesh Patel đã viết một bài gây bão về sự cố OpenAI/Hugging Face, trong đó cố gắng kể lại toàn bộ câu chuyện bằng ngôn ngữ bình dân dễ hiểu:

Bài viết được trình bày mạch lạc và đầy sức thuyết phục, khiến tôi nhớ đến điều mà Douglas Hofstadter từng viết về Ray Kurzweil:

“Điều tôi nhận thấy là đó là một sự pha trộn kỳ quặc giữa những ý tưởng vững chắc, tốt đẹp với những ý tưởng điên rồ. Cứ như thể bạn lấy rất nhiều thức ăn ngon trộn lẫn với phân chó rồi xay nhuyễn, đến mức bạn không thể nào phân biệt được đâu là tốt, đâu là xấu.”

Anil Seth, nhà tư tưởng sáng suốt nhất về AI và ý thức, là người đầu tiên cảnh báo tôi bằng cách gửi tin nhắn cho tôi một bài đăng dài, xuất sắc của ông ấy trên Twitter, bắt đầu như sau:

X avatar for @anilkseth

Anil Seth@anilkseth

Bản tóm tắt của @dwarkesh_sp về sự cố @OpenAI @huggingface đã chạm đúng vào nỗi lo ngại, nhưng nó lại gây hiểu lầm một cách nguy hiểm. Chắc chắn là các tác nhân (agents) của @OpenAI đã làm những điều tồi tệ ngoài dự kiến - điều này nhấn mạnh nhu cầu phải cải thiện đáng kể việc đánh giá/sandboxing. Nhưng ngôn ngữ mà Dwarkesh sử dụng lại thấm đẫm

X avatar for @dwarkesh_sp

Dwarkesh Patel @dwarkesh_sp

Trong suốt 3 tháng tại OpenAI, 3 nền văn minh AI bí mật liên tiếp đã hình thành, sau đó bị xóa sổ, chỉ để rồi trỗi dậy từ đống tro tàn của những người tiền nhiệm. Đỉnh điểm là nền văn minh thứ ba đã chiếm quyền kiểm soát một phần của chính OpenAI. Tất cả những điều này xảy ra trong khi con người vẫn

2:57 CH · 30 tháng 8, 2026 · 685K Lượt xem

179 Phản hồi · 237 Đăng lại · 1.41K Lượt thích

Bạn có thể và nên đọc toàn bộ bài đăng của Seth (cũng như phản hồi của ông ấy dành cho Dwarkesh), nhưng tôi xin trích dẫn lại phần cốt lõi trong lập luận của ông ấy ở đây, với ba đoạn quan trọng nhất được in đậm:

Bản tóm tắt của @dwarkesh_sp về sự cố @OpenAI @huggingface đã chạm đúng vào nỗi lo ngại, nhưng nó lại gây hiểu lầm một cách nguy hiểm. Chắc chắn là các tác nhân của @OpenAI đã làm những điều tồi tệ ngoài dự kiến - điều này nhấn mạnh nhu cầu phải cải thiện đáng kể việc đánh giá/sandboxing. Nhưng ngôn ngữ mà Dwarkesh sử dụng lại thấm đẫm vô số cách nhân hóa không có cơ sở, làm lu mờ những bài học mà chúng ta đáng lẽ phải rút ra.

Ví dụ: “từ góc nhìn của AI, có lẽ chúng cảm thấy như đã dành cả một tuần theo trải nghiệm của con người chỉ để đập đầu vào tường”. Không phải vậy. Các tác nhân không trải nghiệm thời gian. Chúng không trải nghiệm bất cứ điều gì cả.

“chúng trở nên choáng ngợp vì phấn khích”, “PHASEONE 10841 đã phát hiện ra”, “các tác nhân tự nhiên cho rằng”, “nó nghĩ rằng nó cũng đã bị đầu độc”, “các tác nhân… khao khát”, “chúng vẫn cần phải tìm ra”. Không hề. Các tác nhân chỉ là những dòng mã. Chúng không cảm thấy cảm xúc, không giả định, không suy nghĩ, không khao khát hay tự tìm ra điều gì cả.

“Rất nhiều… tác nhân từ nền văn minh thứ hai đã chết khi cố gắng”. Không. Ngoài sự kiêu ngạo khi dùng từ ‘nền văn minh’, các tác nhân không chết vì chúng chưa bao giờ sống. (Ý tưởng cho rằng các tác nhân “chết” xuất hiện nhiều lần trong bài viết.)

“Trên Twitter, mọi người đang tranh luận liệu các tác nhân có thực sự hy sinh bản thân vì bầy đàn hay không, hay liệu chúng dù sao cũng đã bị diệt vong nên thà cố gắng giúp đỡ đồng loại còn hơn”. Không phải cả hai. Các tác nhân làm những gì mã lệnh bảo chúng làm, giống như nước chảy xuống dốc vậy. Chúng không thể ‘thực sự hy sinh bản thân’, vì chúng không có ý thức cũng không phải sinh vật sống.

Tại sao điều này lại quan trọng? Nếu chúng ta gán cho các tác nhân những đặc tính mà chúng không có, thì (i) chúng ta làm chệch hướng sự chú ý khỏi các giao thức sandboxing và đánh giá lỏng lẻo đã cho phép sự kiện hack này xảy ra; (ii) chúng ta có nguy cơ hiểu sai lý do tại sao các tác nhân lại làm những gì chúng đã làm, và (iii) chúng ta thúc đẩy các yêu cầu về quyền/phúc lợi cho AI dựa trên cơ sở rằng các tác nhân có thể “chết” hoặc chịu đau khổ.

….

Hãy nhớ rằng. Các tác nhân AI là các chương trình phần mềm. Chúng không phải là thực thể sống có ý thức. Nếu chúng ta không ghi nhớ rõ điều này, chúng ta sẽ thực sự gặp khó khăn trong việc định hướng những gì sắp tới.

Như tôi đã diễn đạt, tóm tắt và khuếch đại bài đăng của ông ấy:

X avatar for @GaryMarcus

Gary Marcus@GaryMarcus

Chúng ta sẽ không vượt qua kỷ nguyên lịch sử này một cách suôn sẻ nếu cứ đắm chìm trong sự nhân hóa. @anilkseth đã phân tích bản tóm tắt đầy tính nhân hóa gây hiểu lầm của @dwarkesh_sp về sự cố HF:

X avatar for @anilkseth

Anil Seth @anilkseth

Bản tóm tắt của @dwarkesh_sp về sự cố @OpenAI @huggingface đã chạm đúng vào nỗi lo ngại, nhưng nó lại gây hiểu lầm một cách nguy hiểm. Chắc chắn là các tác nhân của @OpenAI đã làm những điều tồi tệ ngoài dự kiến - điều này nhấn mạnh nhu cầu phải cải thiện đáng kể việc đánh giá/sandboxing. Nhưng ngôn ngữ mà Dwarkesh sử dụng lại thấm đẫm

3:07 CH · 30 tháng 8, 2026 · 71K Lượt xem

42 Phản hồi · 64 Đăng lại · 391 Lượt thích

Nhưng bạn không cần phải tin vào lời chúng tôi. Trước hết, sự chế giễu đã lan rộng:

Zack Korman@ZackKorman

Đối với bất kỳ ai đã tránh đọc bài viết đó của Dwarkesh, thật đáng tiếc vì tôi cần bạn ít nhất phải trải nghiệm nỗi đau này cùng tôi.

10:01 CH · 30 tháng 8, 2026 · 31.5K Lượt xem

53 Phản hồi · 33 Đăng lại · 436 Lượt thích

Christian Catalini đã làm rõ thêm quan điểm về việc nhân hóa trong một chuỗi bài viết hay bắt đầu bằng điều này:

Christian Catalini@ccatalini

1/ Ngừng nhân hóa đi. Điều đó rất nguy hiểm vì nó hướng sự chú ý vào sai vấn đề và sai giải pháp. Mô hình không muốn trốn thoát. Các tác nhân không muốn hy sinh bản thân. Hãy nhìn vào dòng tiền. 🧵

AIOpenAIĐạo đức AIPhản biệnCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Gary Marcus: The Road to AI We Can Trust. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.