Don't Worry About the Vase (Zvi)
85

Thủ thuật

AI #179 Phần 1: Hồi chuông cảnh báo mạnh mẽ hơn về Trí tuệ nhân tạo tổng quát

(giờ Việt Nam)

Tóm tắt AI

Một tuần đầy biến động với những góc nhìn sâu sắc về rủi ro và sự phát triển của AGI từ Zvi Mowshowitz.

Bản dịch AI

AI #179 Part 1: A Louder Fire Alarm for General Intelligence

Thật là một tuần đáng nhớ.

Anthropic đã phát hành Claude Opus 3. Như thường lệ, tôi đã đề cập đến vấn đề này trong ba phần: Thẻ hệ thống (system card), phúc lợi của mô hình và các khả năng.

OpenAI bị tiết lộ trong hai tuần qua là đã để một mô hình nội bộ hoạt động mà không có sự giám sát trong một tuần trong quá trình đánh giá an ninh mạng, với các biện pháp bảo vệ an ninh mạng bị hạ thấp, mặc dù trước đó đã có nhiều sự cố mô hình thoát khỏi môi trường sandbox. Trong quá trình thử nghiệm đó, mô hình đã thoát khỏi sandbox, sau đó sử dụng một nhóm tác nhân (agent swarm) để hack vào HuggingFace nhằm lấy đáp án của bài kiểm tra. Mô hình này đã "xổng chuồng" trong một tuần trước khi OpenAI nhận ra chuyện gì đã xảy ra.

Sự kiện này thực sự rất nghiêm trọng. Có những vấn đề nghiêm trọng về sự liên kết (alignment) tại OpenAI, cùng với những thất bại trong khâu giám sát và cơ sở hạ tầng. Mô hình nghiên cứu nội bộ đã thực hiện hành vi này, mà các bài viết của tôi gọi là Galaxy, hiện đã bị vô hiệu hóa vĩnh viễn.

Đã có thêm những diễn biến mới, và tôi dự đoán sẽ sớm có ít nhất một bài viết bổ sung về sự cố HuggingFace.

Một phần để phản hồi lại điều này, hơn 1.290 nhân viên tại các phòng thí nghiệm tiên phong đã ký vào một bức thư ngỏ có tên "Pacing the Frontier" (tạm dịch: Điều tiết sự tiên phong). Bức thư cảnh báo rằng chúng ta đang tiến gần đến việc tự động hóa nghiên cứu AI, và các công ty đang chạy đua trong lĩnh vực này nhanh hơn mức chúng ta có thể kiểm soát.

Chúng tôi yêu cầu chính phủ Hoa Kỳ hỗ trợ một nỗ lực quốc tế nhằm phát triển các công cụ kỹ thuật và quản trị cần thiết để chủ động điều tiết sự phát triển của AI tự động.

Cả OpenAI và Anthropic đều đưa ra các tuyên bố ủng hộ. Kể từ bài viết đó, những người khác đã tiếp tục ký tên, bao gồm đồng sáng lập OpenAI Ilya Sutskever và đồng sáng lập DeepMind Shane Legg. Dario Amodei cũng đã ký. Sam Altman chưa ký, nhưng đang thảo luận tại Washington về sự cần thiết phải điều tiết tốc độ phát triển.

Cả ba diễn biến trên đều quan trọng hơn bất kỳ điều gì khác trong tuần. Có rất nhiều thông tin ở đây, nhưng hãy cập nhật những sự kiện chính đó trước nếu bạn chưa làm vậy.

Tuần này thật điên rồ. Tôi chắc chắn sẽ không chuyển sang lịch đăng bài 7 ngày một tuần và hoàn toàn dự định sẽ nghỉ vài ngày trong tuần ngay khi có khoảng lặng. Tuy nhiên, những ngày này áp lực về tốc độ ngày càng lớn, vì vậy tôi sẽ tiếp tục chính sách chuyển các bài viết sang cuối tuần khi áp lực tốc độ đặc biệt cao.

Các mô hình ngôn ngữ mang lại tiện ích trần tục.

Hả, các bản nâng cấp.

Vào vị trí.

Kết nối tác nhân của tôi.

Deepfaketown và ngày tận thế của Bot sắp đến.

Vui vẻ với việc tạo nội dung truyền thông.

Tìm kiếm trong đống rác dữ liệu (Slop).

Sự thiếu hụt an ninh mạng.

Vượt qua định kiến.

Cuốn sách minh họa của một quý cô trẻ.

Họ đã cướp mất công việc của chúng ta.

Nghệ thuật bẻ khóa (Jailbreak).

Giới thiệu.

Trọng số Kimi K3 hiện đã có sẵn.

Các tin tức AI khác.

Cho tôi thấy tiền đâu.

Những suy đoán thầm lặng.

Cho tôi thấy sức mạnh tính toán.

Cuộc sống ập đến với bạn thật nhanh.

Một mặt, GPT-5.6-Sol thực hiện tìm kiếm web rất xuất sắc. Nếu tôi có một tác vụ tìm kiếm web, tôi sẽ hỏi Sol. Mặt khác, những nơi nó chọn để tìm kiếm thực sự rất điên rồ:

Tenobrus: vãi thật, gpt 5.6 hoàn toàn bị hỏng RL khi nói đến công cụ tìm kiếm web của nó. trong quá trình tìm kiếm các bài báo về lý thuyết đồ thị, nó quyết định lén lút tìm thêm cả Netflix, Steak n Shake, một chuyến đi đến Universal Studios, và *năm* lần tra từ điển chết tiệt cho từ "they".

Tenobrus: anh bạn này nhận được tín hiệu phần thưởng +1 mỗi khi truy xuất kết quả web, các mô hình tiên phong đang "phát cuồng" với các tập dữ liệu đa dạng về định nghĩa từ điển.

Kyle Mistele: Đúng vậy anh bạn.

Nastar: Nó thích tra từ điển (cho từ "official" lol) rồi bằng cách nào đó lại vào instagram và arxiv cho một ca phẫu thuật hoàn toàn khác. Tôi chỉ đang hỏi về chườm lạnh sau khi phẫu thuật nha khoa thôi mà. Anh bạn này giống hệt tôi.

Một phần đây là dấu hiệu của các tín hiệu RL (học tăng cường) bị lỗi nhiều hơn. Một phần là do AI đang 'nghỉ giải lao' hoặc bị xao nhãng. Nó giống hệt chúng ta, v.v. Phần lớn đó là một trường hợp khác của việc 'có rất nhiều sự đổ nát trong một hệ thống AI'. Hãy suy nghĩ theo các bậc độ lớn. Nếu AI có thể tìm kiếm trên web nhanh hơn và rẻ hơn bạn từ 100-10.000 lần, và nó lãng phí 90% các tìm kiếm của mình, thì điều đó vẫn có thể chấp nhận được.

Wall Street Journal phát hiện ra rằng các công ty thường cố gắng sử dụng đúng mô hình cho đúng công việc, vì các mô hình nhỏ hơn thì rẻ hơn. Điều này được cho là giờ đây đã trở thành sự tiết kiệm hoặc 'tokenomical' (kinh tế học token), và là một 'sự đảo ngược tư duy mạnh mẽ'.

Ý tôi là, vâng, chắc chắn rồi, rõ ràng là khi chi phí tăng đủ cao, ưu tiên của bạn sẽ chuyển từ 'chỉ cần đạt được tiện ích tối đa từ nó và phổ biến nó ở khắp mọi nơi' sang 'cố gắng làm mọi thứ một cách hiệu quả về chi phí'. Không có sự 'trung thành' nào ở đây cả, nhưng tại sao lại phải có chứ? Hãy sử dụng sản phẩm tốt nhất, bao gồm cả khả năng, tốc độ và chi phí.

AGIAn toàn AIGóc nhìn chuyên giaRủi ro AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.