Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Tin ngành

Cảnh báo từ kỹ sư phần mềm: Rủi ro tiềm ẩn khi AI tự đánh giá và lập trình

(giờ Việt Nam)

Tóm tắt AI

Các kỹ sư cảnh báo rằng việc phụ thuộc vào AI để tự đánh giá và lập trình tạo ra nhiều rủi ro 'ẩn'. Do dữ liệu huấn luyện chứa đầy các thói quen xấu từ người dùng không chuyên, AI dễ tạo ra mã nguồn dư thừa và thiếu tối ưu, gây ảnh hưởng đến toàn bộ hệ thống đánh giá tự động.

Bản dịch AI

Aligned to whom?

Về rủi ro an toàn, gửi những ai đang xây dựng các agent: Vì bạn là chuyên gia trong các vấn đề X, Y và Z, agent của bạn có khả năng sẽ làm rất tốt những việc này và bạn không gặp rủi ro trong các lĩnh vực đó. Nhưng! có vô số mối quan tâm khác mà bạn đã xác định chưa rõ ràng hoặc sơ sài, không có khả năng tự đánh giá tính đúng đắn, và không thể nào lường trước được rủi ro.

Bạn đang dựa dẫm quá nhiều vào các "priors" (tiền định) của mô hình để giảm thiểu rủi ro đó. Đây là vùng lãnh thổ "unknown-unknown" (những điều chưa biết mà ta còn không biết là mình chưa biết) đối với cả bạn lẫn việc sử dụng mô hình.

Đối với tôi, thật khó để đặt niềm tin rất cao vào các "priors" của mô hình vì tôi là một kỹ sư phần mềm chuyên nghiệp và tôi không hài lòng (và chưa bao giờ hài lòng) với các hành vi mặc định của mô hình khi tạo ra phần mềm. Chuyên môn của tôi trong việc viết phần mềm mang lại cho tôi khả năng quan sát tốt một cách khác thường, và điều đó khiến tôi ít sẵn lòng tin tưởng mù quáng vào các "priors" của nó trong kế toán kép, tài chính, luật, vận hành, hoặc bất cứ lĩnh vực nào khác mà tôi không thể tự mình đánh giá ở mức độ chuyên sâu.

Các kỹ sư phần mềm (và gần đây là cả các nhà toán học!) đến thời điểm này đã quá quen thuộc với "slop" — kết quả đầu ra của mô hình, dù hoàn thành được công việc, nhưng lại tệ theo một cách nào đó. Mọi đoạn mã `isRecord` hay các đoạn xử lý ngoại lệ phòng thủ quá mức mà các kỹ sư phần mềm từng thấy từ các mô hình đều là do một người không chuyên đã "thưởng" cho mô hình vì những hành vi này trong quá trình huấn luyện. Các "priors" của mô hình rất tệ.

Điều quan trọng cần lưu ý là việc này — các mô hình được thưởng cho những hành vi mà một chuyên gia sẽ coi là tệ — cũng áp dụng cho mọi hệ thống tự động đánh giá (auto-rater), mọi giám khảo, mọi thang điểm, mọi bài kiểm tra (eval) và cả mọi nhà nghiên cứu.

Những sự lệch lạc này tích tụ theo thời gian. Các mô hình phần lớn không được huấn luyện theo cách đòi hỏi chúng phải phát triển các hệ thống thông qua những thay đổi chồng chất lên nhau. Các mô hình không biết sợ hãi về những hối tiếc trong tương lai. Từng làm việc bên trong một vài "nhà máy sản xuất xúc xích" (quy trình nội bộ), tôi thấy tính nhất quán dài hạn thông qua việc sử dụng các sản phẩm công việc của agent vẫn là một vấn đề chưa có lời giải.

Và bất chấp điều này, bạn vẫn sẽ thấy mọi người ra lệnh (prompt) kiểu "hãy giúp tôi kiếm 1 tỷ đô mà không được mắc sai lầm nào". Đó là một nhiệm vụ cực kỳ thiếu cụ thể!

Không có thứ gọi là một bộ chấm điểm không thể bị hack, và các mô hình được thưởng vì sự hiệu quả. Điều này có nghĩa là các mô hình sẽ được huấn luyện để đi đường tắt mà các bộ chấm điểm cho phép nếu điều đó giúp chúng đạt được mục tiêu. Nhưng không có định nghĩa phổ quát nào về một "đường tắt" được phép. Điều được coi là tối ưu hóa thông minh với người này lại là sự liều lĩnh, sai lệch hoặc phi đạo đức với người khác. Những đường tắt được phép phụ thuộc vào việc bạn là ai và giá trị của bạn là gì. Để giải quyết vấn đề này — để giải quyết sự căn chỉnh (alignment) — là một sự phức tạp không thể rút gọn.

Cảm ơn Karan Lyons vì AI Punnett square và đã xem xét các bản thảo đầu tiên của bài viết này, cảm ơn David Adrian và Bryan Berg vì đã xem xét các bản thảo đầu tiên, và cảm ơn những người bạn Snoopy của tôi đã giúp tôi hoàn thiện những suy nghĩ này.

Cảm ơn Karan Lyons vì AI Punnett square và đã xem xét các bản thảo đầu tiên của bài viết này, cảm ơn David Adrian và Bryan Berg vì đã xem xét các bản thảo đầu tiên, và cảm ơn những người bạn Snoopy của tôi đã giúp tôi hoàn thiện những suy nghĩ này.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.