Simon Willison Blog
75

Thủ thuật

Các phòng thí nghiệm AI có cố tình huấn luyện mô hình vẽ 'bồ nông đi xe đạp'?

(giờ Việt Nam)

Tóm tắt AI

Thực nghiệm trên 7 mô hình AI cho thấy không có bằng chứng nào về việc các phòng thí nghiệm ưu tiên huấn luyện hình ảnh 'bồ nông đi xe đạp', bác bỏ giả thuyết về dữ liệu được lập trình sẵn.

Bản dịch AI

Are AI labs pelicanmaxxing?

Ngày 22 tháng 7 năm 2026 - Link Blog

Liệu các phòng thí nghiệm AI có đang "pelicanmaxxing" (tối ưu hóa hình ảnh bồ nông) không? (via) Một bài viết xuất sắc của Dylan Castillo, người đã đi sâu vào câu hỏi thường được đặt ra là liệu các phòng thí nghiệm AI có cố tình huấn luyện các mô hình để vẽ hình bồ nông đi xe đạp nhằm phản hồi lại tiêu chuẩn đánh giá hoàn toàn thiếu tính khoa học của tôi hay không.

Trước đây, tôi đã từng kiểm tra ngẫu nhiên vấn đề này bằng cách thử nghiệm các mô hình với những loài động vật khác cưỡi trên các loại phương tiện khác, nhưng chưa bao giờ thực hiện với sự cẩn trọng như phương pháp luận của Dylan ở đây.

Dylan đã sử dụng 8 loài động vật × 6 loại phương tiện = 48 câu lệnh (prompt) và chạy mỗi câu lệnh ba lần trên 7 mô hình khác nhau (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 và DeepSeek V4 Pro). Sau đó, anh ấy sử dụng GPT-5.6 Luna và Gemini 3.1 Flash-Lite để hỗ trợ đánh giá kết quả.

Có một chế độ xem bộ lọc rất gọn gàng để khám phá các kết quả:

Đối với các mô hình mà anh ấy đã thử nghiệm, anh ấy không tìm thấy bằng chứng nào về hiện tượng pelicanmaxxing:

Bồ nông không được vẽ đẹp hơn các loài động vật khác. Xe đạp cũng không được vẽ đẹp hơn các phương tiện khác. Và không có phòng thí nghiệm nào vẽ sự kết hợp này tốt hơn mức mà các hình ảnh bồ nông và xe đạp riêng lẻ của họ đã thể hiện. GLM-5.2 là mô hình gần đạt nhất: nó có sự cải thiện lớn nhất ở đúng ô bồ nông-xe đạp, và mẫu bồ nông đi xe đạp đầu tiên của nó đã thu hút sự chú ý của tôi. Tuy nhiên, hiệu ứng này rất nhỏ và không đáng kể, vì vậy tôi sẽ không đặt quá nhiều kỳ vọng vào nó.

AIThực nghiệmMô hình ngôn ngữDữ liệu huấn luyệnKiểm chứng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.