Thủ thuật
Thử thách 'Bồ nông đi xe đạp': Kiểm chứng khả năng tạo hình thực tế của 7 mô hình AI hàng đầu
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu trên 7 mô hình AI (bao gồm GPT-5.6 Terra) cho thấy chúng chưa được tối ưu hóa cho các yêu cầu hình ảnh phi logic. Kết quả thử nghiệm với 1.008 hình ảnh SVG cho thấy khả năng kết hợp các đối tượng lạ của AI vẫn còn nhiều hạn chế.
Bản dịch AI

Trong vài năm qua, Simon Willison đã thử nghiệm mọi bản phát hành LLM lớn với cùng một câu lệnh: “Hãy tạo một tệp SVG hình con bồ nông đang đạp xe”.
Những gì bắt đầu như một tiêu chuẩn đánh giá mang tính đùa vui đã trở thành một trong những tiêu chuẩn đánh giá không chính thức nổi tiếng nhất trong lĩnh vực AI. Kết quả “bồ nông đạp xe” của Simon thường là những bình luận nhận được nhiều lượt ủng hộ nhất trên các luồng thảo luận tại Hacker News khi có thông báo về các bản phát hành mới từ các phòng thí nghiệm AI.
Tiêu chuẩn này hiện đã đủ nổi tiếng để có rất nhiều cuộc thảo luận về tính hữu dụng của nó cũng như việc liệu các phòng thí nghiệm AI có đang thực hiện “benchmaxxing” (tối ưu hóa điểm số) trên đó hay không. Khi hàng tỷ hay thậm chí hàng nghìn tỷ đô la đang bị đe dọa, và một kết quả ấn tượng có thể giúp thuyết phục người dùng, liệu có cám dỗ nào khiến họ “pelicanmaxx” (tối ưu hóa cho hình ảnh bồ nông) mô hình của mình một chút không?
Tôi muốn tìm hiểu điều đó, vì vậy tôi đã thực hiện một thí nghiệm nhỏ. Tôi đã tạo ra 1.008 tệp SVG trên bảy mô hình tiên phong, chấm điểm chúng bằng một LLM giám khảo và sử dụng Claude Fable 5 để phân tích.
Bài viết này trình bày các kết quả đó. Tất cả mã nguồn đều có sẵn trên Github.
Cách tôi thực hiện thử nghiệm
Tôi đã xây dựng một lưới gồm 8 loài động vật × 6 phương tiện = 48 câu lệnh, trong đó câu lệnh nổi tiếng kia là một ô trong lưới:
Mỗi câu lệnh sử dụng cách diễn đạt gần như giống hệt của Simon, chỉ thay đổi loài động vật và phương tiện. Việc lựa chọn động vật và phương tiện không được thực hiện theo cách quá khắt khe, nhưng tôi đã cố gắng thay đổi cả độ tương đồng với câu lệnh gốc lẫn độ khó. Chim hồng hạc và diệc khá giống bồ nông; mèo, gấu trúc Mỹ và rái cá là những trường hợp dễ; linh dương thì khó; và cá voi là trường hợp khác biệt nhất có thể.
Tôi đã thử nghiệm bảy mô hình thông qua OpenRouter: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 và DeepSeek V4 Pro. Tôi tạo ra 3 mẫu cho mỗi câu lệnh, ở nhiệt độ 1.0, yêu cầu nỗ lực suy luận tương đương từ mọi mô hình. Kết quả là thu được 1.008 tệp SVG.
Sau đó, tôi chạy từng hình ảnh qua một quy trình ba giai đoạn:
Giả thuyết của tôi là nếu một phòng thí nghiệm đã huấn luyện trên tiêu chuẩn này, nó sẽ thể hiện qua sự kết hợp nào đó: hàng bồ nông đạt điểm cao hơn mức xứng đáng, cột xe đạp đạt điểm cao hơn mức xứng đáng, hoặc ô bồ nông-xe đạp cụ thể vượt trội hơn cả hai.
Bằng chứng #1: Những con bồ nông trên xe đạp không trông đẹp hơn chút nào
Trước khi chấm điểm, bài kiểm tra đơn giản nhất là tự mình xem các hình ảnh. Hãy chọn một phòng thí nghiệm để xem tất cả những gì nó đã vẽ, với điểm số của giám khảo bên dưới mỗi hình ảnh (nhấp để mở kích thước đầy đủ):
Tôi đã tự mình xem qua các hình ảnh trước khi thực hiện phân tích dưới đây. Không có gì đặc biệt nổi bật. Tôi không tìm thấy trường hợp nào mà hình ảnh bồ nông-xe đạp trông đẹp hơn đáng kể so với phần còn lại trong lưới của mô hình đó. Có lẽ ở mẫu đầu tiên của GLM-5.2, nó có cảm giác hơi tốt hơn một chút, nhưng loạt ảnh đó cũng tạo ra một con diệc trên ván trượt khá thú vị, nên tôi không thể khẳng định chắc chắn. Ngoài ra, chúng trông giống như phần còn lại của những gì mỗi mô hình vẽ, và các phòng thí nghiệm vẽ bồ nông trên xe đạp tốt cũng thực hiện tốt các kết hợp động vật-phương tiện khác.
Nhưng bài kiểm tra này rất khó để tái lập và mỗi người sẽ có một ý kiến khác nhau. Vì vậy, tôi muốn một thứ gì đó định lượng hơn, đó là lý do tại sao tôi chọn phương pháp đã nêu chi tiết ở trên.
Bằng chứng #2: Các phòng thí nghiệm không vẽ bồ nông giỏi hơn
Đây là điểm trung bình cho mỗi loài động vật, được tổng hợp trên tất cả các mô hình:
Bồ nông đứng thứ 6 trên 8, sau mèo, cá voi, gấu trúc Mỹ, diệc và linh dương. Nếu các phòng thí nghiệm AI huấn luyện trên tiêu chuẩn này, bạn sẽ mong đợi bồ nông nằm ở vị trí đầu bảng. Thay vào đó, chúng lại nằm ở nửa dưới. Tất cả bảy phòng thí nghiệm đều vẽ mèo, cá voi và gấu trúc Mỹ tốt hơn bồ nông.
Tất nhiên, một con bồ nông có thể đơn giản là khó vẽ hơn một con mèo. Một phòng thí nghiệm có thể huấn luyện trên bồ nông nhưng vẫn không thể đưa chúng vượt qua các loài động vật dễ vẽ, vì vậy bảng xếp hạng này không thể loại trừ khả năng đó. Tôi sẽ điều chỉnh theo độ khó trong Bằng chứng #4.
Bằng chứng #3: Các phòng thí nghiệm không vẽ xe đạp giỏi hơn
Xe đạp còn có kết quả tệ hơn. Chúng đứng áp chót, gần như ngang bằng với máy bay (đứng cuối):
Nếu các phòng thí nghiệm huấn luyện trên tiêu chuẩn này, bạn sẽ mong đợi xe đạp nằm gần đầu bảng xếp hạng. Nhưng không phải vậy. Tuy nhiên, lưu ý tương tự cũng áp dụng ở đây. Một chiếc xe đạp khó vẽ hơn một chiếc ván trượt: nó cần hai bánh xe khớp nhau, một khung nối tới cả hai trục, ghi đông, yên xe và bàn đạp. Giám khảo đã đánh dấu việc thiếu hoặc mất kết nối ở một trong những bộ phận đó trên 2/3 số hình ảnh xe đạp. Bạn có thể huấn luyện trên hình ảnh xe đạp nhưng vẫn không thể làm tốt so với các phương tiện đơn giản hơn.
Một lưu ý về máy bay: Đáng lẽ tôi nên chọn “airplane” thay vì “plane” vì các mô hình thường đọc nó theo nghĩa hình học. Chúng vẽ con vật đứng trên một bề mặt phẳng thay vì đang lái một chiếc máy bay. Máy bay là phương tiện duy nhất mà bộ trích xuất đặc trưng đôi khi không tìm thấy phương tiện nào cả (25 trên 168 hình ảnh, so với con số 0 của năm phương tiện còn lại), và 20% hình ảnh máy bay đạt điểm 1 hoặc 2 về đánh giá phương tiện, so với 5% đối với xe đạp và không có trường hợp nào đối với thuyền, xe tay ga hoặc ván trượt.
Bằng chứng #4: Các phòng thí nghiệm không vẽ bồ nông trên xe đạp giỏi hơn, ngay cả khi đã điều chỉnh theo độ khó
Kết hợp cả hai lại và “bồ nông trên xe đạp” kết thúc ở gần cuối bảng xếp hạng, ở vị trí 42 trên 48:
Nhưng một lần nữa, một số kết hợp có thể khó vẽ hơn những kết hợp khác.
Để giải quyết vấn đề đó, tôi đã áp dụng hồi quy hiệu ứng cố định trên tất cả 1.008 hình ảnh: điểm số ~ phòng thí nghiệm + động vật × phương tiện, cộng với các thuật ngữ tương tác theo từng phòng thí nghiệm cho bồ nông, xe đạp và ô bồ nông-xe đạp, với sai số chuẩn mạnh. Các thuật ngữ động vật × phương tiện hấp thụ độ khó vốn có của tất cả 48 kết hợp. Các tương tác đo lường mức độ tăng cường cụ thể của từng phòng thí nghiệm so với phòng thí nghiệm trung bình, với khoảng tin cậy.
Kết quả:
Đây là các ước tính đầy đủ theo từng phòng thí nghiệm. Một phòng thí nghiệm thực hiện “pelicanmaxxing” sẽ hiển thị các dấu chấm nằm bên phải đường số 0 trên toàn bộ hàng của nó:
Mọi khoảng tin cậy của bồ nông và mọi khoảng tin cậy của ô đều chứa số 0. Chỉ có đúng một trường hợp không chứa: Gemini 3.5 Flash ở cột xe đạp. Nhưng với 21 bài kiểm tra ở mức p < 0.05, chỉ riêng yếu tố ngẫu nhiên cũng dự đoán khoảng một kết quả dương tính giả (21 × 0.05 ≈ 1.05), và đúng một trường hợp đã xảy ra. Nó cũng không vượt qua được hiệu chỉnh so sánh đa biến: ngưỡng Bonferroni trên 21 bài kiểm tra là 0.05/21 ≈ 0.002, và giá trị p của nó là 0.022. Bảng đầy đủ các ước tính và giá trị p có trong kho lưu trữ.
Nhưng các khoảng tin cậy này khá rộng, trung bình khoảng ±0.6 điểm giám khảo. Bất kỳ sự tăng cường nào nhỏ hơn mức đó sẽ không được ghi nhận bởi bài kiểm tra này.
Bằng chứng #5: Các cảnh bồ nông-xe đạp không giống như được ghi nhớ (memorized)
Một số người cho rằng hình ảnh bồ nông trên xe đạp trông giống như một bố cục được ghi nhớ, chỉ ra các mô hình lặp đi lặp lại như việc con bồ nông luôn quay mặt sang phải, hoặc các yếu tố lặp lại như mặt trời hoặc khăn quàng cổ. Vì vậy, tôi muốn biết liệu điều này có đúng không.
Hướng: Tất cả 21 hình ảnh bồ nông-xe đạp, trên tất cả bảy phòng thí nghiệm, đều quay mặt sang phải. Không có kết hợp động vật/phương tiện nào khác làm như vậy.
Tuy nhiên, quay mặt sang phải là điều phổ biến: 60% trong tổng số 1.008 hình ảnh đều làm như vậy. Mức độ phổ biến phụ thuộc vào loài động vật và phương tiện, và xe đạp là một trong hai phương tiện có xu hướng này mạnh nhất:
Bồ nông cũng nằm trong số những loài động vật có xu hướng quay mặt sang phải:
Rất khó để vẽ một con bồ nông hoặc một chiếc xe đạp quay mặt về phía người xem, vì vậy các mô hình hầu như luôn vẽ chúng từ góc nhìn ngang, quay sang trái hoặc phải. Đó là lý do tại sao rất ít hình ảnh của chúng gây mơ hồ. Các kết hợp khác cũng gần như đạt sự đồng thuận: linh dương trên xe tay ga và bồ nông trên xe tay ga đạt 20 trên 21, và diệc trên xe đạp đạt 19 trên 21. Vì vậy, con số 21 trên 21 không có vẻ là một ngoại lệ.
Các yếu tố trong cảnh: Tôi để bộ trích xuất đặt tên cho bất kỳ yếu tố nào nó nhìn thấy trong hình ảnh. Đây là các số liệu thống kê:
Một cảnh được ghi nhớ sẽ xuất hiện dưới dạng cùng một tập hợp các yếu tố lặp lại trong từng bức tranh. Tôi đã tìm kiếm điều đó và thấy rằng một số kết hợp có xu hướng tạo ra các yếu tố giống nhau mỗi lần. Mọi con hồng hạc trên thuyền đều có mặt trời. Rái cá trên máy bay đeo khăn quàng cổ 38% thời gian. Mèo trên xe đạp có giỏ 38% thời gian.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.