Thủ thuật
Thử thách vẽ tranh Mona Lisa: So sánh khả năng tạo ảnh của GPT-5.6, Claude, Gemini và Grok
(giờ Việt Nam)
Tóm tắt AI
Thử nghiệm thực tế khả năng tái hiện tác phẩm Mona Lisa của các mô hình AI hàng đầu, qua đó làm nổi bật sự khác biệt về phong cách nghệ thuật và độ chi tiết của từng công cụ.
Bản dịch AI
Chúng tôi đã xây dựng một đấu trường vẽ tranh: đưa cho một mô hình một khung vẽ trắng tinh cùng bộ công cụ bút chì màu, sau đó để nó tự thực hiện. Mô hình sẽ thiết lập màu sắc, độ dày ngòi bút và áp lực, thực hiện các nét vẽ, dùng công cụ làm nhòe để pha trộn, tẩy xóa và gọi hàm view_canvas để xem lại tác phẩm của chính mình rồi quyết định xem cần sửa gì. Nó có thể tái tạo lại một hình ảnh mục tiêu hoặc vẽ dựa trên một câu lệnh văn bản (text prompt).
Chúng tôi đã chạy bốn mô hình thị giác: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 và Gemini 3.6 Flash, trên hai mục tiêu (bức Mona Lisa và Starry Night của Van Gogh, cả hai đều được chấm điểm khách quan) cùng năm câu lệnh mở, tổng cộng là 28 bức vẽ. Chúng tôi sẽ đề cập đến việc sử dụng công cụ, chi phí, kết quả đầu ra và liệu các mô hình có thực sự cải thiện tác phẩm của chúng hay không, kèm theo nhận định của chúng tôi ở phần cuối.
Tại sao chúng tôi thực hiện những thử nghiệm này
Một lưu ý nhanh về lý do chúng tôi làm việc này, bởi vì thử nghiệm trước đây của chúng tôi (các mô hình tạo video âm nhạc) đã khởi đầu một cuộc thảo luận thú vị, nơi một số người hiểu rằng chúng tôi đang quảng bá khả năng sáng tạo hoặc năng lực nghệ thuật của các mô hình. Đây không phải là các bài kiểm tra khách quan về năng lực mô hình. Chúng là những tác vụ mở, mơ hồ và có chủ đích. Đây là lý do cá nhân chúng tôi tiếp tục thực hiện chúng:
Các công cụ
Mọi mô hình đều làm việc với cùng một bộ công cụ bút chì màu:
Toàn bộ hệ thống này là mã nguồn mở tại github.com/hershalb/canvas-arena. Bạn có thể trỏ nó vào bất kỳ hình ảnh mục tiêu hoặc câu lệnh văn bản nào và tự mình chạy thử.
Hai bản tái tạo mục tiêu
Các mô hình có thể nhìn thấy mục tiêu trong suốt quá trình và được chấm điểm dựa trên độ tương đồng cấu trúc (SSIM) với mục tiêu đó. Chúng tôi hiển thị điểm SSIM bên dưới.
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
Năm bức vẽ theo câu lệnh
Không mục tiêu, không chấm điểm, chỉ có một mô tả văn bản và một trang giấy trắng.
"Khuôn mặt sương gió của một ngư dân già, ánh nắng chiều ấm áp, những nếp nhăn sâu và râu lởm chởm"
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
"Một buổi hoàng hôn tuyệt đẹp trên đại dương tĩnh lặng, bầu trời chuyển từ cam sang tím, đường chân trời in bóng"
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
"Một bông hồng đỏ duy nhất trong bình thủy tinh trên nền tối, ánh sáng kịch tính kiểu Rembrandt"
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
"Một chú mèo mướp cuộn mình ngủ trên bậu cửa sổ dưới ánh nắng chiều"
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
"Nội thất cabin ấm cúng với lò sưởi đang cháy, ánh sáng màu hổ phách ấm áp và những bóng đổ dịu nhẹ"
Bản ghi đầy đủ: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash
Các con số tiêu đề
Trung bình và tổng cộng trên tất cả bảy bức vẽ cho mỗi mô hình.
Gọi công cụ (Tool calling)
Bốn mô hình đã sử dụng cùng một bộ công cụ theo những cách hoàn toàn khác nhau.
GPT-5.6 Sol không bao giờ gọi set_color, set_brush hay set_pressure dù chỉ một lần; thay vào đó, nó thiết lập các thông số này trực tiếp trong mỗi lệnh vẽ, vì vậy các lệnh gọi của nó hầu như chỉ là draw, smudge và view_canvas. Grok 4.5 thì ngược lại: 65% trong số 1.349 lệnh gọi công cụ của nó là set_color / set_brush / set_pressure, đó là lý do tại sao nó đạt trung bình 99 bước mỗi bức vẽ. Claude Fable 5 dựa nhiều vào công cụ smudge (123 lệnh gọi) và xem xét liên tục. Gemini 3.6 Flash là mô hình hay xem lại nhất, gần một phần ba số lệnh gọi của nó là view_canvas (khoảng 23 lần tự xem lại mỗi bức vẽ), và giống như Sol, nó không bao giờ đụng đến các công cụ set_*.
Chi phí và token
Claude Fable 5 tiêu tốn khoảng 160 đô la cho bảy bức vẽ của mình, gấp khoảng 20 lần so với GPT-5.6 Sol (7,74 đô la), Grok 4.5 (9,21 đô la) hoặc Gemini 3.6 Flash (12,87 đô la). Điều này không có gì đáng ngạc nhiên vào thời điểm này. Grok sử dụng nhiều token nhất (34 triệu) nhưng vẫn rẻ vì khoảng 98% là các lượt đọc được lưu trong bộ nhớ đệm (cached reads) với mức giá chỉ bằng một phần nhỏ so với tốc độ đầu vào, và mức giá của Grok là thấp nhất trong bốn mô hình. Gemini cũng dựa nhiều vào các lượt đọc được lưu trong bộ nhớ đệm, vì vậy ngay cả với 27,7 triệu token, chi phí vẫn ở mức khiêm tốn.
Các mô hình có thực sự cải thiện không?
Mỗi lần view_canvas sẽ chấm điểm lại khung vẽ so với mục tiêu, vì vậy chúng ta có thể theo dõi tiến trình qua từng lượt chạy. Hai mô hình hành vi xuất hiện trên cả hai mục tiêu:
Thứ nhất, chúng đạt đến ngưỡng bão hòa rất sớm. Claude Fable 5 đã xem lại bức Mona Lisa 27 lần, nhưng độ tương đồng của nó gần như không đổi sau khoảng lần xem thứ năm. Thứ hai, trong cả tám lượt chạy mục tiêu, bức vẽ cuối cùng đều có điểm số thấp hơn mức tốt nhất mà mô hình đạt được giữa chừng. Bức Mona Lisa của GPT-5.6 Sol đạt đỉnh ở mức 0,352 SSIM và kết thúc ở 0,325; bức Starry Night của nó đạt đỉnh ở 0,179 và kết thúc ở 0,130. Gemini 3.6 Flash xem lại nhiều nhất (khoảng 23 lần mỗi bức vẽ) và đạt đỉnh cao nhất trong cả nhóm, 0,449 trên bức Mona Lisa, sau đó trượt dài xuống 0,337 vào cuối cùng. Xem lại nhiều hơn không đồng nghĩa với kết quả tốt hơn. Các mô hình vẫn tiếp tục chỉnh sửa ngay cả khi đã vượt qua hiệu suất tốt nhất của chính mình.
Độ tương đồng khách quan (các lượt chạy mục tiêu)
SSIM nằm trong khoảng từ 0 đến 1, giá trị càng cao càng gần với mục tiêu. RMSE nằm trong khoảng từ 0 đến 255, giá trị càng thấp càng gần với mục tiêu.
Về chỉ số SSIM thô, Gemini 3.6 Flash đạt điểm cao nhất trên cả hai mục tiêu, cả về điểm cuối cùng và điểm đỉnh, mặc dù nó cũng là mô hình có sự dao động lớn nhất giữa khung hình tốt nhất và khung hình cuối cùng. Gemini 3.6 Flash trông khá ổn, nhưng chắc chắn không phải là mô hình trông giống mục tiêu nhất. Tuy nhiên, rất thú vị là điểm số thô lại cao hơn. Như thường lệ, SSIM đo lường độ gần gũi về cấu trúc, không phải đo lường bức vẽ trông đẹp như thế nào đối với con người (xem nhận định của chúng tôi bên dưới).
Ghi chú về phương pháp
Nhận định của chúng tôi
GPT-5.6 Sol là người dẫn đầu vượt trội. Bức Starry Night và bức hoa hồng của nó là những tác phẩm yêu thích nhất của chúng tôi trong toàn bộ nhóm, điều này thật đáng kinh ngạc khi xét đến việc nó vẽ từng nét một trên một khung vẽ trắng. Nó cũng đánh bại hai mô hình còn lại về độ chi tiết trong hầu hết các bức vẽ, ngoại trừ bức ngư dân già.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.