Thủ thuật
Khi lập trình viên dạy AI vẽ tranh bằng mã nguồn
(giờ Việt Nam)
Tóm tắt AI
Một nhà thiết kế tại Brooklyn chia sẻ hành trình huấn luyện AI tạo ra các tác phẩm nghệ thuật thị giác thông qua mã lập trình, mở ra góc nhìn mới về sự kết hợp giữa kỹ thuật và sáng tạo.
Bản dịch AI


Huấn luyện AI vẽ bằng mã nguồn

Khi bạn tạo một hình ảnh bằng mô hình AI, cách duy nhất để tham gia là thông qua câu lệnh (prompt). Bạn không thể chỉnh sửa trực tiếp hình ảnh đó. Để thay đổi bất cứ điều gì, bạn phải quay lại mô hình và nhập câu lệnh một lần nữa. Hạn chế đó chính là khởi nguồn cho dự án này. Bạn của tôi
Cameron
và tôi đã huấn luyện một mô hình ngôn ngữ để tạo hình ảnh bằng cách viết mã nguồn, sử dụng học tăng cường (reinforcement learning). Mã nguồn chính là sản phẩm, và mã nguồn có thể chỉnh sửa được. Bạn có thể thay đổi những gì mô hình tạo ra một cách chi tiết hơn mà không cần phải nhập lại câu lệnh.
Câu hỏi sâu xa hơn mà dự án này đặt ra là làm thế nào để thực hiện học tăng cường trên các tác vụ sáng tạo và thiết kế. RL hoạt động hiệu quả khi phần thưởng có thể kiểm chứng được. Một bài toán toán học là đúng hoặc sai. Một trò chơi là thắng hoặc thua. Chất lượng thẩm mỹ thì không thuộc cả hai trường hợp đó. Bài toán thiết kế trở thành hàm phần thưởng và các tiêu chí mà một giám khảo được yêu cầu áp dụng. Nếu quá cứng nhắc, mô hình sẽ hội tụ. Nếu quá lỏng lẻo, mô hình sẽ bị chệch hướng.
[Video bài thuyết trình luận văn của tôi, cung cấp bối cảnh cho dự án này.]
Đóng góp của tôi
Thiết kế
Phát triển
Nghiên cứu RL
Đội ngũ
Surya
Cameron Franz
Alex Wang
Cách thức hoạt động
Hệ thống là một vòng lặp bốn bước, được chạy hàng nghìn lần trong quá trình huấn luyện.
Mô hình nhận một câu lệnh, ví dụ như "vẽ hoa dâm bụt đào bằng màu nước", và viết một đoạn mã p5.brush JavaScript hoàn chỉnh. Đoạn mã được kết xuất trong môi trường Puppeteer biệt lập, tạo ra một tệp PNG. Tệp PNG này được đánh giá dựa trên hai bức tranh tham chiếu ngẫu nhiên được lấy mẫu từ một nhóm đã được xếp hạng thủ công, với một mô hình giám khảo riêng biệt chọn ra bức tranh màu nước đẹp hơn. Đánh giá này được chuyển đổi thành tín hiệu phần thưởng, GRPO cập nhật mô hình, và vòng lặp chạy lại từ đầu.
Những lựa chọn không hiển nhiên nằm ở việc cái gì được đánh giá, cách thức đánh giá được thực hiện, những gì có trong nhóm tham chiếu và cách viết câu lệnh hệ thống (system prompt). Mỗi yếu tố là chủ đề của một phần dưới đây.
câu lệnhmô hìnhcông cụgiám khảo-cập nhật
Vòng lặp huấn luyện.
Hàm phần thưởng
0501001502000.000.250.500.650.751.00phần thưởng huấn luyện · 200 bướcbước huấn luyện →phần thưởngthang điểm cũ · 9 tín hiệuthang điểm mới · 4 tín hiệu0.65 — giới hạn thang điểm cũnhững thay đổi trong hàm phần thưởng ↓CŨ9 tín hiệu · 5 dư thừabiên dịch5%sử dụng cọ5%độ dài ramp32%HPSv310%hội đồng8%nhận diện10%thẩm mỹ15%kỹ thuật8%chiều sâu7%5 giám khảo, ρ = 0.85–0.95MỚI4 tín hiệu · cặp đôi chiếm ưu thếcổng biên dịch5%độ dài5%HPSv330%cặp đôi60%
Thang điểm cũ so với thang điểm mới, các đường cong phần thưởng trên cùng một trục.
Nhóm tham chiếu
Nhóm này có 581 bức tranh tham chiếu. Tất cả đều được xếp hạng thủ công từ 1664 thế hệ, trong đó 117 bức thuộc nhóm yêu thích, 266 bức ở mức ổn, và 198 bức là bổ sung từ một đợt tạo hình riêng biệt được sử dụng để mở rộng tập so sánh ở những dải màu mà các ví dụ xếp hạng thủ công còn thiếu hụt.
Mọi hình ảnh trong nhóm đều là đầu ra của mô hình. Vì chúng tôi không thể tìm đủ các ví dụ do con người tạo ra do thư viện này là một công cụ chuyên biệt mà các nghệ sĩ sử dụng. Công việc tạo hình đã chạy qua hai quy trình. AutoResearch, với Opus 4.6, GPT-5.4 và Gemini 3.1 Pro lặp lại dựa trên các bức ảnh tham chiếu dưới sự đánh giá của một giám khảo VLM đưa ra điểm số và phản hồi. Và một đợt chạy lớn hơn trên Gemini 3.1 Pro. Cả hai quy trình đều cung cấp dữ liệu cho một câu lệnh hệ thống vốn đã được phát triển thông qua GEPA, sẽ được đề cập trong phần tiếp theo.
Phát triển câu lệnh hệ thống
Câu lệnh hệ thống cũng cần được cải thiện. Các phiên bản đầu bao gồm tài liệu tham khảo API p5.brush dài 400 dòng. Mô hình tạo ra mã nguồn tự tin, được định dạng tốt nhưng lại tự tạo ra các API không tồn tại.
Giải pháp được thực hiện bằng cách sử dụng GEPA, một thư viện tối ưu hóa câu lệnh giúp phát triển câu lệnh dựa trên một hàm tính điểm. Chúng tôi đã chạy 200 lần lặp dựa trên một giám khảo 7-shot có định hướng về thẩm mỹ. Quá trình tối ưu hóa đã hội tụ vào một câu lệnh với danh sách cho phép (allowlist) nghiêm ngặt gồm tám phương thức cọ, không có tài liệu API, không có ví dụ. Lần đầu tiên ba trên ba thế hệ tạo ra các đốm hoa dâm bụt có thể nhìn thấy được là trên phiên bản được viết sau khi loại bỏ hoàn toàn tài liệu tham khảo 400 dòng.
Các phát hiện đã được khái quát hóa. Tài liệu tham khảo dài trong câu lệnh hệ thống khiến các mô hình tạo ra các API ảo tưởng. Một danh sách cho phép ngắn gọn, có quan điểm rõ ràng sẽ kiểm soát đầu ra tốt hơn so với đặc tả ban đầu.
v0 · điểm bắt đầu
các mô hình tiên phong vẫn tạo ra API ảo tưởng
v0v4anh em Pareto (thế mạnh khác nhau)
v4 · Sử dụng GEPA trên tài liệu tham khảo API
ảo tưởng giảm đi
đã quađã trượtđề xuất bị từ chối— cạnh đậm hơn = dòng chính
Sơ đồ quy trình GEPA.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.