QbitAI
85

Mô hình

Andrej Karpathy đề xuất dùng 'Chúa tể những chiếc nhẫn' làm chuẩn đánh giá mô hình AI mới

(giờ Việt Nam)

Tóm tắt AI

Chuyên gia AI Andrej Karpathy vừa giới thiệu một phương pháp đánh giá năng lực mô hình ngôn ngữ lớn (LLM) mới, sử dụng nội dung từ bộ phim kinh điển 'Chúa tể những chiếc nhẫn' làm thước đo chuẩn.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

07-08-2026 09:15:42 Nguồn: QbitAI

Chúa tể những chiếc nhẫn trở thành tiêu chuẩn đánh giá mới cho mô hình ngôn ngữ lớn

Henry đưa tin từ "" (AoFeiSi)

QbitAI | Kênh chính thức QbitAI

Không dài dòng nữa, bắt đầu ngay màn "nằm ườn" mỗi ngày thôi nào (doge)!

Vừa mới đây, đại thần Andrej Karpathy thông báo rằng "chúng ta" tại Anthropic đã bắt đầu áp dụng một phương thức hoàn toàn mới để "tăng độ khó" cho các mô hình ngôn ngữ lớn (LLM) —

Đó chính là Chúa tể những chiếc nhẫn (The Lord of the Rings).

Theo Karpathy, "bộ tiêu chuẩn Chúa tể những chiếc nhẫn" này đang dần thay thế bài kiểm tra SVG "bồ nông đi xe đạp" từng làm mưa làm gió trước đây.

Cụ thể, Karpathy đã trực tiếp đưa phần mở đầu của Chúa tể những chiếc nhẫn cho Opus 5, yêu cầu mô hình này sử dụng Three.js để dựng ngay tại chỗ một "Trung địa" (Middle-earth) hoàn chỉnh.

Về kết quả cuối cùng, nó trông hơi giống những bộ phim hoạt hình 3D nội địa cuối thập niên 90, đầu những năm 2000: rất thô sơ và cũng rất trừu tượng.

Nhưng khách quan mà nói, nếu nhìn kỹ một lúc, và bạn lại tình cờ quen thuộc với Hobbiton – địa điểm quay phim Chúa tể những chiếc nhẫn tại New Zealand – thì quả thực vẫn có thể cảm nhận được một chút "hương vị" của nó~

Tuy nhiên, một sản phẩm trông có vẻ không tinh tế cho lắm này lại tiêu tốn của Opus 5: 1 triệu token, 2 giờ đồng hồ và 5500 dòng mã.

Tất nhiên, trên sân khấu không chỉ có mình Claude đơn độc tỏa sáng.

Điều hài hước nhất chính là phiên bản DeepSeek V4 Flash mà cư dân mạng vừa mới "dọn lên bàn".

Một cảnh tượng "người Trung Quốc biết bay" đúng nghĩa, tất cả nhân vật trong khung hình đều lơ lửng.

Đối mặt với những lỗi hiển thị rõ mồn một này, Karpathy tỏ ra khá thẳng thắn.

Ông chỉ ra rằng, Opus 5 hiện vẫn chưa thể thực sự "bước vào" thế giới mà chính nó tạo ra, mà chỉ có thể chụp ảnh màn hình liên tục tại các thời điểm khác nhau, rồi từ từ kiểm tra xem lỗi nằm ở đâu.

Và điều này đã bộc lộ một điểm yếu rõ rệt của các mô hình ngôn ngữ lớn hiện nay:

Chúng đã có thể viết mã, dựng cảnh, tạo trò chơi, nhưng vẫn chưa thực sự hiểu được video, cũng không thể tự mình chơi thử trò chơi mà chúng tạo ra.

Hai giờ đồng hồ, tự tay dựng một Trung địa

Hãy cùng xem bài kiểm tra "Chúa tể những chiếc nhẫn" này được thực hiện cụ thể như thế nào.

Nếu theo đúng nghĩa đen trong bài đăng của Karpathy, câu lệnh (prompt) chính được đưa cho Opus 5 lần này chính là phần mở đầu của chương 1, Bữa tiệc được mong đợi từ lâu, trong nguyên tác Chúa tể những chiếc nhẫn.

Bilbo Baggins tại Bag End tuyên bố tổ chức bữa tiệc sinh nhật lần thứ 111 hoành tráng, và Hobbiton ngay lập tức xôn xao bàn tán...

Những bạn nào quan tâm có thể tự mình thử nghiệm.

Ngoài ra, Karpathy còn chỉ định sử dụng Three.js trong câu lệnh, đây là một thư viện JavaScript dùng để xây dựng các cảnh 3D bằng mã nguồn.

Từ đó, nhiệm vụ mà Opus 5 phải hoàn thành là đọc hiểu văn bản mở đầu của Chúa tể những chiếc nhẫn, sau đó dịch nó thành một thế giới 3D có thể chạy thời gian thực trên trình duyệt.

Trong suốt quá trình này, Opus 5 cần sử dụng các đa giác để lắp ghép nhân vật, công trình và đạo cụ, đặt từng thứ vào hệ tọa độ x, y, z, sau đó sắp xếp camera, ánh sáng và hoạt ảnh.

Nhân vật di chuyển khi nào, góc máy quay về đâu, ánh sáng thay đổi ra sao, các vật thể trong cảnh tương tác với nhau thế nào, tất cả đều cần mô hình định nghĩa bằng mã.

Mặc dù hình ảnh cuối cùng không thể gọi là tinh tế, và thường xuyên xuất hiện các lỗi như xuyên thấu (clipping), lơ lửng... ví dụ như đầu và thân nhân vật tách rời nhau... nhưng dù sao thì toàn bộ cảnh quan cũng đã được dựng lên thực sự.

Cần lưu ý rằng, điều này không giống với việc các mô hình video tạo ra từng khung hình pixel trực tiếp.

Three.js cần thiết lập nhân vật, vật thể và bối cảnh dưới dạng các đối tượng 3D trước, sau đó tính toán vị trí, góc độ và trạng thái chuyển động của chúng theo thời gian thực dựa trên mã nguồn.

Vì vậy, bản demo mà chúng ta thấy không phải là một đoạn video do AI tạo ra thông thường, mà là bản ghi màn hình khi một cảnh 3D trên web đang chạy.

Tuy nhiên, Karpathy cũng đề cập trong phần bình luận rằng, 3D lập trình và tạo video không phải là lựa chọn loại trừ lẫn nhau.

Một cư dân mạng đề xuất rằng, có thể đưa bản ghi màn hình Three.js thô sơ này cho Seedance làm video tham chiếu, sau đó để mô hình video render lại với chất lượng hình ảnh cao hơn.

Andrej KarpathyLLMĐánh giá AIChúa tể những chiếc nhẫnCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.