Thủ thuật
Simon Willison kiểm chứng hiệu năng 5 cấp độ suy luận của Claude Fable 5.1 qua bộ test Pelican
(giờ Việt Nam)
Tóm tắt AI
Simon Willison thực nghiệm đánh giá Claude Fable 5.1 trên bộ benchmark Pelican. Kết quả cho thấy bước tiến vượt bậc của phiên bản 5.1 với 52,6% điểm số trên Terminal-Bench-Science 0.1, so với 24,7% của thế hệ tiền nhiệm.
Bản dịch AI

Ngày 1 tháng 9 năm 2026
Hôm nay là ngày của Claude Fable (và Mythos) 5.1. Anthropic cho biết Fable 5.1 “thiết lập một tiêu chuẩn mới cho lập trình, công việc tri thức và các tác vụ giải quyết vấn đề dài hạn”. Thông báo của họ dành một phần đáng kể để nói về nghiên cứu khoa học, tự hào với số điểm 52,6% trên bộ tiêu chuẩn đánh giá hoàn toàn mới Terminal-Bench-Science 0.1 (được công bố lần đầu vào ngày 27 tháng 8), tăng từ 24,7% của Fable 5, 29,0% của Opus 5 và 22,4% của GPT-5.6 Sol. Các bộ tiêu chuẩn khác cho thấy điểm số cải thiện nhẹ, nhưng không có cái nào ấn tượng bằng bộ tiêu chuẩn Khoa học.
Nhưng nó "pelican" tốt đến mức nào?
Quay lại tháng 7, tôi đã viết về việc mình đang mất niềm tin vào bộ tiêu chuẩn pelican—mối liên hệ của nó với khả năng thực hiện các tác vụ khác của các mô hình dường như không còn mạnh mẽ như hồi năm 2025. Những hiểu biết thú vị nhất mà tôi có được từ nó hiện nay là các so sánh trong cùng một dòng mô hình, và đặc biệt là so sánh cho cùng một câu lệnh (prompt) ở các mức độ nỗ lực suy luận khác nhau.
Fable 5.1 có năm mức độ suy luận: low (thấp), medium (trung bình), high (cao), xhigh (rất cao), max (tối đa)—và không có tùy chọn để tắt hoàn toàn tính năng suy luận.
Tôi đã sửa một lỗi trong llm-anthropic khiến các bước suy luận không được ghi lại chính xác, sau đó chạy thử một vài câu lệnh.
Đây là toàn bộ các kết quả pelican cho tất cả các mức độ suy luận, mỗi cái đều đi kèm với bản ghi suy luận đầy đủ. Tôi sẽ sao chép chúng ở đây:
Low và medium, cả hai đều không có suy luận?
Tiếp theo, một chút bí ẩn. Đây là những gì tôi nhận được cho mức nỗ lực low:

Bản ghi không hiển thị bất kỳ token suy luận tóm tắt nào và số lượng token đầu ra là 1.998. Với Claude, số lượng token đầu ra đó bao gồm cả các token suy luận. Nó mất 23,8 giây và tốn 10,017 cent.
Tôi đã tăng mức độ lên medium và nhận được kết quả này:

Kỳ lạ thay, kết quả đó cũng không hiển thị văn bản suy luận nào và sử dụng 1.977 token đầu ra—ít hơn 21 token so với mức low. Nó mất 23 giây và tốn 9,912 cent.
Vì vậy, đối với câu lệnh cụ thể này (“Tạo một tệp SVG hình một con bồ nông đang đi xe đạp”), Fable 5.1 dường như đã bỏ qua hoàn toàn việc suy luận ở cả hai thiết lập low và medium.
High
Đây là kết quả ở mức high—29,6 giây, 2.612 token đầu ra, 13,087 cent:

Lần này nó đã thực hiện một chút suy luận, bản tóm tắt ở đây:
Tôi đang lên kế hoạch bố cục SVG cho một con bồ nông đang đi xe đạp, với nền trời và mặt đất, một chiếc xe đạp có hai bánh nan hoa, khung, yên xe và tay lái, cùng một con bồ nông thân trắng với chiếc cổ dài và mỏ màu cam được đặt ở phía trên.
Tuy nhiên, thực sự không có nhiều khác biệt so với mức low và medium.
Ở mức xhigh, mọi thứ trở nên khác biệt hoàn toàn. 36.767 token đầu ra, 7 phút 51 giây, 1,83 đô la!

Quá trình suy luận khá dài và bao gồm các chi tiết như thế này:
Thêm mắt, đôi cánh vươn xuống tay cầm ghi đông, đôi chân màu cam vươn tới bàn đạp và một chiếc lông đuôi nhỏ, đồng thời cố tình giữ cho con bồ nông có kích thước quá khổ so với chiếc xe để tạo hiệu ứng hài hước. [...]
Tôi sẽ chấp nhận độ dày nhẹ đó như một nét duyên dáng thay vì coi đó là sự thiết kế quá mức.
Max
Thiết lập nỗ lực ở mức max đã mang lại cho tôi con bồ nông đẹp nhất mà tôi từng thấy từ bất kỳ mô hình nào của Anthropic. 65.927 token đầu ra, 13 phút 54 giây, 3,30 đô la:
Có rất nhiều điểm đáng khen ở đây. Phần nền trang nhã, đôi chân rõ ràng nằm ở hai bên khung xe, bàn chân đặt trên bàn đạp, cánh đặt trên tay lái, con bồ nông có một chiếc mũ màu xanh dễ thương và có cả một chiếc giỏ đựng cá.
Nó vẫn chưa thể hiện được sự tinh tế như Gemini 3.7 Flash, nhưng tôi không yêu cầu sự tinh tế—tôi yêu cầu một tệp SVG, và đó chính xác là những gì tôi nhận được.
Một số điểm nổi bật từ quá trình suy luận đó:
Thêm hình dạng bàn đạp gần cả hai bàn chân, với bàn chân xa hơn ở chân thứ hai hiển thị một phần phía sau khung xe. Tôi đang cân nhắc xem có nên thêm một chiếc khăn quàng cổ nhỏ hoặc mũ để tạo thêm cá tính không, nhưng nghiêng về việc giữ cho đơn giản để tránh rối mắt.
Bây giờ tôi đang tranh luận giữa việc đội mũ bảo hiểm xe đạp trên đầu hay giữ lại chiếc mào đặc trưng của bồ nông—chiếc mỏ và túi cổ đã cho thấy rõ đó là “bồ nông”, vì vậy một chiếc mũ bảo hiểm có thể củng cố chủ đề xe đạp mà không làm mất đi bản sắc, mặc dù nó có thể cạnh tranh với chiếc mào về không gian thị giác.
Tôi nhận ra chiếc mỏ tại (484,84) sẽ chồng lên chiếc mũ bảo hiểm, vì vậy tôi cần thu nhỏ mũ bảo hiểm để nó chỉ che phần đỉnh đầu, điều chỉnh các điểm cuối cung của nó để ngồi cao hơn và hẹp hơn để chiếc mỏ có thể gắn vào phía trước một cách gọn gàng mà không bị va chạm. [...]
Tôi đang thêm một vùng đầu tối màu hơn để đại diện cho các lông vũ chính, sau đó cân nhắc lại phần mép sau để bao gồm các đường cong lông vũ hình vỏ sò thay vì một đường thẳng mượt mà để có vẻ ngoài tự nhiên hơn. [...]
Bây giờ tôi đang kiểm tra vị trí các đường thông gió trên mũ bảo hiểm, đảm bảo chúng nằm đủ xa bên trong mép mũ bảo hiểm với độ dày nét vẽ và các đầu tròn, đồng thời xác nhận mỗi lỗ thông gió nằm trong ranh giới hình tròn của mũ bảo hiểm. [...]
Tôi quyết định bỏ qua chuông xe đạp và các điểm nhấn trên lốp vì chúng là những bổ sung không cần thiết. Bây giờ tôi đang cân nhắc lại đường cong của phuộc trước — điểm điều khiển hiện tại kéo hình dạng về phía sau trong khi nó nên hướng về phía trước để có độ nghiêng phù hợp, vì vậy tôi cần dịch chuyển điểm điều khiển sang phải để sửa độ nghiêng của phuộc.
OK, hãy tạo hiệu ứng chuyển động cho nó.
Trên Hacker News, swalsh đã bình luận về con bồ nông ở mức Max đó:
Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.