Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Đánh giá GLM-5.3 (max): Thông minh vượt trội, giá hợp lý nhưng phản hồi còn dài dòng

(giờ Việt Nam)

Tóm tắt AI

GLM-5.3 (max) đạt 60 điểm trên bảng xếp hạng Artificial Analysis, vượt xa mức trung bình 35 điểm của các mô hình cùng phân khúc, khẳng định vị thế dẫn đầu về trí tuệ.

Bản dịch AI

GLM-5.3 (max) - Intelligence, Performance & Price Analysis

Trí tuệ

Chỉ số Trí tuệ Artificial Analysis

Artificial Analysis Intelligence Index v4.1.1 bao gồm 9 bài đánh giá: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Artificial Analysis Intelligence Index v4.1.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích chi tiết từng bài đánh giá và cách chúng tôi thực hiện chúng.

Chỉ số Trí tuệ Artificial Analysis theo Trọng số mở / Độc quyền

Artificial Analysis Intelligence Index v4.1.1 bao gồm 9 bài đánh giá: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Artificial Analysis Intelligence Index v4.1.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích chi tiết từng bài đánh giá và cách chúng tôi thực hiện chúng.

Cho biết liệu trọng số mô hình có sẵn hay không. Các mô hình được dán nhãn 'Commercial Use Restricted' (Hạn chế sử dụng thương mại) nếu trọng số có sẵn nhưng việc sử dụng thương mại bị hạn chế (thường yêu cầu phải có giấy phép trả phí).

Các bài đánh giá trí tuệ

Các bài đánh giá trí tuệ được đo lường độc lập bởi Artificial Analysis · Điểm càng cao càng tốt

Sử dụng công cụ tác nhân (Agentic tool use)

Suy luận & kiến thức

Kiến thức

1 - tỷ lệ ảo giác

Suy luận ngữ cảnh dài

Phân tích định lượng trên bảng tính & tài liệu

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Mặc dù trí tuệ của mô hình thường có thể áp dụng trên nhiều trường hợp sử dụng, nhưng các bài đánh giá cụ thể có thể phù hợp hơn với một số trường hợp nhất định.

Artificial Analysis Intelligence Index v4.1.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích chi tiết từng bài đánh giá và cách chúng tôi thực hiện chúng.

AA-Omniscience

Chỉ số AA-Omniscience

Chỉ số AA-Omniscience (điểm càng cao càng tốt) đo lường độ tin cậy của kiến thức và tình trạng ảo giác. Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt việc từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn số câu trả lời đúng.

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Chỉ số AA-Omniscience (điểm càng cao càng tốt) đo lường độ tin cậy của kiến thức và tình trạng ảo giác. Chỉ số này thưởng cho các câu trả lời đúng, phạt các câu trả lời ảo giác và không phạt việc từ chối trả lời. Điểm số dao động từ -100 đến 100, trong đó 0 nghĩa là số câu trả lời đúng bằng số câu trả lời sai, và điểm âm nghĩa là số câu trả lời sai nhiều hơn số câu trả lời đúng.

So sánh Chỉ số Trí tuệ

Chỉ số Trí tuệ so với Chi phí trên mỗi tác vụ Chỉ số Trí tuệ

Chỉ số Trí tuệ Artificial Analysis · Chi phí trung bình có trọng số (USD) trên mỗi tác vụ Chỉ số Trí tuệ Artificial Analysis

Góc phần tư hấp dẫn nhất

Đường Pareto

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Chi phí trung bình có trọng số trên mỗi tác vụ Chỉ số Trí tuệ. Chi phí của mỗi bài đánh giá được tính từ giá của token đầu vào, cache hit, cache write, suy luận và câu trả lời, chia cho số lượng tác vụ và được tính trọng số theo trọng số của Chỉ số Trí tuệ.

Artificial Analysis Intelligence Index v4.1.1 bao gồm: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Xem phương pháp luận của Intelligence Index để biết thêm chi tiết, bao gồm phân tích chi tiết từng bài đánh giá và cách chúng tôi thực hiện chúng.

Sử dụng Token

Token đầu ra trên mỗi tác vụ Chỉ số Trí tuệ

Số lượng token đầu ra trung bình có trọng số được sử dụng để thực hiện một tác vụ trong Chỉ số Trí tuệ Artificial Analysis

Các mô hình suy luận được biểu thị bằng biểu tượng bóng đèn

Số lượng token cần thiết cho mỗi tác vụ Chỉ số Trí tuệ. Con số này được tính bằng cách nhân số token đầu ra trên mỗi bài đánh giá với trọng số tương đối của từng tiêu chuẩn trong Chỉ số Trí tuệ, sau đó chia cho số lượng tác vụ (không bao gồm các phần lặp lại).

GLM-5.3Đánh giá AILLMArtificial AnalysisCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.