QbitAI
85

Mô hình

Zhipu ra mắt GLM-5.3-Flash, tận dụng sức mạnh tính toán từ hạ tầng của SenseTime

(giờ Việt Nam)

Tóm tắt AI

Zhipu AI vừa trình làng mô hình GLM-5.3-Flash, đánh dấu bước tiến mới trong việc phổ cập trí tuệ nhân tạo nhờ sự hỗ trợ hạ tầng tính toán nội địa từ SenseTime.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

28/08/2026 12:06:16 Nguồn: QbitAI

Kiến trúc dị thể nội địa thúc đẩy trí tuệ nhân tạo tiên phong bước vào kỷ nguyên phổ cập

Tối ngày 26 tháng 8, Zhipu chính thức ra mắt và mã nguồn mở GLM-5.3-Flash (320B-A18B), đây là mô hình đa phương thức (multimodal) thuần túy đầu tiên thuộc dòng GLM-5. Với tổng tham số 320B, mô hình này sở hữu năng lực vượt trội hơn GLM-5.2, đạt 57 điểm trong chỉ số Artificial Analysis Intelligence Index (AA) uy tín toàn cầu, lọt vào nhóm các mô hình tiên phong trên thế giới và có điểm số ngang bằng với Claude Opus 4.8, mô hình phổ biến nhất của Anthropic. Kiến trúc của GLM-5.3-Flash được thiết kế chuyên biệt cho chi phí cực thấp, kết hợp với kho dữ liệu tiền huấn luyện đa phương thức 30T Token mới nhất của Zhipu, giúp đạt được hiệu suất mạnh mẽ hơn với ít tài nguyên tính toán hơn.

Dựa trên công nghệ suy luận hỗn hợp dị thể nội địa tiên tiến, nền tảng SenseCore của SenseTime đã cung cấp hỗ trợ sức mạnh tính toán nội địa quy mô lớn và dịch vụ Token cho sự ra mắt của GLM-5.3-Flash, tạo nên một cột mốc tiêu biểu cho việc thương mại hóa quy mô lớn sức mạnh tính toán nội địa.

Đằng sau sự hợp tác này chính là hệ thống năng lực cốt lõi mà SenseTime đã xây dựng: "Một bộ mô hình, một nhà máy Token (Token Factory), một hệ thống quản lý tác nhân thông minh". Trong đó, nhà máy Token đóng vai trò then chốt trong việc sản xuất quy mô lớn các năng lực thông minh: thông qua việc tối ưu hóa liên kết giữa mô hình đa phương thức và cơ sở hạ tầng của nền tảng, nó tổ chức các loại chip, cụm máy chủ, năng lượng và các nút phân phối khác nhau để liên tục sản xuất Token chất lượng cao hơn với chi phí thấp hơn. Đồng thời, một vòng lặp phản hồi hai chiều được thiết lập giữa nhà máy Token và các mô hình lớn, giúp thích ứng tốt hơn với nhu cầu lặp lại của các mô hình đa phương thức thuần túy. Việc SenseCore hỗ trợ hiệu quả cho sự ra mắt của Zhipu GLM-5.3-Flash chính là minh chứng mạnh mẽ cho năng lực vòng lặp này.

Từ lâu, thị trường vẫn quan niệm rằng sức mạnh tính toán nội địa có hiệu suất chi phí không cao và khó thương mại hóa quy mô lớn. Tuy nhiên, trước khi chính thức phát hành, GLM-5.3-Flash đã trải qua các đợt kiểm thử quy mô lớn trên OpenCode và OpenRouter dưới tên mô hình ẩn danh Ox-Alpha (cộng đồng Trung Quốc gọi là "Niu Lai"), với lưu lượng gọi Token lên tới 62T, và toàn bộ các yêu cầu này đều được hỗ trợ bởi sức mạnh tính toán từ chip nội địa. Hơn nữa, so với đường cơ sở ban đầu trong cùng môi trường phần cứng, GLM-5.3-Flash dựa trên cụm chip nội địa đã cải thiện hiệu suất dịch vụ đầu cuối lên gấp 3 lần, với hiệu suất phần cứng và chi phí trên mỗi Token đã đạt mức tương đương với GPU NVIDIA phổ thông.

Thực tiễn này cho thấy sức mạnh tính toán nội địa đã có thể hỗ trợ hiệu quả và kinh tế cho nhu cầu suy luận của các mô hình lớn tiên phong trong các kịch bản kinh doanh thực tế quy mô lớn.

Là cơ sở hạ tầng AI am hiểu nhất về các mô hình lớn, SenseCore của SenseTime đang toàn diện đón đầu xu hướng nội địa hóa và tiếp tục thúc đẩy sức mạnh tính toán nội địa từ "khả dụng tại một điểm" tiến tới "thương mại hóa quy mô lớn". Trong khuôn khổ WAIC năm nay, nhắm vào các điểm nghẽn hiện tại của việc thương mại hóa quy mô lớn sức mạnh tính toán nội địa, SenseCore đã giải quyết vấn đề một cách hệ thống từ ba khía cạnh: "hiệu suất chi phí, khả năng thích ứng và tỷ lệ hiệu suất năng lượng".

Về khía cạnh hiệu suất chi phí, SenseCore vượt ra khỏi tư duy truyền thống về việc so sánh hiệu năng đơn card. Thông qua công nghệ suy luận hỗn hợp dị thể tiên tiến, dựa trên các nhu cầu khác nhau về tính toán và băng thông trong các giai đoạn suy luận khác nhau, nền tảng cho phép các loại chip nội địa với kiến trúc và định vị khác nhau phát huy thế mạnh riêng và phối hợp hiệu quả. Hiệu suất chi phí suy luận tổng thể đạt gấp 1,25 lần so với dòng NVIDIA H, và so với suy luận đồng nhất nội địa, sản lượng Token tăng khoảng 2,5 lần với cùng mức chi phí.

Về khả năng thích ứng, thông qua việc tối ưu hóa toán tử tầng dưới, tinh chỉnh song song đa card và thích ứng chuỗi công cụ, rào cản ứng dụng của sức mạnh tính toán nội địa đã được giảm đáng kể. Về khía cạnh tỷ lệ hiệu suất năng lượng, SenseCore đã ra mắt Agent phối hợp tính toán-điện năng và định nghĩa lại TPW (Tokens Per Watt) như một thước đo giá trị hoàn toàn mới cho AIDC.

Ngoài ra, thông qua việc tích hợp sức mạnh tính toán đa dạng và liên tục tối ưu hóa công cụ suy luận cùng hiệu năng chip, Token Factory của SenseCore đang hình thành năng lực cung cấp Token quy mô lớn, hiệu quả cao và chi phí thấp. Lượng dịch vụ Token trung bình hàng ngày trong tháng 7 đã đạt 2,42 nghìn tỷ, dự kiến sẽ vượt 10 nghìn tỷ/ngày vào cuối năm 2026, với mức tăng trưởng Token cả năm đạt 25 lần.

Trong tương lai, SenseCore sẽ tiếp tục đầu tư vào việc xây dựng dịch vụ Token dựa trên sức mạnh tính toán nội địa, tạo ra cơ sở hạ tầng AI hiệu suất cao, chi phí thấp và có khả năng phân phối quy mô, thúc đẩy sức mạnh tính toán nội địa từ những đột phá kỹ thuật đơn lẻ tiến tới sự thịnh vượng mang tính hệ thống của ngành công nghiệp.

Bài viết này do SenseTime cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.

Bản quyền đã được bảo hộ, không được phép sao chép hoặc sử dụng dưới bất kỳ hình thức nào nếu chưa được ủy quyền, mọi hành vi vi phạm sẽ bị truy cứu trách nhiệm.

量子位的朋友们
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.