QbitAI
85

Mô hình

Mô hình bí ẩn 'Niu Lai' chính là Zhipu AI: GLM đa phương thức thuần túy đầu tiên chạy trên chip nội địa

(giờ Việt Nam)

Tóm tắt AI

Zhipu AI vừa ra mắt GLM-5.3 Flash, mô hình đa phương thức thuần túy đầu tiên của hãng, được tối ưu hóa hoàn toàn để vận hành trên hạ tầng chip AI nội địa Trung Quốc.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

27-08-2026 00:48:12 Nguồn: QbitAI

GLM-5.3 Flash

Kim Lỗi đưa tin từ Aofei Temple

QbitAI | Kênh chính thức QbitAI

Cuối cùng, danh tính thực sự của mô hình bí ẩn "Ox Alpha" (Ngưu Lai) vốn gây xôn xao trên mạng những ngày qua đã được hé lộ!

Và quả nhiên, nó đến từ các nhà phát triển Trung Quốc —

Đó chính là GLM-5.3 Flash, mô hình vừa được Zhipu ra mắt và mở mã nguồn, đồng thời là mô hình đa phương thức (multimodal) thuần túy đầu tiên trong dòng 5 series.

Trong những ngày "Ox Alpha" gây sốt, thực tế đã có không ít người dùng thử nghiệm phiên bản này.

Một trong những thử nghiệm phổ biến nhất là yêu cầu nó tự tay tạo ra một trang web tương tác 3D mô phỏng động cơ tên lửa SpaceX Raptor.

Chẳng hạn như blogger Tim Jayas, sau vài ngày sử dụng cùng một Prompt để yêu cầu "Ox Alpha" thực hiện tác vụ này hai lần, đã phải thốt lên rằng:

Cảm giác "Ox Alpha" là một mô hình có khả năng tự học hỏi liên tục.

Thật tình cờ, chúng tôi cũng vừa nhận được quyền truy cập thử nghiệm nội bộ của GLM-5.3 Flash và đã thực hiện dự án tương tự; sau khi nhập Prompt, chúng tôi không cần phải thao tác thêm bất cứ điều gì:

Sau một lúc chờ đợi, dự án động cơ Raptor 3D đã ra lò, hãy cùng cảm nhận trải nghiệm này:

Địa chỉ video: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

Nhìn vào kết quả so sánh, ừm, không cần phải nói nhiều, động cơ Raptor 3D do GLM-5.3 Flash tạo ra tinh xảo hơn hẳn.

Vậy tại sao mô hình "Ox Alpha" lại hot đến thế?

Chỉ cần nhìn vào các bài đăng từ các nền tảng chính thức, chúng ta có thể thấy được phần nào lý do.

Ví dụ trên OpenRouter, "Ox Alpha" đã vươn lên dẫn đầu bảng xếp hạng ngay ngày đầu tiên và phá vỡ kỷ lục sử dụng tokens trong một ngày:

OpenCode cũng cho biết, ngay khi Ox Alpha ra đời, nó đã chấm dứt chuỗi 56 ngày thống trị bảng xếp hạng của DeepSeek trên OpenCode:

Và sau khi Zhipu chính thức xác nhận "Ox Alpha", chúng tôi còn phát hiện thêm những điểm sáng khác của GLM-5.3 Flash.

Về kích thước mô hình, GLM-5.3 Flash chỉ có 320B, nhưng về năng lực lại vượt trội hoàn toàn so với GLM-5.2 có dung lượng 753B.

Ngoài ra, theo bảng xếp hạng AA mới nhất, GLM-5.3 Flash đã đạt 57 điểm, bước vào hàng ngũ tiên phong trên phạm vi toàn cầu và có điểm số ngang bằng với Claude Opus 4.8.

Về giá cả, GLM-5.3 Flash được định giá bằng 1/10 phiên bản 5.3, giảm giá trong thời gian giới hạn còn 1/20 so với GLM-5.3, 1/40 so với Opus 4.8 và mức giá thấp hơn cả DS-V4-Flash.

Và còn một điều đáng tự hào nữa —

62T Tokens được đề cập ở trên đều chạy trên các dòng chip nội địa! Hóa ra mô hình bí ẩn mà người nước ngoài săn đón suốt một tháng qua lại là một "chú bò" thuần chủng nội địa.

Tiếp theo, theo thông lệ, chúng ta sẽ đi vào một bài kiểm tra chuyên sâu, bắt đầu thôi nào~

Zhipu GLM cuối cùng đã "mở mắt"

Như chúng tôi đã đề cập, Zhipu GLM-5.3 Flash là mô hình đa phương thức thuần túy đầu tiên trong dòng 5 series.

Vì vậy, loạt thử nghiệm đầu tiên, chúng tôi sẽ tập trung vào khả năng đa phương thức.

Ví dụ, chúng tôi cung cấp cho GLM-5.3 Flash một video có nhiều người nói chuyện, yêu cầu nó dựa trên video gốc để phân biệt ai đang nói và chèn phụ đề chính xác.

Prompt như sau:

Trước tiên hãy nhận diện các người nói khác nhau, sau đó tạo phụ đề kết hợp màu sắc nhân vật và hiệu ứng đọc theo kiểu Karaoke: màu nền nhân vật giữ cố định, từ hoặc cụm từ đang đọc được làm nổi bật thêm. Sử dụng phối màu tương phản cao gồm xanh lơ, vàng ấm, đỏ san hô và trắng, từ hiện tại chuyển đổi mượt mà từ độ sáng thấp sang màu nổi bật. Phân biệt người dẫn chương trình chính, khách mời và người nói chen ngang, không liệt kê nhạc nền, tiếng vỗ tay và tiếng ồn môi trường như người nói. Phụ đề phải được căn chỉnh lại dựa trên dòng thời gian cuối cùng, không được sử dụng vị trí thời gian cũ của video gốc cho bất kỳ đoạn cắt nào. Hãy xem toàn bộ video trước khi quyết định, tránh việc chỉ dựa vào mẫu ở đoạn đầu để suy luận cấu trúc tiếp theo. Vui lòng giữ các điểm cắt tự nhiên, ưu tiên đảm bảo giọng nói rõ ràng. Phụ đề đặt trong vùng an toàn của khung hình, sử dụng viền hoặc nền để đảm bảo khả năng đọc trên nền phức tạp.

Tác vụ này thực sự thử thách khả năng xử lý đa phương thức của một mô hình, ví dụ như nó phải hiểu được video, khớp đúng nhân vật và quan trọng nhất là phụ đề phải chính xác.

Zhipu AIGLMĐa phương thứcChip nội địaAI Trung Quốc
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.