Mô hình
Bilibili ra mắt 'Đấu trường AI vô cực': GPT-6 dẫn đầu bảng xếp hạng 100 mô hình toàn cầu
(giờ Việt Nam)
Tóm tắt AI
Ngày 16/9, Bilibili chính thức khởi động 'Đấu trường AI vô cực' và công bố bảng xếp hạng đánh giá các mô hình ngôn ngữ lớn hàng đầu thế giới, trong đó GPT-6 đang chiếm lĩnh vị trí số 1.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
16/09/2026 14:23:05 Nguồn: QbitAI
Ngày 16 tháng 9, "Đấu trường AI vô cực" (AI) trên Bilibili đã chính thức ra mắt, bảng xếp hạng đánh giá các mô hình ngôn ngữ lớn (LLM) đợt đầu tiên cũng được công bố đồng thời.
#BilibiliAIUnlimitedArena#
Ngày 16 tháng 9, "Đấu trường AI vô cực" trên Bilibili đã chính thức ra mắt, bảng xếp hạng đánh giá LLM đợt đầu tiên cũng được công bố đồng thời. GPT-6 Astra đã giành vị trí dẫn đầu trong các bài đánh giá của 10 nhà sáng tạo nội dung (UP chủ), đánh bại GLM-5.3 để trở thành quán quân về số lần đứng đầu bảng xếp hạng; trong top 5, các mô hình nội địa chiếm tới 3 vị trí.
"Đấu trường AI vô cực" là một quảng trường thi đấu tập hợp các bài đánh giá về mô hình AI lớn từ các UP chủ trên Bilibili. Nội dung được xây dựng dựa trên các bài kiểm tra thực tế của các UP chủ trong nhiều lĩnh vực khác nhau trên hàng trăm mô hình AI, bao gồm các chủ đề đánh giá đa dạng như lập trình, suy luận, cộng tác và kiến thức.
Khác với các bài kiểm tra điểm chuẩn (benchmark) truyền thống, Đấu trường AI vô cực của Bilibili không giới hạn chủ đề hay tiêu chí đánh giá. Các UP chủ từ nhiều lĩnh vực khác nhau tự đưa ra đề bài dựa trên quy trình làm việc thực tế, ứng dụng chuyên môn hoặc các ý tưởng sáng tạo thú vị. Thông qua các màn so tài cùng đề bài, sự khác biệt về hiệu năng thực tế của từng mô hình được thể hiện một cách trực quan. Bảng xếp hạng đợt đầu tiên hiện đã bao gồm các bài đánh giá so sánh những mô hình phổ biến như DeepSeek, Kimi, ChatGPT, Claude, Gemini, Doubao, Qwen, Hy, MiniMax…
Trong năm qua, hệ sinh thái AI trên Bilibili đã chứng kiến sự tăng trưởng bùng nổ. Thời lượng tiêu thụ nội dung kiến thức về AI tăng 72% so với cùng kỳ năm ngoái, với hơn 190 triệu người dùng xem nội dung AI mỗi tháng. Từ việc ra mắt, thảo luận, đánh giá, sử dụng, tìm kiếm sự trợ giúp cho đến cùng nhau phát triển các mô hình hoặc ứng dụng AI, các tính năng livestream, video và bình luận (danmu) của Bilibili hoàn toàn phù hợp với nhu cầu tiếp nhận thông tin và giao lưu của những người đam mê công nghệ AI. Trong một hệ sinh thái sôi động như vậy, các nội dung đánh giá LLM cũng dần tích tụ trên cộng đồng Bilibili, tạo ra vô số nội dung đánh giá đa dạng về lĩnh vực, khía cạnh và chủ đề. "Đấu trường AI vô cực" – một quảng trường tập hợp các bài đánh giá này – đã ra đời từ xu thế đó.
Bảng xếp hạng của đấu trường sẽ được cập nhật theo thời gian thực và tiếp tục mở đơn đăng ký cho tất cả các UP chủ trên toàn nền tảng.
Với việc ngày càng có nhiều bài đánh giá được bổ sung, những mẫu thử nghiệm từ các tình huống thực tế này sẽ giúp năng lực của các mô hình được kiểm chứng đầy đủ hơn, đồng thời cung cấp cho người dùng góc nhìn toàn diện hơn để hiểu về giới hạn năng lực của AI.
Link bảng xếp hạng: https://www.bilibili.com/blackboard/era/aiarena.html?bsource=market_aiarena_sns_02


Bài viết này do Bilibili cung cấp, QbitAI đã được cấp phép đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền đã được bảo hộ, nghiêm cấm sao chép và sử dụng dưới mọi hình thức khi chưa được cấp phép, mọi hành vi vi phạm sẽ bị xử lý theo quy định.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.