Mô hình
Đại học Thanh Hoa và LimiX ra mắt mô hình nền tảng dữ liệu cấu trúc LimiX-2, dẫn đầu bảng xếp hạng quốc tế
(giờ Việt Nam)
Tóm tắt AI
Ngày 16/9, LimiX phối hợp cùng Đại học Thanh Hoa giới thiệu mô hình dữ liệu lớn thế hệ mới LimiX-2 với quy mô tham số đạt 400 triệu, thiết lập chuẩn mực mới trên các bảng xếp hạng uy tín.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
16/09/2026 14:32:31 Nguồn: QbitAI
Ngày 16 tháng 9, Wenzhun Intelligence phối hợp cùng Đại học Thanh Hoa đã công bố mô hình lớn dữ liệu thế hệ mới LimiX-2, với quy mô tham số mô hình được nâng cấp lên 400M.
Ngày 16 tháng 9, Wenzhun Intelligence phối hợp cùng Giáo sư Thôi Bằng (Cui Peng) từ Khoa Khoa học Máy tính, Đại học Thanh Hoa, đã công bố mô hình lớn dữ liệu thế hệ mới LimiX-2, với quy mô tham số mô hình được nâng cấp lên 400M. Trong ba Benchmark dữ liệu có cấu trúc phổ biến quốc tế là TabArena, BCCO và TALENT, điểm Elo tổng thể của LimiX-2 lần lượt đạt 1935, 1432 và 1506, đều đứng đầu bảng xếp hạng, vượt qua các mô hình tương tự từ những tập đoàn quốc tế lớn như Google, SAP và Amazon.
Trong ba Benchmark dữ liệu có cấu trúc phổ biến quốc tế là TabArena, BCCO và TALENT, điểm Elo tổng thể của LimiX-2 lần lượt đạt 1935, 1432 và 1506, đều đứng đầu bảng xếp hạng, vượt qua các mô hình tương tự từ những tập đoàn quốc tế lớn như Google, SAP và Amazon.

LimiX-2 dẫn đầu các bảng xếp hạng Benchmark quốc tế phổ biến
Elo là chỉ số xếp hạng dùng để đo lường năng lực tổng hợp của mô hình. TabArena, BCCO và TALENT là các chuẩn đánh giá mô hình dữ liệu có cấu trúc phổ biến quốc tế, bao phủ nhiều loại tác vụ, được sử dụng để đánh giá khả năng tổng quát hóa và hiệu suất dự đoán của mô hình trên các tập dữ liệu khác nhau, đồng thời đã trở thành căn cứ đánh giá quan trọng trong cuộc cạnh tranh mô hình nền tảng dữ liệu có cấu trúc hiện nay.

LimiX-2 đạt điểm Elo tối ưu trong các tác vụ hồi quy, phân loại nhị phân và phân loại đa lớp trên TabArena
Việc nâng cấp năng lực mô hình lần này chủ yếu được thúc đẩy theo 3 lộ trình kỹ thuật.
Thứ nhất là Mạng cơ chế ngữ cảnh CMNs (Contextual Mechanism Networks), đóng vai trò là hệ thống dự đoán các mối quan hệ phụ thuộc, chuyển trọng tâm mô hình hóa từ biến mục tiêu được chỉ định trước sang sự tương quan giữa các biến;
Thứ hai là nâng cấp công cụ tạo dữ liệu tổng hợp tự động trong giai đoạn tiền huấn luyện;
Thứ ba là tiếp tục Scaling, mở rộng quy mô tham số mô hình lên 400M.
Đội ngũ LimiX đã đề xuất Mạng cơ chế ngữ cảnh (CMNs), mở ra một mô hình mới cho việc mô hình hóa dữ liệu có cấu trúc, chuyển từ "dự đoán mục tiêu" sang "khám phá cấu trúc". Các PFNs cổ điển truyền thống lấy phân phối dự đoán của mục tiêu được chỉ định làm cốt lõi; trong khi CMNs lấy sự phụ thuộc liên kết của toàn bộ biến trong dữ liệu ngữ cảnh làm đối tượng mô hình hóa, không chỉ quan tâm đến giá trị của biến mà còn tập trung vào việc khám phá cách các biến tương quan với nhau và cùng tạo nên cấu trúc nội tại như thế nào.
Sự chuyển đổi mô hình này đã xác lập lại mục tiêu học tập của mô hình. Thông qua mô hình hóa mặt nạ điều kiện ngữ cảnh (CCMM), LimiX tổ chức giám sát chéo giữa các biến trong các chế độ quan sát khác nhau, xác lập việc suy luận mối quan hệ biến số thành mục tiêu tiền huấn luyện rõ ràng. Mô hình không còn chỉ học thông tin liên quan cho một kết quả cụ thể nào đó, mà thông qua nhiều dự đoán có điều kiện để cùng ràng buộc sự thể hiện cấu trúc phụ thuộc của toàn bộ biến.
Nguyên tắc này cũng xuyên suốt kiến trúc mạng. Do đó, LimiX áp dụng mô hình hóa cấp độ ô (Cell-Level), lấy quan sát của biến trong mỗi mẫu làm đơn vị biểu diễn cơ bản, bảo lưu danh tính cột, giá trị cụ thể và trạng thái thiếu hụt, hỗ trợ tương tác thông tin chéo biến và chéo mẫu. Từ biểu diễn dữ liệu, mục tiêu huấn luyện đến tính toán mạng, thiết kế tổng thể xoay quanh việc mô hình hóa sự phụ thuộc liên kết.
Trong khuôn khổ này, các tác vụ như phân loại, hồi quy, điền giá trị thiếu hụt được thống nhất thành các truy vấn khác nhau đối với cùng một mô hình dữ liệu. Quan trọng hơn, mô hình hóa mối quan hệ liên kết cung cấp nền tảng thống kê để kết hợp các giả thuyết nhân quả nhằm khám phá khung nhân quả. Những gì CMNs hướng tới không chỉ là một bộ dự đoán mạnh mẽ hơn, mà là trí tuệ dữ liệu phổ quát dựa trên mô hình hóa liên kết, lấy khám phá cấu trúc làm định hướng và hướng tới quy nạp cơ chế dữ liệu.
Về dữ liệu huấn luyện, LimiX-2 đã nâng cấp công cụ tạo dữ liệu tổng hợp tự động quy mô lớn. Dữ liệu có cấu trúc tồn tại rất nhiều trong các hệ thống nội bộ doanh nghiệp, khó có thể thu thập công khai quy mô lớn như văn bản internet, vì vậy các mô hình nền tảng bảng biểu như TabPFN, Mitra cũng thường sử dụng dữ liệu tổng hợp để tiền huấn luyện. LimiX-2 có thể tự động tạo ra dữ liệu với các phân phối khác nhau như tuyến tính, phi tuyến tính, tương tác đa biến, biến đổi chu kỳ và nhiễu, giúp mô hình tiếp xúc với nhiều cấu trúc dữ liệu và mối quan hệ biến số hơn trước khi đi vào doanh nghiệp thực tế.
Tiếp nối việc Wenzhun Intelligence phát hiện và đề xuất "Mô hình nền tảng dữ liệu có cấu trúc tuân theo Scaling Law" vào tháng 11 năm ngoái, mô hình mới lần này tiếp tục đi theo lộ trình kỹ thuật đó, nâng quy mô tham số mô hình lên 400M. Việc tăng tham số lên 400M sẽ giúp lộ trình kỹ thuật mà LimiX lựa chọn được kiểm chứng ở quy mô và phạm vi lớn hơn, đạt được khả năng tổng quát hóa mạnh mẽ hơn, đồng thời ưu thế trong việc khai thác quy luật nhân quả và biểu đạt ổn định cũng được phát huy thêm.
Ngoài năng lực dự đoán như phân loại, hồi quy được thể hiện qua các bảng xếp hạng, LimiX-2 còn cho thấy sự đột phá về kỹ thuật trong việc khám phá nhân quả. Các phương pháp khám phá nhân quả truyền thống phụ thuộc vào tiên nghiệm của chuyên gia hoặc các giả thuyết thống kê nghiêm ngặt, khó đối phó với dữ liệu doanh nghiệp đa chiều. Sau khi áp dụng hàng loạt lộ trình kỹ thuật sáng tạo nêu trên, LimiX-2 đã dẫn trước đáng kể so với các phương pháp khám phá nhân quả truyền thống trên nhiều tập dữ liệu tiêu chuẩn công khai về khám phá nhân quả như Sachs, UF, Causal Chamber.

LimiX-2 dẫn đầu đáng kể trong đánh giá khám phá nhân quả
Tính đến Hội nghị Trí tuệ nhân tạo Thế giới năm 2026, thế hệ LimiX trước đó đã hoàn thành xác thực tính phổ quát cho hơn 3800 kịch bản dữ liệu có cấu trúc và đạt được hợp tác chiến lược với hơn 60 khách hàng. Trước đó, trong nhiều xác thực kịch bản thực tế, LimiX đã chuyển đổi phương thức học máy truyền thống "một tác vụ huấn luyện một mô hình chuyên dụng" thành năng lực dự đoán phổ quát xuyên kịch bản, xuyên tập dữ liệu của một mô hình nền tảng. Tối ưu hóa thông số quy trình, dự đoán lỗi thiết bị, dự đoán điện năng, tối ưu hóa tiêu thụ năng lượng và khoa học vật liệu đều là những hướng ứng dụng điển hình hiện nay.
Tương tự như sự phát triển của đường đua LLM, các mô hình nền tảng dữ liệu có cấu trúc sắp đón nhận thời khắc GPT-3, cường độ cạnh tranh quốc tế không ngừng gia tăng. Nhiều đội ngũ nổi tiếng trong và ngoài nước như Google, Amazon, SAP liên tục đẩy nhanh tiến độ nghiên cứu mô hình, các đội ngũ kỹ thuật Trung Quốc như LimiX cũng đang không ngừng mài giũa lộ trình kỹ thuật tự sáng tạo và khám phá hình thành mô hình Trung Quốc dựa trên việc thúc đẩy lặp lại mô hình từ các kịch bản công nghiệp.
Nhà khoa học trưởng của Wenzhun Intelligence, Thôi Bằng (Cui Peng) cho biết: "Việc công bố LimiX-2 và thành tích Benchmark lần này là kết quả giai đoạn quan trọng trong quá trình khám phá liên tục của đội ngũ theo hướng mô hình lớn dữ liệu có cấu trúc. Chúng tôi vẫn sẽ kiên trì lộ trình kỹ thuật này trong dài hạn và không ngừng nâng cao năng lực hiểu biết của mô hình về quy luật dữ liệu và mối quan hệ nhân quả giữa các biến. Trong tương lai, chúng tôi sẽ tiếp tục thúc đẩy sự phát triển của mô hình theo hướng trí tuệ nhân quả, hỗ trợ trí tuệ nhân tạo chuyển đổi từ dự đoán sang ra quyết định nhanh chóng hơn."

Tiêu đề báo cáo kỹ thuật: LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
Địa chỉ báo cáo kỹ thuật: https://arxiv.org/abs/2609.17488
Github: https://github.com/limix-ldm-ai/LimiX
Huggingface: https://huggingface.co/stable-ai/LimiX-2
model scope: https://modelscope.cn/models/stable-ai/LimiX-2
Bài viết này do Wenzhun Intelligence cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền thuộc về tác giả, không được phép đăng tải lại và sử dụng dưới bất kỳ hình thức nào khi chưa được ủy quyền, kẻ vi phạm sẽ bị truy cứu trách nhiệm.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.