QbitAI
88

Mô hình

Cuộc chiến AGI: Google và Amazon đối đầu, LimiX-2 từ Trung Quốc bất ngờ bứt phá

(giờ Việt Nam)

Tóm tắt AI

LimiX-2 tạo đột phá khi giúp mô hình AI thấu hiểu cơ chế nhân quả đằng sau dữ liệu, vượt mặt các ông lớn công nghệ trong cuộc đua AGI.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

18/09/2026 20:22:47 Nguồn: QbitAI

LimiX giúp mô hình thấu hiểu cơ chế nhân quả đằng sau dữ liệu

Meng Yao, đưa tin từ QbitAI | Tài khoản chính thức QbitAI

Hai năm trở lại đây, đường đua AI ngày càng trở nên nóng bỏng.

Trong khi các mô hình ngôn ngữ lớn LLM (Large Language Model) đang cạnh tranh vô cùng khốc liệt—

Một lộ trình AI khác về dữ liệu có cấu trúc là LDM cũng bất ngờ thu hút sự tham gia của nhiều tên tuổi hàng đầu.

LDM (Large Data Model), tức mô hình nền tảng dữ liệu có cấu trúc, nhắm vào "nỗi đau" cốt lõi ở phía sản xuất: làm thế nào để mô hình nền tảng có thể trực tiếp học được mối quan hệ giữa các biến số, mối quan hệ điều kiện và cơ chế tạo sinh trong các dữ liệu có cấu trúc khác nhau.

Nó nóng đến mức nào ư? Hãy nói thế này!

Những cái tên quen thuộc như Google, Amazon của Mỹ, hay gã khổng lồ phần mềm doanh nghiệp SAP của Đức đều đã lần lượt tham gia vào cuộc chơi.

Thế nhưng, ai mà ngờ được, khi các ông lớn vừa mới đổ xô vào chiếm chỗ trong lĩnh vực LDM, thì một đội ngũ đến từ Trung Quốc đã sớm biến vị trí dẫn đầu thành "ghế ngồi cố định" của riêng mình.

Ngày 15 tháng 9, gã khổng lồ phần mềm Đức SAP tung ra TabPFN-3.5, và chỉ vài giờ sau đó (ngày 16 tháng 9), một đội ngũ gồm các tiến sĩ từ Đại học Thanh Hoa đã sử dụng một mô hình nền tảng dữ liệu có cấu trúc với 400 triệu tham số—

Để giành lấy vị trí "số 1" trong các tác vụ phân loại nhị phân, phân loại đa lớp và hồi quy trên ba bảng xếp hạng chuẩn quốc tế phổ biến là TabArena, TALENT và BCCO, tạo ra một khoảng cách dẫn đầu áp đảo:

△ Bảng xếp hạng TabArena chính thức

Không vòng vo nữa, cái tên khiến các ông lớn như Google phải "hít khói" chính là sản phẩm vừa được LimiX ra mắt: LimiX-2.

Đáng chú ý, đây không phải là lần đầu tiên LimiX đưa LDM lên vị trí dẫn đầu quốc tế.

Năm ngoái, mô hình nền tảng dữ liệu có cấu trúc đầu tiên tại Trung Quốc do họ phát hành đã có một thời gian dài thống trị các bảng xếp hạng. Tuy nhiên, sau đó đội ngũ không chạy theo các bảng xếp hạng mà tập trung đào sâu vào công nghệ nền tảng và tích lũy mô hình.

Và lần này, họ lại một lần nữa khiến các đối thủ chủ chốt trong và ngoài nước trở tay không kịp.

Đối với đội ngũ Trung Quốc này, điều thực sự quan trọng chưa bao giờ là giành lấy vị trí số 1 một lần, mà là khả năng quay trở lại vị trí dẫn đầu mỗi khi đến thời điểm then chốt.

Là mô hình lớn đa năng về dữ liệu có cấu trúc đầu tiên tại Trung Quốc, thứ mà LimiX chinh phục chính là "quy luật nhân quả" – yếu tố giá trị nhất nhưng cũng khó tìm nhất đằng sau dữ liệu.

So với lộ trình mô hình hóa theo dòng (row-level) thiên về dự đoán mục tiêu như TabPFN, LimiX-2 đặt mục tiêu cốt lõi là mô hình hóa mối quan hệ giữa các biến số, từ đó học được cấu trúc phụ thuộc chung giữa các biến và các mẫu dữ liệu.

Ngoài ra, họ còn tự xây dựng một công cụ tổng hợp dữ liệu tự động chất lượng cao, giúp mô hình "nhìn thấy" thế giới dữ liệu đủ phức tạp trước khi bắt tay vào xử lý các tác vụ thực tế.

Trong vài năm qua, LLM đã nắm bắt rất tốt văn bản, giọng nói và video. Tuy nhiên, khi chạm đến các kịch bản ứng dụng thực tế như sản xuất công nghiệp hay nghiên cứu khoa học – nơi cần đưa ra quyết định – yêu cầu về tính nhân quả, độ chính xác và tính ổn định sẽ tăng vọt. Điều này khiến giá trị của LDM ngày càng trở nên rõ nét.

Ngay tại đường đua đang ngày càng nóng bỏng này, LimiX cùng với Đại học Thanh Hoa đã tiên phong đưa thành quả của mình lên vị trí dẫn đầu ngành.

Những "xương cứng" về phân tích dữ liệu mà LLM không thể nhai nổi, nay đã có LDM tiếp quản.

Trong hai năm qua, năng lực của các mô hình ngôn ngữ lớn đã bùng nổ mạnh mẽ.

Nhưng sự sôi động đó cũng đi kèm với một vấn đề vốn dễ bị che lấp bởi sự tăng trưởng năng lực mô hình, nay đã trở nên rõ ràng hơn khi AI thực sự đi sâu vào các ngành công nghiệp—

Đó chính là thế giới thực "lớn" hơn thế giới ngôn ngữ rất nhiều.

Cần biết rằng năng lực của các mô hình ngôn ngữ lớn ngày nay phần lớn được xây dựng trên một thế giới ngữ nghĩa vô cùng đồ sộ.

Văn bản, mã nguồn, luận văn, công thức toán học, thậm chí cả hình ảnh và video đã qua chú thích, tất cả kiến thức chứa đựng trong đó đều có một đặc điểm chung: chúng đã được con người hiểu, sàng lọc và trừu tượng hóa một lần.

Việc LLM làm là mã hóa những thông tin đã gia nhập hệ thống tri thức nhân loại này thành Token, học mối quan hệ ngữ cảnh thông qua kho ngữ liệu khổng lồ, từ đó hình thành khả năng tri thức, suy luận và tạo sinh.

Vì vậy, xét từ góc độ lý thuyết thông tin và đối tượng mô hình hóa, những gì LLM xử lý chủ yếu là thực tại đã hoàn tất quá trình "ngữ nghĩa hóa".

△ AI tạo sinh

Nhưng vấn đề là, trong các hệ thống công nghiệp, một loại dữ liệu khác vẫn tồn tại lâu dài "bên ngoài" lớp ngữ nghĩa này.

Lấy ngành sản xuất làm ví dụ: nhiệt độ, áp suất, tốc độ quay, tỷ lệ nguyên liệu, trạng thái thiết bị, mức tiêu thụ năng lượng... hàng chục, hàng trăm, thậm chí hàng nghìn biến số thay đổi đồng thời, cùng nhau tạo nên một không gian dữ liệu đa chiều không ngừng biến đổi.

Trong đó, rất nhiều quy luật then chốt có thể chưa được con người đúc kết thành quy tắc, công thức hay kiến thức văn bản.

Quan trọng hơn, điều mà ngành công nghiệp thực sự quan tâm thường không phải là một biến số đơn lẻ là gì, mà là mối quan hệ ổn định nào tồn tại giữa các biến số, mối quan hệ nào có thể áp dụng xuyên suốt các môi trường, và khi một biến số thay đổi, toàn bộ hệ thống sẽ phản ứng ra sao.

Nếu chuyển đổi loại dữ liệu này thành văn bản trước rồi mới đưa cho LLM xử lý, quá trình này sẽ tự nhiên trải qua một lần "nén thông tin".

AGILimiXAI Trung QuốcMô hình ngôn ngữNhân quả
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.