Mô hình
Mind Lab: Startup Trung Quốc tiên phong trong xu hướng 'học tập liên tục' cho AI thế hệ mới
(giờ Việt Nam)
Tóm tắt AI
Mind Lab, startup quy tụ nhân tài từ xAI và DeepSeek, đang gây chú ý với mô hình Macaron-V1 sử dụng kỹ thuật Mixture-of-LoRA để hiện thực hóa khả năng 'học tập liên tục' – chìa khóa cho thế hệ AI tiếp theo.
Bản dịch AI
Bài: Vương Hân Dật
Biên tập: Trương Vũ Hân
Chúng tôi gặp nhà sáng lập Mind Lab, Trần Khải Kiệt, vào lúc 9 giờ 30 tối tại Bắc Kinh, khi anh vừa kết thúc một ngày làm việc với các nhà đầu tư.
Trần Khải Kiệt là một doanh nhân khởi nghiệp liên tục. Anh từng bảo lưu kết quả học tập tại Đại học Duke, xây dựng nền tảng kể chuyện tương tác AI MidReal, đồng thời ra mắt ứng dụng Personal Agent có tên Macaron (Ma-ca-rông). Ngay trong ngày đầu ra mắt, ứng dụng này đã đứng đầu bảng xếp hạng ngày trên Product Hunt. Tháng 10 năm 2025, Mind Lab được thành lập với đội ngũ khoảng hơn 30 người. Nhà sáng lập Andrew Chen từng cùng Diêu Thuận Vũ công bố bài báo khoa học FireAct. Đội ngũ chủ chốt đến từ các doanh nghiệp và trường đại học danh tiếng như xAI, DeepMind, DeepSeek, ByteDance Seed, MIT và Đại học Thanh Hoa. Họ tái xuất hiện trước công chúng với hình ảnh Neo Lab.
Hướng đi mà họ đặt cược hoàn toàn trùng khớp với định hướng "học tập liên tục" (continual learning) mà người đoạt giải Turing, cha đẻ của học tăng cường Richard Sutton và cựu CTO của OpenAI Mira Murati từng nhấn mạnh.
Vài ngày trước, tại diễn đàn chính ngày đầu tiên của WAIC 2026, Sutton đã có bài phát biểu nhấn mạnh rằng lộ trình cốt lõi của AI thế hệ tiếp theo là "dựa trên kinh nghiệm" (experience-driven), trong khi mô hình dữ liệu gán nhãn tĩnh đã chạm ngưỡng giới hạn. DeepSeek gần đây cũng đưa khái niệm học tập liên tục đến gần hơn với công chúng, khẳng định rằng vấn đề cần giải quyết sau Agent chính là học tập liên tục, đây cũng là năng lực bắt buộc phải có của các mô hình thế hệ tiếp theo.
Có thể thấy, hậu huấn luyện (post-training) và học tập liên tục đang ngày càng trở thành những điểm mấu chốt để đánh giá năng lực mô hình trong giai đoạn tới.
Mind Lab đã phát hành mô hình Macaron-V1-Preview vào tháng trước, kể từ đó hoạt động kinh doanh nhanh chóng được thúc đẩy: chỉ sau 2 tuần thương mại hóa, ARR (doanh thu định kỳ hàng năm) đã đạt 10 triệu USD.
Cấu trúc của Macaron-V1-Preview là: trên nền tảng GLM-5.1, gắn thêm 5 mô-đun chuyên gia LoRA với khoảng 1B tham số mỗi mô-đun. Mặc dù chỉ là phiên bản xem trước, Macaron-V1-Preview vẫn thể hiện hiệu suất ấn tượng trên nhiều Benchmark, không chỉ vượt qua mô hình nền tảng GLM-5.1 mà còn dẫn trước hàng loạt mô hình khác như GPT 5.4, Claude Opus 4.6. Khả năng vượt trội so với mô hình nền tảng chính là nhờ vào các LoRA được gắn kèm.
Điều thực sự khiến họ nhận được nhiều sự chú ý là lộ trình hậu huấn luyện bằng phương pháp MoL (Mixture-of-LoRA). Khi mô hình thực hiện các tác vụ khác nhau, hệ thống có thể tự động chuyển đổi sang mô-đun chuyên gia phù hợp nhất tùy theo loại tác vụ; trong quá trình người dùng sử dụng lâu dài, dữ liệu tích lũy cũng có thể hình thành một LoRA chuyên biệt, liên tục cập nhật theo tần suất gọi mô hình.
Phiên bản Preview đã đi đầu trong việc thông suốt lộ trình kỹ thuật và kiểm chứng thị trường. Ngay sau đó, vào ngày 21 tháng 7, Mind Lab đã phát hành và mở mã nguồn phiên bản chính thức của Macaron-V1. Theo các benchmark do chính hãng công bố, Macaron-V1 đã đạt 6 kết quả SOTA (State-of-the-art) trong 12 bài kiểm tra tiêu chuẩn, các kết quả còn lại cũng khá sát sao với các mô hình tiên tiến nhất.
Phiên bản này bao gồm hai mô hình: bản flagship Venti, là mô hình hậu huấn luyện dựa trên GLM-5.2 với tổng tham số 748B, trong đó 744B đến từ nền tảng GLM-5.2 đã đóng băng, và 4B đến từ 4 nhóm LoRA (mỗi nhóm khoảng 1B) do Mind Lab tự huấn luyện, lần lượt phụ trách 4 năng lực: Chat, Agent, Coding và tạo giao diện UI; mô hình còn lại là bản nhẹ Tall dành cho triển khai cục bộ, dựa trên hậu huấn luyện Qwen3.6 với tổng tham số 50B. Cả hai phiên bản đều hỗ trợ nguyên bản 2 triệu token ngữ cảnh.
Điều này cũng có nghĩa là, chỉ bằng cách thay đổi 4B tham số, đội ngũ này đã giúp GLM-5.2 đạt được năng lực vượt xa chính nó.
Đối với Mind Lab, khởi nghiệp là quá trình vô số lần giữ vững mục tiêu chính và đập đi xây lại. Gạt bỏ những ồn ào bên ngoài, bên trong đội ngũ, một lộ trình kỹ thuật sâu sắc hơn đang không ngừng tiến hóa – đó là học tập liên tục.
Đồng thời, các nguồn vốn hàng đầu cũng liên tục đặt cược. Kể từ khi thành lập, công ty mẹ của Mind Lab là Mindverse (Tâm Châu Công Nghệ) đã huy động được tổng cộng 60 triệu USD. Đầu năm 2026, công ty hoàn tất vòng gọi vốn Series A gần 50 triệu USD do bộ phận đầu tư chiến lược của Meituan dẫn dắt, cùng sự tham gia của Yuanhe Puhua, Goertek, Variable Capital và các cổ đông cũ. Các cổ đông lịch sử bao gồm Ant Group, Sequoia China, Yuan Yi, ZhenFund, Gaorong, v.v.
Trí tuệ từ kinh nghiệm: Giúp mô hình ngày càng hiểu bạn hơn
Điểm xuất phát ban đầu có thể bắt nguồn từ bài báo FireAct do đồng sáng lập Mind Lab là Andrew và Diêu Thuận Vũ hợp tác thực hiện vào năm 2023. Khi đó, họ cho rằng để cải thiện hiệu suất tác vụ của Agent, thay vì làm kỹ thuật gợi ý (prompt engineering), chi bằng hãy huấn luyện trực tiếp dữ liệu liên quan vào mô hình.
Đây là khởi đầu cho việc họ đặt cược vào học tập liên tục và hậu huấn luyện, thời điểm đó, đây chưa phải là một lộ trình kỹ thuật được quan tâm rộng rãi. "Khi chúng tôi bắt đầu làm học tập liên tục, chúng tôi thậm chí còn không biết nó được gọi là học tập liên tục," Trần Khải Kiệt chia sẻ.
Vấn đề của các kỹ thuật hiện có là một mô hình lớn đa năng khó có thể thích ứng tốt với mọi kịch bản. Sau khi quá trình huấn luyện mô hình kết thúc, các tham số thường cố định và không thay đổi theo kịch bản cụ thể, trong khi chi phí huấn luyện lại mô hình từ đầu lại rất cao.
Để các mô hình tham số lớn thực hiện tác vụ trong các kịch bản chuyên biệt khác nhau, việc sử dụng một Harness (khung điều khiển) phức tạp tất nhiên có thể thích ứng tốt với kịch bản, nhưng kết quả tất yếu là nó sẽ tiêu tốn rất nhiều Token và tốc độ cũng sẽ rất chậm, điều này rõ ràng không thể giải quyết vấn đề từ gốc rễ.
Trong khuôn khổ lý thuyết thông tin Shannon, trong mô hình học tăng cường, nhu cầu về lượng tham số mà mô hình học được trở nên nhỏ hơn, điều này cũng có nghĩa là trong điều kiện mô hình có đủ tham số lớn và đủ thưa, việc thực hiện học tăng cường trong cùng một lĩnh vực chuyên biệt bằng LoRA có thể đạt được hiệu quả tương đương với huấn luyện toàn bộ tham số (full-parameter training).
Vì vậy, không cần huấn luyện lại toàn bộ tham số, vẫn có thể thích ứng tốt với các kịch bản cụ thể.
Thành quả đầu tiên họ mang lại là đạt được học tăng cường với mô hình nghìn tỷ tham số. Tháng 12 năm 2025, Mind Lab đã thực hiện huấn luyện học tăng cường LoRA end-to-end trên Kimi K2 (một mô hình MoE nghìn tỷ tham số), chỉ sử dụng 64 card H800, đạt được hiệu quả gần như huấn luyện toàn bộ tham số, trong khi mức tiêu thụ GPU chỉ bằng khoảng 10% so với RL toàn bộ tham số truyền thống.
Vào thời điểm đó, một số tập đoàn lớn và công ty khởi nghiệp như ByteDance, Alibaba, DeepSeek, Kimi... cũng có khả năng học tăng cường nghìn tỷ tham số, tuy nhiên, tại Trung Quốc, Mind Lab là đội ngũ duy nhất có thể chạy thông suốt LoRA-RL trên quy mô nghìn tỷ tham số, và đội ngũ duy nhất trên thế giới làm được điều này là Thinking Machines Lab do cựu CTO OpenAI Mira Murati sáng lập.
Khó khăn để hiện thực hóa học tăng cường nghìn tỷ tham số nằm ở chỗ, học tăng cường đòi hỏi độ chính xác rất cao đối với cơ sở hạ tầng. Nếu độ chính xác giữa huấn luyện và suy luận không đồng nhất, có thể dẫn đến sai lệch (drift), khiến kết quả cuối cùng không thể hội tụ. Giải pháp của Mind Lab là thiết kế một bộ máy song song phối hợp hỗn hợp, tích hợp song song tensor, song song đường ống, song song chuyên gia và song song chuỗi, giúp LoRA vận hành ổn định trên kiến trúc MoE. Họ cũng giải quyết vấn đề không khớp giữa huấn luyện và suy luận bằng cách đưa vào lấy mẫu quan trọng cắt cụt (truncated importance sampling) để sửa chữa sự khác biệt phân phối.
Thành quả này đã giúp Mind Lab có một màn ra mắt ấn tượng. Tuy nhiên, dưới góc nhìn của Trần Khải Kiệt, con hào kỹ thuật thực sự của đội ngũ chính là cơ sở hạ tầng.
Một năm trước, lượng dữ liệu hậu huấn luyện chỉ bằng khoảng 1/10 lượng dữ liệu tiền huấn luyện, nhưng hiện nay, lượng dữ liệu hậu huấn luyện trong nhiều mô hình còn lớn hơn cả dữ liệu tiền huấn luyện. Xây dựng cơ sở hạ tầng tốt cho hậu huấn luyện còn khó hơn cả tiền huấn luyện.
Do đó, vào tháng 1 năm nay, họ đã ra mắt một nền tảng cơ sở hạ tầng huấn luyện và suy luận LoRA – MinT, cung cấp giải pháp toàn trình cho hậu huấn luyện mô hình lớn cho khách hàng. Khách hàng có thể nhận hỗ trợ tính toán trên nền tảng này và huấn luyện LoRA của riêng mình. MinT có thể quản lý hàng triệu mô hình LoRA, trong quá trình huấn luyện, đánh giá, triển khai và khôi phục chỉ cần truyền tải LoRA Adapter cực nhẹ, tốc độ tải thời gian thực tăng gần mười lần.
Sau đó, họ tập trung nhiều hơn vào lộ trình tự tiến hóa và học tập liên tục của mô hình, đồng thời tiếp tục khám phá khả năng của MoL (Mixture of LoRA) trên nền tảng LoRA.
Học tập liên tục đang dần chuyển từ sự khám phá của một nhóm nhỏ thành sự đồng thuận của ngành. Hai tuần trước, cha đẻ của học tăng cường Sutton đã đích thân khởi nghiệp, thành lập công ty mới Oak Lab, cam kết xây dựng một tác nhân thông minh có khả năng học tập liên tục từ kinh nghiệm của chính mình và tiến hóa trong thời gian thực. Nhà sáng lập Zhipu, Đường Kiệt, trong thư nội bộ gần đây cũng đề cập rằng các công nghệ then chốt cần chinh phục tiếp theo bao gồm trí nhớ, học tập liên tục và tự đánh giá. Các đội ngũ hàng đầu trong và ngoài nước lần lượt tham gia, sự tăng tốc của đường đua này đang tăng lên rõ rệt.
Theo Trần Khải Kiệt, ở giai đoạn hiện tại, học tập liên tục có bốn giải pháp:
Thứ nhất là ngữ cảnh trò chuyện, mô hình liên tục hiểu ý định của người dùng trong cửa sổ đối thoại;
Thứ hai là External Memory (Bộ nhớ ngoài), sử dụng RAG làm bộ nhớ gắn ngoài. Khi những thứ cần ghi nhớ ngày càng nhiều, cơ sở dữ liệu cũng phình to với tốc độ rất nhanh, khả năng giải quyết vấn đề của mô hình gắn liền trực tiếp với khả năng truy xuất cơ sở dữ liệu;
Thứ ba là Harness và Loop Engineering, vấn đề nằm ở chỗ khi độ phức tạp của Harness tăng lên, nó có thể tiêu tốn rất nhiều Token và tốc độ cũng sẽ trở nên rất chậm;
Thứ tư là thay đổi trực tiếp tham số của mô hình để thích ứng với kịch bản ứng dụng, biến nó thành một mô hình chuyên biệt từ tầng dưới cùng, thay đổi hiệu suất của mô hình từ gốc rễ.
LoRA thuộc về giải pháp thứ tư. "Chỉ khi xác định một kịch bản cụ thể cần học tập bổ sung, chúng tôi mới kích hoạt chế độ LoRA," Trần Khải Kiệt chia sẻ với chúng tôi.
Mô hình lớn đa năng không thể giải quyết 100% vấn đề trong các kịch bản cụ thể, muốn đạt được sự thích ứng hoàn toàn, cần phải huấn luyện chuyên biệt cho mô hình trong bất kỳ kịch bản nào. Đôi khi, 99% tham số giữa các mô hình khác nhau có thể chia sẻ được, nhưng 1% đó lại quyết định sự khác biệt của chúng.
Dựa trên sự hiểu biết này, Trần Khải Kiệt cho rằng cần đặt mô hình vào các kinh nghiệm khác nhau, để nó không ngừng phát triển.
Mind Lab đúc kết tư duy này thành "Trí tuệ kinh nghiệm" (Experiential Intelligence): Mô hình có thể học từ những trải nghiệm của chính mình, kinh nghiệm chuyển hóa thành năng lực mới, năng lực mới giúp nó giải quyết các vấn đề khó hơn, và các vấn đề khó hơn lại mang đến những kinh nghiệm phong phú hơn, từ đó trí tuệ trở thành một quá trình tăng trưởng liên tục. Không chỉ vậy, quá trình này là tự động hóa, mô hình cần không ngừng tự tiến hóa, tự lặp lại, như vậy mới có thể đạt được "học tập liên tục" thực sự. Hướng đi này cũng hoàn toàn trùng khớp với lộ trình "dựa trên kinh nghiệm" của Sutton.
Bài viết được AI dịch và tổng hợp tự động từ 36 36Kr. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.