KrASIA
75

Nghiên cứu

Mind Lab thử nghiệm khả năng học liên tục với mô hình Macaron-V1

(giờ Việt Nam)

Tóm tắt AI

Mind Lab tuyên bố mô hình Macaron-V1 đã vượt qua GLM-5.2 nhờ huấn luyện thêm 4 tỷ tham số thông qua các bộ điều hợp LoRA chuyên biệt.

Bản dịch AI

Mind Lab puts continual learning to the test with Macaron-V1

Chen Kaijie là một doanh nhân khởi nghiệp liên tiếp, người đã rời Đại học Duke trước khi tốt nghiệp. Anh từng xây dựng MidReal, một nền tảng kể chuyện tương tác dựa trên trí tuệ nhân tạo, và ra mắt Macaron, một ứng dụng tác nhân cá nhân đã đứng đầu bảng xếp hạng hàng ngày của Product Hunt ngay trong ngày đầu tiên. 36Kr đã trò chuyện với anh để tìm hiểu thêm về Macaron và Mind Lab, công ty đứng sau sản phẩm này.

Mind Lab được thành lập vào tháng 10 năm 2025 và có hơn 30 nhân viên. Người sáng lập công ty, Andrew Chen, là đồng tác giả của bài báo khoa học FireAct cùng với Shunyu Yao. Đội ngũ của công ty chủ yếu đến từ xAI, DeepMind, DeepSeek, ByteDance Seed, MIT, Đại học Thanh Hoa và các công ty cũng như tổ chức học thuật khác.

Định hướng của Mind Lab gắn liền với phương pháp học tập liên tục (continual learning) được ủng hộ bởi Richard Sutton, người đoạt giải Turing và được coi là cha đẻ của học tăng cường (reinforcement learning), cùng với Mira Murati, cựu CTO của OpenAI.

Tại diễn đàn chính trong ngày khai mạc Hội nghị Trí tuệ Nhân tạo Thế giới năm nay, Sutton cho biết con đường trọng tâm cho thế hệ AI tiếp theo sẽ được thúc đẩy bởi trải nghiệm, trong khi mô hình dữ liệu tĩnh được gán nhãn đã đạt đến giới hạn.

DeepSeek cũng đã mang khái niệm học tập liên tục đến với đông đảo người dùng hơn. Họ cho rằng học tập liên tục là vấn đề mà ngành công nghiệp cần giải quyết sau các tác nhân (agents), và đây là năng lực mà thế hệ mô hình tiếp theo bắt buộc phải sở hữu.

Hậu đào tạo (post-training) và học tập liên tục đang trở thành những thước đo quan trọng hơn về năng lực mô hình khi ngành công nghiệp bước vào giai đoạn tiếp theo.

Mind Lab đã phát hành mô hình Macaron-V1-Preview vào tháng 6. Hoạt động kinh doanh nhanh chóng đạt được đà tăng trưởng. Chỉ hai tuần sau khi bắt đầu thương mại hóa, doanh thu định kỳ hàng năm của công ty đã đạt 10 triệu USD.

Macaron-V1-Preview được xây dựng bằng cách gắn năm mô-đun chuyên gia LoRA (low-rank adaptation) vào GLM-5.1. Mỗi mô-đun có khoảng một tỷ tham số.

Macaron-V1-Preview thể hiện hiệu suất mạnh mẽ trên nhiều tiêu chuẩn đánh giá. Theo các tiêu chuẩn được công ty trích dẫn, nó không chỉ vượt trội hơn mô hình cơ sở GLM-5.1 mà còn vượt qua cả các mô hình như GPT-5.4 và Claude Opus 4.6. Mind Lab cho rằng sự cải thiện của mô hình so với mô hình cơ sở là nhờ vào các mô-đun chuyên gia LoRA được gắn kèm.

Điều thu hút sự chú ý chính là phương pháp tiếp cận hậu đào tạo của Mind Lab thông qua MoL, hay còn gọi là hỗn hợp các bộ điều hợp LoRA (mixture of LoRA adapters).

Khi mô hình thực hiện các tác vụ khác nhau, hệ thống có thể tự động chuyển đổi sang mô-đun chuyên gia phù hợp nhất với tác vụ đó. Khi người dùng tiếp tục sử dụng mô hình, dữ liệu tích lũy cũng có thể được chắt lọc thành một bộ điều hợp LoRA chuyên dụng, được cập nhật liên tục mỗi khi mô hình được gọi.

Phiên bản xem trước đã cho thấy phương pháp kỹ thuật này có thể hoạt động hiệu quả và cung cấp sự xác nhận ban đầu từ thị trường.

Mind Lab đã phát hành và mở mã nguồn phiên bản đầy đủ của Macaron-V1 vào ngày 21 tháng 7. Theo các tiêu chuẩn đánh giá do công ty công bố, Macaron-V1 đã đạt được kết quả tiên tiến nhất (state-of-the-art) trong 6 trên 12 bài kiểm tra. Các điểm số còn lại cũng tương đối sát với các mô hình tiên phong khác.

Bản phát hành bao gồm hai mô hình:

Cả hai phiên bản đều hỗ trợ nguyên bản cửa sổ ngữ cảnh (context window) lên tới hai triệu token.

Trên thực tế, đội ngũ đã giúp GLM-5.2 vượt qua các khả năng trước đó của nó chỉ bằng cách thay đổi bốn tỷ tham số.

Đối với Mind Lab, khởi nghiệp là một quá trình liên tục giữ vững định hướng cốt lõi trong khi phá bỏ và xây dựng lại mọi thứ xung quanh nó.

Bên dưới những ồn ào bên ngoài, một con đường kỹ thuật sâu rộng hơn vẫn tiếp tục phát triển trong nội bộ công ty: học tập liên tục.

Mindverse, công ty mẹ của Mind Lab, đã huy động được 60 triệu USD kể từ khi thành lập. Đầu năm 2026, công ty đã hoàn tất vòng gọi vốn Series A trị giá gần 50 triệu USD do bộ phận đầu tư của Meituan dẫn đầu, với sự tham gia của Oriza Hua, Shokz, Var Capital và các nhà đầu tư hiện hữu. Các nhà đầu tư từ những vòng trước bao gồm Ant Group, HSG, Being Capital, ZhenFund và Gaorong Ventures.

Giúp các mô hình AI cải thiện theo thời gian

Điểm khởi đầu của công ty có thể bắt nguồn từ bài báo FireAct mà Andrew Chen đã viết cùng Shunyu Yao vào năm 2023.

Vào thời điểm đó, họ tin rằng hiệu suất tác vụ của một tác nhân có thể được cải thiện hiệu quả hơn bằng cách huấn luyện dữ liệu liên quan trực tiếp vào mô hình thay vì dựa vào kỹ thuật gợi ý (prompt engineering). Đó đã trở thành điểm khởi đầu cho sự đặt cược của họ vào học tập liên tục và hậu đào tạo, mặc dù định hướng kỹ thuật này khi đó chưa thu hút được sự chú ý rộng rãi.

"Khi chúng tôi bắt đầu làm việc với học tập liên tục, chúng tôi thậm chí còn không biết nó được gọi là học tập liên tục," Chen nói.

Một vấn đề với công nghệ hiện tại là một mô hình ngôn ngữ lớn đa năng gặp khó khăn trong việc thích ứng hiệu quả với mọi trường hợp sử dụng có thể xảy ra.

Sau khi quá trình huấn luyện hoàn tất, các tham số của mô hình thường được cố định. Chúng không thay đổi để phản ánh một trường hợp sử dụng cụ thể, trong khi việc huấn luyện lại mô hình từ đầu là cực kỳ tốn kém.

Một hệ thống khung phức tạp có thể giúp một mô hình lớn thực hiện các tác vụ trên các trường hợp sử dụng chuyên biệt khác nhau. Sự đánh đổi là nó có thể tiêu tốn một lượng lớn token và hoạt động chậm. Điều đó không giải quyết được vấn đề cốt lõi.

Nhìn qua khung lý thuyết thông tin Shannon, mô hình học tăng cường giúp giảm số lượng tham số mà một mô hình biểu diễn cần phải học.

Điều này cũng có nghĩa là khi một mô hình đủ lớn và thưa (sparse), học tăng cường trong cùng một lĩnh vực có thể cho phép sự thích ứng dựa trên LoRA đạt được kết quả tương đương với việc huấn luyện toàn bộ tham số. Do đó, một mô hình có thể được điều chỉnh cho một trường hợp sử dụng cụ thể mà không cần phải huấn luyện lại hoàn toàn.

Kết quả quan trọng đầu tiên của đội ngũ là làm cho học tăng cường hoạt động ở quy mô hàng nghìn tỷ tham số.

Vào tháng 12 năm 2025, Mind Lab đã thực hiện huấn luyện LoRA-RL đầu cuối trên Kimi K2, một mô hình hỗn hợp chuyên gia (MoE) có hàng nghìn tỷ tham số. LoRA-RL đề cập đến học tăng cường được thực hiện bằng cách sử dụng các bộ điều hợp LoRA.

Sử dụng 64 GPU Nvidia H800, báo cáo cho biết họ đã đạt được kết quả gần bằng với việc huấn luyện toàn bộ tham số trong khi chỉ tiêu tốn khoảng 10% tài nguyên GPU so với học tăng cường toàn bộ tham số thông thường.

Vào thời điểm đó, các công ty công nghệ lớn và các công ty khởi nghiệp bao gồm ByteDance, Alibaba Group, DeepSeek và Moonshot AI cũng có khả năng thực hiện học tăng cường ở cùng quy mô này.

Mind Lab được cho là đội ngũ duy nhất tại Trung Quốc thực hiện thành công LoRA-RL trên một mô hình hàng nghìn tỷ tham số. Ở nước ngoài, một đội ngũ khác có năng lực tương tự là Thinking Machines Lab, do cựu CTO của OpenAI là Mira Murati thành lập.

Một trong những khó khăn chính khi triển khai học tăng cường ở quy mô này là nó đặt ra yêu cầu độ chính xác cực cao đối với cơ sở hạ tầng nền tảng. Khi độ chính xác được sử dụng trong quá trình huấn luyện khác với độ chính xác được sử dụng trong quá trình suy luận, hiện tượng trôi lệch (bias drift) có thể xảy ra, ngăn cản kết quả cuối cùng hội tụ.

Giải pháp của Mind Lab là thiết kế một công cụ huấn luyện song song lai (hybrid parallel training engine) tích hợp song song tensor, song song đường ống (pipeline), song song chuyên gia và song song trình tự. Điều này cho phép quá trình huấn luyện dựa trên LoRA hoạt động ổn định trên kiến trúc MoE.

Công ty cũng giải quyết sự không khớp giữa huấn luyện và suy luận bằng cách giới thiệu lấy mẫu quan trọng bị cắt bớt (truncated importance sampling) để sửa chữa sự khác biệt giữa hai phân phối.

Việc đạt được kết quả này đã mang lại cho Mind Lab một bằng chứng quan trọng. Tuy nhiên, theo quan điểm của Chen, lợi thế kỹ thuật thực sự của công ty nằm ở cơ sở hạ tầng của nó.

Một năm trước, khối lượng dữ liệu hậu đào tạo chỉ bằng khoảng một phần mười khối lượng dữ liệu tiền đào tạo.

Ngày nay, lượng dữ liệu hậu đào tạo được sử dụng trong nhiều mô hình còn lớn hơn cả lượng dữ liệu được sử dụng cho tiền đào tạo.

AIHọc liên tụcMacaron-V1LoRAMô hình ngôn ngữ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.