Sản phẩm
Startup '' gọi vốn hàng chục triệu NDT, tiên phong phát triển bộ nhớ dài hạn đa phương thức cho AI
(giờ Việt Nam)
Tóm tắt AI
(Thalamus AI) vừa huy động thành công hàng chục triệu NDT để xây dựng lớp hạ tầng bộ nhớ độc lập cho AI, giúp các mô hình ngôn ngữ lớn cá nhân hóa trải nghiệm và tiến tới khả năng 'chủ động thông minh'.
Bản dịch AI
Tác giảVương Hân Dật
Biên tậpTrương Vũ Hân
Giới thiệu tóm tắt
Công ty duy nhất tại Trung Quốc tập trung vào bộ nhớ dài hạn đa phương thức (multimodal long memory) – Thalamus Intelligence, đã ra mắt nền tảng bộ nhớ đa phương thức nguyên bản, đặt cược vào xu hướng AI chuyển dịch từ mô hình tổng quát sang cá nhân hóa, và cuối cùng là hướng tới trí tuệ chủ động (active intelligence).
Trí tuệ chủ động đề cập đến khả năng AI hiểu rõ người dùng, từ đó chủ động tương tác với họ vào đúng thời điểm và bằng phương thức phù hợp. Để hiện thực hóa trí tuệ chủ động, Memory (bộ nhớ) là ngưỡng cửa bắt buộc phải vượt qua.
Tình hình gọi vốn
Gần đây, Thalamus Intelligence đã hoàn tất vòng gọi vốn hạt giống với số tiền hàng chục triệu nhân dân tệ. Các nhà đầu tư bao gồm các quỹ đầu tư hàng đầu tại Thâm Quyến và các quỹ đầu tư công nghiệp. Vòng gọi vốn này chủ yếu được sử dụng cho nghiên cứu phát triển công nghệ và bổ sung đội ngũ nhân sự.
Giới thiệu đội ngũ
Thalamus Intelligence được thành lập vào tháng 11 năm 2025. Nhà sáng lập kiêm CEO Trương Nguyên tốt nghiệp Đại học Bắc Kinh, sở hữu nền tảng kiến thức kép về Điện tử và Kinh tế. Cô từng đảm nhiệm vị trí COO tại một công ty xe tự lái, đồng thời có kinh nghiệm trong lĩnh vực đầu tư mạo hiểm và trí tuệ hiện thân (embodied AI).
Độ tuổi trung bình của đội ngũ khoảng 26 tuổi. Các nhân sự chủ chốt chủ yếu đến từ các doanh nghiệp và trường đại học danh tiếng như Alibaba DAMO Academy, Tencent, SenseTime, CUHK (Đại học Hồng Kông Trung Quốc), CUHK-Shenzhen, Đại học Bắc Kinh, Đại học Giao thông Tây An, KIT, Đại học Phúc Đán, v.v.
Sản phẩm và kinh doanh
Sự đồng thuận của ngành về lĩnh vực Memory bắt đầu hình thành từ cuối năm 2025 trong giới học thuật. Đây là một lĩnh vực rất mới. Khi tiếp xúc với các nhà đầu tư, Trương Nguyên thường xuyên nhận được những câu hỏi như: Liệu các mô hình nền tảng (base models) có tự phát triển bộ nhớ không? Liệu tầng Memory có thực sự tồn tại độc lập? Sự phân công giữa mô hình nền tảng và các công ty chuyên về bộ nhớ nên như thế nào?
Đối với những câu hỏi này, Trương Nguyên có một câu trả lời kiên định: Tầng bộ nhớ chắc chắn sẽ tồn tại lâu dài như một cơ sở hạ tầng độc lập.
Cô giải thích rằng, các mô hình nền tảng của những nhà cung cấp khác nhau có đặc tính và dữ liệu huấn luyện khác biệt, thế mạnh về tác vụ cũng khác nhau. Việc người dùng liên tục chuyển đổi giữa các mô hình dẫn đến vấn đề "ốc đảo bộ nhớ" (memory silos) tồn tại dai dẳng. Trong quá trình AI chuyển từ tổng quát sang cá nhân hóa, thị trường đang thiếu một tầng trung gian có khả năng học tập liên tục và ghi nhớ người dùng. Do đó, một tầng bộ nhớ bên thứ ba lấy người dùng làm trung tâm chắc chắn sẽ tồn tại độc lập bên ngoài các mô hình nền tảng. Đây chính là cơ hội mà Trương Nguyên nhìn thấy.
Tuy nhiên, đối với cô, ưu tiên hàng đầu là giải quyết những vấn đề mà ngành vẫn chưa xử lý được. Ở giai đoạn hiện tại, lĩnh vực Memory đang tồn tại một số điểm đau (pain points):
Thứ nhất là vấn đề chi phí, hầu hết các giải pháp đều nhồi nhét toàn bộ ngữ cảnh khổng lồ vào cửa sổ (context window), dẫn đến chi phí suy luận rất cao; thứ hai là vấn đề đứt gãy ngữ cảnh, các cuộc hội thoại giữa các phiên (session) và các tác vụ khác nhau khó có thể kết nối hiệu quả; thứ ba là vấn đề thiếu hụt phương thức, các giải pháp bộ nhớ hiện tại hầu hết chỉ giới hạn ở văn bản thuần túy, không thể xử lý thông tin đa phương thức như hình ảnh, âm thanh.
Không chỉ vậy, do kiến trúc Transformer dẫn đến sự xáo trộn trình tự thời gian liên tục, các mô hình lớn hiện nay không thể hiểu được thời gian. Trong sự phối hợp của các Agent, các ốc đảo bộ nhớ thường ảnh hưởng đến hiệu quả thực thi tác vụ, thông tin người dùng bị cô lập trong từng Agent, khó có thể thông suốt với nhau.
Trương Nguyên cho rằng, để AI thực sự hòa nhập vào thế giới vật lý, nó phải lấy nhận thức đa phương thức của con người làm tham chiếu ngay từ khâu thiết kế. Kiến trúc bộ nhớ ngay từ đầu phải là đa phương thức nguyên bản, thay vì chuyển đổi thông tin thành văn bản rồi mới lưu trữ.
Vì vậy, vào tháng 6, Thalamus Intelligence đã ra mắt nền tảng bộ nhớ có tên MemAura, cung cấp cho khách hàng các dịch vụ ADK (Agent Development Kit) và API (Application Programming Interface).
MemAura có khả năng hỗ trợ tích lũy bộ nhớ dài hạn và truy xuất bộ nhớ nhanh chóng, sử dụng cơ chế ngữ cảnh hiệu quả, đồng thời giảm chi phí suy luận một cách đáng kể. Về kết quả, hiệu suất của MemAura rất ấn tượng: mức tiêu thụ Token đầu vào giảm 40%-49%, độ trễ truy xuất bộ nhớ được kiểm soát dưới 400 mili giây, phản hồi đầu tiên từ đầu đến cuối (end-to-end) có thể đạt dưới 1 giây, và độ chính xác tổng thể đạt trên 80%.
Về quy trình xử lý bộ nhớ, cách tiếp cận của MemAura khác biệt rất lớn so với các hệ thống bộ nhớ truyền thống.
Các hệ thống bộ nhớ truyền thống thường trích xuất, nén và tóm tắt đầu vào của người dùng, sau đó lưu vào kho thông tin gốc, rồi lưu trữ thông qua kiến trúc hoặc đồ thị cụ thể, cuối cùng dựa vào mô hình Agent để truy xuất.
Tuy nhiên, chiến lược của MemAura là xây dựng một cơ chế xử lý bộ nhớ mô phỏng sinh học, quy trình cụ thể gồm ba bước: Đầu tiên là nhận diện sự kiện, bắt chước cơ chế bộ nhớ của con người để giữ lại thông tin quan trọng và lọc bỏ nhiễu dư thừa; sau đó, MemAura mã hóa thông tin đã lọc; bước thứ ba là phân vùng thông tin, tách biệt bộ nhớ riêng tư và không riêng tư.
Ngoài ra, họ còn áp dụng chiến lược lưu trữ nóng và lạnh: Đối với dữ liệu truy cập tần suất cao, sử dụng lưu trữ nóng để truy xuất nhanh; đối với dữ liệu tần suất thấp, sử dụng lưu trữ lạnh để tiết kiệm tài nguyên. Cách này vừa đảm bảo dữ liệu cốt lõi luôn có thể truy cập, vừa kiểm soát hiệu quả chi phí tổng thể.
Trương Nguyên chia sẻ rằng, trong thị trường nghìn tỷ đô của lĩnh vực bộ nhớ đa phương thức, Thalamus Intelligence hiện chưa phải đối mặt với sự cạnh tranh trực diện. Mặc dù thị trường này có thể chứa đựng nhiều đối thủ, nhưng hiện chỉ có vài công ty khởi nghiệp quan tâm, công ty có định giá cao nhất cũng chưa đến 2 tỷ nhân dân tệ, nên sự cạnh tranh chưa thể gọi là gay gắt.
Khách hàng chính của Thalamus Intelligence hiện nay bao gồm các thiết bị phần cứng đồng hành có sản lượng lớn như robot đồng hành, và một số kịch bản Agent chuyên biệt như chăm sóc khách hàng AI, nhân viên kỹ thuật số, v.v. Khách hàng sử dụng API bộ nhớ để giúp các mô hình nền tảng truy xuất thông tin gốc khi trả lời và thực thi tác vụ, từ đó nâng cao hiệu quả tương tác.
Vì mỗi kịch bản có trọng tâm khác nhau về khả năng bộ nhớ, ví dụ như sản phẩm đồng hành cho trẻ 3-5 tuổi so với sản phẩm cho người 18-25 tuổi có yêu cầu rất khác biệt. Trương Nguyên cho biết: "Chúng tôi không muốn tùy chỉnh quá mức, vì vậy chúng tôi đóng gói khả năng Memory thành các ADK khác nhau dựa trên trọng số của bản đồ kịch bản, khách hàng có thể chọn ADK để kết nối."
Về mô hình kinh doanh, MemAura thu phí dựa trên lưu lượng gọi API và kết hợp cấp phép theo kịch bản, khách hàng có thể chọn các cấp độ khả năng bộ nhớ tùy theo nhu cầu.
"Hiện tại, phần lớn khách hàng của chúng tôi vẫn tập trung vào văn bản thuần túy hoặc văn bản kết hợp giọng nói. Khi các công nghệ liên quan đến đa phương thức chín muồi, phương thức của khách hàng sẽ phong phú hơn, và sẽ có nhiều khách hàng trong các kịch bản hiện thân (embodied scenarios) đến để kiểm chứng," Trương Nguyên nói.
Rào cản cốt lõi
Từ khi thành lập đến nay, lộ trình công nghệ của họ đã hoàn thành hai lần lặp (iteration) và đang dần khám phá lần lặp thứ ba.
Thế hệ đầu tiên là Đồ thị tri thức không-thời gian (STKG - Spatio-Temporal Knowledge Graph). Cách làm cụ thể là: họ đặt thời gian và không gian vào tầng vật lý, đặt thông tin cảm nhận đa phương thức vào tầng cảm nhận, và xây dựng một tầng nhận thức để hình thành mạng lưới nhận thức, thực hiện suy luận tiến (forward reasoning).
Hiệu suất Benchmark của nó rất tốt, đạt SOTA (State-of-the-art) trong cả hai bài kiểm tra LoCoMo (suy luận và trình tự thời gian) và LongMemEval (tương tác và sở thích).
Tuy nhiên, đối với khách hàng, sau khi đạt đến một ngưỡng nhất định, việc tăng điểm Benchmark không còn quá ý nghĩa, khách hàng quan tâm nhiều hơn đến độ trễ và chi phí Token. Vì vậy, họ đã thực hiện một số cân nhắc về kỹ thuật, lặp lại ở tầng kiến trúc, chuyển sang cách xây dựng hệ thống bộ nhớ bằng cách mô phỏng mã hóa hồi hải mã và bản đồ nhận thức, tích hợp tầng vỏ não của con người để xây dựng kiến trúc bộ nhớ mô phỏng sinh học MemAura.
Về dữ liệu, MemAura đạt được sự dẫn đầu về mặt quy mô. Hiện tại, các kịch bản chăm sóc khách hàng trực tuyến truyền thống có độ trễ khoảng 10 giây, kịch bản đồng hành khoảng 2 giây, trong khi MemAura có thể kiểm soát độ trễ dưới 400 mili giây.
Hiện tại, về công nghệ Memory, Thalamus Intelligence vẫn đang không ngừng khám phá. Họ đang thực hiện bước lặp tiếp theo thông qua các phương pháp kỹ thuật liên quan đến E2P (Embedding-to-Prefix) và tinh chỉnh kiến trúc Transformer. Trong môi trường phòng thí nghiệm, họ đã đạt được kết quả tiết kiệm đáng kể chi phí Token và hiệu quả học tập liên tục xấp xỉ trong lĩnh vực trích xuất sở thích.
Tháng 5 năm 2026, Thalamus Intelligence đã phối hợp với NVIDIA, HKUST (Đại học Khoa học và Công nghệ Hồng Kông) và CUHK công bố Benchmark bộ nhớ dài hạn đa phương thức đầu tiên trên thế giới mang tên MEMLENS. Hiện dự án đã mã nguồn mở và lọt vào top 3 Daily Paper trong lĩnh vực AI trên Hugging Face.
Họ đã đưa 27 mô hình ngôn ngữ thị giác lớn và 7 Memory Agent vào cùng một bộ dữ liệu đa phương thức, chia thành 4 mức độ dài ngữ cảnh tiêu chuẩn (32, 100, 128, 256K) để thực hiện một thí nghiệm đối chứng hoàn chỉnh, và rút ra những phát hiện sau:
Thứ nhất, các mô hình ngôn ngữ thị giác lớn thường không thực hiện bất kỳ sự nén nào, nhồi nhét toàn bộ nội dung vào cửa sổ ngữ cảnh, nhưng khi độ dài tăng lên, hiệu suất mô hình giảm mạnh; hiệu suất của Memory Agent tuy tương đối ổn định, nhưng do khiếm khuyết trong thiết kế kiến trúc bộ nhớ, một lượng lớn dữ liệu thị giác và đa phương thức đã bị mất ngay từ giai đoạn ghi dữ liệu.
Bài viết được AI dịch và tổng hợp tự động từ 36 36Kr. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.