Mô hình
PrismML ra mắt Bonsai 2 27B: Nén mô hình Qwen 27B xuống còn 5.9GB, chạy mượt trên PC
(giờ Việt Nam)
Tóm tắt AI
PrismML vừa trình làng Bonsai 2 27B, phiên bản tối ưu hóa từ Qwen 27B với dung lượng chỉ 5.9GB. Bước tiến này giúp giảm 10 lần bộ nhớ, cho phép chạy các mô hình AI mạnh mẽ ngay trên PC và smartphone cao cấp.
Bản dịch AI

Nếu bạn chưa biết đến phòng thí nghiệm AI PrismML, thì đã đến lúc nên tìm hiểu — không phải vì họ đã huy động được số tiền khổng lồ (thực tế là chưa, họ mới chỉ gọi được 22,25 triệu USD vốn hạt giống), mà vì những bộ óc kỹ thuật đứng sau và công nghệ có tiềm năng thay đổi ngành mà họ đang phát triển.
PrismML đang đặt cược vào việc các mô hình ngôn ngữ lớn (LLM) có khả năng suy luận mạnh mẽ, hiệu suất cao thực chất không nhất thiết phải có kích thước lớn.
Họ đang tạo ra các mô hình suy luận nhỏ đến mức có thể chạy trên PC và điện thoại thông minh. (Thậm chí có tin đồn rằng họ đang đàm phán với Apple, mặc dù CEO Babak Hassibi từ chối bình luận về điều này với TechCrunch.)
Vào thứ Năm, PrismML đã phát hành Bonsai 2 27B, phiên bản mới nhất trong dòng mô hình của họ, giúp nén Qwen3.8 27B — một mô hình mã nguồn mở phổ biến từ Alibaba — xuống chỉ còn 5,9 GB. Kích thước này đủ nhỏ để chạy trên PC và có thể là cả những chiếc điện thoại thông minh cao cấp. Đây là mức giảm bộ nhớ từ 9 đến 10 lần so với bản gốc.
PrismML được thành lập bởi một nhóm các nhà nghiên cứu từ Caltech và được dẫn dắt bởi Hassibi, một giáo sư tại Caltech và là chuyên gia về công nghệ nén. Startup này cũng có Ion Stoica làm cố vấn. Stoica là đồng sáng lập của Databricks (và nhiều công ty khác), đồng thời là giám đốc của Sky Computing Lab danh tiếng tại Berkeley, nơi đã khai sinh ra nhiều công nghệ và startup, từ Letta đến SGLang.
PrismML cũng được hậu thuẫn bởi các nhà đầu tư Khosla Ventures, Cerberus Capital và Caltech.
Startup này chắc chắn không phải là công ty duy nhất đang nghiên cứu công nghệ nén LLM. Multiverse Computing, được thành lập bởi một giáo sư nổi tiếng từ Trung tâm Vật lý Quốc tế Donostia của Tây Ban Nha, cũng là một cái tên khác. (Và Multiverse Computing đã huy động được rất nhiều vốn.)
Tuy nhiên, Hassibi cho biết công nghệ nén của PrismML là độc nhất vô nhị vì các LLM của họ hầu như không bị giảm hiệu suất so với bản gốc. Bonsai 2 đạt 98% điểm số chuẩn (benchmark) tổng hợp của Qwen. Con số này đã tăng lên so với phiên bản Bonsai đầu tiên ra mắt vào tháng 3, vốn đạt 95%. Theo công ty, mô hình gốc đó đã được tải xuống hơn 11 triệu lần, và các mô hình nhỏ hơn của PrismML cũng đã đạt thêm 2,6 triệu lượt tải xuống.
Điều này cho thấy kết quả nén của PrismML đã cải thiện qua từng phiên bản. Liệu họ có thể đạt tới mức hiệu suất chuẩn 100% hay không vẫn là một câu hỏi còn bỏ ngỏ. Hassibi cho biết, việc nén dữ liệu có lẽ sẽ luôn gây ra một số tác động nhất định.
Dù vậy, việc đạt được sự tương đồng hoàn hảo trong các bài kiểm tra chuẩn cũng chỉ mang tính học thuật. Các LLM vốn dĩ không quá chính xác ở dạng chưa nén, và các bài kiểm tra chuẩn cũng không phản ánh hoàn hảo các tác vụ thực tế, nên mức giảm 2% có lẽ sẽ không ảnh hưởng đáng kể đến cách mô hình hoạt động trong thực tế. (Thêm vào đó, phần mềm xung quanh — khung chạy mô hình — cũng đóng vai trò rất quan trọng đối với độ chính xác.)
PrismML cho biết họ đạt được điều này bằng cách thu nhỏ các "trọng số" (weights) cấu thành nên mô hình — về cơ bản, trọng số là thông tin mà mô hình học và lưu trữ trong quá trình huấn luyện. Thông thường, mỗi trọng số cần 16 bit. Cách tiếp cận của PrismML, được gọi là trọng số "ternary" (tam phân), đơn giản hóa con số đó xuống còn ba giá trị: +1, −1 hoặc 0. Với các giá trị cần lưu trữ cho mỗi trọng số nhỏ hơn nhiều, mô hình chiếm ít không gian hơn đáng kể. (Để tìm hiểu sâu hơn về kỹ thuật nén này, bạn có thể xem trang GitHub của dự án.)
Mục tiêu tiếp theo của startup này là áp dụng kỹ thuật nén trên cho các mô hình lớn hơn nữa. "Các mô hình tiếp theo mà chúng tôi sẽ phát hành, hy vọng là trong vài tháng tới, sẽ nằm trong phạm vi hàng trăm tỷ tham số, và tôi kỳ vọng rằng việc duy trì trí thông minh ở đó sẽ dễ dàng hơn," Hassibi chia sẻ với TechCrunch.
Ông nói thêm, khi kích thước mô hình tăng lên, "sẽ có nhiều không gian hơn để nén chúng mà không làm mất đi trí thông minh. Vì vậy, tôi có thể nói rằng, theo xu hướng chung, đối với các mô hình lớn hơn, việc đạt được mức 100% sẽ dễ dàng hơn."
Stoica cho biết ông rất hào hứng với công nghệ này vì nó giúp các mô hình tiên tiến có thể chạy trực tiếp trên thiết bị của người dùng. "Bạn sẽ có trí thông minh trong tầm tay, và nó sẽ miễn phí vì nó chạy trên chính thiết bị bạn đã mua. Nó cũng sẽ đảm bảo tính riêng tư, vì bạn không cần phải gửi dữ liệu lên đám mây."
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.