Latent Space
92

Tin ngành

Bên trong 'Nhà máy mô hình' của Poolside AI: Cách họ tạo ra Laguna S

(giờ Việt Nam)

Tóm tắt AI

Đồng CEO Eiso Kant chia sẻ về cách đội ngũ tinh nhuệ tại Poolside xây dựng quy trình huấn luyện mô hình hiệu quả, giúp Laguna S (118B MOE) vượt mặt các mô hình mã nguồn mở quy mô 1T tham số.

Bản dịch AI

Inside the Model Factory — Eiso Kant, Poolside AI

Trong những tháng gần đây, các cuộc thảo luận về mô hình mở so với đóng, và Mỹ so với Trung Quốc về quyền sở hữu mô hình cũng như AI chủ quyền/địa phương đã trở nên vô cùng gay gắt. Vì vậy, một tin rất rất tốt là Poolside AI cuối cùng đã xuất hiện với các mô hình mới, như Laguna S 2.1, vượt trội hơn hẳn so với các bản phát hành gần đây của Thinking Machines dù kích thước chỉ bằng 1/10.

Báo cáo kỹ thuật gần đây của Poolside đã nhận được rất nhiều lời khen ngợi nhờ mức độ chi tiết, và Vibhu đã lần đầu tiên đề cập đến báo cáo kỹ thuật của Laguna trên câu lạc bộ nghiên cứu của chúng tôi:

X avatar for @eisokant

Eiso Kant@eisokant

Rất thích cách @latentspacepod phân tích Báo cáo kỹ thuật Laguna M.1/XS.2 của chúng tôi! Câu lạc bộ nghiên cứu Latent Space vừa thực hiện một bài phân tích chuyên sâu, và những đúc kết của họ đã nắm bắt hoàn hảo những gì chúng tôi đặt mục tiêu xây dựng với Model Factory của mình. Một vài trích dẫn từ video 🧵👇 (1/6) youtu.be/QLfZamyMls0

8:34 CH · 28 tháng 5, 2026 · 11,3 nghìn Lượt xem

1 Phản hồi · 8 Lượt đăng lại · 47 Lượt thích

Từ việc chi 12 triệu USD để xây dựng các mô hình ngôn ngữ cho mã nguồn trước khi thế giới quan tâm, đến việc tạo ra một Model Factory có thể đưa một mô hình từ giai đoạn tiền huấn luyện đến khi phát hành chỉ trong tám tuần, Eiso Kant đã dành hơn một thập kỷ để đặt cược rằng mã nguồn chính là con đường dẫn đến AGI. Trong tập này, nhà đồng sáng lập Poolside cùng với swyx và Vibhu giải thích lý do tại sao ChatGPT lại là sự minh chứng cho tầm nhìn của họ, tại sao Poolside ủng hộ trọng số mở và nghiên cứu mở, và tại sao ông thà sống trong một thế giới có 100 công ty mô hình nền tảng còn hơn là chỉ có năm công ty, ngay cả khi Poolside nằm trong số năm công ty đó.

Chúng tôi đi sâu vào Model Factory của Poolside: các hệ thống kỹ thuật đằng sau 10.000–20.000 thử nghiệm mỗi tháng, truyền dữ liệu trực tiếp vào quá trình huấn luyện, thử nghiệm có khả năng tái lập, tính toán độ chính xác thấp, và các tác nhân (agents) ngày càng đảm nhận việc viết mã, khởi chạy các tác vụ, đánh giá kết quả và sửa đổi các quy trình được sử dụng để huấn luyện các mô hình tương lai. Eiso cũng giải mã về bản phát hành Laguna S gần đây của họ, lý do tại sao tính kiên trì, xác minh và quay lui (backtracking) có thể quan trọng hơn trí thông minh thô, khả năng còn tiềm ẩn trong các mô hình nhỏ hơn, tại sao học tăng cường (reinforcement learning) sẽ chuyển dịch sớm hơn vào giai đoạn tiền huấn luyện, và tại sao dự đoán token tiếp theo vẫn đang khai thác quá ít thông tin từ web.

X avatar for @poolsideai

Poolside@poolsideai

Hôm nay chúng tôi phát hành Laguna S 2.1, mô hình có năng lực tốt nhất của chúng tôi cho đến nay. Đây là mô hình Mixture-of-Experts với tổng cộng 118 tỷ tham số, trong đó 8 tỷ tham số được kích hoạt trên mỗi token, cửa sổ ngữ cảnh lên tới 1 triệu token, cùng các chế độ có suy nghĩ và không suy nghĩ. Đủ khả năng để cạnh tranh sòng phẳng với các mô hình lớn hơn nhiều.

5:05 CH · 21 tháng 7, 2026 · 656 nghìn Lượt xem

160 Phản hồi · 320 Lượt đăng lại · 2,18 nghìn Lượt thích

Chúng tôi cũng thảo luận về việc đồng thiết kế mô hình và hệ thống hỗ trợ (model-harness co-design), con đường của Poolside từ các tác nhân viết mã đến AGI, lý do tại sao Eiso cho rằng MCP và các lệnh gọi công cụ truyền thống là "ngớ ngẩn", kinh tế học thực tế đằng sau việc huấn luyện mô hình tiên phong, khoản huy động vốn 500 triệu USD của Poolside, AI nguồn mở, quy định, ảnh hưởng của NVIDIA và TSMC, năng suất kỹ thuật trong kỷ nguyên tác nhân, các đội ngũ có tính chủ động cao và việc tuyển dụng tại Poolside.

Cách công trình RNN của Andrej Karpathy truyền cảm hứng cho Eiso bắt đầu xây dựng các mô hình ngôn ngữ cho mã nguồn vào năm 2015

Tại sao Eiso dành bốn năm và 12 triệu USD để theo đuổi một ý tưởng trước khi thị trường quan tâm

Tại sao ChatGPT lại là sự minh chứng cho tầm nhìn và đưa Poolside quay trở lại với nguồn mở

Tại sao Eiso thích một thế giới có 100 công ty mô hình nền tảng hơn là một nhóm độc quyền gồm năm công ty

Sự khác biệt giữa việc phát hành trọng số mở và công bố nghiên cứu thực sự mở

Tại sao Poolside cố tình xây dựng một tổ chức nghiên cứu toàn cầu bên ngoài cuộc chiến nhân tài tại Bay Area

Tại sao việc xây dựng mô hình cuối cùng chiếm 90% là kỹ thuật

Model Factory: Hệ thống toàn diện của Poolside để huấn luyện và cải thiện mô hình một cách nhanh chóng

Cách chưa đầy 70 nhà nghiên cứu thực hiện khoảng 10.000–20.000 thử nghiệm mỗi tháng

Cách Poolside chuyển từ chu kỳ mô hình sáu tháng sang các đợt phát hành từ năm đến tám tuần

Tại sao việc truyền dữ liệu trực tiếp vào quá trình huấn luyện giúp mở khóa khả năng thử nghiệm nhanh hơn

Cách dữ liệu bất biến, mã nguồn được đánh phiên bản và khả năng tái lập cho phép nghiên cứu mô hình một cách nghiêm ngặt

Tại sao Eiso muốn các nhà nghiên cứu tài năng rời khỏi phòng thí nghiệm của họ để trở thành đối thủ cạnh tranh của Poolside

Tại sao 95% công việc xây dựng mô hình có thể được quy về việc cải thiện dữ liệu hoặc hiệu quả tính toán

Laguna S và lý do tại sao tính kiên trì, xác minh và quay lui có thể vượt trội hơn trí thông minh thô

Tại sao các mô hình nhỏ hơn có thể xử lý nhiều công việc tri thức hơn dự kiến trước đây

Tại sao học tăng cường sẽ chuyển dịch sớm hơn vào giai đoạn tiền huấn luyện

Tại sao dự đoán token tiếp theo vẫn chưa khai thác đủ tri thức từ web

Tại sao chưng cất (distillation) và môi trường đã trở thành những "chất gây nghiện" ưa thích của ngành công nghiệp AI

Tại sao huấn luyện giữa chừng (mid-training) thực chất là một dạng thiết kế chương trình học sớm

Huấn luyện độ chính xác thấp, các nút thắt cổ chai về mạng và những bước tiến tiếp theo trong hiệu quả tính toán

Laguna S: 118 tỷ tham số tổng cộng, 8 tỷ tham số hoạt động, và tám tuần từ khi huấn luyện đến khi ra mắt

Tại sao những người xây dựng mô hình thường có thể đánh giá một điểm kiểm tra (checkpoint) mới trong vòng 30 phút đầu tiên

Poolside AILLMHuấn luyện mô hìnhLaguna SCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.