MarkTechPost
85

Mô hình

Poolside ra mắt Laguna S 2.1: Mô hình lập trình mã nguồn mở hiệu năng vượt trội

(giờ Việt Nam)

Tóm tắt AI

Poolside vừa giới thiệu Laguna S 2.1, mô hình lập trình Mixture-of-Experts 118B với cửa sổ ngữ cảnh 1 triệu token. Dù có kích thước khiêm tốn, mô hình này đạt hiệu suất ấn tượng trên các bài kiểm tra lập trình đa ngôn ngữ, vượt xa nhiều đối thủ cùng phân khúc.

Bản dịch AI

Poolside Releases Laguna S 2.1, an Open-Weight Agentic Coding Model Punching Above Its Weight Class on SWE-Bench Multilingual

Poolside vừa phát hành Laguna S 2.1, một mô hình open-weight với 118 tỷ tham số được xây dựng cho mục đích lập trình tác tử (agentic coding). Đây là mô hình Mixture-of-Experts (MoE) với 8 tỷ tham số được kích hoạt trên mỗi token. Mô hình hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token ở cả hai chế độ có suy luận (thinking) và không suy luận (no-thinking). Các trọng số hiện có trên Hugging Face theo giấy phép OpenMDW-1.1, và mô hình đủ nhỏ để chạy trên một thiết bị NVIDIA DGX Spark duy nhất.

Trên các tiêu chuẩn đánh giá lập trình dài hạn (long-horizon coding benchmarks), Laguna S 2.1 thể hiện sức mạnh ngang ngửa với các mô hình có kích thước lớn hơn gấp nhiều lần, bao gồm DeepSeek-V4-Pro-Max, Nemotron 3 Ultra của NVIDIA và Inkling của Thinking Machines. Laguna S 2.1 là phiên bản mở rộng của dòng Laguna XS, được huấn luyện trên cùng tập dữ liệu tiền huấn luyện với XS 2.1.

Laguna S 2.1 là gì?

Mô hình kích hoạt khoảng 6,8% tham số trên mỗi token bất kỳ. Tất cả 118 tỷ tham số vẫn nằm trong bộ nhớ, nhưng chỉ khoảng 8 tỷ tham số được truyền qua mạng trong mỗi bước. Chính tính thưa thớt (sparsity) này là lý do tại sao một mô hình tầm trung có thể hoạt động như một mô hình lớn hơn trong khi vẫn duy trì chi phí vận hành thấp.

Đội ngũ Poolside công bố các trọng số ở định dạng BF16, FP8, INT4 và NVFP4, cùng với các bản chuyển đổi chính thức GGUF, MLX và các mô hình dự thảo DFlash. Quá trình từ khi bắt đầu huấn luyện đến khi ra mắt mất chưa đầy chín tuần. Việc tiền huấn luyện bắt đầu vào ngày 22 tháng 5 năm 2026 trên 4.096 GPU NVIDIA H200. Đây là mô hình đầu tiên của Poolside thực hiện học tăng cường (reinforcement learning) ở độ chính xác FP8.

Hiệu năng

Laguna S 2.1 đạt 70,2% trên Terminal-Bench 2.1 khi bật chế độ suy luận. Kết quả này đưa nó lên vị trí dẫn đầu trong số các mô hình mở, công khai kích thước trên bảng xếp hạng của Poolside, chỉ đứng sau các hệ thống lớn hơn hoặc hệ thống đóng. Trên SWE-Bench Multilingual, mô hình đạt 78,5%, đứng đầu bảng xếp hạng được công bố. Bảng so sánh đầy đủ do Poolside phát hành nằm ở bên dưới.

Tín hiệu rõ ràng nhất là DeepSWE v1.1, vốn vẫn còn nhiều dư địa phát triển. Tại đó, Laguna S 2.1 đạt 40,4% so với 9,0% của DeepSeek-V4-Pro-Max, với số lượng tham số hoạt động chỉ bằng khoảng một phần sáu. Các mô hình biên (frontier models) đóng như Claude Fable 5 và Kimi K3 vẫn dẫn đầu ở một số tiêu chuẩn đánh giá. Tuyên bố của Poolside tập trung vào phân khúc trọng lượng (weight class) chứ không phải vị trí dẫn đầu tuyệt đối. Các quỹ đạo (trajectories) từ tập đánh giá cuối cùng được công bố tại trajectories.poolside.ai.

Hai chế độ suy luận và nguồn gốc của điểm số

Laguna S 2.1 có hai chế độ: tắt và tối đa (max), với chế độ tối đa được bật theo mặc định. Ở chế độ tối đa, mô hình tự thiết lập ngân sách tính toán tại thời điểm kiểm tra (test-time compute budget). Hiện tại, Poolside phát hành mô hình mà chưa cho phép người dùng tùy chỉnh mức độ nỗ lực thấp/trung bình/cao.

Chế độ suy luận tối đa giúp nâng điểm Terminal-Bench 2.1 từ 60,4% lên 70,2%. Nó cũng nâng điểm DeepSWE từ 16,5% lên 40,4%. Những mức tăng này phải trả giá bằng token: các quỹ đạo DeepSWE chạy khoảng 249 nghìn token hoàn thiện ở chế độ suy luận so với 99 nghìn token khi không bật. Đội ngũ Poolside báo cáo rằng mô hình có khả năng suy luận mạch lạc, hiệu quả trong nhiều giờ và hàng trăm nghìn token.

Ba lần chạy thử nghiệm được công bố

Đội ngũ Poolside đã chia sẻ ba quỹ đạo chưa qua chỉnh sửa để thể hiện hành vi thay vì chỉ đưa ra điểm số. Trong một lần chạy, mô hình đã xây dựng một công cụ trình duyệt HTML/CSS hoạt động được từ một thư mục trống. Lần chạy đó mất 181 bước trong phiên làm việc kéo dài 50 phút, không có sự can thiệp của con người và nó đã tự xác thực kết quả đầu ra của mình với headless Chromium.

Trong lần chạy thứ hai, mô hình đã tối ưu hóa bộ công cụ tác tử (agent harness) của chính Poolside. Nó giúp bộ công cụ này nhanh hơn 5,2% với mức phân bổ bộ nhớ thấp hơn khoảng 71%, bằng cách thay thế việc nối chuỗi O(n²) bằng các bộ đệm (buffers). Trong lần chạy thứ ba, nó đã tự suy luận lại Bài toán Erdős #397 ngoại tuyến bằng Perl trong 68 phút, do môi trường sandbox không có Python. Kết quả đó là một sự tái khám phá độc lập; GPT-5.2 Pro đã giải cùng bài toán này vào tháng 1 năm 2026, trong khi thời điểm cắt dữ liệu (knowledge cutoff) của Laguna là tháng 11 năm 2025.

Bạn có thực sự triển khai được nó không?

Việc tính toán kích thước sử dụng toàn bộ 118 tỷ tham số, không phải số lượng 8 tỷ tham số hoạt động, vì mọi chuyên gia (expert) đều nằm trong bộ nhớ. Ở định dạng 4-bit (NVFP4 hoặc INT4), các trọng số cần khoảng 59 GB, vừa vặn với 128 GB bộ nhớ thống nhất của một thiết bị DGX Spark. Ở định dạng FP8, chúng cần khoảng 118 GB, vẫn nằm trong giới hạn của một Spark hoặc một H200. Ở định dạng BF16, chúng cần khoảng 236 GB, đòi hỏi hai thiết bị Spark liên kết hoặc một node trung tâm dữ liệu đa GPU.

Poolside đã hợp tác với NVIDIA để tối ưu hóa suy luận từ phục vụ TRT-LLM sang NVFP4 trên kiến trúc Blackwell, xuống mức một thiết bị DGX Spark duy nhất. Mô hình hỗ trợ ngay từ ngày đầu cho vLLM, SGLang và Ollama. Quyền truy cập được lưu trữ (hosted access) thông qua OpenRouter, miễn phí ở ngữ cảnh 256K và trả phí ở ngữ cảnh đầy đủ 1M với giá $0,10 / $0,20 / $0,01 cho mỗi 1 triệu token đầu vào / đầu ra / cache-read. Mô hình cũng có mặt trên Baseten, Kilo, Prime Intellect Prime Lab và ZML.

Những điểm chính cần lưu ý

Nguồn: Poolside Technical— Giới thiệu Laguna S 2.1, Robert McHardy trên X, Poolside trên X và thẻ mô hình Hugging Face.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với người đọc.

AILập trìnhMã nguồn mởPoolsideLLM
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.