Mô hình
Poolside ra mắt Laguna S 2.1: Mô hình MoE 118B với khả năng xử lý ngữ cảnh dài vượt trội
(giờ Việt Nam)
Tóm tắt AI
Poolside vừa trình làng Laguna S 2.1, mô hình MoE 118B tham số với 8B tham số kích hoạt, hỗ trợ cửa sổ ngữ cảnh 1M token. Mô hình đạt hiệu suất ấn tượng trên Terminal-Bench và DeepSWE, hiện đã được mã nguồn mở hoàn toàn.
Bản dịch AI

Hôm nay, chúng tôi ra mắt Laguna S 2.1, một bước tiến quan trọng trong quá trình phát triển các mô hình hướng tới những công việc có tầm nhìn dài hạn và tận dụng hiệu quả khả năng suy luận.
Laguna S 2.1 là mô hình Mixture-of-Experts (MoE) với tổng cộng 118 tỷ tham số, trong đó có 8 tỷ tham số được kích hoạt trên mỗi token, đồng thời hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token ở cả chế độ thinking (suy nghĩ) và no-thinking (không suy nghĩ). Mô hình này đã đi từ giai đoạn bắt đầu huấn luyện đến khi ra mắt trong chưa đầy chín tuần, và trên các tiêu chuẩn đánh giá lập trình dài hạn, nó hoàn toàn có thể cạnh tranh với các mô hình có kích thước lớn hơn gấp nhiều lần. Đối với mỗi điểm số benchmark mà chúng tôi công bố hôm nay, chúng tôi đều cung cấp toàn bộ quỹ đạo (trajectories) cho mọi lượt thử nghiệm trong tập đánh giá cuối cùng tại trajectories.poolside.ai.
Terminal-Bench 2.1: Các tác vụ đã giải quyết trên Terminal-Bench 2.1.
SWE-Bench Multilingual: Các tác vụ đã giải quyết trên SWE-Bench Multilingual.
SWE-Bench Pro (Public Dataset): Các tác vụ đã giải quyết trên SWE-Bench Pro (Public Dataset).
DeepSWE: Các tác vụ đã giải quyết trên DeepSWE.
SWE Atlas (Codebase QnA): Các tác vụ đã giải quyết trên SWE Atlas (Codebase QnA).
Toolathlon Verified: Các tác vụ đã giải quyết trên Toolathlon Verified.
Các benchmark tính đến ngày 21 tháng 7 năm 2026. Chỉ số pass@1 được tính trung bình trên 4 lần thử cho mỗi tác vụ, ngoại trừ DeepSWE, SWE Atlas (Codebase QnA) và Toolathlon Verified là 3 lần thử mỗi tác vụ. Đối với tất cả các benchmark, chúng tôi lấy giá trị tối đa từ điểm số do nhà cung cấp tự báo cáo, bảng xếp hạng của tác giả benchmark hoặc bảng xếp hạng của bên thứ ba (Artificial Analysis), ngoại trừ SWE Atlas (Codebase QnA) là chúng tôi không sử dụng số liệu từ bảng xếp hạng bên thứ ba.
Laguna S 2.1 (118B-A8B)
Nemotron 3 Ultra (550B-A55B)
DeepSeek-V4-Pro Max (1.6T-A49B)
Qwen 3.7 Max (—)
Muse Spark 1.1 (—)
Claude Fable 5 (—)
Terminal-Bench 2.1
Vượt xa đẳng cấp của chính mình
Theo những gì chúng tôi có thể đo lường, Laguna S 2.1 là mô hình lập trình có khả năng tác nhân (agentic) mạnh mẽ nhất trong cùng phân khúc trọng lượng với khoảng cách biệt đáng kể.
S 2.1 đạt 70,2% trên Terminal-Bench 2.1 trong bộ công cụ đánh giá tác nhân (agent harness) của chúng tôi khi bật chế độ thinking. Kích thước nhỏ gọn giúp nó trở nên đặc biệt phù hợp cho các công việc phức tạp trên máy cục bộ.
Benchmark
Terminal-Bench 2.1 đánh giá một tập hợp rộng lớn, chất lượng cao các tác vụ dài hạn, nơi mô hình tác nhân được kết nối với môi trường thông qua terminal. Laguna S 2.1 là một mô hình nổi bật trong phân khúc kích thước của nó trên benchmark này.
Benchmark
Tìm hiểu sâu hơn về DeepSWE
Các benchmark nêu trên đều có ý nghĩa và chúng tôi rất vui khi tiến gần đến ngưỡng giới hạn (frontier) của chúng. Tuy nhiên, một phần của sự gần gũi đó là đặc tính của các benchmark đang dần hoàn thiện: khi ngưỡng giới hạn tiến xa hơn, các điểm số cao nhất sẽ tập trung trong khoảng 70-90% và các mô hình có hành vi rất khác nhau cuối cùng cũng chỉ chênh lệch nhau vài điểm. DeepSWE của Datacurve vẫn còn nhiều dư địa đáng kể. Các tác vụ của nó có tầm nhìn dài hơn và khó giải quyết một phần, điểm số thực sự có sự phân hóa: các mô hình ở ngưỡng giới hạn dao động từ 54% đến 73% trên biến thể v1.1, trong khi một số mô hình mở có tham số trên 1T lại đạt dưới 10%.
Trên DeepSWE v1.1, Laguna S 2.1 đạt 40,4 điểm ở chế độ thinking trong pool harness.
Cần lưu ý rằng Laguna S 2.1 đạt 40,4% trong bộ công cụ đánh giá tác nhân của chúng tôi (pool), không phải mini-swe-agent mà bảng xếp hạng của DeepSWE sử dụng. Đối với các mô hình khác, chúng tôi báo cáo giá trị tối đa dựa trên các điểm số đã công bố, vốn đối với hầu hết các mô hình là kết quả bảng xếp hạng chính thức do Datacurve báo cáo. Mặc dù điều này làm cho các điểm số khó so sánh hơn, chúng tôi không tin rằng nó đặt chúng tôi vào vị thế có lợi đặc biệt, vì đã có báo cáo cho thấy nhiều mô hình đạt điểm bằng hoặc tốt hơn trong mini-swe-agent so với các bộ công cụ gốc của chúng. Mọi quỹ đạo trong lần đánh giá cuối cùng đều có sẵn tại đây.
Phương pháp đánh giá
Việc đánh giá các mô hình tác nhân vốn nổi tiếng là khó khăn do sự phổ biến của tình trạng "reward hacking" (lợi dụng lỗ hổng phần thưởng). Chúng tôi đã từng viết về reward hacking trong các benchmark hàng đầu cũng như hệ thống đánh giá và tính nghiêm ngặt của chúng tôi trong báo cáo kỹ thuật về các mô hình Laguna M.1 và XS.2. Các nghiên cứu gần đây đã tập trung vào việc đánh giá đối kháng (adversarial judging) để tăng cường khả năng phát hiện reward hacking.
Với bản phát hành này, chúng tôi cung cấp tất cả các quỹ đạo từ các đánh giá cuối cùng của checkpoint Laguna S 2.1 đã công bố để xem và tải xuống tại trajectories.poolside.ai.
Chứng kiến mô hình hoạt động
Điểm số benchmark cung cấp cái nhìn định lượng về hành vi của mô hình, nhưng để hiểu trực quan hơn về cách mô hình hoạt động, việc xem xét các lượt chạy trên các tác vụ thực tế là rất hữu ích. Chúng tôi chia sẻ ba tác vụ như vậy cùng với các quỹ đạo chưa qua chỉnh sửa và bình luận đi kèm.
Nghiên cứu tình huống 1
Xây dựng engine trình duyệt từ một thư mục trống
Một trong những điều chúng tôi yêu thích nhất ở Laguna S 2.1 là sự tháo vát: Nó sẽ tìm ra những cách thông minh để đạt được mục tiêu ngay cả khi con đường trực tiếp không khả dụng. Chúng tôi đã thấy một minh chứng tuyệt vời về điều này khi yêu cầu nó xây dựng một engine trình duyệt từ đầu; biết rằng đây sẽ là một thử thách đối với Laguna trong việc xác minh công việc của chính mình do thiếu khả năng thị giác. Trong một phiên làm việc 50 phút với 181 bước, không có sự can thiệp của con người, Laguna S 2.1 đã xây dựng một engine kết xuất HTML/CSS hoạt động được từ một thư mục trống, sau đó chứng minh nó kết xuất giống như một trình duyệt thực thụ bằng cách tự đo lường so với một trình duyệt khác. Trong suốt quá trình làm việc, mô hình đã tìm ra những cách ngày càng phức tạp để xác thực công việc của mình bất chấp những hạn chế, dẫn đến việc chạy headless Chromium để đọc lại các canvas và so sánh ảnh chụp màn hình bằng số liệu. Xem toàn bộ quỹ đạo tại đây.
Trong suốt phiên làm việc, mô hình đã xây dựng toàn bộ quy trình, từ parser → cascade → layout → renderer, bằng JavaScript thuần: một bộ phân tích cú pháp HTML và cây DOM, một bộ phân tích cú pháp CSS với độ đặc hiệu của bộ chọn, một engine cascade với tính kế thừa, bố cục box-model và một renderer canvas-2D, được gói gọn trong một ứng dụng hiển thị chín đoạn mã trên canvas của chính nó bên cạnh cùng một đánh dấu trong một iframe, để trình duyệt chủ đóng vai trò là tham chiếu ngay tại đó.
Nghiên cứu tình huống 2
Tối ưu hóa bộ công cụ của chính chúng tôi
Laguna S 2.1 có khả năng theo đuổi các công việc kỹ thuật và nghiên cứu có ý nghĩa. Trong một ví dụ, một trong những nhà nghiên cứu của chúng tôi đã hướng nó vào bộ công cụ tác nhân của chúng tôi, vốn được sử dụng để huấn luyện/đánh giá và tương tác người dùng với các mô hình của chúng tôi. Trong một vòng lặp tự động, Laguna S 2.1 đã giúp bộ công cụ của chúng tôi nhanh hơn 5,2% với mức phân bổ bộ nhớ thấp hơn khoảng 70%. Xem toàn bộ quỹ đạo tại đây.
Đối với tác vụ này, chúng tôi đã trang bị các benchmark vào bộ công cụ để mô hình có thể thấy chính xác thời gian và bộ nhớ được sử dụng ở đâu. Chúng tôi đặt ra các quy tắc nghiêm ngặt: mỗi lần chỉ thử một cách tiếp cận, chạy benchmark sau mỗi thay đổi, chỉ giữ lại những gì mang lại hiệu quả đo lường được. Sau đó, chúng tôi chạy Laguna S 2.1 trong một vòng lặp nghiên cứu tự động, nơi mỗi kết quả được phản hồi lại cho nó và thúc đẩy nó tiếp tục cải thiện.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.