Mô hình
IFM ra mắt dòng mô hình nguồn mở K2 Horizon: Từ 0.9B đến 375B tham số
(giờ Việt Nam)
Tóm tắt AI
IFM công bố 6 mô hình K2 Horizon theo giấy phép Apache 2.0, trong đó các phiên bản nhỏ đạt hiệu suất SOTA và mô hình 36B ứng dụng kiến trúc MoVA mới.
Bản dịch AI

Hôm nay, IFM ra mắt K2 Horizon, một đội ngũ gồm sáu mô hình kết nối với nhau: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B và 0.9B. Trên các phương diện lập luận, toán học, lập trình, tác vụ đại lý (agentic tasks) và khả năng tổng quát, K2 Horizon mang lại hiệu suất hàng đầu trong mọi phân khúc kích thước—với các mô hình 0.9B, 3.7B và 7B thiết lập các tiêu chuẩn hiện đại mới (state of the art) ở quy mô tương ứng của chúng.
K2 Horizon cũng là bản phát hành mở toàn diện nhất của chúng tôi từ trước đến nay. Đối với mỗi mô hình, chúng tôi mở toàn bộ vòng đời đào tạo từ tiền huấn luyện (pretraining) cho đến lập luận và hậu huấn luyện đại lý (agentic post-training). Chúng tôi phát hành các điểm kiểm tra trung gian (intermediate checkpoints), dữ liệu đào tạo hoặc công thức xây dựng dữ liệu chi tiết, kiến trúc mở, thành phần hỗn hợp, mã nguồn đào tạo, cấu hình, nhật ký chi tiết, kết quả đánh giá và trọng số cuối cùng.
Các mô hình và mã nguồn được phát hành theo giấy phép Apache 2.0. Các tập dữ liệu được phát hành theo giấy phép áp dụng tương ứng, chẳng hạn như ODC-BY; chúng tôi công khai cách dữ liệu được xây dựng và trộn lẫn trong trường hợp không thể tái phân phối.
Tổng thể, K2 Horizon đại diện cho bản phát hành mô hình mở toàn diện nhất từ trước đến nay:
Hiệu suất hàng đầu thế giới trên mọi quy mô
Các mô hình 0.9B, 3.7B và 7B đạt được kết quả hiện đại nhất trong phân khúc tương ứng của chúng trên các lĩnh vực toán học, lập luận, khả năng tổng quát, lập trình và tác vụ đại lý.
Mô hình 36B-A4B hoạt động vượt xa mức kỳ vọng thông thường so với số lượng tham số hoạt động của nó, chứng minh hiệu quả của thiết kế Mixture-of-Expert độc đáo của chúng tôi khi tính toán các giá trị chú ý (attention values). Các mô hình 32B và 375B-A23B nằm trong số những mô hình hàng đầu trong các phân khúc so sánh tương ứng.
Các mô hình nhỏ đặc biệt đáng chú ý. K2 Horizon 0.9B đạt điểm AIME 2026 trên 48, cùng với khả năng lập luận, sử dụng công cụ và khả năng đại lý mạnh mẽ. K2 Horizon 3.7B và 7B mở rộng các khả năng này sang các môi trường kỹ thuật phần mềm và đa bước đòi hỏi khắt khe hơn, được chứng minh qua hiệu suất mạnh mẽ trên SWE-bench và BrowseComp. Mặc dù các tác vụ phức tạp đòi hỏi sự khám phá sâu rộng và phục hồi lặp đi lặp lại, chẳng hạn như trong TerminalBench, vẫn còn khó khăn đối với các mô hình nhỏ nhất, nhưng K2 Horizon đã dịch chuyển ranh giới của những gì có thể thực hiện được ở mọi quy mô.
Tại sao đội ngũ Horizon lại quan trọng
Một mô hình minh bạch nhưng tụt hậu xa so với biên giới năng lực thì có giá trị hạn chế khi làm nền tảng, ngay cả đối với nghiên cứu. Đồng thời, một mô hình mạnh mẽ chỉ được phát hành dưới dạng trọng số cuối cùng cho phép mọi người chạy nó, nhưng lại cung cấp rất ít thông tin chi tiết về cách các khả năng của nó được tạo ra.
K2 Horizon kết hợp hai yếu tố này lại với nhau. Đội ngũ này cung cấp các mô hình có tính cạnh tranh cao và công bố các công thức được sử dụng để đào tạo chúng. Các nhà nghiên cứu có thể nghiên cứu các khả năng nâng cao trong các mô hình đủ mạnh để thể hiện chúng, trong khi các nhà phát triển có thể tái tạo, điều chỉnh và mở rộng các phương pháp thay vì coi điểm kiểm tra cuối cùng là một điểm khởi đầu mơ hồ.
Kể từ khi giới thiệu nguyên tắc mở hoàn toàn trong bài báo LLM360 năm 2023, chúng tôi đã phát hành các mô hình mở hàng năm, đồng thời mở rộng cam kết đó sang các quy mô lớn hơn, khả năng mạnh mẽ hơn và hiện tại là toàn bộ vòng đời thông qua hậu huấn luyện đại lý.
Tìm hiểu sâu về đội ngũ K2 Horizon
K2 Horizon 375B-A23B: sức mạnh cho doanh nghiệp
K2 Horizon 375B-A23B là mô hình lớn nhất và có khả năng nhất của đội ngũ. Kiến trúc MoE thưa thớt của nó cung cấp tổng dung lượng 375 tỷ tham số trong khi kích hoạt khoảng 23 tỷ tham số cho mỗi token, cho phép nó tận dụng dung lượng của một mô hình lớn hơn nhiều mà không cần sử dụng mọi tham số cho mỗi token.
Mô hình này xếp hạng trong số các mô hình hàng đầu dưới 400 tỷ tham số trên các đánh giá tổng quát, lập luận, lập trình và đại lý. Nó được thiết kế cho các khối lượng công việc đòi hỏi khắt khe nơi chất lượng mô hình là quan trọng nhất, bao gồm lập luận phức tạp, kỹ thuật phần mềm, nghiên cứu và các tác vụ đại lý dài hạn.
Giống như mọi mô hình trong đội ngũ Horizon, 375B-A23B không được phát hành dưới dạng một điểm cuối duy nhất mà là một cây phát triển. Các điểm kiểm tra trung gian và các nhánh hậu huấn luyện của nó cho thấy cách mô hình cơ sở phát triển thành các biến thể lập luận, tuân thủ hướng dẫn và đại lý chuyên biệt.
K2 Horizon 32B và 36B-A4B: hiệu suất mạnh mẽ cho triển khai cục bộ
Horizon 32B là mô hình dày (dense model) mạnh mẽ nhất của đội ngũ, mang lại sự cân bằng tốt giữa khả năng, khả năng thích ứng và khả năng triển khai cục bộ. Nó xếp hạng trong số các mô hình dày hàng đầu dưới 40 tỷ tham số.
Horizon 36B-A4B đạt hiệu suất gần bằng mô hình dày 32B trong khi chỉ kích hoạt khoảng 4 tỷ tham số mỗi token. Hiệu suất của nó đến từ MoVA, kiến trúc chú ý thưa thớt mới của chúng tôi, cùng với các lớp feed-forward MoE.
Hai mô hình này đóng vai trò là điểm tham chiếu quan trọng để nghiên cứu cách các kiến trúc dày và thưa hoạt động trong các điều kiện đào tạo tương tự.
Các mô hình này chiếm vị trí tối ưu về hiệu suất cục bộ của đội ngũ. Chúng đủ mạnh cho các ứng dụng lập luận, lập trình và đại lý đòi hỏi khắt khe trong khi vẫn thực tế cho các máy trạm cục bộ và các hệ thống phục vụ hiệu quả.
K2 Horizon 7B, 3.7B và 0.9B: khả năng tiên phong ở quy mô nhỏ
K2 Horizon 7B và 3.7B mang lại hiệu suất lập luận, toán học, lập trình, sử dụng công cụ và đại lý mạnh mẽ trong khi vẫn phù hợp để triển khai cục bộ và trên thiết bị. Trong một số đánh giá, kết quả của chúng tiệm cận hoặc vượt qua các mô hình lớn hơn gấp nhiều lần từ thế hệ trước.
K2 Horizon 0.9B mang nhiều khả năng tương tự vào các môi trường bị hạn chế nghiêm ngặt. Nó có thể thực hiện lập luận toán học, sử dụng công cụ và hoàn thành các tác vụ đại lý đơn giản trong khi vẫn đủ nhỏ gọn cho các ứng dụng trên đồng hồ, kính và các thiết bị biên khác dưới dạng lượng tử hóa (quantization).
Tác vụ phù hợp thay đổi theo quy mô: mô hình 0.9B phù hợp nhất với các tương tác tập trung và sử dụng công cụ nhẹ, trong khi các mô hình 3.7B và 7B có thể xử lý các quy trình lập trình và đa bước đòi hỏi khắt khe hơn. Cùng nhau, chúng chứng minh khả năng có thể được duy trì trong các mô hình đủ nhỏ để chạy ở hầu hết mọi nơi.
Thiết kế K2 Horizon
Một gia đình ngay từ đầu
Horizon được thiết kế như một gia đình kết nối thay vì một tập hợp các mô hình không liên quan. Sáu mô hình chia sẻ các quyết định kiến trúc cốt lõi, phương pháp đào tạo, giao diện, cơ sở hạ tầng đánh giá và công cụ triển khai. Điều này cho phép các nhà phát triển di chuyển giữa các kích thước dễ dàng hơn và cung cấp cho các nhà nghiên cứu một môi trường được kiểm soát tốt hơn để nghiên cứu khả năng trên quy mô lớn.
Mỗi mô hình được tiền huấn luyện trên khoảng 20 nghìn tỷ token bằng cách sử dụng các hỗn hợp được xây dựng và ghi chép cẩn thận. Các điểm kiểm tra trung gian và nhật ký chi tiết tương ứng của chúng được ghi lại trong suốt quá trình đào tạo, tạo ra một hồ sơ chi tiết về cách mỗi mô hình phát triển.
MoVA: mở rộng quy mô chú ý với các chuyên gia thưa thớt
Ý tưởng cốt lõi đằng sau mixture-of-experts là tăng tổng dung lượng mô hình trong khi giữ cho tính toán cần thiết cho mỗi token ở mức tương đối cố định. Các kiến trúc MoE thông thường áp dụng sự thưa thớt này chủ yếu vào các lớp feed-forward: nhiều chuyên gia chuyên biệt có sẵn, nhưng một bộ định tuyến chỉ kích hoạt một tập hợp con nhỏ cho mỗi token.
Kiến trúc mới của chúng tôi, MoVA—Mixture-of-Value Attention, mở rộng nguyên tắc này sang chú ý (attention). Vì chú ý xác định cách một transformer tập hợp thông tin từ khắp ngữ cảnh của nó, việc giới thiệu sự thưa thớt ở đó mở ra một chiều hướng khác để mở rộng dung lượng mô hình ngoài mạng feed-forward.
MoVA tích hợp định tuyến chuyên gia vào chú ý đa đầu (multi-head attention) trong khi vẫn tương thích với các kỹ thuật hiệu quả bao gồm FlashAttention, grouped-query attention và sparse attention.
Kết quả là K2 Horizon MoVA 36B-A4B: một mô hình với tổng số 36 tỷ tham số nhưng chỉ khoảng 4 tỷ tham số hoạt động mỗi token. Trong cùng điều kiện đào tạo, nó chỉ hoạt động thấp hơn một chút so với mô hình dày Horizon 32B trong khi yêu cầu ít tham số hoạt động hơn đáng kể.
Dữ liệu đào tạo
Đào tạo trên sáu quy mô đòi hỏi dữ liệu đủ rộng để hỗ trợ khả năng tổng quát và được xây dựng đủ cẩn thận để duy trì chất lượng trên khoảng 20 nghìn tỷ token.
Hỗn hợp tiền huấn luyện của Horizon kết hợp các nguồn web, mã nguồn, toán học, khoa học, đa ngôn ngữ và các nguồn chuyên biệt theo lĩnh vực với dữ liệu tổng hợp được tạo thông qua các đường ống của riêng chúng tôi. Một trong những đổi mới dữ liệu chính của chúng tôi là kết hợp lập luận trực tiếp vào tiền huấn luyện: gần 17% kho ngữ liệu tiền huấn luyện bao gồm các quỹ đạo giải quyết vấn đề với lập luận rõ ràng. Các quỹ đạo lập luận cho các tác vụ toán học đã được viết lại thành các định dạng như đối thoại và hướng dẫn học tập. Tổng cộng, chúng tôi đã sử dụng khoảng 10 nghìn tỷ token tổng hợp trong quá trình tiền huấn luyện.
Các đường ống dữ liệu tổng hợp của chúng tôi sử dụng hàng triệu tổ hợp các nút đa dạng và hạt giống ngữ cảnh, bao gồm cả việc truy xuất từ một công cụ tìm kiếm được xây dựng nội bộ trên kho ngữ liệu web tiền huấn luyện. Để định lượng sự đa dạng ở quy mô ngữ liệu, chúng tôi đã phát triển một chỉ số nén dựa trên gzip tùy chỉnh với bước nhảy thích ứng để tránh sự bão hòa nhanh chóng của các phép đo dựa trên gzip tiêu chuẩn khi số lượng tài liệu tăng lên. Như được hiển thị bên dưới, sự đa dạng đo được của dữ liệu tổng hợp của chúng tôi tiệm cận với văn bản web tự nhiên chất lượng cao và vượt xa đáng kể so với mã nguồn web.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.