Mô hình
StepFun ra mắt Step 5 Preview: Mô hình MoE 600B tham số, hỗ trợ cửa sổ ngữ cảnh 1 triệu token
(giờ Việt Nam)
Tóm tắt AI
StepFun giới thiệu Step 5 Preview, mô hình MoE đa phương thức mạnh mẽ với 600B tham số, hỗ trợ xử lý 1 triệu token và tích hợp sâu cho các tác vụ AI đại lý.
Bản dịch AI

StepFun vừa ra mắt Step 5 Preview, mô hình chủ lực mới của họ dành cho các tác vụ đại lý (agentic work). Các khối lượng công việc mục tiêu bao gồm kỹ thuật phần mềm, công việc tri thức chuyên môn và tài chính. Điểm nhấn chính nằm ở chi phí. Đội ngũ StepFun khẳng định mô hình mang lại trí tuệ tương đương với chi phí thực hiện tác vụ thấp hơn đáng kể. Đó chính là cách tiếp cận "đường biên Pareto" (Pareto frontier) được nêu trong tiêu đề ra mắt.
Liệu mô hình có thể triển khai được không? Có, dưới dạng API được lưu trữ (hosted API) và trên nền tảng StepFun. Việc tự lưu trữ (self-hosting) cần chờ đợi các trọng số mở (open weights). StepFun cho biết các trọng số mở sẽ được công bố vào ngày 15 tháng 10 năm 2026. Theo tính toán đơn giản, 600 tỷ tham số sẽ cần khoảng 1,2 TB ở định dạng BF16, chưa tính KV cache. Hãy lên kế hoạch cho phần cứng máy chủ đa GPU khi các trọng số được phát hành.
Những gì StepFun đã phát hành
Step 5 Preview là một mô hình Mixture-of-Experts (MoE) thưa. Nó sở hữu tổng cộng khoảng 600 tỷ tham số và kích hoạt khoảng 27 tỷ tham số cho mỗi token. Con số này tương đương với khoảng 4,5% trọng số được sử dụng trên mỗi token.
Tài liệu chính thức của mô hình liệt kê các thông số kỹ thuật sau:
Đối với các tác vụ nghiên cứu, đội ngũ StepFun cho biết mô hình đã điều phối 950 lượt truy xuất web trong một hành động đại lý duy nhất. Đội ngũ StepFun cũng ghi nhận sự tích hợp với Claude Code thông qua Step Plan của họ.
Kiến trúc: Hẹp và Sâu
StepFun không mở rộng mạng lưới theo chiều ngang. Theo Pandaily, họ đã xếp chồng 92 lớp Transformer theo bố cục hẹp và sâu. Nhóm nghiên cứu lập luận rằng các lớp xếp chồng sâu hơn tạo ra các đường dẫn dài hơn cho suy luận đa bước (multi-hop reasoning) ngầm định. Điều này rất quan trọng trong quá trình tiền nạp (prefill) dài, khi các đại lý thực hiện tìm kiếm, chạy mã và đọc kết quả trả về từ công cụ.
Quá trình huấn luyện dựa trên học tăng cường (reinforcement learning) theo chính sách (on-policy) với tầm nhìn dài hạn. StepFun trích dẫn sự đồng bộ hóa huấn luyện và suy luận ở cấp độ bit trên toàn bộ quá trình định tuyến MoE. Các kỹ thuật khác được liệt kê bao gồm giải mã suy đoán MTP-3, FP8 MoE và giải phóng KV-cache (KV-cache offload). StepFun báo cáo tốc độ tăng hơn 3 lần từ đầu đến cuối cho học tăng cường tầm nhìn dài hạn.
Trình giải thích tương tác
Điểm chuẩn: Do công ty báo cáo so với độc lập
Step 5 Preview được chạy ở mức nỗ lực Cao (High), trong khi các đối thủ cạnh tranh chạy ở mức Tối đa (Max).
StepFun báo cáo các kết quả này thông qua RuntimeWire:
Về lập trình, StepFun báo cáo đạt 67,7 điểm trên DeepSWE v1.1, 49,0 trên StepCodeBench và 80,5 trên ProgramBench. GPT-6 Astra và Claude Opus 5 vẫn dẫn trước ở cả 3 bài kiểm tra. StepCodeBench là điểm chuẩn riêng của StepFun.
StepFun cũng đã thực hiện 2 thử nghiệm đại lý kéo dài 24 giờ mỗi thử nghiệm. Trong thử nghiệm đầu tiên, mô hình đã tinh chỉnh nhân H100 lên 508 TFLOPS, so với 493 của Claude Opus 5. Trong thử nghiệm thứ hai, nó đã nâng cấp Qwen3-30B-A3B trên AIME24 từ 53,3% lên 60% thông qua quá trình hậu huấn luyện tự động.
Kiểm tra độc lập đến từ Artificial Analysis. Họ chấm Step 5 Preview 44 điểm trên Chỉ số Trí tuệ (Intelligence Index). Mức trung bình của các mô hình suy luận trong cùng phân khúc giá là 24. Họ đo lường tốc độ đầu ra đạt 99,8 token mỗi giây trên API của StepFun.
Định giá
Giá niêm yết API của StepFun trên mỗi 1 triệu token:
Artificial Analysis đưa ra mức trung bình cho các mô hình tương đương là 1,88 USD cho đầu vào và 10,00 USD cho đầu ra. Có một lưu ý nhỏ: mô hình đã tạo ra 160 triệu token đầu ra trong lần chạy chỉ số, so với mức trung bình là 92 triệu. Việc suy luận dài dòng sẽ tiêu tốn một phần chi phí tiết kiệm được trên mỗi token.
Những điểm chính cần lưu ý
Câu hỏi thường gặp (FAQ)
Hãy xem các Chi tiết Kỹ thuật. Mọi ghi nhận đều thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Bản phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.