# Fireworks AI ra mắt Ember-1: Mô hình hậu huấn luyện từ Kimi K3 giúp giảm 40% token suy luận

- Nguồn: MarkTechPost
- Thời gian phát hành: 2026-09-28 14:22 (giờ Việt Nam)
- Điểm AI: 78/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/bc961d23714b7498
- Nguồn dữ liệu AI HOT: https://aihot.news/items/zkdby2t1m0py60rlf2cyevbl5
- Link gốc: https://www.marktechpost.com/2026/09/28/fireworks-ai-releases-ember-1-a-post-trained-kimi-k3-that-uses-about-40-fewer-tokens

## Lý do tinh chọn

Mở ra hướng đi mới trong việc tối ưu hiệu suất suy luận thông qua hậu huấn luyện thay vì thay đổi tham số, cung cấp dữ liệu thực tế hữu ích cho các nhà phát triển quan tâm đến chi phí AI.

## Tóm tắt AI

Ember-1 là mô hình tối ưu hóa từ Kimi K3, giúp cắt giảm 40% token suy luận dư thừa mà vẫn giữ nguyên độ chính xác, mang lại hiệu quả chi phí vượt trội trong môi trường thực tế.

## Thân bài

![Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens](https://www.marktechpost.com/wp-content/uploads/2026/09/blog111-33.png)

Fireworks AI vừa ra mắt [Ember-1](https://fireworks.ai/models/fireworks/ember-1), một mô hình chuyên biệt từ Fireworks Research được xây dựng bằng cách hậu huấn luyện (post-training) mô hình mã nguồn mở [Kimi K3](https://fireworks.ai/models/fireworks/kimi-k3) của Moonshot AI. Ember-1 học cách tạo ra các chuỗi suy luận ngắn hơn trong khi vẫn duy trì độ chính xác của tác vụ. Điều này khác với việc giảm thiết lập nỗ lực suy luận tại thời điểm suy luận (inference). Theo [bài đăng ra mắt của Fireworks](https://fireworks.ai/blog/ember-1), Ember-1 mang lại chất lượng tương đương Kimi K3 với số lượng token ít hơn khoảng 40%.

Có thể triển khai được không? Có, nhưng chỉ thông qua API serverless của Fireworks dưới dạng Bản xem trước nghiên cứu (Research Preview). Fireworks chưa phát hành trọng số, mã huấn luyện hoặc thuật toán huấn luyện chính xác của Ember-1, vì vậy việc tự lưu trữ (self-hosting) hiện không khả thi.

### Vấn đề: Các mô hình suy luận đang "suy nghĩ" quá nhiều

Nhóm Fireworks báo cáo rằng các mô hình suy luận như Kimi K3 đôi khi dành hơn 90% số token được tạo ra cho việc suy luận nội bộ. Chi phí đó tăng lên trong các khối lượng công việc tác nhân (agentic workloads) đa lượt. Mỗi lượt sẽ phát lại các suy luận trước đó cho mô hình. Ngữ cảnh tăng lên theo cấp số nhân bình phương với số lượt. Các chuỗi suy luận dài từ những lượt đầu tiên bị đọc lại và tính phí lại trong mọi lệnh gọi sau đó.

Nhóm Fireworks giải thích rằng khách hàng muốn khả năng lập trình của K3 với chi phí thấp hơn. Việc giảm nỗ lực suy luận của K3 không giải quyết được vấn đề này. Các thiết lập nỗ lực thấp hơn làm giảm quá nhiều chất lượng. Vì vậy, nhóm đã huấn luyện mô hình để suy luận hiệu quả hơn.

### Cách Fireworks Research xây dựng Ember-1

Không phải tất cả suy luận của K3 đều lãng phí. Một phần trong đó là sự tự phản ánh hữu ích, như xem xét lại một giả định hoặc phản ứng với phản hồi. Ember-1 giữ lại hành vi đó trong khi cắt giảm các suy luận dư thừa và các vòng lặp không hiệu quả.

Tập dữ liệu huấn luyện bao gồm toán học, lập trình, tuân thủ hướng dẫn, hội thoại, tìm kiếm, sử dụng công cụ và kỹ thuật phần mềm. Nó bao gồm cả các bài toán độc lập và các tương tác đa bước mở rộng. Phản hồi từ tác vụ và môi trường hướng dẫn việc lập kế hoạch và học tập theo chính sách (on-policy). Nhóm Fireworks đã thực hiện hơn 50 thí nghiệm huấn luyện và hơn 200 đánh giá. Họ cũng phát triển các thuật toán huấn luyện mới, vốn chưa được công bố. Tất cả quá trình huấn luyện đều chạy trên [Fireworks Serverless Training](https://fireworks.ai/training). Fireworks tuyên bố họ sử dụng dữ liệu của riêng mình và không sử dụng dữ liệu khách hàng.

### Kết quả điểm chuẩn (Benchmark)

Fireworks đã so sánh Ember-1 với Kimi K3 ở ba mức độ nỗ lực suy luận. Chi phí được tính theo bảng giá API công khai của Kimi K3. Đây là các đánh giá do chính Fireworks công bố.

| Điểm chuẩn | N | K3 Thấp | K3 Cao | K3 Tối đa | Ember-1 | Ember-1 so với K3 Tối đa (chi phí) |
| --- | --- | --- | --- | --- | --- | --- |
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51,9% / -23,1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15,5% / -68,1 USD |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32,5% / -60,8 USD |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23,7% / -126,9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5,9% / -0,3 USD |

Ember-1 dẫn trước K3 Tối đa trên Terminal Bench 2.1 và DeepSWE 1.1. Nó theo sau một chút trên SWE-bench Verified và SWE-Interact. Trên bảy điểm chuẩn và lưu lượng sản xuất của hai khách hàng, Fireworks cho biết suy luận của K3 đã được rút ngắn từ 35 đến 50% mà không làm giảm độ chính xác.

Trên Bedside Bench của Doximity, một tập hợp gồm 500 ca lâm sàng được bác sĩ xác nhận, Ember-1 đã thiết lập một đường biên Pareto mới về chi phí trên mỗi tác vụ. Kết quả đó đến từ [Chỉ số Trí tuệ Chuyên biệt](https://fireworks.ai/specialized-intelligence-index/) mới của Fireworks.

### Kết quả kiểm thử A/B trong môi trường thực tế

Fireworks đã chạy các bài kiểm thử A/B trực tiếp với 2 khách hàng trên khối lượng công việc lập trình thực tế. Cả hai đều ghi nhận số token ít hơn khoảng 35% cho mỗi tác vụ với chất lượng tương đương. Trong lần chạy được công bố, số token đầu ra giảm từ 49,3K xuống 29,9K mỗi tác vụ. Token suy luận giảm 71,3% và tổng số token giảm 39%. Điểm số tác vụ về cơ bản không thay đổi: 0,753 cho Ember-1 so với 0,751 cho K3. Số bước trung bình giảm từ 23,8 xuống 21,4. Một khách hàng hiện đang chạy Ember-1 trong môi trường thực tế.

Ember-1 có chi phí mỗi token tương đương với Kimi K3 trên Fireworks: 3,00 USD cho đầu vào, 0,30 USD cho đầu vào được lưu trong bộ nhớ đệm và 15,00 USD cho đầu ra trên mỗi 1 triệu token. Khoản tiết kiệm hoàn toàn đến từ việc tạo ra ít token hơn. Với mức giá đầu ra đó, các con số A/B cho thấy chi phí khoảng 0,74 USD so với 0,45 USD chi phí đầu ra mỗi tác vụ (tính toán của chúng tôi, chỉ tính đầu ra).

### Các điểm chính

- Ember-1 là Kimi K3 được hậu huấn luyện để suy luận với ít token hơn, không phải chạy ở mức nỗ lực thấp hơn.
- Fireworks báo cáo số token ít hơn khoảng 40% trong khi độ chính xác vẫn được duy trì qua các đánh giá của họ.
- Trong một bài kiểm thử A/B thực tế, đầu ra giảm từ 49,3K xuống 29,9K token mỗi tác vụ với điểm số 0,753 so với 0,751.
- Nó vượt qua K3 Tối đa trên Terminal Bench 2.1 (82,0%) và DeepSWE 1.1 (75,2%), theo sau trên SWE-bench Verified (92,2%).
- Bản xem trước nghiên cứu chỉ qua API với mức giá của K3; trọng số và mã huấn luyện không được phát hành.

Xem [Chi tiết kỹ thuật](https://fireworks.ai/blog/ember-1). Mọi công lao thuộc về nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên [Twitter](https://x.com/intent/follow?screen_name=marktechpost) và đừng quên tham gia [SubReddit 150k+ ML](https://www.reddit.com/r/machinelearningnews/) của chúng tôi và Đăng ký [bản tin của chúng tôi](https://magic.beehiiv.com/v1/f5e63dd4-5653-4f09-83e2-321a8b1ba526?email={{email}}). Khoan đã! Bạn có dùng Telegram không? [bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.](https://t.me/machinelearningresearchnews)

Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC trang Hugging Face HOẶC Ra mắt sản phẩm HOẶC Hội thảo trực tuyến, v.v.? [Kết nối với chúng tôi](https://forms.gle/MJjjVDPS7whH8Ngs6)

![](https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-150x150.png)

#### Asif Razzaq

Asif Razzaq là CEO của Marktechpost AI Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.marktechpost.com/2026/09/28/fireworks-ai-releases-ember-1-a-post-trained-kimi-k3-that-uses-about-40-fewer-tokens>
