Fireworks AI (Web)
92

Mô hình

Đánh giá DeepSeek-V4.1-Flash: Hiệu năng ngang ngửa GPT-6 Astra với chi phí chỉ bằng 1/15

(giờ Việt Nam)

Tóm tắt AI

Fireworks công bố DeepSeek-V4.1-Flash đạt 74.34% pass@1 trên DeepSWE, ngang tầm GPT-6 Astra nhưng tối ưu chi phí vượt trội với mức giá chỉ 0.43 USD mỗi tác vụ.

Bản dịch AI

Tuần trước, Fireworks đã phát hành phiên bản mới nhất DeepSeek-V4.1-Flash. Sau khi trải qua một bộ tiêu chuẩn đánh giá toàn diện, kết quả cho thấy mô hình này thiết lập một đường biên Pareto mới trên các yếu tố đánh đổi then chốt như chất lượng, tốc độ và chi phí. Trên DeepSWE, nó đạt độ chính xác lập trình ngang tầm GPT-6 Astra với mức giá chỉ bằng 1/15 trên mỗi tác vụ.

Các nhà phát triển thường hỏi chúng tôi cách chọn mô hình phù hợp. Thực tế là một mô hình chỉ là một điểm duy nhất trên bản đồ, nhưng ứng dụng của bạn lại là một hệ thống hoàn chỉnh. Khả năng của AI thường không đồng đều, nghĩa là một mô hình xử lý tốt tác vụ này có thể gặp khó khăn với tác vụ khác. Vì không có mô hình đơn lẻ nào chiến thắng trong mọi tình huống, việc thiết kế khối lượng công việc đòi hỏi phải khớp đúng mô hình với đúng tác vụ, cho dù bạn cần xử lý độ trễ thấp hay tính toán chuyên sâu cho các suy luận phức tạp.

Dưới đây là cách DeepSeek-V4.1-Flash thực sự vận hành trên các khối lượng công việc khác nhau và vị trí của nó trong hệ thống của bạn.

DeepSeek trên đường biên Pareto DeepSWE

Chúng tôi đã đánh giá tiêu chuẩn DeepSWE để xem cách các mô hình cân bằng giữa độ chính xác và chi phí trên mỗi tác vụ.

Về chất lượng, bốn mô hình này thuộc cùng một phân khúc. Trên DeepSWE, cả bốn đều nằm trong khoảng cách 0,7 điểm về pass@1, và độ biến thiên giữa các lần chạy của chúng tôi là từ 1,4 đến 3,2 điểm, vì vậy không có mô hình nào trong nhóm này vượt trội hơn hẳn về chất lượng. Sự khác biệt hoàn toàn nằm ở chi phí: DeepSeek-V4.1-Flash trên Fireworks mang lại cùng mức độ chính xác với giá 0,43 USD mỗi tác vụ, thấp hơn 5,5 lần so với Gemini 3.8 Flash, thấp hơn 15 lần so với GPT-6 Astra và thấp hơn 28 lần so với Claude Opus 5.

Mô hình DeepSeek-V4.1-Flash mới thay đổi căn bản kinh tế học đơn vị của các tác vụ kỹ thuật phần mềm tự động. Việc chạy các quy trình đại lý (agent) lặp lại nhiều lần, quét lỗi đa vòng hoặc tạo thử nghiệm quy mô lớn trên các mô hình đóng đắt đỏ như GPT-6 Astra và Opus 5 sẽ nhanh chóng làm cạn kiệt ngân sách kỹ thuật. Với mức giá 0,43 USD mỗi tác vụ, các đại lý SWE cấp độ tiên phong trở nên khả thi như một cơ sở hạ tầng nền tảng liên tục. Với DeepSeek V4.1 Flash, giờ đây bạn có thể chạy 15 lượt lập trình tự động với chi phí chỉ bằng một lần gọi Astra.

Bên trong công nghệ: kiến trúc kích hoạt phân tách mới

DeepSeek-V4.1-Flash là mô hình nhỏ nhất trong dòng kiến trúc mới của DeepSeek và đi kèm với một số cải tiến về kiến trúc.

Nó bao gồm 552B tham số MoE với kiến trúc phân tách encoder–decoder mới. Trong kiến trúc này, thay vì một ngân sách kích hoạt cho toàn bộ quá trình truyền xuôi (forward pass), mô hình chia nó thành 8B tham số hoạt động cho đầu vào và 16B cho đầu ra. Điều này tạo ra một thiết kế hiệu quả hơn, dẫn đến mức tiêu thụ token kinh tế hơn.

Sự bất đối xứng đó phù hợp với cách các đại lý lập trình hoạt động. Một quỹ đạo đại lý điển hình rất nặng về đầu vào. Một đại lý lập trình thường đọc lại các tệp, đọc lại ghi chú cá nhân, đọc lại đầu ra của công cụ và tạo ra một bản vá tương đối nhỏ. Trong lần chạy DeepSWE của chúng tôi, mô hình tiêu thụ 36,9 triệu token đầu vào so với 211 nghìn token đầu ra, tỷ lệ 174:1. Kiến trúc này cho phép các nhà phát triển tiết kiệm một nửa chi phí tính toán ở phía đầu vào, nơi thường chiếm tỷ lệ phần trăm token lớn hơn.

Các tối ưu hóa KV cache

DeepSeek đã cải thiện việc sử dụng KV Cache trên DeepSeek-V4.1-Flash so với thế hệ DeepSeek V4 trước đó, chỉ tiêu thụ 1/4 dung lượng HBM và 1/8 dung lượng lưu trữ SSD.

Tối ưu hóa KV Cache mới này mở ra hiệu quả kinh tế tốt hơn cho các đại lý lập trình của bạn. Từ lần chạy DeepSWE, chúng tôi có các số liệu kinh tế sau:

99,6% token đầu vào trong lần chạy này là cache hit (truy cập bộ nhớ đệm thành công), và phí cho cache-hit chiếm 60% hóa đơn.

Hầu hết mọi người cho rằng kinh tế học đại lý của bạn chủ yếu là trả tiền cho những gì mô hình tạo ra. Tuy nhiên, trong một vòng lặp đại lý chạy dài, phần lớn chi phí đến từ việc đọc lại cùng một ngữ cảnh nhiều lần. Vòng lặp chi phí từ các tác vụ lặp lại này khiến việc giảm 4 lần bộ nhớ KV cache có tác động lớn hơn đến chi phí token của bạn. Nó nhắm trực tiếp vào yếu tố thúc đẩy chi phí lớn nhất trong thiết kế đại lý của bạn, đưa điểm số DeepSWE 74% xuống mức chi phí thấp hơn 15 lần. Việc giảm 8 lần chi phí SSD đóng vai trò bổ trợ cho tối ưu hóa HBM, bằng cách giữ tỷ lệ cache hit gần 99% trên các quỹ đạo dài.

Terminal-Bench 2.1: Kém Astra một điểm nhưng rẻ hơn 12 lần

Trên một tác vụ khác, chúng tôi thấy điều tương tự: DeepSeek-V4.1-Flash đang tiến gần đến ngưỡng tiên phong với chi phí chỉ bằng một phần nhỏ.

Kết quả trên Terminal-Bench 2.1 chỉ chênh lệch một điểm về chất lượng, nhưng kinh tế học lại khác biệt đáng kể. DeepSeek-V4.1-Flash sử dụng trung bình nhiều hơn khoảng 4 lần token đầu ra so với Astra, nghĩa là nó suy nghĩ lâu hơn và viết nhiều hơn. Kết quả là tối ưu hóa chi phí hơn 20 lần chỉ tính riêng giá đầu ra. Khi kết hợp mọi thứ, bao gồm đầu vào không có cache, cache hit và đầu ra, DeepSeek-V4.1-Flash mang lại chi phí thấp hơn 12 lần trên mỗi tác vụ với chất lượng gần như tương đương.

HLE và đánh giá bộ định tuyến oracle

Chúng tôi đã chạy một tác vụ tiêu chuẩn thứ ba, Humanity’s Last Exam, còn được gọi là HLE. Đây là một tiêu chuẩn đa phương thức để đo lường giới hạn của các LLM trên các môn học cấp độ sau đại học. Trong thử nghiệm này, chúng tôi cũng thực hiện một số đánh giá với các bộ định tuyến oracle (oracle routers), tương tự như những gì chúng tôi đã làm với Kimi K3 và DeepSeek V4 Pro. Nhắc lại nhanh: định tuyến oracle là một phương pháp đo lường hiệu suất lý thuyết tốt nhất bằng cách chạy tác vụ qua từng mô hình và sau đó chọn phương án đúng tối ưu về chi phí để thiết lập trần chi phí và hiệu suất.

Trên HLE, DeepSeek-V4.1-Flash đứng sau Astra khi chạy độc lập. Điều này cho thấy DeepSeek khi đứng một mình phù hợp hơn với các tác vụ lập trình đại lý như DeepSWE hơn là các tác vụ suy luận như HLE. Nếu khối lượng công việc của bạn chỉ là suy luận khoa học khó, đây có thể không phải là lựa chọn phù hợp.

Bộ định tuyến oracle là kết quả thú vị ở đây, cho thấy tầm quan trọng của định tuyến và các hệ thống đa mô hình. Bộ định tuyến oracle cho Astra cộng với DeepSeek V4.1 hoạt động tốt hơn so với chỉ riêng GPT-6 Astra. Sự khác biệt 4,4% này chỉ đạt được nếu V4.1-Flash trả lời đúng một tập hợp các câu hỏi có ý nghĩa mà Astra trả lời sai. Con số 34,52% không phải là tập con của 50,40%; hai mô hình thất bại ở các vấn đề khác nhau. Một điều cần cân nhắc là bộ định tuyến oracle là giới hạn trên khả thi cho ứng dụng của bạn. Một bộ định tuyến thực tế có thể không nắm bắt được toàn bộ sự khác biệt 4,4 điểm phần trăm, nhưng bộ định tuyến oracle cho thấy khả năng của một hệ thống các mô hình để đạt được kết quả tốt hơn một mô hình Astra độc lập.

Bắt đầu với DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash của Fireworks thiết lập một tiêu chuẩn chi phí-hiệu suất mới bằng cách đạt độ chính xác lập trình ngang bằng các mô hình hàng đầu như GPT-6 Astra với chi phí chỉ bằng 1/15 trên mỗi tác vụ. Thiết kế MoE 552B của nó sử dụng ngân sách kích hoạt đầu vào/đầu ra phân tách cùng với bộ nhớ đệm KV được nâng cấp giúp cắt giảm mức sử dụng HBM, mang lại hiệu quả kinh tế tốt hơn cho các đại lý lập trình của bạn. Nó tụt hậu trong các suy luận học thuật phức tạp (34,52% trên HLE so với 50,40% của Astra), nhưng vì nó giải quyết các vấn đề khác với Astra, việc kết hợp cả hai trong một hệ thống định tuyến sẽ đánh bại Astra khi đứng một mình với ngân sách chỉ bằng một phần nhỏ.

Dưới đây là cách bạn có thể bắt đầu xây dựng ngay hôm nay:

Bạn đang thử nghiệm trên khối lượng công việc của mình? Chúng tôi rất muốn nghe về trải nghiệm của bạn, vì vậy hãy gắn thẻ chúng tôi trên X (@FireworksAI_HQ) và cho chúng tôi biết bạn đang xây dựng những gì!

DeepSeekAI ModelsTối ưu chi phíGPT-6Fireworks AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Fireworks AI (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.