Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
88

Thủ thuật

So sánh Kimi K3 và Fable 5: Mô hình mã nguồn mở giúp giảm chi phí vận hành tới 50 lần

(giờ Việt Nam)

Tóm tắt AI

Thử nghiệm trên 1.000 tác vụ cho thấy Kimi K3 đạt hiệu suất ngang ngửa Fable 5 nhưng với chi phí thấp hơn 50 lần. Việc kết hợp thông minh giữa hai mô hình giúp duy trì độ chính xác 93% trong khi tối ưu hóa đáng kể ngân sách.

Bản dịch AI

K3 là một mô hình mở chất lượng hàng đầu với chi phí chỉ bằng một phần nhỏ. Quan trọng hơn, nó bổ trợ cho Fable một cách đầy dự đoán, giúp đạt được trí tuệ nhân tạo chất lượng cao nhất thông qua việc điều hướng tác vụ (routing tasks).

🧭 Tóm tắt: Chúng tôi đã chạy thử nghiệm Kimi K3 (mở) so với Fable 5 (đóng) trên khoảng 1.000 tác vụ đại lý (agentic tasks) và nhận thấy:

Cách chúng tôi đo lường

Chúng tôi lấy trung bình các điểm chuẩn (benchmarks), mỗi cái nhắm vào một loại công việc khác nhau, và chạy K3 cùng Fable 5 qua cùng một hệ thống kiểm thử. Tổng cộng có khoảng 1.030 tác vụ trong các vòng lặp đại lý thực tế.

Một định nghĩa nhanh trước khi đi vào kết quả. Oracle routing là phương pháp đo lường hiệu suất lý thuyết tốt nhất bằng cách chạy tác vụ qua từng mô hình, sau đó chọn phương án đúng với chi phí thấp nhất (giới hạn về chi phí/hiệu suất). Trong một bộ điều hướng (router) thực tế, bạn không thể chạy tác vụ của mình trên nhiều mô hình cùng lúc. Bộ điều hướng sẽ dự đoán mô hình nào có sự cân bằng tốt nhất giữa chi phí và chất lượng, nhưng cuối cùng đó vẫn chỉ là một sự phỏng đoán.

Trong nghiên cứu này, oracle routing cho thấy K3 được chọn cho 72-96% các tác vụ. Điều này gợi ý rằng một bộ điều hướng gần như hoàn hảo có thể đạt được bằng cách học sự khác biệt giữa các tác vụ hàng ngày và các tác vụ chuyên sâu (long tail) thực sự. Sẽ cần thêm dữ liệu điều hướng lớn hơn gấp nhiều lần và hiệu suất thực tế để khẳng định điều này.

K3 là một mô hình tốt.

Nhìn từ góc độ tổng quan, rất dễ để nhìn vào cả hai mô hình và coi kết quả đối đầu là hòa. Ví dụ, nếu nhìn vào SWE, điểm chuẩn tiêu đề, K3 đạt 92,4%, Fable 92,6%. Trên năm loại tác vụ mà chúng tôi đã đo lường, hai mô hình có xu hướng chênh lệch nhau chỉ vài điểm, với Fable nhỉnh hơn một chút về độ rộng ngôn ngữ lập trình (Multi-lang).

Dễ dàng để dừng lại ở đó và nói "chúng ngang ngửa nhau". Tin tức ở đây là chúng có hiệu suất vượt trội rõ rệt trên các loại tác vụ khác nhau.

Hai mô hình tốt hơn một

Nếu bạn nhìn sâu vào một điểm chuẩn duy nhất, sẽ thấy nhiều thứ hơn là chỉ con số độ chính xác cao nhất. Hãy lấy SWE, nơi cả hai ngang bằng nhau về tổng thể. Nếu bạn chia SWE theo lĩnh vực vấn đề, bạn có thể thấy thế mạnh của từng mô hình. K3 sắc bén nhất về toán học biểu tượng và công cụ phát triển (dev tooling); Fable thắng ở mảng web và trực quan hóa dữ liệu. Mô hình tương tự diễn ra trong tập đa ngôn ngữ, nơi sự đa dạng của Fable chiếm ưu thế ở Java, Python và C++, trong khi K3 cân bằng ở JavaScript và Rust.

Đối với công việc dài hạn tại terminal, điều khiển shell và can thiệp vào hệ thống qua hàng chục lượt, K3 đã thể hiện bản lĩnh thực sự. Nó đã hoàn thành một loạt tác vụ mà Fable chưa bao giờ giải quyết được: băm 7z, phân tích mật mã FEAL, các bí mật bị rò rỉ, lỗ hổng bảo mật trực tiếp, các tác vụ bất đồng bộ bị lỗi.

K3 có thể có chi phí thấp hơn tới 50 lần trên Fireworks. 🫳🎤

Trong khi chất lượng gần như ngang bằng ở mức tổng thể, giá cả thì không hề gần nhau.

Vậy khoảng cách giá khổng lồ này đến từ đâu? Từ giá token, bộ nhớ đệm prompt (prompt caching) và nỗ lực trên mỗi tác vụ. Ví dụ, trên SWE, K3 làm việc vất vả hơn nhiều so với Fable: khoảng 55 lượt và 1,3 triệu token mỗi tác vụ so với 21 lượt và 130 nghìn token. Đối với các tác vụ terminal dài hạn thì ngược lại: Fable mới là bên bị xoáy sâu, chạy tới 64 lượt và 1,5 triệu token (đôi khi dẫn đến quá thời gian chờ).

Prompt caching đóng vai trò chính trong việc biến nỗ lực đó thành lợi thế về giá của K3: ngay cả khi K3 đọc số lượng token gấp mười lần, với các lần truy cập bộ nhớ đệm (cache hits), chi phí chạy SWE vẫn thấp hơn Fable. Có một sự đánh đổi. Các tác vụ có thêm lượt thường có nghĩa là thời gian thực tế mỗi lần chạy lâu hơn, tức là chạy chậm hơn. Nếu bạn cần câu trả lời trong hai giây, điều đó rất quan trọng; nếu bạn đang chạy các đại lý ở quy mô lớn trong nền, một hóa đơn chỉ bằng một phần nhỏ sẽ quan trọng hơn nhiều.

Đừng chọn một mô hình. Hãy điều hướng (Route).

Nếu bạn gửi mọi tác vụ đến nơi xử lý tốt nhất, bạn sẽ không dừng lại ở mức trung bình giữa hai mô hình, mà bạn sẽ vượt lên trên cả hai.

Điều hướng theo từng tác vụ luôn mang lại hiệu suất cao hơn bất kỳ mô hình đơn lẻ nào:

Oracle router chọn K3 cho 72-96% lưu lượng tác vụ. Bằng cách thiết kế bộ điều hướng theo cách này, bạn đạt được chất lượng tổng thể vượt trội hơn bất kỳ mô hình nào đứng riêng lẻ với chi phí gần bằng việc chỉ sử dụng mô hình tối ưu chi phí.

K3 được tối ưu hóa chi phí trên tất cả các loại công việc.

Đặt cả chất lượng và chi phí lên một biểu đồ. K3 màu xanh nằm bên trái (phía tiết kiệm chi phí hơn) so với Fable màu đỏ trong cả năm nhóm tác vụ. Độ chính xác thay đổi qua lại: Fable dẫn trước về đa ngôn ngữ, K3 về terminal và pháp lý, các phần còn lại gần như ngang bằng.

Các mô hình đơn lẻ là sự lãng phí và không còn là SOTA (công nghệ tiên tiến nhất).

Kimi K3 + Fable được điều hướng cùng nhau sẽ mở khóa những phẩm chất tốt nhất của chúng với mức giá tốt nhất.

Thời đại của nhà cung cấp mô hình đơn lẻ và tối đa hóa token đang dần kết thúc. Dữ liệu cấp tác vụ cho thấy các mô hình này là những chuyên gia với mức giá rất khác nhau. AI tốt nhất không còn đến từ một phòng thí nghiệm duy nhất, mà là sự kết hợp của nhiều mô hình.

Điều này có nghĩa là gì trong thực tế:

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.