Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Thủ thuật

Mô hình 4B dùng Castform: Hiệu suất ngang ngửa GPT-5.6 Sol với chi phí rẻ gấp 100 lần

(giờ Việt Nam)

Tóm tắt AI

Nhờ kỹ thuật hậu huấn luyện Castform, mô hình mã nguồn mở 4B đạt độ chính xác tương đương GPT-5.6 Sol trong các tác vụ truy xuất thông tin, nhưng tiết kiệm chi phí gấp 100 lần và giảm đáng kể độ trễ.

Bản dịch AI

How Castform + Neon Beats Frontier Models on Price and EfficiencyComparison of Castform fine-tune and frontier models by inference cost and mean evaluation reward

“Dữ liệu huấn luyện tốt nhất của hầu hết các đội ngũ vẫn đang nằm im trong cơ sở dữ liệu của họ. Vấn đề là việc biến dữ liệu thô thành thứ có thể sử dụng được rất khó khăn, và việc cho phép các agent đọc, tìm kiếm và thay đổi dữ liệu với chi phí thấp ở quy mô lớn đòi hỏi hạ tầng tiên tiến. Sử dụng Castform kết hợp với Neon giúp bỏ qua cả hai rào cản này.”

Một "agent tốt" cần phải mạnh ở 2 lĩnh vực:

Neon (Lakebase Postgres) cùng các tiện ích mở rộng Search mới của họ giải quyết vấn đề thứ nhất; Castform giải quyết vấn đề thứ hai.

Khoảng năm 2022, ngành công nghiệp đã dồn toàn lực vào tìm kiếm nhúng (embedding search). Mọi nhà cung cấp cơ sở dữ liệu đều bổ sung tính năng này, và pgvector là tiện ích mở rộng được tải xuống nhiều nhất của Neon. Để cung cấp ngữ cảnh cho các LLM, các kỹ sư đã tự xây dựng các pipeline RAG thủ công, về bản chất, đó là một dạng tìm kiếm tương đồng nhúng.

Khoảng năm 2025, các agent bắt đầu thu hút được nhiều sự chú ý hơn. Các nhà phát triển bắt đầu tạo ra các quy trình tìm kiếm đa chặng (multi-hop), phân tách các vấn đề lớn thành những vấn đề nhỏ hơn. Việc truy xuất đã chuyển từ các hệ thống tìm kiếm một lần (one-shot) sang truy xuất theo kiểu agent (agentic retrieval). Thay vì đưa ra một truy vấn duy nhất, các mô hình lập kế hoạch và tìm kiếm nhiều lần trong một vòng lặp. Mỗi lần lặp lại trong vòng lặp đồng nghĩa với một lệnh gọi khác đến mô hình tiên phong (frontier model), làm tăng chi phí tổng thể và độ trễ trên mỗi yêu cầu của người dùng.

Comparison of a traditional RAG pipeline and an agentic search workflow

Cụ thể, một yêu cầu tìm kiếm đa lượt điển hình với gpt-5.6-sol mất hơn 10 giây và tốn khoảng 0,03 USD cho toàn bộ quy trình, khiến nó trở nên quá chậm và đắt đỏ.

Trong khi đó, các mô hình mã nguồn mở nhỏ hơn lại rẻ hơn gấp 100 lần. Tuy nhiên, nếu dùng ngay (out of the box), khả năng của chúng vẫn thua kém các mô hình API đóng. Việc hậu huấn luyện bằng RL (RL post-training) giúp thu hẹp khoảng cách này. Đối với các tác vụ cụ thể như tìm kiếm, các mô hình mã nguồn mở đã qua hậu huấn luyện có thể sánh ngang và vượt qua các mô hình tiên phong trong khi chi phí trên mỗi yêu cầu thấp hơn hàng chục lần.

Đó là lý do chúng tôi xây dựng Castform: để giúp các nhà phát triển hậu huấn luyện mô hình bằng RL mà không cần phải xử lý các kiến thức chuyên sâu về học máy và GPU. Mục tiêu là làm cho việc hậu huấn luyện trở nên dễ tiếp cận như kỹ thuật prompt (prompt engineering).

Pipeline của Castform chạy trên Neon thông qua Lakebase Search:

Để thực hiện hậu huấn luyện RL hiệu quả, bạn cần một tác vụ (ví dụ: trả lời câu hỏi của người dùng), môi trường để agent chạy (ví dụ: công cụ tìm kiếm cho kho dữ liệu của bạn) và một hàm thưởng (ví dụ: câu trả lời có đúng không?).

Với cả 3 thành phần này, hậu huấn luyện RL là một vòng lặp thử và sai: mô hình thực hiện tác vụ với các công cụ được cung cấp, hàm thưởng chấm điểm nỗ lực đó, và tín hiệu phản hồi sẽ hướng dẫn mô hình cách tối ưu hóa hiệu suất.

Tuy nhiên, hầu hết các công ty không có sẵn một tập dữ liệu sạch gồm các tác vụ và hàm thưởng để phục vụ hậu huấn luyện.

Các doanh nghiệp thực sự sở hữu một lượng lớn dữ liệu độc quyền:

Dữ liệu này chứa kiến thức mà một agent cần, nhưng việc biến nó thành một tập dữ liệu huấn luyện hiệu quả thường đòi hỏi kỹ thuật dữ liệu và gắn nhãn thủ công đáng kể.

Điều đó khiến nhiều đội ngũ từ bỏ việc hậu huấn luyện vì một trong hai lý do:

Castform giải quyết cả hai vấn đề trên. Nó biến kho dữ liệu hiện có thành các tác vụ huấn luyện, sau đó quản lý vòng lặp RL cần thiết để dạy một mô hình mã nguồn mở cách sử dụng dữ liệu đó một cách hiệu quả.

Với Castform, bạn có thể biến cơ sở tri thức của công ty mình thành một mô hình:

Với tập dữ liệu câu hỏi-trả lời đã tạo, Castform cho phép bạn thiết lập quy trình huấn luyện bằng cách chỉ định các công cụ mà agent có quyền truy cập và một hàm thưởng.

Hàm thưởng xác định những gì bạn muốn mô hình của mình đạt được. Trong trường hợp của chúng tôi, chúng tôi muốn nó truy xuất đúng các đoạn văn bản, trích dẫn đúng nguồn và cung cấp câu trả lời cuối cùng chính xác.

Xem ví dụ mã nguồn đầy đủ tại đây.

Castform cung cấp cho bạn khả năng quan sát toàn diện quá trình chạy RL. Bạn có thể theo dõi sự cải thiện điểm thưởng qua từng bước, nhưng quan trọng hơn, bạn có thể đi sâu vào từng tác vụ/prompt cụ thể để xem mô hình thực hiện như thế nào về mặt chất lượng, cho phép bạn gỡ lỗi các vấn đề như công cụ bị hỏng hoặc "hack" phần thưởng (reward hacking).

Để biết thêm chi tiết về cách theo dõi quá trình huấn luyện, bạn có thể xem blog của Castform tại đây. Bạn cũng có thể xem ví dụ về quá trình huấn luyện của chúng tôi tại đây.

Average reward over training steps

Trong quá trình huấn luyện, agent liên tục gọi Lakebase Search cho đến khi có đủ ngữ cảnh để trả lời. Với hàng ngàn lượt chạy song song, mỗi lượt có khả năng thực hiện hàng chục lệnh gọi, điều này tạo ra một khối lượng công việc bùng nổ (bursty workload).

Neon CPU allocation and usage during a Castform training run

Khả năng mở rộng tính toán linh hoạt của Neon hấp thụ các đỉnh tải này mà không yêu cầu Castform phải cung cấp dung lượng tối đa suốt ngày đêm. Các đợt huấn luyện nhận được khả năng tìm kiếm độ trễ thấp khi nhu cầu tăng cao, trong khi tài nguyên tính toán sẽ giảm xuống trong thời gian nhàn rỗi.

Hạ tầng này càng trở nên giá trị hơn khi các agent vượt ra ngoài phạm vi tìm kiếm và bắt đầu sửa đổi dữ liệu. Việc huấn luyện các agent có trạng thái (stateful agents) đòi hỏi các môi trường biệt lập có thể được tạo và đặt lại với chi phí thấp, ngăn chặn các hành động của một lượt chạy ảnh hưởng đến lượt khác hoặc tác động đến môi trường sản xuất.

Tính năng phân nhánh (branching) của Neon có thể cung cấp cho mỗi lượt chạy một trạng thái cơ sở dữ liệu biệt lập, trong khi các truy vấn du hành thời gian (time-travel queries) giúp tái tạo và kiểm tra trạng thái mà agent đã gặp phải. Kết hợp với tính năng tự động mở rộng và thu nhỏ về 0 (scale-to-zero), điều này tạo ra con đường để huấn luyện hàng ngàn lượt chạy agent có trạng thái mà không cần duy trì hàng ngàn môi trường chạy liên tục.

Castform giúp bất kỳ nhà phát triển nào cũng có thể dễ dàng hậu huấn luyện các mô hình mã nguồn mở để trở nên rẻ hơn, nhanh hơn và tốt hơn các mô hình tiên phong. Hãy hậu huấn luyện mô hình đầu tiên của bạn ngay hôm nay tại castform.com.

Mô hình ngôn ngữTối ưu chi phíRAGCastformMã nguồn mở
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.