Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
88

Mô hình

Cactus ra mắt Gemma 4 Hybrid: Tự động đánh giá độ tin cậy và tối ưu hóa chi phí cho AI

(giờ Việt Nam)

Tóm tắt AI

Cactus giới thiệu mô hình lai dựa trên Gemma 4, tích hợp bộ dò độ tin cậy để tự động quyết định xử lý tại chỗ hoặc chuyển tiếp sang mô hình lớn hơn. Giải pháp này giúp cân bằng hiệu năng và chi phí, đạt kết quả vượt trội so với các phương pháp truyền thống.

Bản dịch AI

GitHub - cactus-compute/cactus-hybrid: On-device models that know when they're wrong: every answer carries a confidence score for cloud handoff.

Một mô hình nhỏ chạy trên thiết bị (on-device) có ưu điểm là nhanh và riêng tư, nhưng đôi khi vẫn đưa ra kết quả sai. Tại Cactus, chúng tôi thực hiện huấn luyện hậu kỳ (post-train) cho các mô hình để chúng tự nhận biết khi nào câu trả lời bị sai: chúng tôi tích hợp các "probe" (bộ dò) vào bên trong checkpoint, giúp chấm điểm mọi câu trả lời với độ tin cậy từ 0 đến 1, được trả về dưới dạng dữ liệu có cấu trúc (không bao giờ được phân tách từ văn bản câu trả lời). Hãy phản hồi trên thiết bị khi độ tin cậy cao; bạn có thể chuyển hướng sang một mô hình lớn hơn khi độ tin cậy thấp:

Chúng tôi bắt đầu triển khai với Gemma 4 E2B Hybrid, tất cả các bản build đều có sẵn trong bộ sưu tập Cactus Hybrid trên Hugging Face.

Gemma 4 E2B Hybrid, mô hình Gemma nhỏ nhất, đạt hiệu suất tương đương Gemini 3.1 Flash-Lite trên các tiêu chuẩn đánh giá phổ biến bằng cách chỉ chuyển hướng 15–55% truy vấn sang Gemini 3.1 Flash-Lite và tự xử lý phần còn lại.

Cactus

MLX

Transformers

Hãy tải mô hình với lệnh.to(device) tường minh, không dùng device_map="auto": các probe sẽ chấm điểm các thế hệ (generations) bên ngoài đường dẫn forward của module, vì vậy các trọng số giúp tăng tốc offload (để lại trên thiết bị meta) sẽ gây lỗi khi đọc độ tin cậy.

llama.cpp

llama.cpp được viết bằng C++, vì vậy probe là một bản vá (patch) mà bạn biên dịch vào engine (xem tại patches/llama.cpp/). Hãy build server đã vá một lần:

Sau đó, phục vụ và truy vấn nó giống như bất kỳ llama-server nào — phản hồi sẽ mang theo một trường độ tin cậy (confidence field) ở cấp cao nhất:

Chất lượng định tuyến (AUROC)

AUROC của Gemma 4 E2B Hybrid đo lường mức độ hiệu quả của việc phân tách các câu trả lời sai khỏi câu trả lời đúng (càng cao càng tốt, 0.5 là ngẫu nhiên, 1.0 là hoàn hảo):

Kết quả ấn tượng nhất: probe được huấn luyện mà không có dữ liệu âm thanh nào, nhưng vẫn đạt AUROC từ 0.79–0.88 trên bốn tiêu chuẩn đánh giá âm thanh (hai tiêu chuẩn về phiên mã, một về trắc nghiệm âm thanh, một về phiên mã ngoài miền dữ liệu).

Điều này loại bỏ các giải thích ở mức bề mặt, probe đang đọc tín hiệu về độ chính xác độc lập với phương thức (modality-independent) từ trạng thái ẩn (hidden state), chứ không phải ghi nhớ các mẫu từ dữ liệu huấn luyện.

Giấy phép MIT. Việc sử dụng mô hình Gemma phải tuân theo các điều khoản của Gemma.

Gemma 4AI trên thiết bịTối ưu hóa AIMô hình laiCactus
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.