Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Sản phẩm

Cerebras ra mắt nền tảng suy luận tốc độ siêu nhanh: Qwen 27B đạt 1500 tokens/giây

(giờ Việt Nam)

Tóm tắt AI

Cerebras bổ sung Qwen 27B và GPT-OSS 120B vào danh mục mô hình, mang lại tốc độ suy luận ấn tượng lên tới 1500-3000 tokens/giây, hỗ trợ cửa sổ ngữ cảnh lớn.

Bản dịch AI

Model Catalog - Cerebras Inference

Duyệt qua tất cả các mô hình hiện có trên các public endpoints của Cerebras.

Các mô hình trên public endpoints của Cerebras khả dụng cho cả gói dùng thử miễn phí (free trial) và gói trả phí theo mức sử dụng (pay-as-you-go), tùy thuộc vào giới hạn tốc độ và bảng giá. Để biết thêm về các dòng mô hình khác, dung lượng dự trữ, lưu lượng cao hơn và SLA sản xuất, vui lòng xem Dedicated Endpoints.

Các mô hình khả dụng

Nén mô hình (Model Compression)

Phần này cung cấp thông tin minh bạch về trạng thái nén của từng mô hình có sẵn trên nền tảng của chúng tôi. Chúng tôi lưu trữ nhiều mô hình mã nguồn mở từ cộng đồng. Hiện tại, chúng tôi không lưu trữ các mô hình đã cắt tỉa (pruned models) trên các public endpoints. Tất cả các mô hình được cung cấp thông qua public endpoints của chúng tôi đều là phiên bản gốc, chưa qua cắt tỉa. Mặc dù chúng tôi đang thực hiện nghiên cứu về các kỹ thuật cắt tỉa như REAP (Router-weighted Expert Activation Pruning), các mô hình đã cắt tỉa này được chia sẻ với cộng đồng nghiên cứu trên Hugging Face chứ không khả dụng thông qua API dùng chung của chúng tôi. Bạn có thể đọc thêm về REAP trong blog nghiên cứu của chúng tôi. Tất cả các mô hình công khai của chúng tôi đều không bị cắt tỉa. Cerebras chỉ sử dụng kỹ thuật lượng tử hóa trọng số (weight-only quantization) có chọn lọc trong quá trình lưu trữ để bảo toàn chất lượng tối đa. Điều này có nghĩa là các trọng số được lưu trữ ở định dạng 16-bit / 8-bit / 4-bit một phần, phù hợp với các tiêu chuẩn ngành. Để đảm bảo chất lượng, các lớp nhạy cảm được lưu trữ ở độ chính xác đầy đủ (full precision) với quá trình giải lượng tử hóa (dequantization) diễn ra ngay lập tức, vì vậy các thao tác được thực hiện ở độ chính xác cao. Các kích hoạt (activations), cơ chế chú ý (attention) và kv cache vẫn giữ nguyên độ chính xác đầy đủ và không bị lượng tử hóa.

Các câu hỏi thường gặp

Các bạn có thay đổi kiến trúc của mô hình mà không thông báo trước không?

Không. Chúng tôi cam kết cung cấp các mô hình gốc cho tất cả các endpoint hiện có mà không thực hiện bất kỳ sửa đổi nào. Chúng tôi không thay đổi kiến trúc mô hình thông qua việc cắt tỉa trên danh mục sản phẩm được lưu trữ của mình. Nếu chúng tôi khám phá thêm các kỹ thuật nén khác (như cắt tỉa) trong tương lai, chúng sẽ được cung cấp dưới dạng các endpoint riêng biệt với tên gọi cụ thể cho việc cắt tỉa, đảm bảo tính minh bạch hoàn toàn và cho phép bạn chọn phiên bản phù hợp nhất với nhu cầu của mình.

Tôi có thể tìm thấy các mô hình đã cắt tỉa bằng REAP của các bạn ở đâu?

Các mô hình đã cắt tỉa bằng REAP của chúng tôi có sẵn trên Hugging Face cho mục đích nghiên cứu và thử nghiệm: Cerebras REAP Collection. Các mô hình này thể hiện kết quả nghiên cứu về cắt tỉa của chúng tôi nhưng không được cung cấp thông qua API sản xuất.

Nén, lượng tử hóa và cắt tỉa là gì?

Nén là thuật ngữ bao quát cho các kỹ thuật giúp giảm kích thước mô hình hoặc yêu cầu tính toán. Các kỹ thuật nén phổ biến bao gồm:

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.