Nghiên cứu
Moore Threads công bố giải pháp Prefill-as-a-Service trên MTT S5000, tối ưu chi phí suy luận văn bản dài
(giờ Việt Nam)
Tóm tắt AI
Moore Threads ra mắt sách trắng về kiến trúc 'Prefill-as-a-Service' dựa trên card đồ họa MTT S5000, giúp giải quyết bài toán chi phí cao trong các tác vụ suy luận AI với ngữ cảnh cực dài như AI Agent và phân tích tài liệu.
Bản dịch AI
IT ngày 24 tháng 8 đưa tin, Moore Threads chính thức phát hành "Sách trắng kỹ thuật MTT S5000 Prefill-as-a-Service", công bố xây dựng mô hình mới "Prefill As a Service" dựa trên card tính toán thông minh huấn luyện và suy luận AI hàng đầu MTT S5000. Hướng tới các kịch bản suy luận ngữ cảnh dài như AI Agent, tạo mã nguồn và phân tích tài liệu siêu dài, giải pháp này cung cấp cho ngành một lộ trình khả thi, cân bằng giữa hiệu suất suy luận, kiểm soát chi phí và tối ưu hóa khả năng sinh lời của năng lực tính toán.

Theo giới thiệu của Moore Threads, khi quy mô ngữ cảnh đầu vào của các mô hình lớn (Large Models) nhanh chóng tiến tới mức hàng trăm K đến 1M, áp lực về tiêu thụ năng lực tính toán và độ trễ ký tự đầu tiên (TTFT) do văn bản dài mang lại đang không ngừng gia tăng, dần trở thành nút thắt cổ chai quan trọng hạn chế hiệu suất dịch vụ suy luận và tổng chi phí sở hữu (TCO) của doanh nghiệp. Mô hình triển khai năng lực tính toán trên các cụm đồng nhất truyền thống đã không còn đáp ứng được nhu cầu khác biệt về tài nguyên phần cứng trong các giai đoạn tính toán khác nhau.
Điểm đau cốt lõi nằm ở sự sai lệch về cấu trúc: Trong suy luận trực tuyến của mô hình lớn, giai đoạn đầu vào Prefill (tiền điền) là tác vụ thâm dụng tính toán, bị ràng buộc bởi năng lực tính toán dấu phẩy động; giai đoạn đầu ra Decode (giải mã) là tác vụ thâm dụng truy cập bộ nhớ, bị ràng buộc bởi băng thông bộ nhớ đồ họa (VRAM).
Việc chạy hỗn hợp cả hai trong cùng một nhóm tài nguyên vật lý tất yếu dẫn đến sự lãng phí hai chiều — nếu chọn cấu hình theo băng thông Decode, thì bộ nhớ đồ họa dung lượng lớn của Prefill sẽ bị lãng phí trong thời gian dài; nếu chọn theo năng lực tính toán của Prefill, thì các đơn vị tính toán Decode sẽ rơi vào tình trạng nhàn rỗi trên diện rộng. "Sách trắng" chỉ ra rằng, chìa khóa để phá vỡ nút thắt này nằm ở việc tách rời hoàn toàn Prefill và Decode, cho phép mỗi bên vận hành trên nhóm tài nguyên phần cứng phù hợp nhất với đặc tính tính toán của chính nó:
Nhóm năng lực tính toán Prefill: Chuyên biệt cho hiệu suất sử dụng tính toán cao và độ trễ ký tự đầu tiên (TTFT) cực thấp;
Nhóm tài nguyên Decode: Chuyên biệt cho khả năng đồng thời cao và độ trễ trên mỗi Token (ITL) ổn định.
Thông qua việc đầu tư phân tầng phần cứng, cấu hình năng lực tính toán chuyển dịch từ "dư thừa phổ quát" sang "khớp theo nhu cầu", từ đó đạt được mục tiêu giảm chi phí hạ tầng trên mỗi Token trong khi vẫn đảm bảo các ràng buộc về chất lượng dịch vụ (SLO).
IT đính kèm toàn văn sách trắng như sau:
"Sách trắng kỹ thuật MTT S5000 Prefill-as-a-Service"
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.