QbitAI
85

Tin ngành

Đột phá tách biệt PD: Tối ưu hóa hạ tầng tính toán, giảm 50% độ trễ và 40% chi phí

(giờ Việt Nam)

Tóm tắt AI

Báo cáo kỹ thuật mới nhất công bố giải pháp 'tiếp sức' giúp tối ưu hóa tài nguyên tính toán toàn quốc, giải quyết triệt để bài toán tách biệt PD với hiệu suất vượt trội.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-07-30 14:14:43 Nguồn: QbitAI

Báo cáo kỹ thuật đầy đủ mới nhất đã được công bố

Yun Zhong, đưa tin từ Aofeisi

QbitAI | Tài khoản chính thức QbitAI

Tại Hội nghị Trí tuệ Nhân tạo Thế giới WAIC 2026 vừa khép lại, Infinigence đã lần đầu tiên công bố bước đột phá mới trong kiến trúc hệ thống suy luận mô hình lớn (LLM) của mình – kiến trúc suy luận dị thể liên cụm PDD.

Hiện tại, báo cáo kỹ thuật đầy đủ đã có sẵn.

Địa chỉ báo cáo kỹ thuật: https://github.com/infinigence/pdd

Kiến trúc này sử dụng mạng Ethernet diện rộng (WAN) với hiệu năng chi phí cao để kết nối các trung tâm dữ liệu đồng nhất đã được xây dựng ở nhiều nơi, đồng thời cải tiến cấu trúc tách biệt P-D truyền thống thành kiến trúc suy luận ba tầng "P-RLD-MD".

Trong khi cho phép các phần cứng "lệch tủ" (chuyên biệt) chỉ thực hiện những tác vụ mà chúng giỏi nhất, kiến trúc này còn giải quyết triệt để điểm nghẽn về độ trễ truyền tải KV Cache trong môi trường Ethernet.

Dữ liệu đo đạc thực tế cho thấy, kiến trúc này giúp giảm 51,5% độ trễ Token đầu tiên, đồng thời giảm 37,5% chi phí cho mỗi Token.

Điều này không chỉ có nghĩa là trải nghiệm tốc độ của người dùng được cải thiện đáng kể, mà còn tối ưu hóa việc điều phối sức mạnh tính toán dị thể trên toàn mạng lưới, cho phép các tài nguyên cụm hiện có ở khắp nơi phát huy tối đa giá trị công nghiệp.

Hôm nay, đội ngũ suy luận của Infinigence sẽ lần đầu tiên chia sẻ toàn cảnh quá trình suy luận thiết kế của kiến trúc này, khôi phục chuyên sâu các lộ trình tư duy và chi tiết kỹ thuật đằng sau sự đổi mới.

Lý tưởng và thực tế của suy luận dị thể liên cụm

Trong năm qua, chi phí và hiệu quả của việc suy luận mô hình lớn đã trở thành "lằn ranh sinh tử" mà toàn ngành phải đối mặt.

Sự đồng thuận trong ngành là: Suy luận LLM tồn tại hai giai đoạn với đặc tính hoàn toàn khác biệt là Prefill (tiền điền, tập trung vào tính toán) và Decode (giải mã, tập trung vào truy cập bộ nhớ).

Giải pháp lý tưởng nhất về mặt lý thuyết là lộ trình "tách biệt dị thể": Để các card có sức mạnh tính toán mạnh đảm nhận Prefill, và các card có băng thông bộ nhớ cao đảm nhận Decode.

Nhưng thực tế lại rất khắc nghiệt.

Để xây dựng tài nguyên tính toán dị thể quy mô lớn trong cùng một cụm, không chỉ chi phí mua sắm cực kỳ đắt đỏ, mà một khi kiến trúc mô hình thay đổi, các phần cứng với tỷ lệ cố định này sẽ rất dễ rơi vào tình trạng nhàn rỗi cục bộ.

Vì vậy, một ý tưởng tự nhiên đã nảy sinh:

Tại sao không kết nối các cụm đồng nhất đã được xây dựng sẵn ở khắp nơi bằng mạng Ethernet diện rộng chi phí thấp để thực hiện suy luận tách biệt dị thể liên cụm?

Ý tưởng này tưởng chừng như thuận nước đẩy thuyền, nhưng khi đưa vào thực tiễn kỹ thuật, nó ngay lập tức đâm sầm vào một "bức tường than thở" – đó là nút thắt về băng thông và độ trễ khi truyền tải KV Cache liên cụm.

Kiến trúc PDD chính xác được thiết kế để vượt qua bài toán khó này.

Tuy nhiên, trước khi đi sâu vào chi tiết thiết kế và triển khai của kiến trúc này, chúng tôi muốn chia sẻ với các bạn một vài "quy luật nền tảng" cực kỳ quan trọng mà đội ngũ Infinigence đã phát hiện trong nghiên cứu sơ bộ, đây cũng là tiền đề cốt lõi để toàn bộ giải pháp P liên cụm có thể tồn tại.

Điểm đau và thấu hiểu: Sự "lệch tủ" của phần cứng và "quy luật 80/20" của lưu lượng

Để hiểu thiết kế của PDD, cần bắt đầu từ ba thông tin chi tiết (Insights) cốt lõi mà Infinigence đã tiết lộ trong phần Bối cảnh của báo cáo kỹ thuật PDD.

Thông tin 1: Sự "lệch tủ" cực đoan về hiệu năng phần cứng

Nhu cầu về tài nguyên phần cứng của hai giai đoạn Prefill và Decode trong suy luận LLM là hoàn toàn trái ngược nhau. Đội ngũ Infinigence cũng phát hiện trong các bài kiểm tra chuẩn nội bộ rằng hiệu năng của chip cực kỳ "lệch tủ":

Lấy một GPU hiệu năng cao hàng đầu 8 card làm chuẩn, chip E của một nhà sản xuất nhất định khi xử lý giai đoạn Prefill tập trung vào tính toán chỉ đạt khoảng 81% hiệu năng chuẩn; nhưng ở giai đoạn Decode tập trung vào truy cập bộ nhớ, nó lại có thể bùng nổ đạt tới 210% hiệu năng chuẩn.

△ Kết quả kiểm tra hiệu năng của các phần cứng khác nhau trong giai đoạn tiền điền và giải mã

Nếu đặt những loại chip "lệch tủ" này vào các cụm đồng nhất, vừa phải gánh tính toán Prefill vừa phải làm đầu ra Decode, không những không phát huy được lợi thế sở trường mà còn kéo lùi hiệu quả tổng thể của giai đoạn Prefill.

Phát hiện này đã thúc đẩy mạnh mẽ ý tưởng của đội ngũ Infinigence về việc tách rời Prefill và Decode, triển khai riêng biệt trên các phần cứng phù hợp nhất với chúng.

Thông tin 2: Băng thông gấp 10 lần nhờ công nghệ DRC

Chỉ cân nhắc tính toán và truy cập bộ nhớ là chưa đủ, việc truyền tải lượng lớn KV Cache liên cụm sẽ ngay lập tức "ngốn" sạch băng thông mạng diện rộng.

May mắn thay, nghiệp vụ Agent có một đặc điểm nổi bật: tỷ lệ trúng bộ nhớ đệm tiền tố (prefix cache) cực cao.

Tận dụng đặc tính này, đội ngũ đã triển khai bộ nhớ đệm tiền tố RadixCache (gọi tắt là DRC) ở phía Decode.

Nói một cách đơn giản, DRC sẽ lưu trữ KV Cache của các yêu cầu lịch sử trên thực thể Decode.

Khi phía Prefill phát hiện một yêu cầu trúng bộ nhớ đệm tiền tố, nó không cần phải truyền toàn bộ KV Cache của ngữ cảnh đó, mà chỉ cần truyền phần "gia tăng" nhỏ bé đó là đủ.

Hạ tầng AIĐiện toán đám mâyTối ưu chi phíCông nghệ mớiHiệu năng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.