Ngành
Card đồ họa PCIe bị đánh giá thấp: Tối ưu nhân và tái cấu trúc giao tiếp giúp DeepSeek tăng tốc suy luận gấp 7 lần
(giờ Việt Nam)
Tóm tắt AI
Nhờ cải tiến kỹ thuật, hệ thống sử dụng 1,5 card 6000D đã vượt qua hiệu suất của 1 card B300 trong tác vụ suy luận DeepSeek.
Chính văn · Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
24-09-2026 22:17:48 Nguồn: QbitAI
1,5 card 6000D vượt mặt 1 card B300!
Yun Zhong, đưa tin từ Ao Feisi, QbitAI | Tài khoản chính thức QbitAI
Khi nhu cầu về sức mạnh tính toán cho các mô hình lớn (LLM) liên tục tăng cao, chi phí mua sắm và các hạn chế về nguồn cung GPU ngày càng trở nên trầm trọng.
Cuộc cạnh tranh trong lĩnh vực suy luận AI (AI inference) đang âm thầm chuyển hướng: không còn đơn thuần là cuộc đua "ai mua được phần cứng hiệu năng cao nhất", mà chuyển sang "ai có thể tận dụng tối ưu nguồn lực tính toán hiện có".
Với nhiều loại card GPU, các framework mã nguồn mở có thể thực hiện tải mô hình, tải trọng số (weights), khởi chạy dịch vụ và đạt trạng thái "chạy được", nhưng hiệu năng thực tế khi kiểm thử áp lực (stress test) thường thấp hơn nhiều so với thông số quảng cáo. Bản thân mô hình không lỗi, phần cứng vẫn hoạt động bình thường, nhưng cốt lõi của sự sụt giảm hiệu năng nằm ở khoảng cách hiệu suất giữa framework mô hình và phần cứng.
Những loại card GPU này thiếu kết nối tốc độ cao giữa các card và không nằm trong ma trận xác thực chính thức của các framework mã nguồn mở phổ biến. Nếu sử dụng trực tiếp các phương án triển khai mặc định của cộng đồng, sẽ phát sinh hàng loạt vấn đề như: toán tử tự động quay lui (fallback) về các cài đặt chung kém hiệu quả, giao tiếp tập thể vẫn sử dụng các tham số tối ưu hóa của phần cứng NVLink, hay cấu hình bộ nhớ và song song hóa vẫn dùng mặc định của phần cứng khác. Tiềm năng tính toán vốn có của phần cứng bị kìm hãm bởi sự thiếu hụt trong việc thích ứng ở tầng phần mềm.
METASTONE là một doanh nghiệp công nghệ hoạt động với tư cách là "nhà vận hành sức mạnh tính toán toàn diện độc lập bên thứ ba". Không bị ràng buộc với bất kỳ nhà cung cấp mô hình lớn cụ thể nào, công ty cam kết cung cấp cho khách hàng dịch vụ cung ứng sức mạnh tính toán toàn diện một cửa, bao gồm phần cứng, mạng lưới, điều phối, tối ưu hóa và vận hành.
Nhờ kinh nghiệm phong phú từ các trung tâm tính toán cấp quốc gia, công ty đảm bảo cụm sức mạnh tính toán vận hành an toàn và ổn định với SLA lên tới hơn 99,95%. Hiện tại, METASTONE đã quản lý hơn 20.000P sức mạnh tính toán, vận hành hơn 10 trung tâm tính toán thông minh và sở hữu 2 trung tâm siêu máy tính cấp quốc gia. Các thành viên trong đội ngũ từng giành được 3 giải thưởng Gordon Bell, sở hữu năng lực dịch vụ kỹ thuật toàn diện cho các cụm siêu quy mô.
Meta-Infer, công cụ triển khai hiệu quả do METASTONE tự phát triển, là công cụ suy luận mô hình lớn hiệu năng cao cấp doanh nghiệp dành cho các chip tăng tốc không đồng nhất. Công cụ này nỗ lực thu hẹp khoảng cách giữa phần cứng và framework thông qua các biện pháp tối ưu hóa thuần phần mềm, khai thác tối đa khả năng suy luận của kiến trúc phần cứng GPU mà không cần thay đổi cấu trúc mô hình hay ngữ nghĩa tác vụ, mang đến cho ngành một khả năng mới:
Dựa vào tối ưu hóa phần mềm, các card GPU có chi phí thấp hơn hoàn toàn có cơ hội đạt được năng lực dịch vụ tiệm cận với những gì trước đây chỉ có các GPU cao cấp mới làm được, xét trên một số chỉ số nghiệp vụ suy luận.
Toàn bộ logic tối ưu hóa của công cụ suy luận hiệu quả Meta-Infer được chia thành hai giai đoạn then chốt:
- Phối hợp tính toán-mô hình (Compute-Model Synergy), giải phóng các lộ trình hiệu năng cao vốn bị che khuất bởi sự khác biệt phần cứng;
- Tái cấu trúc tính toán-truyền thông (Compute-Communication Reconstruction), khơi thông các điểm nghẽn, tận dụng triệt để tài nguyên phần cứng.
Cuối cùng, các yếu tố này đọng lại thành bốn năng lực cốt lõi của công cụ suy luận hiệu quả Meta-Infer: Bổ sung nhân (Kernel completion), Tối ưu hóa toán tử & Tái cấu trúc truyền thông, Tinh chỉnh song song & dung lượng, và Tái sử dụng bộ nhớ đệm (Cache reuse).
1. Bổ sung nhân (Kernel completion)
Các framework suy luận phổ biến tích hợp sẵn một lượng lớn toán tử hiệu năng cao, nhưng đối với các phần cứng "đuôi dài" (long-tail) không nằm trong danh sách xác thực chính thức, framework sẽ không báo lỗi mà chỉ âm thầm bỏ qua các lộ trình tăng tốc, hạ cấp xuống chạy các logic chung kém hiệu quả.
Nhiều nhân (kernel) hiệu năng cao không phải là thiếu, mà chỉ do siêu dữ liệu, kích thước trang (page size) hoặc sự thích ứng nhân phần cứng không khớp, dẫn đến việc không thể kích hoạt thực thi.
Công cụ suy luận hiệu quả Meta-Infer thực hiện sửa lỗi thích ứng thông qua việc bổ sung nhân:
- Đồng bộ hóa định nghĩa siêu dữ liệu giữa phần cứng và framework, sửa cấu hình kích thước trang, mở khóa lộ trình toán tử hiệu năng cao gốc;
- Thay thế các nhân tính toán cũ không tương thích với phần cứng bằng các bản thực thi được tinh chỉnh chuyên sâu cho phần cứng mục tiêu;
- Mở rộng ngưỡng kích hoạt cho các lộ trình truyền thông nhanh, giúp các tác vụ truyền thông quy mô lớn tránh được logic quay lui chậm chạp.
△ Hình ảnh do METASTONE cung cấp

Lấy DeepSeek-V4.1-Flash làm ví dụ, trong môi trường 8 card đồ họa PCIe-Only với phiên bản cơ sở Day0 của cộng đồng, lưu lượng đầu vào (throughput) chỉ đạt 1932 tok/s.
Sau khi sửa lỗi và thích ứng ở giai đoạn phối hợp tính toán-mô hình, bổ sung lộ trình nhanh sparse-MLA Prefill, thay thế nhân FP8 dense GEMM chậm, mở rộng phạm vi bao phủ của lộ trình nhanh truyền thông PCIe-IPC, lưu lượng tăng trực tiếp lên 5850 tok/s.
Sự cải thiện ở giai đoạn này không phải là tạo ra thuật toán mới, mà là giải phóng hiệu năng vốn có của phần cứng và framework nhưng bị khóa lại do các vấn đề thích ứng.
△ Hình ảnh do METASTONE cung cấp

△ Hình ảnh do METASTONE cung cấp
Tư duy tương tự cũng được áp dụng trên các mô hình như DeepSeek-V4-Flash, GLM5.3: sửa các tính toán dư thừa trong việc bổ sung đầu chú ý (attention head), tăng tốc vector hóa logic đánh dấu KV cache, tái cấu trúc logic phân tách toán tử để thích ứng với đặc tính phần cứng, mở rộng phạm vi bao phủ của đồ thị tính toán CUDA, giúp nhiều batch yêu cầu hơn có thể đi vào đồ thị tăng tốc để thực thi. Chỉ riêng việc hoàn thành phối hợp tính toán-mô hình, nhiều mô hình đã đạt được mức tăng lưu lượng từ 20%-33%.
Sau khi hoàn thành thích ứng phần cứng và mở khóa lộ trình tăng tốc, điểm nghẽn hiệu năng sẽ chuyển dịch sang các khâu như chi phí truyền thông, điều phối song song, phân bổ bộ nhớ đồ họa, tính toán lặp lại. Băng thông truyền thông giữa các card của kiến trúc PCIe-Only thấp hơn nhiều so với NVLink, nếu áp dụng trực tiếp các chiến lược mặc định dành cho phần cứng kết nối tốc độ cao, GPU sẽ mất nhiều thời gian chờ đợi truyền thông hoàn tất, khiến tài nguyên tính toán bị lãng phí.
2. Tối ưu hóa toán tử & Tái cấu trúc truyền thông
Dựa vào tối ưu hóa toán tử và tái cấu trúc truyền thông, công cụ suy luận hiệu quả Meta-Infer thực hiện hợp nhất các toán tử then chốt như attention, projection để nén thời gian tính toán từng bước; thực hiện chồng lấp thời gian giữa tác vụ tính toán và truyền thông tập thể, nhúng các tính toán thống kê vào khoảng trống truyền thông để thực thi song song; viết lại logic truyền thông tập thể để thích ứng với đặc tính băng thông PCIe, giảm chi phí chờ đợi do truyền tải tin nhắn gây ra.
3. Tinh chỉnh song song & dung lượng
Trên cơ sở đó, thực hiện tinh chỉnh song song và dung lượng, từ bỏ các tham số song song cố định toàn cục của framework, cấu hình khác biệt cho chiến lược song song tensor và song song ngữ cảnh tùy theo các giai đoạn vận hành khác nhau như Prefill (tiền điền) và Decode (tạo); kết hợp với đặc tính bộ nhớ đồ họa phần cứng, điều chỉnh linh hoạt tỷ lệ bộ nhớ tĩnh và tham số dung lượng KV cache để tránh tràn bộ nhớ và quay lui toán tử; khớp linh hoạt các hình thái kết hợp pipeline và song song tensor cho các tải công việc khác nhau, giúp cả yêu cầu ngắn có độ đồng thời cao lẫn yêu cầu ngữ cảnh siêu dài đều nhận được cấu hình thực thi tối ưu.
4. Tái sử dụng bộ nhớ đệm (Cache reuse)
Đối với các kịch bản văn bản dài và tạo video, năng lực tái sử dụng bộ nhớ đệm cung cấp cơ chế tái sử dụng có nhận thức rủi ro, tự động phán đoán thời điểm tái sử dụng và làm mới bộ nhớ đệm dựa trên trạng thái tạo theo thời gian thực, giúp cắt giảm tính toán lặp lại và đọc/ghi bộ nhớ mà không làm giảm chất lượng đầu ra.
Trong thực tế với DeepSeek-V4.1-Flash, sau khi hoàn thành phối hợp tính toán-mô hình, thông qua toàn bộ quá trình tinh chỉnh tái cấu trúc tính toán-truyền thông: hợp nhất toán tử attention, cắt tỉa hợp lý độ dài bản nháp suy luận suy đoán (speculative decoding), chồng lấp tính toán-truyền thông, phân biệt chiến lược song song Prefill/Decode, tái điều chỉnh tham số dung lượng bộ nhớ, lưu lượng đầu vào tăng từ 5850 tok/s lên 13274 tok/s, đạt mức tăng lưu lượng tổng thể 6,87 lần và hỗ trợ ngữ cảnh siêu dài 1M.
Phương pháp luận này có tính phổ quát, bao phủ nhiều loại tác vụ như mô hình ngôn ngữ lớn, ngữ cảnh dài và tạo video:
DeepSeek-V4-Flash: Sau khi tối ưu hóa toàn diện, lưu lượng đầu vào tăng từ 14546 tok/s lên 22584 tok/s, tăng 1,55 lần;
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.