QbitAI
Điểm AI 85/100

Mô hình

Tối ưu hóa sản xuất Token: Bước tiến công nghệ và thực tiễn triển khai suy luận hỗn hợp không đồng nhất

(giờ Việt Nam)

Tóm tắt AI

Bài viết chia sẻ kinh nghiệm thực tiễn và sự phát triển công nghệ của SenseTime trong việc triển khai hệ thống suy luận hỗn hợp không đồng nhất (heterogeneous hybrid inference) nhằm tăng hiệu suất xử lý Token.

Chính văn · Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

23-09-2026 17:56:53 Nguồn: QbitAI

Thực tiễn đổi mới và tiến hóa công nghệ trong suy luận hỗn hợp dị thể trên hạ tầng SenseCore của SenseTime

Nền kinh tế Token đang bùng nổ mạnh mẽ, nhu cầu về sức mạnh tính toán (compute) đã có sự đảo chiều về cấu trúc, trong đó nhu cầu suy luận (inference) đã thay thế huấn luyện (training) để trở thành động cơ tăng trưởng chính của sức mạnh tính toán.

Theo đó, hạ tầng AI đang đối mặt với những bài toán và thách thức hoàn toàn mới: Khi lưu lượng gọi Token tăng lên gấp hàng nghìn lần, hệ thống suy luận làm thế nào để đáp ứng nhu cầu liên tục leo thang? Làm thế nào để sản xuất Token hiệu quả và ổn định thông qua sức mạnh tính toán dị thể?

Tại "Hội thảo kỹ thuật về công nghệ huấn luyện và suy luận hỗn hợp tại Token Factory" thuộc khuôn khổ "Hội nghị chip AI toàn cầu 2026" vừa diễn ra, chuyên gia kỹ thuật cấp cao của SenseCore (SenseTime), ông La Vĩ, đã có bài phát biểu với chủ đề "Token Factory: Xây dựng hạ tầng AI thế hệ mới bằng sức mạnh tính toán dị thể". Ông đã phân tích sâu sắc các thách thức hệ thống khi suy luận quy mô lớn, đồng thời chia sẻ những thực tiễn và khám phá của SenseCore trong kiến trúc suy luận dị thể, thích ứng mô hình và tiến hóa các công nghệ then chốt.

01 Thách thức ngành: Kỷ nguyên Agent, nút thắt tải suy luận xuyên suốt toàn bộ hệ thống

Đặc điểm tải trọng trong kỷ nguyên Agent khác biệt rõ rệt so với nhu cầu suy luận của các cuộc đối thoại đơn vòng truyền thống.

Đầu tiên là ngữ cảnh dài (long context), dẫn đến sự tăng trưởng liên tục của việc tính toán đầu vào và chiếm dụng KV Cache; thứ hai là các cuộc đối thoại đa vòng liên tục, đồng nghĩa với việc tiền tố (prefix) được tái sử dụng và các điểm nóng (hotspot) thay đổi không ngừng; thứ ba là nhu cầu đột biến và nhu cầu đuôi dài (long-tail) nhiều, đồng nghĩa với việc phân phối lưu lượng và độ dài sẽ liên tục biến động.

Ông La Vĩ cho biết, đối mặt với những thay đổi này, logic nền tảng của SenseCore đã chuyển hướng sang "lấy Token, trạng thái và ngân sách độ trễ làm trung tâm", mọi thiết kế đều xoay quanh hiệu suất sản xuất Token, chất lượng phân phối và chi phí đơn vị để tổ chức và sử dụng tài nguyên.

Thiết kế hệ thống lấy Token làm trung tâm này cũng hỗ trợ SenseCore không ngừng nâng cao năng lực dịch vụ và sản xuất Token quy mô lớn. Hiện nay, lưu lượng dịch vụ Token trung bình mỗi ngày của SenseCore đã tăng từ 0,46 nghìn tỷ vào tháng 2 đầu năm lên 4,5 nghìn tỷ vào tháng 8.

02 Thực tiễn đổi mới: Kết nối tài nguyên theo chiều ngang, nâng cao hiệu suất theo chiều dọc, tăng năng lực sản xuất Token ở cấp hệ thống

Làm thế nào để tổ chức hiệu suất tại các điểm đơn lẻ thành năng lực sản xuất Token cấp hệ thống? Ông La Vĩ chia sẻ hai trục chính của SenseCore: "Điều phối ngang" và "Tối ưu hóa dọc". Hai trục này cùng hướng tới mục tiêu chung: đạt chuẩn chất lượng mô hình, đạt chuẩn SLO, tăng thông lượng hiệu dụng và giảm chi phí trên mỗi đơn vị năng lực sản xuất.

Kết nối tài nguyên theo chiều ngang: Để các loại sức mạnh tính toán khác nhau phát huy thế mạnh

"Điều phối ngang" nhằm mục đích phối hợp tài nguyên, giúp nền tảng biết được mô hình nào, phiên bản nào có thể chạy trên sức mạnh tính toán nào, sự kết hợp Prefill và Decode nào có thể thực hiện chuyển giao KV Cache, yêu cầu hiện tại nên đi theo đường dẫn nào và tự động điều chỉnh ra sao khi tải trọng thay đổi.

Đối với các thương hiệu và thông số kỹ thuật khác nhau của sức mạnh tính toán, SenseCore đã xây dựng hồ sơ tài nguyên thống nhất, bao gồm thông lượng tính toán, dung lượng KV Cache, băng thông hiệu dụng, khả năng tương thích mô hình, v.v., giúp các loại sức mạnh tính toán khác nhau cùng nằm trong một góc nhìn điều phối.

Trên cơ sở đó, nền tảng thực hiện quản lý toàn bộ vòng đời cho các yêu cầu suy luận. Từ việc khớp nối truy cập, thực thi Prefill, chuyển giao trạng thái KV Cache đến tiếp quản Decode, mỗi khâu đều có cơ chế phối hợp tiêu chuẩn hóa để đảm bảo tính ổn định của dịch vụ.

"Chúng tôi không cố định một loại chip nào làm nút P (Prefill) hoặc nút D (Decode) vĩnh viễn", ông La Vĩ nhấn mạnh. Nền tảng sẽ điều chỉnh linh hoạt sự phân công vai trò của các chip khác nhau dựa trên sự thay đổi nút thắt của mô hình, batch size và độ dài ngữ cảnh, nhằm đạt được tính khả dụng cao hơn, sự kết hợp và tỷ lệ linh hoạt hơn.

Nâng cao hiệu suất theo chiều dọc: Tối đa hóa hiệu năng trên toàn bộ đường dẫn

Song song với việc kết nối tài nguyên theo chiều ngang, SenseCore tiếp tục làm sâu sắc thêm quá trình tối ưu hóa dọc ba tầng "Mô hình × Engine × Chip", từ thích ứng mô hình đến runtime của chip, nhằm giải phóng hoàn toàn hiệu năng của toàn bộ đường dẫn thực thi.

Trong đó, ở tầng mô hình, thực hiện tinh chỉnh về lượng tử hóa trọng số và ngân sách bộ nhớ video (VRAM) để cân bằng giữa độ chính xác và thông lượng; ở tầng Engine, tối ưu hóa song song cho các toán tử cốt lõi như Attention, GEMM; ở tầng chip, thích ứng sâu với biên dịch, lập lịch truy cập và quản lý bộ nhớ. Mọi kết quả tối ưu hóa đều được kiểm chứng hệ thống trong tải trọng thực tế để tránh các nút thắt hiệu suất đơn điểm.

03 Tiến hóa công nghệ: Từ pooling động đến phân tách mô-đun, không ngừng nâng cao hiệu suất sản xuất Token

Trên cơ sở các thực tiễn đã chín muồi, ông La Vĩ chia sẻ thêm hai hướng tiến hóa công nghệ then chốt để tiến tới hiệu suất và tính linh hoạt cao hơn trong phối hợp dị thể.

Hướng tiến hóa công nghệ 1: Từ P/D cố định sang pool tài nguyên động

Ở cấp độ lập lịch tài nguyên, SenseCore đang chuyển dịch từ tỷ lệ P/D cố định sang pooling tài nguyên động. Độ dài đầu vào/đầu ra và các điểm nóng lưu lượng của các nghiệp vụ khác nhau, thời điểm khác nhau liên tục thay đổi, sự kết hợp P/D tĩnh dễ gây ra tình trạng xếp hàng cục bộ và sai lệch tài nguyên.

Vì vậy, SenseCore đã xây dựng Prefill Pool và Decode Pool riêng biệt, thực hiện định tuyến yêu cầu và khớp nối tài nguyên P/D động dựa trên tải trọng thời gian thực, trạng thái KV Cache và độ ổn định của nút. Khi đầu vào dài gây áp lực lên Prefill, hệ thống có thể tăng nút P một cách linh hoạt; khi đầu ra dài đẩy tải trọng Decode lên cao, hệ thống sẽ tăng nút D, thậm chí chuyển đổi vai trò P/D linh hoạt, giúp tài nguyên điều chỉnh động theo tải trọng, vừa đảm bảo SLA vừa nâng cao hiệu suất sử dụng sức mạnh tính toán tổng thể.

Hướng tiến hóa công nghệ 2: Từ P/D tiến tới pool tài nguyên cấp mô-đun

Hướng tới sự phát triển của các mô hình đa phương thức (multimodal) và MoE trong tương lai, cách phân chia tài nguyên theo hai giai đoạn P/D truyền thống sẽ bộc lộ nút thắt. Hướng tiến hóa kiến trúc của SenseCore là tiến xa hơn tới pooling tài nguyên cấp mô-đun: tách các mô-đun như Encoder, Attention, FFN, mã hóa hình ảnh... thành các pool tài nguyên độc lập, mỗi pool tự động mở rộng hoặc thu hẹp theo đặc điểm tải trọng, giúp việc khớp nối tài nguyên chính xác hơn và hiệu suất sử dụng cao hơn.

Kết thúc bài phát biểu, ông La Vĩ cho biết, hướng tới tương lai, với tư cách là "Hạ tầng AI hiểu rõ mô hình lớn nhất", SenseCore sẽ tiếp tục thúc đẩy đổi mới sản phẩm và công nghệ, cùng các đối tác trong hệ sinh thái đẩy nhanh quá trình nâng cấp hạ tầng AI, thúc đẩy AI phổ cập và kiến tạo một tương lai tươi sáng.

Bài viết này do SenseTime cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.

Bản quyền thuộc về tác giả, không được phép sao chép và sử dụng dưới mọi hình thức khi chưa được ủy quyền, mọi hành vi vi phạm sẽ bị xử lý theo pháp luật.

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Tối ưu hóa sản xuất Token: Bước tiến công nghệ và thực tiễn triển khai suy luận hỗn hợp không đồng nhất | AIHOT.vn