Tin ngành
Huawei Ascend hỗ trợ '0-day' cho mô hình ngôn ngữ mã nguồn mở dots3-note của Xiaohongshu
(giờ Việt Nam)
Tóm tắt AI
Xiaohongshu vừa ra mắt mô hình mã nguồn mở dots3-note, đồng thời Huawei đã hoàn tất tối ưu hóa toàn diện trên các dòng chip Ascend Atlas 800 và 900, hỗ trợ triển khai suy luận thông qua vLLM.
Bản dịch AI
Theo tin từ IT ngày 16 tháng 8, Xiaohongshu (Tiểu Hồng Thư) đã chính thức phát hành mô hình ngôn ngữ lớn mã nguồn mở dots3-note preview vào ngày 14 tháng 8. Hôm qua, Huawei chính thức thông báo rằng các dòng sản phẩm Ascend Atlas 800 A3 và Atlas 900 A3 SuperPoD đã hoàn tất việc thích ứng toàn diện với dots3-note preview, đồng thời cung cấp khả năng triển khai và suy luận hoàn chỉnh dựa trên công cụ suy luận mã nguồn mở vLLM Ascend.

Theo giới thiệu, là phiên bản đầu tiên của dòng dots3, mô hình ngôn ngữ lớn mã nguồn mở dots3-note preview được xây dựng trên nền tảng 280B tham số tổng thể và 16B tham số kích hoạt, đồng thời sở hữu khả năng nhận diện và hiểu biết toàn diện các phương thức (modalities) bao gồm văn bản, hình ảnh và âm thanh. Phía chính thức cho biết, mô hình này đã được tối ưu hóa toàn diện về khả năng suy luận, Agent và nhận diện đa phương thức, đạt được hiệu quả ngang ngửa với các mô hình xuất sắc có kích thước lớn hơn cả trong và ngoài nước ở nhiều tác vụ khác nhau.

Ngoài ra, Huawei cho biết ngay trong ngày mô hình được công bố, Ascend đã hoàn tất việc thích ứng triển khai suy luận 0 Day và tối ưu hóa hiệu năng. Trong khi vẫn giữ nguyên khả năng hiểu đa phương thức tích hợp gồm văn bản, hình ảnh và âm thanh của mô hình, hệ thống đã đạt được sự vận hành ổn định và nâng cao hiệu suất tạo nội dung, cung cấp hỗ trợ sức mạnh tính toán cho việc triển khai thông minh trong các kịch bản tác vụ phức tạp và dài hạn.
Các điểm thích ứng và tối ưu hóa then chốt của Ascend lần này như sau:
Thích ứng toàn diện đầu cuối (End-to-End) cho đa phương thức
Dựa trên khung suy luận vLLM Ascend, hoàn tất việc thích ứng đầu cuối cho các khả năng đa phương thức bao gồm văn bản, hình ảnh và âm thanh của dots3-note preview. Kết nối toàn bộ chuỗi từ bộ mã hóa hình ảnh, trích xuất đặc trưng âm thanh đến suy luận chính của LLM, bảo toàn trọn vẹn khả năng tương tác và hiểu đa phương thức gốc của mô hình, hỗ trợ suy luận ổn định cho các kịch bản đầu vào đa phương thức như hình ảnh-văn bản, âm thanh-văn bản và video.
Tối ưu hóa đặc tính chuyên sâu của khung, giải phóng tiềm năng sức mạnh tính toán phần cứng
Tối ưu hóa truyền thông FlashComm: Đối với các vấn đề tính toán dư thừa của các toán tử độc lập theo cột như RMSNorm sau AllReduce, Dynamic Quant, giảm chiều MLA QKV, thông qua biến đổi tương đương toán học để phân tách AllReduce thành ReduceScatter+AllGather, đưa các toán tử độc lập theo cột lên thực thi trước giữa hai giai đoạn truyền thông, loại bỏ hoàn toàn các phép tính lặp lại giữa các card, giúp giảm đáng kể độ trễ suy luận.
Hợp nhất tính toán và truyền thông FUSED_MC2: Kích hoạt toán tử hợp nhất dispatch_ffn_combine của lớp MoE, kết hợp các Kernel độc lập vốn có trong quá trình truyền thông như "dispatch, gmm1, swiglu, gmm2, combine" thành một toán tử lớn duy nhất. Thông qua việc giảm số lần Kernel Launch, thực hiện pipeline sâu giữa truyền thông và tính toán, cũng như không ghi đĩa các tensor trung gian, giúp nâng cao đáng kể lưu lượng (throughput) suy luận MoE.
Hỗ trợ gốc cho suy luận dự đoán MTP, giải quyết nút thắt cổ chai về độ trễ giải mã tăng dần
Nhắm vào nút thắt cổ chai cốt lõi về lưu lượng là TPOT (thời gian tạo mỗi Token) trong giai đoạn suy luận tăng dần, vLLM Ascend đã thích ứng gốc khả năng giải mã dự đoán MTP của dots3-note preview. Thông qua việc tạo song song nhiều ứng viên Token trong một lần chuyển tiếp (forward) và kiểm chứng tái sử dụng, giúp giảm đáng kể số lần chuyển tiếp giải mã, giảm hiệu quả TPOT, nâng cao hiệu suất tạo nội dung tổng thể, đáp ứng tốt hơn nhu cầu độ trễ thấp của các dịch vụ trực tuyến có lưu lượng truy cập cao.
IT đính kèm các liên kết liên quan như sau:
Hướng dẫn triển khai dots3-note preview trên Ascend: https://docs.vllm.ai/projects/ascend/en/latest/tutorials/models/Dots3-Note.html
Trọng số mô hình dots3-note preview: https://huggingface.co/dots-studio/dots3-note-prev
Blog kỹ thuật chính thức của Xiaohongshu: https://studio.dots.ai/dots/dots3-zh.html
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.