IT Home
85

Sản phẩm

Arm ra mắt nền tảng tính toán CSS for Mobile 2, tối ưu cho kỷ nguyên AI Agent

(giờ Việt Nam)

Tóm tắt AI

Tại sự kiện Arm Everywhere China, Arm đã giới thiệu CSS for Mobile 2 thế hệ mới, tích hợp CPU C2, GPU Mali G2-Ultra NX và hệ thống kết nối SI L2 nhằm tăng cường sức mạnh xử lý cho các tác vụ AI Agent trên thiết bị di động.

Bản dịch AI

Ngày 8 tháng 9, Arm đã tổ chức sự kiện thường niên Arm Everywhere China tại Thượng Hải, đồng thời công bố hệ thống con tính toán thiết bị di động thế hệ thứ hai: CSS for Mobile 2.

Đây là nền tảng tính toán hướng tới AI tác tử (Agent AI) và đồ họa AI nguyên bản, tích hợp cụm CPU Arm C2, GPU Mali G2-Ultra NX và hệ thống kết nối SI L2, đồng thời hợp nhất IP hệ thống, phần mềm và công cụ dành cho nhà phát triển thành một nền tảng hoàn chỉnh.

图片 1

Nếu chỉ nhìn vào tên gọi của nền tảng tính toán mới, CSS for Mobile 2 có vẻ như chỉ là một bản cập nhật thông thường. Tuy nhiên, sau khi theo dõi toàn bộ buổi ra mắt và trao đổi về các chi tiết kỹ thuật với các giám đốc điều hành của Arm trong buổi phỏng vấn, tôi đã có một nhận thức mới về nền tảng này. Với mỗi bước nâng cấp chi tiết kỹ thuật của CSS for Mobile 2, Arm thực chất đang trả lời một câu hỏi căn bản hơn: Khi AI tiến hóa từ một trợ lý hỏi đáp thành một tác tử có khả năng hiểu ý định, lập kế hoạch và thực hiện công việc thay cho người dùng, nền tảng tính toán trên điện thoại nên trông như thế nào?

图片 4

Nhận định của Arm là hiệu năng của thiết bị di động phụ thuộc vào ba chiều cốt lõi: tốc độ thực thi ở từng giai đoạn tác vụ, hiệu quả truyền tải dữ liệu giữa các công cụ tính toán khác nhau và khả năng điều phối hiệp đồng của hệ thống đối với toàn bộ quy trình tác vụ.

Dựa trên cơ sở đó, CSS for Mobile 2 thực hiện tối ưu hóa tổng thể từ cấp độ hệ thống và mở rộng sự tối ưu hóa này đến giai đoạn hiện thực hóa vật lý, cho phép các đối tác cân nhắc công suất, hiệu năng, diện tích cùng với thiết kế kiến trúc ngay cả trước khi tích hợp SoC. Các thành phần được giữ tính linh hoạt, có thể áp dụng trọn bộ hoặc kết hợp với IP tự phát triển hoặc IP của bên thứ ba.

Đằng sau điều này thực chất là tư duy nhất quán của Arm CSS: biến công nghệ tính toán nền tảng thành một cơ sở tính toán tích hợp, đã được kiểm chứng và có thể cấu hình linh hoạt. Nói cách khác, các đối tác không cần phải tốn quá nhiều thời gian và nguồn lực kỹ thuật vào việc tích hợp công nghệ nền tảng, mà có thể đứng trên nền tảng CSS để tập trung nguồn lực vào những nơi thực sự tạo ra sự khác biệt — bộ tăng tốc, kiến trúc bộ nhớ, công nghệ kết nối, công nghệ hệ thống và năng lực phần mềm của riêng họ, nhằm tạo ra các con chip tùy chỉnh cho thị trường mục tiêu và khối lượng công việc của mình. Việc đi đường tắt ở tầng dưới giúp quá trình phát triển nhanh hơn, độ phức tạp thấp hơn, từ đó các đổi mới khác biệt có thể được đưa ra thị trường nhanh hơn, đồng thời tận dụng tối đa lợi thế của hệ sinh thái Arm.

Dưới đây chúng ta sẽ xem xét cụ thể.

Cụm CPU C2: Kép SME2 và công cụ điều phối.

Ngày nay, các tác tử AI không chỉ thực hiện suy luận mà còn phải duy trì ngữ cảnh, chạy ứng dụng, điều phối các mô hình và dịch vụ khác nhau, đồng thời tự chủ hoàn thành nhiệm vụ dưới sự cho phép của người dùng, và tất cả những điều này đều phải nằm trong giới hạn công suất và tản nhiệt của điện thoại. Các tác vụ tính toán trên điện thoại đã chuyển từ "trả lời một câu hỏi" thành "tự mình chạy hoàn tất một quy trình".

Arm cho rằng, trong quy trình này, CPU được định nghĩa lại thành công cụ điều phối của hệ thống, chịu trách nhiệm duy trì ngữ cảnh, lập lịch tải và điều phối tác vụ.

Cụm CPU C2 mới bao gồm CPU di động mạnh nhất từ trước đến nay của Arm là C2-Ultra, CPU hướng tới hiệu năng năng lượng C2-Pro và bộ đôi công cụ SME2. Cụm CPU hoàn toàn mới này mang lại hiệu năng tăng tới 1,7 lần đối với các mô hình AI mới nhất, hiệu năng đơn luồng tăng 15% và giảm tới 38% công suất tiêu thụ ở cùng mức hiệu năng.

Nhìn sâu hơn, khi chạy các mô hình chuyển đổi giọng nói thành văn bản như Moonshine và Parakeet, C2-Ultra giảm 40% độ trễ so với thế hệ trước C1-Ultra, trực tiếp rút ngắn thời gian chờ đợi trước khi tác tử "phản hồi bằng lời nói".

图片 5

Hiệu suất truy xuất bộ nhớ trong giai đoạn ghi nhớ tăng 41%, tốc độ trung bình tạo lệnh của các mô hình ngôn ngữ nhỏ trong giai đoạn suy luận tăng 25%. Tính tổng thể từ đầu đến cuối, hiệu năng toàn bộ quy trình làm việc tăng 24%.

Cần giải thích thêm rằng, con số 15% ở trên đến từ các chuẩn đo lường phổ biến như GeekBench 6.3, còn 1,7 lần tương ứng với thông lượng tính toán ma trận trên các mô hình AI cụ thể. Công thần chính là SME2 — thế hệ này đã tăng số lượng công cụ SME2 từ một lên hai, giúp năng lực tính toán ma trận tăng gấp đôi, từ đó mới có được bước nhảy vọt về cấp độ này. Ngoài ra, nền tảng thế hệ này còn có thể hỗ trợ các nút quy trình tiên tiến hơn như 2nm, các đối tác cũng có thể triển khai nhiều đơn vị SME2 hơn trên các quy trình tiên tiến để dành không gian hiệu năng cho tương lai.

图片 4

Đến đây, có lẽ nhiều bạn sẽ tò mò: những năm gần đây các hãng điện thoại đều đang chạy đua TOPS của NPU, sau khi kỷ nguyên tác tử AI đến, liệu trung tâm cạnh tranh có quay trở lại CPU và hệ thống bộ nhớ?

Trong buổi phỏng vấn, cũng có truyền thông đặt câu hỏi này. Câu trả lời của Daniel Lu, Giám đốc quản lý sản phẩm CPU AI biên của Arm, là trong mười năm qua, sự chú trọng của ngành đối với các khối lượng công việc khác nhau luôn tiến hóa theo nhu cầu tính toán, luôn tìm kiếm điểm cân bằng tính toán phù hợp nhất cho các thiết bị và kịch bản khác nhau. Hiện tại, năng lực tính toán của NPU flagship đạt khoảng 100 đến 200 TOPS, trong khi cụm CPU trang bị SME có năng lực tính toán tương đương khoảng 5 đến 6 TOPS. Các khối lượng công việc có mật độ tính toán cực cao phù hợp hơn với GPU hoặc NPU, còn chiến trường của CPU là các mô hình ngôn ngữ nhỏ có thể nằm gọn trong ngân sách tính toán cục bộ.

图片 6

Ông đặc biệt nhấn mạnh rằng CPU coi trọng độ trễ hơn là đỉnh hiệu năng, việc mù quáng theo đuổi đỉnh hiệu năng ngược lại có thể kéo lùi độ trễ.

Ngoài ra, để đối phó với nút thắt cổ chai về bộ nhớ vốn phổ biến ở thiết bị đầu cuối, cụm CPU C2 sử dụng kiến trúc topo khác biệt, kết hợp bộ nhớ đệm L2 riêng với bộ nhớ đệm L3 chia sẻ dung lượng lớn, thông qua ưu thế dung lượng của hai cấp bộ nhớ đệm để giảm tần suất truy cập DRAM. Daniel Lu thẳng thắn thừa nhận rằng vấn đề bộ nhớ ở thiết bị đầu cuối thực tế còn nghiêm trọng hơn vấn đề tính toán, và topo bộ nhớ đệm là phương thức cốt lõi để họ đối mặt với thách thức này.

Một vai trò khác dễ bị bỏ qua là lớp điều phối. Nó chịu trách nhiệm duy trì trạng thái tác vụ, hợp nhất ngữ cảnh và quyết định giai đoạn nào của quy trình làm việc sẽ được giao cho tài nguyên tính toán nào, có thể là ứng dụng cục bộ, mô hình tại thiết bị hoặc dịch vụ đám mây.

CPU đóng vai trò điều phối thống nhất quản lý quyền hạn và thực thi tác vụ trong đó. Sau khi bước vào kỷ nguyên tác tử AI, vai trò của CPU đã chuyển từ đơn thuần là "tính toán nhanh" sang "quản lý tốt".

Về số lượng nhân, Daniel Lu tiết lộ cụm CPU C2 hỗ trợ tối đa 14 nhân, các đối tác có thể lựa chọn linh hoạt dựa trên khối lượng công việc thực tế. Một số đối tác sau khi đánh giá cho rằng khối lượng công việc của tác tử AI cần ít nhất mười nhân, họ sẽ chọn cấu hình mười nhân. Arm không quyết định thay cho khách hàng mà trao quyền linh hoạt cho họ.

Việc áp dụng hệ sinh thái SME2 cũng đang tăng tốc. James McNiven, Phó chủ tịch phụ trách thiết bị đầu cuối thông minh AI biên của Arm, cho biết hiện nay hầu như tất cả các điện thoại thông minh flagship, dù là Android hay iOS, đều đã áp dụng công nghệ SME2. Hệ sinh thái được xây dựng xung quanh SME2 bao gồm Alipay, Google AI Edge Gallery, OPPO và vivo, v.v. Thông Nghĩa Vấn Vấn (Qwen) của Alibaba cũng đã trình diễn tại sự kiện cách gia đình Qwen-Audio tận dụng CPU Arm và SME2 để chạy hiệu quả trên thiết bị đầu cuối, cung cấp hiệu năng và độ chính xác cần thiết cho việc tạo giọng nói chất lượng cao.

Mali G2-Ultra NX: Kiến trúc đồ họa AI nguyên bản, nhúng mạng thần kinh vào shader.

Nói xong CPU, hãy xem đến GPU. Mali G2-Ultra NX là GPU Mali AI nguyên bản đầu tiên của Arm, thay đổi lớn nhất là nhúng trực tiếp bộ tăng tốc mạng thần kinh chuyên dụng vào nhân shader của GPU. Bằng cách này, khối lượng công việc đồ họa thần kinh có thể chạy song song với các tác vụ đồ họa và tính toán, đồng thời tái sử dụng hệ thống bộ nhớ, bộ nhớ đệm nhất quán và cấu trúc điều khiển của GPU, giảm việc di chuyển dữ liệu giữa các đơn vị tính toán khác nhau.

Deyan Lazarov, Giám đốc sản phẩm cấp cao về AI biên của Arm, đã đặc biệt làm rõ một chi tiết kỹ thuật trong buổi phỏng vấn: họ sử dụng mạng thần kinh tích chập (CNN), không phải Transformer. Hệ thống này không tạo ra hình ảnh từ hư không như các mô hình ngôn ngữ lớn, mà xuất phát từ hình ảnh thực tế được render bởi GPU, sử dụng CNN để thực hiện siêu phân giải và bổ sung chi tiết. Nếu trò chơi có phong cách nghệ thuật độc đáo, nhà phát triển cũng có thể huấn luyện lại mô hình dựa trên nội dung trò chơi của riêng họ.

图片 8

Mali G2-Ultra NX hỗ trợ ba công nghệ tăng tốc mạng thần kinh. Trong đó, lấy mẫu siêu thần kinh (NSS) tái tạo hình ảnh độ phân giải cao từ hình ảnh độ phân giải thấp; tăng tốc độ khung hình thần kinh (NFRU) cải thiện tốc độ khung hình bằng cách tạo khung hình trung gian; và lấy mẫu siêu thần kinh kết hợp khử nhiễu (NSSD) kết hợp siêu phân giải và khử nhiễu, hướng tới các kịch bản dò tia (ray tracing) phức tạp.

Trong trò chơi demo "Light & Shadow" (tạm dịch: Ánh sáng và Bóng tối) do Arm và Sumo Digital hợp tác tạo ra dựa trên Unreal Engine, giải pháp NFRU và NSSD đã đạt được mức tăng hiệu suất lên tới 4 lần so với render truyền thống, lưu lượng bộ nhớ ngoài giảm tới 70%, đồng thời cho phép các công nghệ như MegaLights của Unreal Engine được áp dụng trên thiết bị di động.

Đối với vấn đề độ trễ mà mọi người có thể quan tâm, Deyan Lazarov đã tính toán một bài toán. Lấy 30FPS làm ví dụ, ngân sách thời gian cho mỗi khung hình là khoảng 33 mili giây, nhà phát triển cần hoàn thành cả việc render khung hình gốc và chèn khung hình do AI tạo ra trong cửa sổ này, từ đó xuất ra hiệu ứng 60FPS trong ngân sách thời gian 30FPS, đồng thời phối hợp với giải pháp nhịp khung hình để đối phó với sự biến động của thời gian render. Hiện tại, NFRU thế hệ này chỉ hỗ trợ tạo một khung hình tái tạo AI giữa hai khung hình render, nhưng Arm đã lên kế hoạch lộ trình phong phú hơn để mở rộng khả năng tạo đa khung hình.

Để mang lại cho nhà phát triển nhiều không gian cân nhắc hơn, Arm cũng giới thiệu các mô hình với cấp độ chất lượng khác nhau, nhà phát triển có thể lựa chọn linh hoạt giữa chất lượng hình ảnh và hiệu năng. Deyan Lazarov cho biết, bản thân "Light & Shadow" sử dụng render độ phân giải thấp, hoàn thành việc phóng đại và tái tạo độ phân giải trong quy trình tạo khung hình, khi áp lực render lớn còn có thể giảm thêm độ phân giải render gốc.

Hiệu năng đồ họa truyền thống cũng không bị bỏ qua. Công cụ thực thi hoàn toàn mới là bản nâng cấp kiến trúc tập lệnh lớn nhất trong bảy thế hệ sản phẩm Mali của Arm, số lượng thanh ghi của mỗi nhóm luồng nhiều gấp 2 lần so với thế hệ trước và sử dụng phân bổ thanh ghi động để giảm tràn. Đơn vị dò tia thế hệ thứ ba cung cấp hỗ trợ cấp phần cứng cho Opacity Micro-Maps (OMM), sử dụng OMM có thể tăng tốc độ khung hình thêm 30%, giảm tới 70% khối lượng công việc dò tia.

So với thế hệ trước, hiệu năng benchmark tăng tới 24%, hiệu năng trò chơi không phải AI tăng tới 14%, lưu lượng DRAM trong kịch bản dò tia giảm tới 13%, hỗ trợ chạy ổn định tối đa 120 khung hình mỗi giây.

Trong buổi phỏng vấn, cũng có truyền thông hỏi về sự so sánh với công nghệ tạo khung hình trên máy tính để bàn. James McNiven thẳng thắn thừa nhận điện thoại dù sao cũng khác với PC, bị hạn chế bởi công suất và tản nhiệt, tài nguyên khả dụng có hạn, do đó phải thực hiện thiết kế và tối ưu hóa kiến trúc chuyên biệt cho nền tảng di động.

Một điểm khác biệt nữa của Arm là chiến lược mở, mô hình là mở, các hãng điện thoại sau khi kiểm chứng có thể tối ưu hóa và tùy chỉnh thêm theo nhu cầu sản phẩm của riêng mình. Gần đây, Arm cũng tuyên bố hợp tác với Tencent Games để cùng khám phá các công nghệ tương lai như chiếu sáng toàn cục động thần kinh.

Cuối cùng, hệ thống kết nối SI L2 là chất kết dính của toàn bộ nền tảng, hỗ trợ nhiều tiêu chuẩn bộ nhớ như LPDDR6, LPDDR5X và LPDDR5, có sự cải thiện đáng kể so với thế hệ trước về tính nhất quán của bộ nhớ đệm và tối ưu hóa mô hình lớn.

ArmChip di độngAI AgentPhần cứng AICông nghệ bán dẫn
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.