Sản phẩm
AINews: Sự trỗi dậy và thoái trào của Megakernels
(giờ Việt Nam)
Tóm tắt AI
Trong một ngày tin tức trầm lắng, chúng ta cùng nhìn lại màn ra mắt của Cursor và cuộc tranh luận kỹ thuật thú vị về tương lai của Megakernels.
Bản dịch AI
![[AINews] Megakernels are so dead and so back](https://substackcdn.com/image/fetch/$s_!Gpou!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fpbs.substack.com%2Fmedia%2FHNw6xyYaUAA_BVO.jpg)
Một phần trong chương trình Inference Engineering Masterclass của chúng tôi ngày hôm qua có một cuộc thảo luận khá "gắt" về Megakernel:
Megakernel đã chết, tại sao megakernel lại hữu ích? Bạn dành hai tháng để viết một kernel chỉ để tiết kiệm thời gian cho chi phí khởi chạy (launch overhead) và khắc phục tình trạng chồng lấn (overlap) kém giữa các kernel.
Bạn từng có PDL nhưng mọi người lại nói nó không hoàn hảo, rằng bạn vẫn có thể đạt được một số lợi ích nhỏ nhờ các straggler CTA (các CTA bị chậm) và vì vậy— khoan đã, xin lỗi, tôi quên mất, Rubin đã giải quyết vấn đề đó (kernel thứ hai cần 10 CTA và kernel thứ nhất đã hoàn thành 7, còn 3 cái bị chậm, kernel thứ hai sẽ khởi chạy 7 CTA của nó).
Nếu xét trên một khoảng thời gian đủ dài, mọi thứ sẽ cân bằng. Không có nhà cung cấp dịch vụ inference nghiêm túc nào sử dụng kernel forward pass viết tay dài 67k dòng code trong môi trường production, và những đội ngũ làm điều đó chỉ đang thực hiện vì mục đích nghiên cứu thuần túy.
Đã chết.

ali@waterloo_intern
Hai tuần trước, tôi đã tham gia podcast của @swyx và nói một vài điều mà tôi... lẽ ra không nên nói. Rất nhiều chuyện đã xảy ra kể từ đó, tôi nợ các bạn một lời xin lỗi. Tôi xin lỗi vì tôi đã đúng về mọi thứ. a) về việc megakernel đã chết, tại sao megakernel lại hữu ích? Bạn dành hai tháng...

Latent.Space @latentspacepod
Inference Engineering Masterclass: Các mô hình nhanh gấp 10 lần, lượng tử hóa (quantization), speculative decoding, Rubin, & AI tự tối ưu hóa https://t.co/uRYIWWDebj @Baseten @philipkiely và @waterloo_intern giải thích những gì thực sự xảy ra sau khi một mô hình được huấn luyện, tại sao việc chuyển đổi trọng số thành một...
11:49 CH · 3 tháng 8, 2026 · 380K Lượt xem
53 Phản hồi · 67 Đăng lại · 1.28K Lượt thích
Toàn bộ cuộc thảo luận, dành cho những ai muốn lắng nghe:
Ali: Một fused kernel (kernel hợp nhất) không thể cứu bạn. Ví dụ như với tensor parallelism, một nửa ma trận nằm trên một GPU và nửa còn lại nằm trên một GPU khác, và nếu tôi cần toàn bộ ma trận để thực hiện một phép toán phi tuyến tính ở bước tiếp theo, chẳng hạn như khi tôi đang thực hiện attention, tôi cần softmax, hoặc tôi cần thực hiện lũy thừa, tôi cần phải có toàn bộ hàng đó. Vì vậy, tôi cần biết kết quả từng phần từ GPU 2 và kết quả từng phần từ GPU 1 để có thể thực hiện softmax ở giai đoạn tiếp theo.
Vì vậy, tôi phải bắt chúng giao tiếp với nhau, ngay cả khi tôi có một fused kernel, vì các tính chất phi tuyến tính bên trong mỗi kernel. Ngoài ra, với các mega kernel, thành thật mà nói, tôi rất bi quan. Đó là một hướng nghiên cứu tốt, và có vẻ như về mặt trực giác, lý thuyết, nó rất hay. Bạn có rất nhiều chi phí khởi chạy từ việc khởi chạy... Chỉ cần... tiếp tục hợp nhất nó và di chuyển dữ liệu. Chỉ cần hợp nhất mọi thứ lại với nhau.
Nhưng bản thân độ phức tạp của kernel khiến việc viết một mega kernel được tối ưu hóa cao là rất khó. Rất khó để làm điều đó. Và không muốn nêu tên bất kỳ công ty nào, nhưng ngay cả những công ty đã làm việc hoặc những người tôi từng nói chuyện tại các công ty thực hiện fused mega kernel, họ thường không chạy chúng trong môi trường production vì TensorRT-LLM và các modular kernel (kernel mô-đun) khởi chạy nhanh hơn, bởi vì bạn có thể tối ưu hóa từng thành phần riêng lẻ và có thể để chúng song song hóa với nhau.
Một trong những trưởng nhóm kỹ thuật tại NVIDIA đã đăng một bài trên Twitter nói rằng: "Chúng tôi đang vén màn về Rubin, và đây là các thông số kỹ thuật." Và dòng tweet thứ ba cho thấy, không muốn đi quá sâu vào kỹ thuật, tôi cần đọc kỹ hơn, nhưng GPU được thiết kế theo cách triệt tiêu các mega kernel. Vì vậy, có vẻ như toàn bộ lĩnh vực nghiên cứu đó sẽ không được tiếp tục.
Anh ấy đang trích dẫn (một người bạn của chương trình!) Kyle Kranen khi thông báo về các dependency trigger (kích hoạt phụ thuộc) - một phần của sự tắc nghẽn đường ống (pipeline) mà trước đây từng biện minh cho việc hợp nhất kernel:

Kyle Kranen@KranenKyle
3/ Cải thiện Kernel Overlap: Rubin cho phép điều phối kernel ở mức độ chi tiết hơn, bao gồm các dependency trigger ở cấp độ tile. Điều này có nghĩa là ngay khi dữ liệu để bắt đầu làm việc trên một phần của thao tác đã sẵn sàng, các kernel để thực thi nó có thể bắt đầu!

4:43 CH · 21 tháng 7, 2026 · 27.2K Lượt xem
2 Phản hồi · 8 Đăng lại · 98 Lượt thích
Như đã nêu trong chương trình, vẫn còn những hạn chế vật lý chưa được giải đáp, nhưng hoàn toàn hợp lý khi Nvidia cập nhật thiết kế Rubin để phù hợp hơn với những thứ "ghê gớm" đang được thực hiện trong thế giới kernel.
Một trong những đồng tác giả megakernel của Ben Spector, Stuart Sul, hiện đang dẫn dắt nhóm đã phát hành Mixture of Kittens (một tham chiếu đến ThunderKittens với cái tên thú vị của Ben, và là một phần trong nhóm của Dan Fu), megakernel mã nguồn mở của Cursor ngày hôm nay:

Cursor@cursor_ai
Chúng tôi đang mở mã nguồn Mixture-of-Kittens (MoK), megakernel huấn luyện MoE của chúng tôi dành cho các NVL72. Nó hợp nhất tất cả giao tiếp và tính toán của Mixture-of-Experts thành một kernel duy nhất, hoàn toàn tất định và chạy nhanh hơn tới 2,37 lần so với các baseline công khai mạnh nhất.
4:00 CH · 4 tháng 8, 2026 · 277K Lượt xem
151 Phản hồi · 304 Đăng lại · 4K Lượt thích
Kết quả tiêu đề rất thuyết phục - tăng 41% tổng số token mỗi giây.
Ở quy mô lớn, điều này giúp tiết kiệm hàng tỷ đô la.
Tin tức AI từ 3/8/2026 - 4/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/hủy nhận email theo tần suất!
Các mô hình Frontier được phát hành: Qwen 3.8-Max, Alpamayo 2 Super, Pokee-Isaac, Maple-Preview và Shieldstral.
Nhịp độ phát hành của Qwen tiếp tục trên các phương thức: @Alibaba_Qwen đã ra mắt Qwen3.8-Max với tiêu chí "tốt hơn và rẻ hơn", và nhanh chóng đưa nó vào các hệ sinh thái tác nhân (agent) thông qua Hermes Agent, Nous Research và ClinePass. Về phía thị giác máy tính, @skalskip92 đã làm nổi bật hành vi phát hiện dựa trên box của Qwen3.8-Max, báo cáo đạt 60% mAP với một box và 80% với nhiều box cho các khái niệm khó mô tả; bộ công cụ hình ảnh của Qwen cũng đã thăng hạng, với @arena và @Alibaba_Qwen lưu ý rằng Qwen-Image-3.0-Pro đã đạt vị trí thứ 5 trong Text-to-Image Arena.
NVIDIA và Mistral đều tập trung vào chuyên môn hóa có thể triển khai: @JensenHuang đã giới thiệu Alpamayo 2 Super cho suy luận AV với các điều khoản phát hành mở cho mục đích thương mại, trong khi @MistralAI ra mắt Shieldstral, một mô hình an toàn 3B với trọng số mở được thiết kế để kiểm duyệt/phân loại trên thiết bị. @vllm_project đã hỗ trợ phục vụ ngay từ ngày đầu (day-0) và làm nổi bật khả năng chấm điểm an toàn qua một lần forward pass, đầu vào đa phương thức, 12 ngôn ngữ và ngữ cảnh 32k.
Thử nghiệm về ngữ cảnh dài và trọng số hiệu quả đã tăng tốc: @Pokee_AI đã phát hành Pokee-Isaac 28B, tuyên bố ngữ cảnh 10M-token, 93,3% RULER ở mức 10M và khả năng triển khai trên một GPU bắt đầu từ RTX 4090; mô hình này cũng được cho là có hỗ trợ day-0 trong vLLM và SGLang. Trong khi đó, @deepgrove_ai đã giới thiệu Maple-Preview, một mô hình suy luận trọng số bậc ba (ternary-weight) 20B-A1B mã nguồn mở, được cho là chạy ở tốc độ hơn 200 tok/s trên Mac Mini M4 và vượt trội hơn các mô hình khác trong cùng phân khúc trọng số. Cả hai bản phát hành đều chỉ ra một sự phân tách ngày càng tăng: không chỉ là các mô hình frontier lớn hơn, mà còn là sự khám phá mạnh mẽ về kiến trúc ngữ cảnh và hiệu quả bit thấp/bậc ba.
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.