Tin ngành
a16z rót vốn vào Gimlet Labs: Bước tiến mới cho hạ tầng điện toán đa chip
(giờ Việt Nam)
Tóm tắt AI
a16z chính thức đầu tư vào Gimlet Labs để phát triển nền tảng điện toán suy luận đa chip, tối ưu hóa hiệu suất trí tuệ nhân tạo trên cùng một mức tiêu thụ năng lượng.
Bản dịch AI


Mỹ | Công nghệ | Ý kiến | Văn hóa | Biểu đồ

Chúng ta đang cạn kiệt nguồn điện.
Suy luận AI (AI inference) là một trong những thị trường tăng trưởng nhanh nhất trong lịch sử chủ nghĩa tư bản, và chúng ta đang cạn kiệt gần như mọi đầu vào vật lý cần thiết để phục vụ nó: đất đai có điện, tua-bin, máy biến áp, trung tâm dữ liệu, GPU, tấm wafer nút tiên tiến và bộ nhớ băng thông cao. Công suất GPU đang được cho thuê với mức giá kỷ lục, trong khi sự tăng trưởng của OpenAI và Anthropic bị hạn chế bởi tốc độ mở rộng đội ngũ tính toán của họ. Bạn có thể cảm nhận trực tiếp sự khan hiếm đó: giới hạn tốc độ (rate limits) bị thắt chặt và phản hồi chậm lại khi các nhà cung cấp đánh đổi độ trễ để lấy thông lượng nhằm tạo ra nhiều token hơn từ cùng một lượng điện năng.
Đây là lý do tại sao chu kỳ đầu tư vốn lớn nhất trong lịch sử đương đại đang diễn ra. Bảy trong số mười công ty giá trị nhất thế giới là các hyperscaler (nhà cung cấp dịch vụ đám mây quy mô lớn) hoặc các đơn vị cung ứng cho họ. Chỉ riêng năm hyperscaler của Mỹ dự kiến sẽ chi 1 nghìn tỷ USD cho chi phí vốn (capex) vào năm tới. NVIDIA thậm chí còn tiến xa hơn, hợp tác với các đối tác vốn để huy động hơn 500 tỷ USD cho các nhà máy AI.
Nhưng chỉ mở rộng thôi là chưa đủ. Nhu cầu suy luận tăng theo tốc độ của phần mềm; trong khi các nhà máy điện, trung tâm dữ liệu và nhà máy sản xuất bán dẫn thì không. Việc phục vụ khối lượng công việc quan trọng nhất trong đời chúng ta đòi hỏi phải khai thác được nhiều trí tuệ hơn từ mỗi watt điện. Điều đó bắt đầu bằng việc nhận ra rằng suy luận không phải là một khối lượng công việc duy nhất.
Nếu không có GPU, AI ngày nay sẽ không tồn tại. Sự linh hoạt của nó đã cho phép thực hiện các thử nghiệm ban đầu với các mô hình transformer. Sau đó, các cụm máy tính khổng lồ được xây dựng xung quanh một kiến trúc tăng tốc duy nhất đã cung cấp năng lượng cho các đợt huấn luyện, chứng minh các định luật mở rộng (scaling laws) và tạo ra các mô hình tiên phong hiện nay.
Nhưng sự đa dạng của các ứng dụng AI đang bùng nổ. Một trợ lý giọng nói sống hay chết phụ thuộc vào độ trễ; xử lý hàng loạt (batch processing) giúp tối đa hóa thông lượng; một tác nhân nghiên cứu có thể ưu tiên chi phí trên mỗi token; một tác nhân lập trình phải cân bằng cả ba yếu tố trên. Ngay cả một lệnh gọi mô hình đơn lẻ cũng được chia thành giai đoạn tiền nạp (prefill) thâm dụng tính toán và giai đoạn giải mã (decode) bị giới hạn bởi bộ nhớ. Các tác nhân nhân rộng sự biến đổi này bằng cách điều hướng giữa các mô hình chuyên biệt nhỏ và các mô hình suy luận lớn hơn, truy xuất tệp, thực thi mã trên CPU và gọi các công cụ bên ngoài. Suy luận không còn là một khối lượng công việc đơn lẻ nữa.
Đồng thời, các lựa chọn phần cứng đang ngày càng gia tăng. Một số kiến trúc tối ưu hóa thông lượng số học; số khác tối ưu hóa dung lượng bộ nhớ, băng thông hoặc kết nối độ trễ thấp. Không một bộ xử lý đơn lẻ nào có thể mang lại sự kết hợp tốt nhất về chi phí, thông lượng và độ trễ trên mọi ứng dụng và mọi bước. GPU sẽ vẫn là nền tảng, nhưng chúng sẽ ngày càng hoạt động cùng với CPU, các hệ thống tối ưu hóa bộ nhớ và các loại chip chuyên dụng khác.
Hệ thống tối ưu phải khớp từng phần công việc với kiến trúc xử lý nó tốt nhất, tạo ra nhiều công việc hữu ích hơn từ cùng một nguồn lực. Nó phải là hệ thống không đồng nhất (heterogeneous).
Thách thức nằm ở việc làm cho tất cả phần cứng này hoạt động như một hệ thống duy nhất. Cơ sở hạ tầng quy mô lớn được thiết kế dựa trên tính đồng nhất với các máy chủ, mạng, nguồn điện, hệ thống làm mát và mô hình vận hành tiêu chuẩn hóa. Việc đưa vào nhiều kiến trúc khác nhau tạo ra sự phức tạp ở mọi lớp. Phần mềm phải điều phối các bộ xử lý vốn không được thiết kế để làm việc cùng nhau, trong khi cơ sở vật chất vật lý phải đáp ứng các cấu trúc liên kết mạng, mật độ rack, hồ sơ năng lượng và yêu cầu làm mát khác nhau. Ví dụ, hệ thống của Cerebras và NVIDIA yêu cầu nhiệt độ nước đầu vào khác nhau. Đôi khi tính toán không đồng nhất là vấn đề của trình biên dịch; đôi khi nó là vấn đề của hệ thống đường ống.
Làm cho tính toán không đồng nhất hoạt động ở quy mô lớn là chìa khóa để mở ra cái mà chúng tôi tin sẽ là thị trường lớn nhất thế giới. Chúng tôi tin rằng Gimlet Labs đã xây dựng được giải pháp: đám mây suy luận đa chip (multi-silicon) đầu tiên, được thiết kế để tạo ra nhiều trí tuệ hơn từ mỗi watt điện.
Đối với mỗi khối lượng công việc, Gimlet xác định một kế hoạch thực thi cân bằng giữa độ trễ, thông lượng và chi phí. Nó có thể điều hướng các mô hình và công cụ khác nhau lên các bộ xử lý khác nhau, tách biệt giai đoạn tiền nạp khỏi giai đoạn giải mã, hoặc chia nhỏ một mô hình ở cấp độ lớp hoặc thao tác. Trình biên dịch của nó tối ưu hóa từng phần cho phần cứng mục tiêu, trong khi thời gian chạy (runtime) của nó điều phối việc thực thi trên toàn hệ thống. Đối với các nhà phát triển, tất cả sự phức tạp đó nằm sau một API suy luận duy nhất.
Gimlet mở rộng sự điều phối đó vào trung tâm dữ liệu vật lý. Nó tích hợp GPU, CPU và các bộ tăng tốc chuyên dụng vào một nhóm công suất chung, quản lý những khác biệt về mạng, điện năng và làm mát vốn gây khó khăn cho việc vận hành cơ sở hạ tầng không đồng nhất. Hệ thống này hiện đã mang lại mức tăng thông lượng và tính tương tác lên tới 10 lần trên các mô hình tiên phong trong cùng một giới hạn năng lượng.
Trong một thế giới mà quy mô là yếu tố quan trọng, Gimlet đã thực hiện điều này ở quy mô lớn nhất có thể, với khách hàng bao gồm cả một phòng thí nghiệm tiên phong và một hyperscaler. Trong một thị trường đang khao khát năng lực tính toán, hiệu quả chính là năng lực mới và độ trễ chính là sự khác biệt của sản phẩm.
Chúng tôi tin rằng không có đội ngũ nào tốt hơn Zain, Michelle, Natalie, Omid và James để giải quyết vấn đề này. Họ đã từng chứng kiến kịch bản này trước đây và là một trong số ít những đội ngũ có đủ tầm nhìn để theo đuổi vấn đề qua mọi lớp trừu tượng. Khi các nhân (kernels) và trình biên dịch là không đủ, họ đã đẩy mạnh vào mạng tốc độ cao. Khi phần mềm là không đủ, họ đã chuyển sang năng lượng, làm mát và xây dựng trung tâm dữ liệu. Bất cứ nơi nào ngăn xếp hiện tại kết thúc, đội ngũ Gimlet sẽ bắt đầu.
Tương lai của suy luận là không đồng nhất, và Gimlet đang xây dựng lớp cơ sở hạ tầng để biến điều đó thành hiện thực. Chúng tôi vô cùng hào hứng khi được hợp tác với toàn bộ đội ngũ Gimlet.

Bản tin này chỉ được cung cấp cho mục đích thông tin và không nên được coi là lời khuyên về pháp lý, kinh doanh, đầu tư hoặc thuế. Hơn nữa, nội dung này không phải là lời khuyên đầu tư, cũng không dành cho bất kỳ nhà đầu tư hoặc nhà đầu tư tiềm năng nào trong các quỹ a16z. Bản tin này có thể liên kết đến các trang web khác hoặc chứa thông tin khác thu được từ các nguồn của bên thứ ba - a16z chưa xác minh độc lập và không đưa ra tuyên bố nào về tính chính xác hiện tại hoặc lâu dài của thông tin đó. Nếu nội dung này bao gồm quảng cáo của bên thứ ba, a16z chưa xem xét các quảng cáo đó và không xác nhận bất kỳ nội dung quảng cáo hoặc công ty liên quan nào trong đó. Bất kỳ khoản đầu tư hoặc công ty trong danh mục đầu tư nào được đề cập, tham chiếu hoặc mô tả đều không đại diện cho tất cả các khoản đầu tư trong các phương tiện do a16z quản lý; hãy truy cập https://a16z.com/investment-list/ để xem danh sách đầy đủ các khoản đầu tư. Thông tin quan trọng khác có thể được tìm thấy tại a16z.com/disclosures. Bạn nhận được bản tin này vì bạn đã chọn đăng ký trước đó; nếu bạn muốn từ chối nhận các bản tin trong tương lai, bạn có thể hủy đăng ký ngay lập tức.
Không có bài đăng nào.
Bài viết được AI dịch và tổng hợp tự động từ a16z: News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.