Thủ thuật
Giá thuê năng lực tính toán AI dự báo có thể tăng gấp 10 lần
(giờ Việt Nam)
Tóm tắt AI
Giá thuê GPU đang tăng mạnh do nhu cầu khổng lồ từ các ông lớn công nghệ. Nếu AI đạt trình độ kỹ sư phần mềm, chi phí thuê mỗi đơn vị H100 có thể tăng gấp 15 lần so với hiện tại.
Bản dịch AI

Tôi muốn thử nghiệm với một bài blog thật nhanh, nơi tôi giới hạn thời gian viết trong 2 giờ. Tôi sẽ không thể đi sâu vào nhiều câu hỏi phụ quan trọng, nhưng lựa chọn thay thế là không thể đạt được tiến triển nào trong rất nhiều chủ đề khác mà tôi đang tò mò.
Hôm nay tôi muốn bàn về tình hình năng lực tính toán (compute) của các phòng thí nghiệm trong những năm tới.
Doanh thu của Anthropic đã tăng gấp 10 lần so với cùng kỳ năm ngoái. Anthropic có khả năng kết thúc năm với doanh thu khoảng 100–150 tỷ USD. Để xu hướng này tiếp tục, Anthropic sẽ phải đạt doanh thu 1 nghìn tỷ USD vào cuối năm sau. Không có lý do sâu xa nào bắt buộc xu hướng này phải tiếp diễn, và rất có thể nó sẽ không xảy ra — suy cho cùng, đây là vấn đề về năng lực của AI. Nhưng giả sử nó xảy ra, thì điều gì phải đúng trong thế giới đó?
Năng lực tính toán của các phòng thí nghiệm tăng gấp 3 lần mỗi năm. Để một phòng thí nghiệm tăng doanh thu gấp 10 lần trong khi chỉ tăng năng lực tính toán gấp 3 lần, một sự kết hợp của 3 yếu tố sau đây phải xảy ra: 1. Biên lợi nhuận của phòng thí nghiệm phải tăng, 2. Giá của năng lực tính toán phải tăng, 3. Các phòng thí nghiệm phải dành một phần lớn hơn trong năng lực tính toán của họ cho việc suy luận (inference).
Theo hiểu biết của tôi, về cơ bản cả 3 điều này đều đang diễn ra: 1. Anthropic đã tăng biên lợi nhuận từ 40% vào năm 2025 lên có lẽ hơn 80% trong năm nay đối với suy luận Fable (mặc dù có thể không phải trên phần năng lực tính toán biên - xem thêm bên dưới). 2. Giá giao ngay (spot prices) cho năng lực tính toán đã tăng hơn 40% so với mức thấp nhất vào tháng 2, và con số đó có lẽ còn thấp hơn thực tế so với mức mà các phòng thí nghiệm phải chi trả (một lần nữa, xem thêm bên dưới). 3. Theo Epoch, khoảng một phần tư chi phí tính toán năm 2024 của OpenAI đã dành cho suy luận, và chắc chắn con số này hiện đã gần mức 50% hoặc thậm chí cao hơn.
Các phòng thí nghiệm không muốn thực hiện điều 3 (dành ngày càng nhiều phần trăm năng lực tính toán cho suy luận). Như người ta vẫn nói đùa, mục đích của doanh thu từ suy luận là để thuyết phục các nhà đầu tư rót thêm tiền cho bạn mua thêm năng lực tính toán nhằm huấn luyện các mô hình lớn hơn. Nếu bạn đang dành phần lớn năng lực tính toán cho suy luận, bạn gần như đang tuyên bố rằng tiến trình phát triển AI đã chững lại, vì việc đầu tư thêm vào huấn luyện không còn xứng đáng, và công việc kinh doanh của bạn về cơ bản giống như một nhà cung cấp dịch vụ đám mây. Các phòng thí nghiệm không nghĩ điều này là đúng — họ cho rằng họ đang cung cấp các mô hình mà chỉ trong vòng một năm nữa sẽ trở nên cực kỳ tệ hại, nhằm xây dựng cơ sở kinh doanh để tiếp tục huấn luyện các mô hình thông minh hơn.
Vậy chỉ còn lại: 1. Biên lợi nhuận của phòng thí nghiệm sẽ tăng, hoặc 2. Năng lực tính toán trở nên đắt đỏ hơn. Điều thứ nhất sẽ chiếm ưu thế nếu 1 đến 2 phòng thí nghiệm dẫn đầu vượt xa các đối thủ cạnh tranh. Trong một thị trường, biên lợi nhuận của bạn được quyết định bởi việc bạn tốt hơn giải pháp thay thế tốt nhất tiếp theo bao nhiêu. Để yếu tố 1 chiếm ưu thế, biên lợi nhuận sẽ phải đạt mức giữa 90% vào cuối năm sau. Điều đó nghe có vẻ khá điên rồ đối với tôi. Nhưng việc doanh thu của các phòng thí nghiệm AI tiếp tục tăng trưởng với tốc độ đáng kinh ngạc nghe có vẻ hợp lý.
Vậy còn một yếu tố nữa để giải thích làm thế nào thế giới với doanh thu 1 nghìn tỷ USD điên rồ vào cuối năm sau có thể xảy ra: năng lực tính toán trở nên đắt đỏ hơn nhiều. Như tôi đã đề cập, điều này đã bắt đầu xảy ra. Sự tăng giá thậm chí còn mạnh mẽ hơn khi chúng ta nhìn vào phân khúc năng lực tính toán mà các phòng thí nghiệm cần — rõ ràng họ không thể dựa vào các instance giao ngay (spot instances) — họ cần sự bảo mật cho các trọng số (weights) và thông tin khách hàng, cũng như đủ quy mô để đạt được hiệu suất sử dụng và sự linh hoạt tốt. Để thấy thị trường tính toán trong phân khúc đó điên rồ như thế nào, hãy xem xét mức giá mà Google và Anthropic đang thuê năng lực tính toán từ SpaceX. Theo báo cáo, Google đang trả 900 triệu USD mỗi tháng cho 110.000 GPU, bao gồm sự kết hợp giữa GB200 và GB300. Con số đó gấp khoảng 2 lần giá giao ngay mỗi giờ cho các GPU đó. Và bản thân giá giao ngay hiện tại đã cao hơn 40% so với tháng 2.
Tôi muốn nhấn mạnh kết luận chính ở đây: khi các mô hình AI trở nên thông minh hơn, chúng sẽ kiếm tiền tốt hơn từ cùng một lượng năng lực tính toán. Nếu một kỹ sư phần mềm thực thụ ở trình độ con người có thể chạy trên một thiết bị tương đương H100, theo mức giá thị trường hiện tại cho kỹ sư phần mềm, thì H100 đó nên có giá thuê hơn 250.000 USD một năm. Đó là gấp 15 lần giá giao ngay hiện nay.
Tất nhiên bạn có thể cho rằng nếu chúng ta có thêm 10 triệu kỹ sư phần mềm, giá trị biên của một kỹ sư phần mềm sẽ giảm xuống và do đó H100 đó không nhất thiết có thể tạo ra doanh thu gấp 15 lần so với hiện tại. Nhưng tôi thực sự không biết liệu điều đó có đúng không. Nếu chúng ta áp dụng lập luận này cho con người thay vì AI, thì đây sẽ là ngụy biện "lượng lao động cố định" (lump of labor fallacy) kinh điển. Các nhà kinh tế thường tin rằng nhập cư lao động tay nghề cao không làm giảm tiền lương trong dài hạn nhờ vào cách chuyên môn hóa và đổi mới làm tăng giá trị của lao động. Có lẽ cú sốc cung lao động này quá lớn và quá nhanh đến mức quy tắc chung này không còn áp dụng được nữa. Nhưng nếu chúng ta tin vào những gì kinh tế học tiêu chuẩn nói về lao động, thì giá trị biên của năng lực tính toán (và do đó là giá biên của năng lực tính toán) sẽ trở nên cao một cách đáng kinh ngạc.
Điều gì sẽ xảy ra trong một thế giới như vậy?
Khi các mô hình hàng đầu ngày càng giỏi hơn trong việc kiếm tiền từ năng lực tính toán, việc bắt kịp sẽ ngày càng khó khăn hơn. Nếu đến năm 2028, chúng ta đã tự động hóa kỹ thuật phần mềm và giá năng lực tính toán cao gấp 15 lần hiện tại, thì sẽ rất khó để bạn, với con số không về doanh thu, có thể cạnh tranh năng lực tính toán với các phòng thí nghiệm tiên phong.
Nếu bạn có mô hình tốt nhất, bạn sẽ có thể tính biên lợi nhuận cao hơn nhiều so với hiện tại. Đây là hiệu ứng Alchian–Allen trong kinh tế học, nhưng giải thích một cách đơn giản: nếu thay vì 2 USD cho mỗi giờ H100, bạn phải chi 20 USD, thì sẽ thật ngu ngốc nếu chạy một mô hình kém thông minh hơn trên năng lực tính toán đó, vì nó có thể tiêu tốn nhiều token hơn (do đó lãng phí năng lực tính toán đắt đỏ này) để đạt được cùng một kết quả. Tất nhiên nếu bạn đang sử dụng API thì bạn đang trả tiền cho năng lực tính toán đó một cách gián tiếp, nhưng logic vẫn như vậy. Nếu ngay từ đầu bạn phải trả quá nhiều cho năng lực tính toán cơ bản, bạn cũng nên trả tiền để sử dụng mô hình tốt nhất, hiệu quả nhất chạy trên lượng năng lực tính toán đó.
Rất nhiều ứng dụng phổ biến hiện nay của AI sẽ bị loại khỏi thị trường do giá cả. Lý do AI hiện tương đối rẻ, ít nhất là so với lao động con người, một phần là vì nó không thể làm được nhiều việc mà những người giỏi nhất có thể làm. Đến một lúc nào đó, điều đó sẽ không còn đúng nữa. Và vì vậy, việc sử dụng GPU để tạo ra các nội dung video ngắn rác rưởi sẽ bị loại bỏ vì chi phí quá cao.
Đồng thời, kiểu dự đoán này khớp với những cách mà con người từng sai lầm về sự khan hiếm trong quá khứ. Tôi đang nghĩ đến vụ cá cược Simon–Ehrlich, nơi Paul Ehrlich đặt cược rằng chi phí của một giỏ hàng hóa sẽ tăng thay vì giảm trong thập kỷ dẫn đến năm 1990. Vụ cá cược này rất nổi tiếng trong các cuộc thảo luận kinh tế phổ thông, vì nó được cho là minh họa cách thế giới quan Malthus của Ehrlich bị bác bỏ — ông đã đánh giá thấp cách mà các tín hiệu thị trường và sự khéo léo của con người tìm ra những cách để tiết kiệm các nguồn lực khan hiếm tốt hơn. (Mặc dù các phân tích khác cho thấy nếu vụ cá cược này được thực hiện trong một thập kỷ khác, Ehrlich đã có thể thắng).
Tôi đoán giỏ hàng hóa Simon-Ehrlich không phải là lớp tham chiếu chính xác cho năng lực tính toán, vì nguồn cung năng lực tính toán ít co giãn hơn nhiều, và ít có khả năng hấp thụ các cú sốc cầu lớn hơn nhiều so với việc khai thác các kim loại khác nhau. Mức tăng gấp 3 lần năng lực tính toán mỗi năm đó đến từ việc nhân các con số sau lại với nhau: 1,4 lần từ Định luật Moore, 1,2 lần từ việc xây dựng nhà máy sản xuất mới (bị thắt nút cổ chai ít nhất đến năm 2030 do nguồn cung công cụ EUV), 1,8 lần từ việc AI chiếm phân bổ tấm wafer tiên tiến từ các thiết bị khác (điều này sẽ bắt đầu chạm ngưỡng vào cuối năm 2027, khi AI chiếm từ 60% lên 86% sản lượng N3).
Tôi muốn làm rõ rằng vào một thời điểm nào đó trong tương lai, năng lực tính toán sẽ trở nên rẻ trở lại. Đến một lúc nào đó, robot sẽ có thể biến những bãi cát silica và các mỏ đồng thành máy tính. Khi đó, giá của năng lực tính toán sẽ giảm xuống gần hơn với chi phí của nguyên liệu thô và công cụ. Tôi chỉ đang nói về chế độ hiện tại, nơi năng lực tính toán AI chỉ tăng gấp 3 lần mỗi năm, tốc độ này không đủ nhanh để bù đắp cho hiệu ứng giá cả từ việc AI ngày càng trở nên hữu ích hơn theo từng năm.
Biên lợi nhuận suy luận hỗn hợp là >70%, vì vậy tôi đoán biên lợi nhuận của Fable API là >80% - đây chỉ là cảm nhận cá nhân.
Không có bài đăng nào.
Bài viết được AI dịch và tổng hợp tự động từ Dwarkesh Patel: Podcast & Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.