Thủ thuật
Tương lai mô hình mã nguồn mở: Nvidia và canh bạc 'dạy mọi người luyện token'
(giờ Việt Nam)
Tóm tắt AI
Nvidia đang chi 26 tỷ USD thúc đẩy các mô hình mã nguồn mở nhằm kích cầu chip xử lý, nhưng nếu chiến lược này thất bại, cộng đồng sẽ chuyển hướng sang tối ưu hóa hiệu suất và tinh chỉnh các mô hình nhỏ thay vì đào tạo từ đầu.
Bản dịch AI

Sự so sánh lâu đời nhất mà mọi người thường đưa ra là việc so sánh những gì đang diễn ra với các mô hình mở (open models) và các dự án phần mềm nguồn mở nền tảng như hệ điều hành Linux. Có những điểm tương đồng khá rõ ràng, nhưng chúng vẽ ra một lộ trình hẹp cho bản chất tự duy trì của hệ sinh thái mô hình nguồn mở, nơi mà một khi Linux đủ lớn, nó sẽ tự khẳng định mình là công cụ tốt nhất cho nhiều công việc. Mô hình ngôn ngữ nguồn mở – tức là các mô hình đi kèm với đầy đủ công thức huấn luyện, dữ liệu, mã nguồn, v.v. – là một sự tương đồng gần gũi hơn với hệ điều hành nguồn mở. Các mô hình trọng số mở (open weight models) mà bạn sử dụng – những mô hình chỉ có trọng số và mã suy luận để chạy chúng – lại gần giống với các phiên bản phần mềm cụ thể mà bạn cài đặt trong một dự án được xây dựng dựa trên chúng.
Chia sẻ
Trọng số mô hình nhìn chung rất dễ thay đổi, nhưng chúng vẫn có thời hạn sử dụng lâu dài, giống như nhiều phần mềm được sử dụng rộng rãi khác. Đó là lý do tại sao nhiều công ty vẫn đang sử dụng các quy trình làm việc được xây dựng trên Llama 3, mặc dù các hành vi tác nhân (agentic behaviors) đã bùng nổ nhiều năm sau đó. Công thức nguồn mở, điển hình trong thời hiện đại là các mô hình Olmo mà tôi đã góp phần xây dựng tại Ai2, cùng với những người tiền nhiệm như Pythia từ EleutherAI, là một quy trình đòi hỏi nhiều tài nguyên mà bất kỳ công ty nào cũng có thể tiếp nhận, sửa đổi và nhấn "chạy" để tạo ra một bộ trọng số mô hình mới. Trong trường hợp tốt nhất, cộng đồng cũng có thể đóng góp các cải tiến về dữ liệu hoặc mã huấn luyện cho mô hình tiếp theo! Đây là lý do tại sao Nvidia đang đầu tư rất nhiều vào các mô hình gần như nguồn mở – đối với các mô hình Nemotron, họ phát hành tất cả dữ liệu mà họ có thể về mặt pháp lý cùng với mã huấn luyện, v.v. Nvidia muốn một thế giới nơi vô số người có thể xây dựng các cỗ máy tạo token, để trí tuệ không bị độc quyền. Đây là một thế giới có nhu cầu khổng lồ về suy luận trên nhiều công ty, tất cả đều muốn mua các sản phẩm của Nvidia.
AI nguồn mở có một tương lai đầy thách thức, vì việc xây dựng các mô hình tốt nhất đòi hỏi nguồn vốn cực kỳ lớn. Khả năng xây dựng các mô hình cạnh tranh vẫn duy trì được sự dễ tiếp cận trong ngành lâu hơn nhiều so với dự đoán của nhiều người. Kỳ vọng mặc định của nhiều người là việc huấn luyện mô hình quá đắt đỏ và công thức nguồn mở đang bị tụt hậu quá xa, vì vậy việc xây dựng một phòng thí nghiệm mới tập trung vào một phần nào đó của việc huấn luyện LLM sẽ không khả thi.
Có hai tương lai từ đây. Đầu tiên là nếu "nó hiệu quả" – nếu công thức nguồn mở mang lại hiệu quả cho Nvidia, họ sẽ tạo ra nhu cầu về chip (và lợi nhuận) lớn hơn nhiều so với chi phí xây dựng các mô hình. Hiện tại, có báo cáo cho rằng Nvidia đang chi 26 tỷ USD cho nỗ lực này. Chưa rõ liệu điều này có thành công hay không, hoặc liệu sự thâm dụng vốn của AI có đẩy ngày càng nhiều công ty ra khỏi cuộc chơi huấn luyện hay không. Chúng ta chưa thấy nhiều dấu hiệu cho thấy điều này đang bắt đầu. Trên thực tế, các công ty rút lui – như Databricks và 01.ai – dường như chỉ là những trường hợp ngoại lệ.
Hệ sinh thái nguồn mở sẽ ngày càng phụ thuộc vào nguồn tài chính của Nvidia trong những năm tới. Đây là một giai đoạn mang tính sống còn, nơi trong vòng vài năm tới, lợi nhuận từ cách tiếp cận này cần phải quay trở lại với họ, hoặc một công ty mô hình mở khác cần phải nuôi dưỡng các vòng lặp phản hồi tài chính giống như nền tảng dựa trên sự cởi mở của họ. Phần thưởng kinh tế này cần phải tương xứng với lợi nhuận do các API của Anthropic và OpenAI tạo ra để bắt kịp với sự phát triển của mô hình ngôn ngữ trong nhiều thập kỷ. Điều này có thể được thúc đẩy bởi khả năng cạnh tranh về hiệu suất hoặc bởi sự bùng nổ của AI lớn đến mức các công ty huấn luyện, suy luận và tinh chỉnh mô hình mở đều có nhu cầu khổng lồ.
Tương lai thứ hai là nếu một trong hai con đường tài chính tích cực này không diễn ra, các mô hình mở sẽ rẽ nhánh sang một lộ trình phát triển khác so với các mô hình đóng hàng đầu – một lộ trình tập trung hơn vào hiệu quả, khả năng sửa đổi, chuyên môn hóa, v.v. Tôi coi đây là kết quả có khả năng xảy ra nhất – các mô hình mở vẫn cực kỳ hữu ích, nhưng lấp đầy một hệ sinh thái "đuôi dài" (long-tail) so với các đối tác đóng vốn có lợi thế sở hữu độc quyền trong các lĩnh vực có giá trị nhất như cộng tác công việc tri thức, khám phá thuốc, SWE, v.v. "Đuôi dài" ở đây giống như các tác nhân dành riêng cho doanh nghiệp chạy tại chỗ (on-prem) với dữ liệu riêng tư cho các tác vụ kinh doanh lặp đi lặp lại.
Một phần lý do khiến tôi nghĩ rằng việc huấn luyện nguồn mở này sẽ khó bắt kịp là vì quá trình huấn luyện đang trở nên phức tạp và trừu tượng hơn. Hệ sinh thái mô hình mở hiện tại đang được thúc đẩy bởi sự bùng nổ mối quan tâm đối với các mô hình mở sau huấn luyện (post-training). Những người này lấy các mô hình như DeepSeek V4 Flash, Inkling Small hoặc GLM 5.X và tinh chỉnh chúng cho các tác vụ tác nhân cụ thể của họ.
Trong vài năm qua, "sau huấn luyện" (post-training) phần lớn đề cập đến toàn bộ quá trình sửa đổi mô hình cơ sở để làm cho nó thông minh và có thể sử dụng được. Đang có một sự thay đổi khi khả năng huấn luyện một mô hình cơ sở trở thành một tác nhân suy luận tổng quát đang trở nên mờ mịt giống như các phương pháp tiền huấn luyện (pretraining) quy mô lớn từ vài năm trước. Điều này có thể đi xa đến mức thay đổi từ vựng tiền huấn luyện, huấn luyện trung gian (midtraining), sau huấn luyện đã trở thành tiêu chuẩn trong vài năm qua. Nó có thể trở thành thứ gì đó gần hơn với tiền huấn luyện, huấn luyện suy luận (reasoning training) và sau huấn luyện.
Khi sự quan tâm đến việc huấn luyện toàn bộ mô hình giảm đi, sự quan tâm đến việc đầu tư vào AI nguồn mở cũng giảm theo. Đây là những dấu hiệu duy nhất chúng ta có được, nhưng chúng ta không thể làm gì nhiều để chống lại trọng lực kinh tế của những tình huống này. Xu hướng này là bước tiếp theo trong số lượng các nhà xây dựng mô hình mở phát hành mô hình cơ sở (các phiên bản mô hình trước khi huấn luyện suy luận cốt lõi) tiếp tục giảm. Nó đi đôi với việc các nhà xây dựng mô hình mở thử nghiệm các giấy phép chia sẻ doanh thu cho việc sử dụng hạ nguồn trong các sản phẩm hoặc suy luận. Đây là những thử nghiệm nhằm giữ cho nguồn tài chính khả thi cho việc xây dựng các mô hình trọng số mở gần ngưỡng tiên phong – tương lai gần phụ thuộc rất nhiều vào mức độ thành công của chúng. Đây là những người cần phải thành công để chiến lược tăng trưởng nhu cầu xung quanh nguồn mở của Nvidia thành công và bền vững.
Trên chặng đường đó, chúng ta vẫn sẽ chứng kiến rất nhiều hoạt động trong lĩnh vực mô hình trọng số mở, vì việc mở quyền truy cập vào trí tuệ là một trong những chiến lược kinh doanh mạnh mẽ nhất hiện có. Loại người chơi bổ sung này, những người kiếm tiền từ AI một cách gián tiếp, được điển hình hóa bởi Meta và các nhà cung cấp dịch vụ đám mây quy mô lớn (hyperscalers) với bảng cân đối kế toán khổng lồ. Việc Meta phát hành mô hình Muse Spark 1.2 rất mạnh của họ dưới dạng trọng số mở sẽ cản trở nghiêm trọng tốc độ tăng trưởng doanh thu của các đối thủ cạnh tranh như Anthropic và OpenAI, những công ty dựa vào việc bán token. Cả hai công ty này đều đang thương mại hóa các phần bổ trợ của họ, nhưng họ làm điều đó theo những cách khác nhau. Nvidia muốn dạy mọi người cách "câu" token để hệ sinh thái tự duy trì, nhưng Meta lại đang chiến lược "làm ngập" khu vực bằng các token.
Bài viết được AI dịch và tổng hợp tự động từ Nathan Lambert: Interconnects. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.