elsewhere:
85

Thủ thuật

Mô hình ngôn ngữ lớn: Ngành công nghiệp sản xuất đầy khắc nghiệt

(giờ Việt Nam)

Tóm tắt AI

Bài viết phân tích bản chất của các mô hình AI lớn hiện nay, ví von chúng như một ngành công nghiệp sản xuất thâm dụng tài nguyên với sự cạnh tranh khốc liệt và những rào cản gia nhập thị trường ngày càng cao.

Bản dịch AI

Large Language Models Are a Brutal Manufacturing Business

"Ai đó hãy gọi Yu Hao đến huấn luyện những mô hình này đi"

Kỷ nguyên LLM đang dần khép lại; kỷ nguyên mới của các ứng dụng AI đã đến. Để chuẩn bị cho giai đoạn tiếp theo của các ứng dụng AI—vốn tràn đầy sức sống và tính cạnh tranh—Funeral AI sẽ mang chuyên mục "nước cờ vua" cũ trở lại. Đây là phần đầu tiên, tập trung vào các mô hình lớn. Các nội dung về mã nguồn mở và ứng dụng sẽ được ra mắt trong một hoặc hai ngày tới.

Sau hai tháng bị các phòng thí nghiệm mô hình "dội bom" bằng những bản cập nhật không ngừng nghỉ, tôi nghĩ tất cả chúng ta đều nhận ra một điều:

Không có sự khác biệt cơ bản nào giữa các phòng thí nghiệm mô hình này. Tất cả họ đều ở cùng một đẳng cấp. Khoảng cách duy nhất chỉ là ai tung ra phiên bản mới sớm hơn vài ngày, ai tung ra muộn hơn vài ngày mà thôi.

GLM 5.2 rất tuyệt—đã bứt phá trong các kịch bản lập trình nhờ hậu huấn luyện (post-training). Nhưng một tháng sau, K3 ra mắt và hoàn toàn vượt mặt nó.

Bạn từng nghĩ Zhipu AI là "vua" của hậu huấn luyện, không ai cản nổi trong việc tinh chỉnh dữ liệu lập trình. Hóa ra vẫn còn một "trùm cuối" khác: DeepSeek V4 Flash đạt hiệu suất ngang ngửa GLM 5.2 với chỉ một phần ba số tham số.

Bạn từng nghĩ Kimi đã giải mã thành công cuộc đua tham số, bỏ xa các đối thủ một bậc với 2.8T. Sau đó, "chú" Qwen đã mã nguồn mở một mô hình MoE khổng lồ 2.4T với kiến trúc về cơ bản là tương đương.

Từ góc nhìn của chúng tôi, LLM chẳng còn bí mật nào cả.

Công chúng đang có một sự hiểu lầm nghiêm trọng về các mô hình lớn. LLM là sản xuất, không phải thuật giả kim mà chỉ những thần đồng hay các bậc hiền triết huyền thoại mới có thể làm chủ.

Sản xuất thì phải tuân theo quy luật sản xuất. LLM không có "hào sâu" (moat) bảo vệ. Bất kỳ lợi thế nào cũng chỉ là tạm thời—nhiều nhất là một tháng. Các đội ngũ khác sẽ bắt kịp ngay. Cạnh tranh luôn có lúc thăng lúc trầm.

Ai cũng đang làm cùng một việc: tìm kiếm tài nguyên tính toán, xây dựng đường ống dữ liệu, rồi đẩy quy mô lên mức tối đa. Những phép màu từ sức mạnh cơ bắp (brute-force).

Bất kỳ sự đổi mới nào cũng sẽ bị các đối thủ sao chép trong vòng một hoặc hai tháng.

Zhipu AI là đơn vị đầu tiên giải mã con đường hậu huấn luyện cho lập trình, đầu tiên xây dựng đường ống dữ liệu đó, rồi mở rộng quy mô mạnh mẽ và làm bùng nổ thị trường với GLM 5.2.

Giờ đây, mọi phòng thí nghiệm mô hình đều làm như vậy. Ngoại trừ phòng thí nghiệm hạng hai là Seed, vốn tuyên bố không chưng cất (distill) dữ liệu—còn lại tất cả đều đang "ngấu nghiến" dữ liệu của Claude.

Ví dụ điển hình: bạn thậm chí không thể tìm thấy một dịch vụ relay Claude ổn định nào nữa. Mọi relay đều đã bị các phòng thí nghiệm mô hình "chưng cất" đến kiệt quệ. Chẳng còn API Fable 5 nào ổn định để dùng.

Việc phình to tham số cũng chẳng phải bí mật gì. GLM, MiniMax—tất cả đều đang huấn luyện các mô hình hàng nghìn tỷ tham số. Lợi thế của Kimi chỉ kéo dài được một tháng. Khó mà kéo dài thêm tháng nữa.

Một ví dụ khác: các công ty dữ liệu đã trở thành mảng kinh doanh tốt nhất trong lĩnh vực AI hiện nay. Hàng trăm startup đã xuất hiện; một trong số đó đã đạt được kết quả lớn. Đây là chủ đề lớn tiếp theo của thị trường VC sau các mô hình thế giới (world models).

Thị trường luôn chạy theo các xu hướng nóng, dễ bị lóa mắt bởi một phiên bản mô hình nào đó đạt đến cái gọi là "điểm uốn". Nhưng sự thật là: bất kỳ đội ngũ LLM nào đã có mặt trên bàn cờ thì về cơ bản đều ở cùng một đẳng cấp.

Qwen, Kimi, Zhipu AI có thể dẫn đầu trong chốc lát. Hunyuan, Seed, MiniMax, StepFun bắt kịp chỉ là vấn đề thời gian. LongCat, Mimo cũng có cơ hội—nếu "chú" Wang và Lei Jun đổ thêm nguồn lực vào đó. Chỉ có ERNIE Bot là trông thực sự "hết thuốc chữa".

Bởi vì LLM là một bài toán kỹ thuật. Không có sự đổi mới kiến trúc mang tính đột phá nào cả. Định luật mở rộng (scaling law) vẫn cứ tiếp tục tiến triển đều đặn.

Tôi rất thích đoạn trích này từ Dario, ông trùm của tập đoàn A độc ác:

"Cứ vài tháng, tâm lý công chúng lại tin rằng AI đã chạm ngưỡng, hoặc lại phấn khích về một đột phá mới có thể thay đổi cuộc chơi từ gốc rễ. Nhưng thực tế là, bên dưới sự biến động và suy đoán của công chúng, năng lực nhận thức của AI vẫn đang cải thiện một cách ổn định và không ngừng nghỉ."

"Thánh" Liang cũng đã nói với mọi người: đừng coi họ là thiên tài, mà hãy coi họ là những người bình thường tập trung vào công việc. "Thánh" Liang nói đúng—chúng ta nên lắng nghe.

Giống như cách DeepSeek V4 Flash từng vô đối về hiệu năng trên giá thành trước khi tăng giá, tạo ra kỳ vọng cực cao. Sau đó, bản Pro chính thức ra mắt gần như không cải thiện gì so với Flash, mà giá lại tăng gấp ba—về cơ bản là tự sát.

Khi Baby Whale không đạt kỳ vọng, "chú" Tang tại Zhipu AI lập tức tung ra phiên bản mới. Mô hình cơ sở GLM 5.2 vẫn còn dư địa cho hậu huấn luyện. Kéo dài tuổi thọ của "vua hậu huấn luyện", sự việc là vậy đó.

Nhưng sự khác biệt là không đáng kể. Đống mô hình mới này đều nằm giữa Opus 4.8 và Opus 5. Quá đồng nhất. Chỉ có giá cả và tốc độ là tạo ra sự khác biệt.

Việc cập nhật phiên bản quá chi tiết cũng chẳng hay ho gì. Các phòng thí nghiệm mô hình đang "cắt xúc xích" giữa Opus 4.8 và Opus 5—chẳng qua là quản lý vốn hóa thị trường, thuần túy là chiêu trò thu hút sự chú ý.

Đồ ăn ngon cần thời gian. Chẳng ai cần phải gọi cả gia đình đến cho đến khi có người tuyên bố vượt qua hoàn toàn Fable 5. ❤️

Lưu ý nhỏ: một số người có thể nói rằng bản phát hành chính thức V4 Pro cần bật "chế độ tối thiểu" (minimal mode) trong DeepSeek Harness để thể hiện hiệu suất tốt nhất.

Nhưng hãy nhìn vào tất cả những điều kiện kèm theo trước cụm từ "phát hành chính thức" đó—chẳng phải hơi buồn cười sao?

Điều này khác gì các nhà sản xuất ô tô thay thế mọi linh kiện và thuê các đội chuyên nghiệp để tinh chỉnh cho thời gian chạy vòng đua Nürburgring? Tôi nghĩ việc chồng chất các điều kiện trước khi đo điểm chuẩn (benchmark) là một thói quen xấu đang lan từ ngành công nghiệp ô tô sang LLM.

Mặc dù LLM và xe điện thực sự giống nhau: không có phép màu, chỉ có năng lực kỹ thuật bài bản.

Chỉ có ba biến số quyết định kết quả của LLM: tài nguyên tính toán, dữ liệu và năng lực tổ chức.

Mọi đội ngũ mô hình trên bàn cờ đều đáp ứng ít nhất hai yếu tố. Nếu tài nguyên tính toán và dữ liệu ổn mà năng lực mô hình vẫn tụt hậu, thì chắc chắn đó là vấn đề về tổ chức.

Trường hợp điển hình trong sách giáo khoa: Gemini.

Hóa ra các nhà khoa học không thể dẫn dắt các đội ngũ LLM ở giai đoạn này. Các nhà khoa học không thích quản lý các nhóm dán nhãn, không thích những công việc kỹ thuật chân tay. Nhưng hiện tại, LLM cần những quản đốc thúc đẩy các ca làm việc 007 cùng đội ngũ—công việc chính là giải quyết vấn đề, làm bài kiểm tra.

Và tình cờ thay, đó lại là điều mà các đội ngũ mô hình Trung Quốc giỏi nhất.

Vì vậy, bạn thấy đấy, các đội ngũ mô hình của Trung Quốc đều khá ổn. Các đội hàng đầu thay phiên nhau cạnh tranh cho vị trí số 3 thế giới. Các đội hạng hai như Tencent, Meituan, Xiaomi đều có thể tung ra một mô hình không đến nỗi tệ trong vòng sáu tháng.

Một chỉ số cứng để biết liệu một ngành công nghiệp có phải là sản xuất hay không: liệu Elon Musk có thể hiểu được nó không?

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.