The Decoder: AI News
85

Thủ thuật

Frontier Radar #4: AI Trung Quốc đã bắt kịp, phương Tây còn lại lợi thế gì?

(giờ Việt Nam)

Tóm tắt AI

Các mô hình như Kimi K3 và GLM-5.3 đang dần san bằng khoảng cách với AI Mỹ. Phương Tây hiện chỉ còn duy trì ưu thế trong các bài kiểm tra tư duy trừu tượng, độ tin cậy thực tế và an ninh mạng.

Bản dịch AI

Frontier Radar #4: China has caught up, so what's left of the Western AI lead?

Một năm rưỡi trước, DeepSeek R1 đã gây chấn động. Một phòng thí nghiệm của Trung Quốc bất ngờ cạnh tranh với o1 của OpenAI, mô hình suy luận thương mại đầu tiên, và được cho là đã thực hiện điều đó với chi phí thấp hơn nhiều. Thị trường trở nên lo ngại. Hàng tỷ USD giá trị thị trường đã bốc hơi chỉ trong vài ngày. Liệu kế hoạch xây dựng cơ sở hạ tầng có đang bị thổi phồng quá mức?

Bức tranh lúc đó mờ mịt hơn những gì các tiêu đề báo chí gợi ý. Trong báo cáo của chính DeepSeek, R1 vượt qua o1 trong các bài kiểm tra riêng lẻ như AIME 2024 nhưng lại tụt hậu rõ rệt ở những bài khác, chẳng hạn như kiến thức thực tế (SimpleQA). Các tiêu chuẩn đánh giá (benchmark) sau đó đã phơi bày thêm nhiều lỗ hổng. Các mô hình Trung Quốc chỉ đạt vị trí dẫn đầu trong từng lĩnh vực riêng lẻ, chứ không phải trên diện rộng.

Mới gần đây vào cuối tháng 6, khi chúng tôi bắt đầu thực hiện vấn đề này, GLM-5.2 của Z.ai vẫn cho thấy mô hình tương tự. Sau đó là sự xuất hiện của các mô hình mã nguồn mở (open-weights) mới nhất từ Trung Quốc: Kimi K3 của Moonshot, Qwen3.8-Max của Alibaba và GLM-5.3.

Các mô hình Trung Quốc hiện đã nằm gần vị trí dẫn đầu trong hầu hết các đánh giá toàn diện và khắt khe. Chúng xử lý các tác vụ kiến thức dài, lập trình qua nhiều bước và điều phối công cụ đáng tin cậy hơn nhiều so với những phiên bản tiền nhiệm.

Nếu đo lường bằng các tiêu chuẩn phổ biến, khoảng cách vài tháng thường được nhắc đến đã thu hẹp đủ để trở thành vấn đề đối với các nhà đầu tư. Theo Wall Street Journal, Anthropic đang phải đối mặt với những câu hỏi khó chịu trước đợt IPO sắp tới và họ lấy lợi thế dẫn đầu còn lại ở phân khúc cao cấp để làm lá chắn. Dưới phân khúc đó, thị trường phần lớn thuộc về các mô hình mở, rẻ hơn nhiều từ Trung Quốc.

Các nhà đầu tư lo ngại rằng hiệu suất mô hình thuần túy không còn đủ để duy trì một doanh nghiệp. Bất cứ điều gì một mô hình có thể làm độc quyền hôm nay, một mô hình có thể tải xuống miễn phí cũng có thể làm được sau vài tháng.

Có hai cáo buộc đang được đưa ra: Các phòng thí nghiệm Trung Quốc bị cho là đã khai thác các mô hình phương Tây làm "giáo viên", một phương pháp được gọi là chưng cất (distillation). Và họ bị cáo buộc tinh chỉnh mô hình để đạt điểm số benchmark cao mà không có khả năng tương ứng trên diện rộng - cái gọi là "benchmaxxing".

Lợi thế của Mỹ vẫn chưa biến mất. Nhưng nó đã rút lui về một vài lĩnh vực ngày càng hẹp của cái gọi là "biên giới" (frontier) – ranh giới dẫn đầu của những gì khả thi về mặt kỹ thuật. Lợi thế đó còn nằm ở đâu và giá trị kinh tế của nó là gì, đó là câu hỏi đầu tiên của vấn đề này.

Câu hỏi thứ hai nối tiếp câu hỏi đầu tiên. Nếu bản thân mô hình không còn tạo ra sự khác biệt rõ ràng, thì lợi thế đó dựa trên cái gì? Luận điểm của chúng tôi: ngày càng ít dựa vào mô hình, và ngày càng nhiều dựa vào hệ thống tổng thể xung quanh nó, nghĩa là hệ thống nơi công việc liên tục tạo ra các mô hình tiếp theo.

Những gì còn lại của lợi thế dẫn đầu

Khi ra mắt, Artificial Analysis đã xếp K3 ở vị trí thứ ba trên Chỉ số Thông minh (Intelligence Index) với 57 điểm, ngay sau những đơn vị dẫn đầu lúc bấy giờ là GPT-5.5 và Opus 4.8. K3 cải thiện nhiều nhất ở các tác vụ đại lý (agentic tasks), chính xác là công việc thực tế quan trọng trong sử dụng doanh nghiệp. Trên AutomationBench-AA, K3 thậm chí đã ra mắt ở vị trí đầu tiên cho đến khi Anthropic đáp trả bằng Opus 5.

Trên CEO-Bench, nơi một đại lý điều hành một công ty phần mềm giả định trong 500 ngày mô phỏng, K3 đã ghi nhận lượt chạy đơn lẻ tốt nhất từng được công bố với 22,15 triệu USD. Các mô hình Trung Quốc, bao gồm cả phiên bản tiền nhiệm K2.7, thường xuyên thất bại trong những thử thách dài hơi này. Qwen3.8-Max đạt mức tổng thể cao tương tự. Một lưu ý vẫn còn đó: Các mô hình Trung Quốc mới hơn đôi khi tiêu tốn nhiều token hơn đáng kể so với các mô hình phương Tây, điều này làm giảm một phần lợi thế về giá của chúng. Phép tính chi phí trên mỗi tác vụ vẫn được áp dụng.

Ranh giới của các khả năng mô hình hiện tại đã phát triển với tốc độ không đồng đều trong một thời gian, điều mà các nhà nghiên cứu gọi là "biên giới răng cưa" (jagged frontier). Các khả năng riêng lẻ tiến bộ với tốc độ khác nhau, đó là lý do tại sao khoảng cách vài tháng được trích dẫn nhiều luôn phụ thuộc vào việc ai đo lường cái gì. Điều mới mẻ là nơi mà lợi thế của phương Tây vẫn còn có thể đo lường được. Ba lĩnh vực vẫn còn tồn tại.

Thứ nhất là các bài kiểm tra chuyên môn trừu tượng. Ngay sau khi K3 ra mắt, Opus 5 đã giành lại vị trí đầu bảng chỉ số với 61 điểm, một khoảng cách nhỏ so với 57 điểm của K3. Trên ARC-AGI-1, một bài kiểm tra về nhận dạng mẫu trừu tượng sử dụng các lưới giải đố nhỏ, K3 và Fable 5 - dòng sản phẩm chủ lực của Anthropic cho công việc lập trình và đại lý - gần như ngang bằng ở mức 94,5 và 98,5 phần trăm. Chỉ trên ARC-AGI-2, khoảng cách mới nới rộng: 60,4 so với 89,2 phần trăm. Nhưng ARC-AGI cố tình đo lường khả năng nhận dạng mẫu trừu tượng vốn tách biệt hoàn toàn với các tác vụ hàng ngày. Không có gì đảm bảo rằng khoảng cách này dự đoán được sự khác biệt trong thực tế. Nó có thể đơn giản là không có ý nghĩa về mặt kinh tế trong hầu hết các trường hợp.

Thứ hai là độ tin cậy. Benchmark AA-AnalystAgent, ra mắt ngày 12 tháng 8, kiểm tra khả năng phân tích dữ liệu đại lý trên các bảng và tài liệu thực tế. Nó chỉ tính một tác vụ là đã giải quyết nếu mô hình thực hiện đúng trong 5 trên 5 lần chạy độc lập, một thước đo mà các nhà vận hành gọi là pass^5. Opus 5 dẫn đầu với 54 phần trăm, vượt trên GPT-5.5 với 50 phần trăm. K3 là mô hình mở tốt nhất với 39 phần trăm.

Khoảng cách này gần như hoàn toàn đến từ khả năng lặp lại kém. K3 giải quyết 73 phần trăm các tác vụ ít nhất một lần trong năm lần thử, gần như ngang bằng với Opus 5 ở mức 74 phần trăm. Độ tin cậy cũng không tuân theo các bảng xếp hạng chỉ số thông minh thông thường. Ngay cả GPT-5.6 Sol cũng tụt hậu so với chính phiên bản tiền nhiệm của nó ở đây.

Về mặt thương mại, độ tin cậy có trọng lượng rất lớn, như các nhà vận hành giải thích trong bài viết ra mắt của họ. Một đại lý phân tích chỉ tiết kiệm được công sức khi câu trả lời của nó đứng vững mà không cần xem xét lại. Nhiều lần chạy và các bộ kiểm tra có thể bù đắp, nhưng chúng làm tăng chi phí cho mỗi kết quả được chấp nhận.

Thứ ba là an ninh mạng. Đây là nơi khoảng cách được ghi nhận rõ ràng nhất. Một đánh giá chung của AISI (Anh) và CAISI (Mỹ) cho thấy K3 tụt hậu xa so với các mô hình hàng đầu của Mỹ về khả năng tấn công mạng.

Trên ExploitBench, một bài kiểm tra để phát triển các mã khai thác (exploits), K3 đạt 32 phần trăm. Các mô hình hàng đầu của Mỹ đạt trung bình khoảng 76 phần trăm. K3 thất bại trong tất cả 41 tác vụ yêu cầu thực thi mã trên hệ thống mục tiêu; các mô hình hàng đầu của Mỹ giải quyết trung bình 20 tác vụ. Và trong một cuộc tấn công mô phỏng, K3 đạt đến bước 17 trên 32, trong khi các đơn vị dẫn đầu của Mỹ đạt trung bình 28,5.

Nhưng khoảng cách này cũng đang thu hẹp. GLM-5.3, ra mắt ngày 14 tháng 8, đạt 54,4 phần trăm trên ExploitBench theo phép đo của chính Z.ai, cao hơn gấp đôi so với phiên bản tiền nhiệm GLM-5.2. Điều đó rút ngắn khoảng cách với các đơn vị dẫn đầu của Mỹ xuống còn một nửa trong vòng một tháng. Về việc tìm kiếm và xác thực các lỗ hổng trong mã nguồn (CyberGym), GLM-5.3 thậm chí còn vượt qua các mô hình hàng đầu của Mỹ.

Đồng thời, an ninh mạng là lĩnh vực duy nhất mà các nhà cung cấp không công khai bán những khả năng mạnh nhất của họ. Mô hình an ninh mạng tốt nhất của Anthropic, Mythos 5, đạt 78 phần trăm trên ExploitBench, chỉ khả dụng trong các điều kiện được kiểm soát thông qua Project Glasswing. "Người anh em" công khai của nó là Fable 5 thực tế chỉ dừng lại ở mức của Opus 4.8 cũ với 40 phần trăm, vì các biện pháp bảo vệ thượng nguồn đã chặn 407 trong số 410 tập thử nghiệm.

OpenAI áp dụng cách tiếp cận tương tự với Daybreak và các biến thể an ninh mạng chuyên dụng. GPT-5.6 Sol đạt 73,5 phần trăm trên ExploitBench trong đánh giá của chính OpenAI nhưng vẫn nằm dưới mức Critical, mức cao nhất trên thang đo rủi ro của OpenAI. Với Astra sắp tới, lần đầu tiên OpenAI không thể loại trừ khả năng một trong các mô hình của chính họ vượt qua ngưỡng đó. Nếu điều đó xảy ra, Khung chuẩn bị (Preparedness Framework) sẽ được kích hoạt mạnh mẽ hơn nhiều, thậm chí dẫn đến việc tạm dừng hoàn toàn quá trình phát triển. OpenAI đã tạm dừng một số công việc nội bộ liên quan đến Astra.

Và với GLM-5.3, một phòng thí nghiệm Trung Quốc lần đầu tiên áp dụng mô hình này. Z.ai đang trì hoãn việc phát hành trọng số khoảng hai tuần để thực hiện các công việc an toàn bổ sung và có kế hoạch giới hạn các chức năng an ninh mạng nhạy cảm nhất cho những người dùng đã được xác minh.

Lợi thế còn lại được tổng kết như sau: Khoảng cách trong các bài kiểm tra chuyên môn trừu tượng là có thể đo lường được, nhưng giá trị kinh tế của nó vẫn chưa rõ ràng. Khoảng cách về độ tin cậy quan trọng nhất về mặt thương mại nhưng lại là yếu tố ít ổn định nhất - khi một mô hình mới hơn tụt hậu so với chính phiên bản tiền nhiệm của nó trong cùng một phòng thí nghiệm (GPT-5.6 Sol so với GPT-5.5), thứ hạng đó rõ ràng đang biến động.

Khoảng cách an ninh mạng liên quan đến những khả năng mà hầu như không khách hàng nào có thể mua được qua các kênh thông thường, và ngay cả khoảng cách đó cũng đã thu hẹp mạnh mẽ gần đây. Chỉ một vài khả năng nguy hiểm mới có thể bị ngăn chặn. Phần còn lại có giá trị thương mại, như lập trình, nghiên cứu, công việc đại lý, phải duy trì khả năng truy cập thông qua API, nếu không sẽ không có kinh doanh. Và đó là nơi lợi thế thu hẹp trong vòng vài tháng.

Sự nghi ngờ hiển nhiên là hai điều này có liên quan với nhau. Các phòng thí nghiệm Trung Quốc có thể đang sử dụng các mô hình phương Tây làm "giáo viên" thông qua API của họ (phương pháp chưng cất đã đề cập trước đó) và lợi thế sau đó sẽ giữ nguyên ở những nơi thiếu quyền truy cập đó. Có những lý do chính đáng cho sự nghi ngờ này, và chúng tôi sẽ đi sâu vào cách các phòng thí nghiệm Trung Quốc có thể hưởng lợi từ kiến thức bên trong các mô hình phương Tây dưới đây.

Nhưng trước hết, đối với đánh giá chiến lược, câu hỏi về tội lỗi gần như là thứ yếu. Nếu sự nghi ngờ là đúng, mọi khả năng được bán cuối cùng đều chuyển sang đối thủ cạnh tranh, vì vẫn chưa có cách nào đáng tin cậy để ngăn chặn việc "hớt váng". Nếu không đúng, các phòng thí nghiệm Trung Quốc đã tự bắt kịp, và lợi thế đó thậm chí còn ít giá trị hơn.

Cả hai cách hiểu đều dẫn đến cùng một kết quả. Lợi thế mô hình chỉ giữ được ở nơi sản phẩm không được cung cấp rộng rãi ngay từ đầu, và bạn không thể xây dựng doanh nghiệp dựa trên điều đó. Việc xem xét kỹ lưỡng về chưng cất vẫn đáng giá, vì cơ chế của nó quyết định liệu có tồn tại bất kỳ khả năng mô hình nào có thể bảo vệ được hay không.

Chưng cất giải thích tốc độ, không phải phạm vi

OpenAI và Anthropic cáo buộc các công ty Trung Quốc sử dụng mô hình của họ ở quy mô lớn để xây dựng mô hình riêng. Theo Anthropic, các chiến dịch công nghiệp của DeepSeek, Moonshot và MiniMax đã thực hiện hơn 16 triệu tương tác thông qua khoảng 24.000 tài khoản gian lận. Chiến dịch được cho là của Moonshot nhắm vào suy luận đại lý, sử dụng công cụ, lập trình và các dấu vết suy luận với hơn 3,4 triệu tương tác. Điều đó phù hợp với việc Together AI tìm thấy mối tương quan 0,72 giữa tỷ lệ thành công ở cấp độ tác vụ của K3 và Fable 5 trên các vấn đề phần mềm thực tế, và với một phân tích phong cách của Typebulb đặt K3 gần nhất với Fable 5.

Các nhà phê bình phản bác rằng khoảng thời gian giữa việc phát hành Fable 5 và K3 là quá ngắn để ảnh hưởng đến quá trình đào tạo. Nhưng Opus 4.8, một mô hình có liên quan chặt chẽ, đã khả dụng lâu hơn nhiều, và các nghiên cứu tương tự cũng cho thấy sự chồng chéo rõ ràng ở đó. OpenAI mô tả một mô hình tương tự với DeepSeek trong bản ghi nhớ gửi Quốc hội Mỹ. Tuy nhiên, không phòng thí nghiệm nào công bố bằng chứng có thể kiểm chứng, và các yêu cầu của chúng tôi với OpenAI và Anthropic không mang lại kết quả mới.

Tuy nhiên, các cáo buộc đã biết và một số bài báo nghiên cứu giúp có thể tái tạo cách Moonshot, DeepSeek và những đơn vị khác có thể hưởng lợi từ việc chưng cất trong quá trình đào tạo.

Trong quá trình tiền đào tạo (pretraining), một mô hình học các khả năng cơ bản từ lượng văn bản khổng lồ. Quá trình đào tạo trung gian (midtraining) chuyển sang dữ liệu ít hơn nhưng chất lượng cao hơn, và quá trình hậu đào tạo (post-training) định hình hành vi thông qua tinh chỉnh có giám sát và học tăng cường. Dữ liệu chưng cất có thể được đưa vào hầu hết các giai đoạn này.

Một mô hình phương Tây hàng đầu trả lời hàng chục nghìn tác vụ được chọn lọc, hoàn chỉnh với các lộ trình giải pháp và lệnh gọi công cụ. Các câu trả lời tốt nhất chảy vào quá trình đào tạo trung gian hoặc tinh chỉnh, và mô hình học viên tiếp thu các mô hình giải pháp của giáo viên.

Đối với học tăng cường, giáo viên thậm chí không cần phải hoạt động trực tiếp nữa. Dữ liệu thu thập được có thể được sử dụng để xây dựng các mô hình phần thưởng (reward models).

Báo cáo của Anthropic cho thấy đây không phải là một thí nghiệm tư duy. Trong chiến dịch được cho là của DeepSeek, Claude đã xử lý các tác vụ chấm điểm ở quy mô lớn bằng cách sử dụng các tiêu chí được xác định trước, đóng vai trò hiệu quả như một mô hình phần thưởng cho quá trình học tăng cường của người khác. Nghiên cứu về chưng cất đa giáo viên trên chính sách (multi-teacher on-policy distillation) và chưng cất mô hình phần thưởng cho thấy phương pháp này hoạt động như thế nào trên toàn bộ các quy trình đào tạo.

Giới hạn cứng là quyền truy cập: Bất kỳ ai chưng cất thông qua API nước ngoài chỉ thấy những gì giao diện trả về. Trọng số, đánh giá nội bộ và quy trình tìm kiếm vẫn được ẩn giấu. Nghiên cứu về chưng cất hộp đen (black-box distillation) mô tả chính xác hạn chế này.

Tuy nhiên, sự trỗi dậy của các mô hình suy luận đã mở ra một cánh cửa khác: đọc các chuỗi suy luận. Các phòng thí nghiệm cố tình hạn chế khả năng hiển thị đó. OpenAI chỉ cung cấp các bản tóm tắt về chuỗi suy nghĩ, Anthropic hiển thị tư duy mở rộng ở dạng hạn chế và xAI truyền suy luận dưới dạng mã hóa.

Tuy nhiên, việc trích xuất không bao giờ có thể ngăn chặn hoàn toàn. Một nghiên cứu được công bố vào tháng 8 bởi một nhóm do nhà nghiên cứu bảo mật Alexander Panfilov dẫn đầu cho thấy các dấu vết suy luận được mã hóa của các mô hình hàng đầu có thể được đọc ra thông qua một lỗ hổng API. Các nhà cung cấp kể từ đó đã đóng lỗ hổng này.

Image description
AI Trung QuốcCạnh tranh AIKimi K3Địa chính trịCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.