# CEO Anthropic Dario Amodei: DeepSeek không làm suy yếu tính cần thiết của kiểm soát xuất khẩu chip

- Nguồn: Dario Amodei: Blog (Web)
- Thời gian phát hành: 2026-09-28 12:32 (giờ Việt Nam)
- Điểm AI: 88/100
- Link AIHOT.vn: https://aihot.vn/items/72d7117623ad00af
- Nguồn dữ liệu AI HOT: https://aihot.news/items/yfpgqwi1ygldou79m35nmn25v
- Link gốc: https://www.darioamodei.com/post/on-deepseek-and-export-controls

## Tóm tắt AI

Dario Amodei bác bỏ quan điểm cho rằng DeepSeek chứng minh lệnh cấm vận chip của Mỹ thất bại, đồng thời khẳng định các biện pháp kiểm soát vẫn đóng vai trò sống còn trong việc duy trì lợi thế công nghệ cho các quốc gia dân chủ.

## Thân bài

![Dario Amodei — On DeepSeek and Export Controls](https://cdn.prod.website-files.com/67ecbba31246a69e485fdd4b/6814ea7a66aeea4623ccc8ea_og_on-deepseek-and-export-controls%20(3).jpg)

Tháng 1 năm 2025

Vài tuần trước, tôi đã [lập luận](https://www.wsj.com/opinion/trump-can-keep-americas-ai-advantage-china-chips-data-eccdce91) về việc cần thắt chặt hơn nữa các biện pháp kiểm soát xuất khẩu chip của Mỹ sang Trung Quốc. Kể từ đó, DeepSeek, một công ty AI của Trung Quốc, đã xoay xở để — ít nhất là ở một vài khía cạnh — [tiệm cận hiệu suất](https://techcrunch.com/2025/01/27/deepseek-claims-its-reasoning-model-beats-openais-o1-on-certain-benchmarks/) của các mô hình AI tiên phong tại Mỹ với chi phí thấp hơn.

Ở đây, tôi sẽ không tập trung vào việc liệu DeepSeek có phải là mối đe dọa đối với các công ty AI của Mỹ như Anthropic hay không (mặc dù tôi tin rằng nhiều tuyên bố về mối đe dọa của họ đối với vị thế dẫn đầu về AI của Mỹ đã bị thổi phồng quá mức)[1](https://darioamodei.com/on-deepseek-and-export-controls#fn:1). Thay vào đó, tôi sẽ tập trung vào việc liệu các bản phát hành của DeepSeek có làm suy yếu lập luận cho các chính sách kiểm soát xuất khẩu chip đó hay không. Tôi không nghĩ là có. Thực tế, tôi cho rằng chúng khiến các chính sách kiểm soát xuất khẩu trở nên quan trọng hơn bao giờ hết đối với sự tồn vong so với một tuần trước2.

Kiểm soát xuất khẩu phục vụ một mục đích thiết yếu: giữ cho các quốc gia dân chủ luôn đi đầu trong phát triển AI. Cần làm rõ rằng, đây không phải là cách để né tránh sự cạnh tranh giữa Mỹ và Trung Quốc. Suy cho cùng, các công ty AI tại Mỹ và các quốc gia dân chủ khác phải sở hữu những mô hình tốt hơn so với Trung Quốc nếu chúng ta muốn giành chiến thắng. Nhưng chúng ta không nên trao cho Đảng Cộng sản Trung Quốc những lợi thế công nghệ khi chúng ta không bắt buộc phải làm vậy.

### Ba động lực của phát triển AI

Trước khi đưa ra lập luận về chính sách, tôi sẽ mô tả ba động lực cơ bản của các hệ thống AI mà việc thấu hiểu chúng là vô cùng quan trọng:

1. Định luật mở rộng (Scaling laws). Một đặc tính của AI — mà tôi và các đồng sáng lập là những người đầu tiên [ghi nhận](https://arxiv.org/abs/2001.08361) khi còn làm việc tại OpenAI — đó là khi mọi yếu tố khác không đổi, việc mở rộng quy mô huấn luyện các hệ thống AI sẽ dẫn đến kết quả tốt hơn một cách ổn định trên hàng loạt các tác vụ nhận thức. Ví dụ, một mô hình trị giá 1 triệu USD có thể giải quyết 20% các tác vụ lập trình quan trọng, mô hình 10 triệu USD có thể giải quyết 40%, 100 triệu USD có thể giải quyết 60%, và cứ thế tiếp tục. Những khác biệt này thường có ý nghĩa thực tiễn to lớn — một hệ số 10 có thể tương ứng với sự khác biệt giữa trình độ sinh viên đại học và trình độ tiến sĩ — và do đó các công ty đang đầu tư mạnh mẽ vào việc huấn luyện các mô hình này.
2. Dịch chuyển đường cong. Lĩnh vực này liên tục đưa ra các ý tưởng, dù lớn hay nhỏ, giúp mọi thứ trở nên hiệu quả hơn: đó có thể là một cải tiến về kiến trúc mô hình (một tinh chỉnh đối với kiến trúc Transformer cơ bản mà tất cả các mô hình ngày nay đều sử dụng) hoặc đơn giản là cách vận hành mô hình hiệu quả hơn trên phần cứng nền tảng. Các thế hệ phần cứng mới cũng mang lại hiệu quả tương tự. Điều này thường làm [dịch chuyển đường cong](https://arxiv.org/abs/2311.15377): nếu đổi mới đó là một "hệ số nhân tính toán" (CM) gấp 2 lần, thì nó cho phép bạn đạt được 40% hiệu suất tác vụ lập trình với chi phí 5 triệu USD thay vì 10 triệu USD; hoặc 60% với 50 triệu USD thay vì 100 triệu USD, v.v. Mọi công ty AI tiên phong đều thường xuyên khám phá ra nhiều CM như vậy: thường là những cải tiến nhỏ (~1,2x), đôi khi là trung bình (~2x), và thỉnh thoảng là rất lớn (~10x). Vì giá trị của việc sở hữu một hệ thống thông minh hơn là rất cao, sự dịch chuyển đường cong này thường khiến các công ty [chi tiêu nhiều hơn](https://epoch.ai/blog/how-much-does-it-cost-to-train-frontier-ai-models#:~:text=The%20cost%20of%20training%20frontier,a%20billion%20dollars%20by%202027.), chứ không phải ít đi, cho việc huấn luyện mô hình: những lợi ích về hiệu quả chi phí cuối cùng được dành trọn cho việc huấn luyện các mô hình thông minh hơn, chỉ bị giới hạn bởi nguồn lực tài chính của công ty. Mọi người thường bị thu hút bởi ý tưởng rằng "ban đầu thứ gì đó đắt đỏ, sau đó nó sẽ rẻ hơn" — như thể AI là một thực thể có chất lượng không đổi, và khi nó rẻ hơn, chúng ta sẽ dùng ít chip hơn để huấn luyện. Nhưng điều quan trọng là đường cong mở rộng: khi nó dịch chuyển, chúng ta chỉ đơn giản là đi dọc theo nó nhanh hơn, vì giá trị của những gì nằm ở cuối đường cong là rất lớn. Năm 2020, nhóm của tôi đã xuất bản [một bài báo](https://cdn.openai.com/papers/ai_and_efficiency.pdf) cho thấy sự dịch chuyển đường cong do tiến bộ thuật toán là khoảng 1,68x/năm. Con số đó có lẽ đã tăng tốc đáng kể từ đó; nó cũng chưa tính đến hiệu suất và phần cứng. Tôi đoán con số ngày nay có lẽ là khoảng 4x/năm. Một ước tính khác nằm [tại đây](https://epoch.ai/blog/algorithmic-progress-in-language-models). Sự dịch chuyển của đường cong huấn luyện cũng làm dịch chuyển đường cong suy luận, và kết quả là giá thành giảm mạnh trong khi chất lượng mô hình vẫn giữ nguyên đã diễn ra trong nhiều năm. Ví dụ, Claude 3.5 Sonnet được phát hành 15 tháng sau GPT-4 bản gốc đã vượt qua GPT-4 trên hầu hết các bài kiểm tra chuẩn, trong khi giá API thấp hơn khoảng 10 lần.
3. Dịch chuyển mô hình (paradigm). Thỉnh thoảng, thực thể nền tảng đang được mở rộng lại thay đổi một chút, hoặc một loại hình mở rộng mới được thêm vào quy trình huấn luyện. Từ 2020-2023, trọng tâm chính là các mô hình tiền huấn luyện: các mô hình được huấn luyện trên lượng văn bản internet ngày càng tăng với một chút huấn luyện bổ sung. Năm 2024, ý tưởng sử dụng học tăng cường (RL) để huấn luyện các mô hình tạo ra chuỗi suy luận đã trở thành trọng tâm mới của việc mở rộng. Anthropic, DeepSeek và nhiều công ty khác (đáng chú ý nhất có lẽ là OpenAI với việc phát hành mô hình o1-preview vào tháng 9) đã nhận thấy rằng quá trình huấn luyện này làm tăng đáng kể hiệu suất trên một số tác vụ chọn lọc, có thể đo lường khách quan như toán học, các cuộc thi lập trình và các suy luận tương tự. Mô hình mới này bắt đầu với loại mô hình tiền huấn luyện thông thường, sau đó sử dụng RL ở giai đoạn thứ hai để bổ sung các kỹ năng suy luận. Quan trọng là, vì loại RL này còn mới, chúng ta vẫn đang ở giai đoạn rất sớm trên đường cong mở rộng: số tiền chi cho giai đoạn thứ hai (RL) vẫn còn nhỏ đối với tất cả các bên. Chi 1 triệu USD thay vì 0,1 triệu USD là đủ để đạt được những bước tiến lớn. Các công ty hiện đang làm việc rất nhanh để mở rộng giai đoạn thứ hai lên hàng trăm triệu và hàng tỷ USD, nhưng điều quan trọng cần hiểu là chúng ta đang ở một "điểm giao thoa" độc đáo, nơi có một mô hình mới đầy mạnh mẽ đang ở giai đoạn đầu của đường cong mở rộng và do đó có thể tạo ra những bước tiến lớn một cách nhanh chóng.

### Các mô hình của DeepSeek

Ba động lực nêu trên có thể giúp chúng ta hiểu về các bản phát hành gần đây của DeepSeek. Khoảng một tháng trước, DeepSeek đã phát hành một mô hình có tên "[DeepSeek-V3](https://github.com/deepseek-ai/DeepSeek-V3)", đây là một mô hình tiền huấn luyện thuần túy3 — giai đoạn đầu tiên được mô tả ở mục #3 phía trên. Sau đó vào tuần trước, họ đã phát hành "[R1](https://github.com/deepseek-ai/DeepSeek-R1)", bổ sung thêm giai đoạn thứ hai. Không thể xác định mọi thứ về các mô hình này từ bên ngoài, nhưng dưới đây là hiểu biết tốt nhất của tôi về hai bản phát hành này.

DeepSeek-V3 thực sự là một sự đổi mới thực thụ và là điều đáng lẽ đã khiến mọi người phải chú ý từ một tháng trước (chúng tôi chắc chắn đã làm vậy). Là một mô hình tiền huấn luyện, nó dường như [tiệm cận hiệu suất của](https://github.com/deepseek-ai/DeepSeek-V3)4 các mô hình tiên tiến nhất tại Mỹ trên một số tác vụ quan trọng, trong khi chi phí huấn luyện thấp hơn đáng kể (mặc dù chúng tôi nhận thấy rằng Claude 3.5 Sonnet đặc biệt vẫn tốt hơn nhiều trên một số tác vụ then chốt khác, chẳng hạn như lập trình thực tế). Đội ngũ DeepSeek đã làm được điều này thông qua một số cải tiến thực sự và ấn tượng, chủ yếu tập trung vào hiệu quả kỹ thuật. Có những cải tiến đặc biệt sáng tạo trong việc quản lý một khía cạnh gọi là "Key-Value cache", và trong việc cho phép một phương pháp gọi là "mixture of experts" được đẩy xa hơn so với trước đây.

Tuy nhiên, điều quan trọng là phải nhìn nhận kỹ hơn:

- DeepSeek không hề "làm được với 6,5 triệu USD những thứ tiêu tốn của các công ty AI Mỹ hàng tỷ USD". Tôi chỉ có thể nói thay cho Anthropic, nhưng Claude 3.5 Sonnet là một mô hình tầm trung tiêu tốn vài chục triệu USD để huấn luyện (tôi sẽ không đưa ra con số chính xác). Ngoài ra, 3.5 Sonnet không hề được huấn luyện theo bất kỳ cách nào liên quan đến một mô hình lớn hơn hoặc đắt đỏ hơn (trái với một số tin đồn). Quá trình huấn luyện Sonnet đã được thực hiện từ 9-12 tháng trước, trong khi mô hình của DeepSeek được huấn luyện vào tháng 11/12, và Sonnet vẫn vượt trội đáng kể trong nhiều bài đánh giá nội bộ và bên ngoài. Do đó, tôi nghĩ một nhận định công bằng là "DeepSeek đã tạo ra một mô hình có hiệu suất gần bằng các mô hình Mỹ đã ra mắt trước đó 7-10 tháng, với chi phí thấp hơn đáng kể (nhưng không hề gần với tỷ lệ mà mọi người đã gợi ý)".
- Nếu xu hướng lịch sử của đường cong chi phí giảm khoảng 4 lần mỗi năm, điều đó có nghĩa là trong hoạt động kinh doanh thông thường — theo các xu hướng giảm chi phí lịch sử như đã xảy ra trong năm 2023 và 2024 — chúng ta sẽ kỳ vọng một mô hình rẻ hơn 3-4 lần so với 3.5 Sonnet/GPT-4o vào thời điểm hiện tại. Vì DeepSeek-V3 kém hơn các mô hình tiên phong của Mỹ — giả sử khoảng 2 lần trên đường cong mở rộng, mức mà tôi cho là khá ưu ái cho DeepSeek-V3 — thì việc chi phí huấn luyện DeepSeek-V3 thấp hơn khoảng 8 lần so với các mô hình Mỹ hiện tại được phát triển cách đây một năm là hoàn toàn bình thường, hoàn toàn "đúng xu hướng". Tôi sẽ không đưa ra con số cụ thể, nhưng rõ ràng từ điểm trước đó, ngay cả khi bạn chấp nhận chi phí huấn luyện của DeepSeek theo giá trị danh nghĩa, thì họ cũng chỉ đạt mức "đúng xu hướng" là cùng, thậm chí có lẽ còn không đạt được mức đó. Ví dụ, mức này còn ít dốc hơn so với chênh lệch giá suy luận từ GPT-4 gốc sang Claude 3.5 Sonnet (10 lần), và 3.5 Sonnet là một mô hình tốt hơn GPT-4. Tất cả những điều này cho thấy DeepSeek-V3 không phải là một bước đột phá độc nhất vô nhị hay thứ gì đó làm thay đổi căn bản nền kinh tế của LLM; đó là một điểm dự kiến trên đường cong giảm chi phí đang diễn ra. Điều khác biệt lần này là công ty đầu tiên chứng minh được mức giảm chi phí dự kiến lại là công ty Trung Quốc. Điều này chưa từng xảy ra trước đây và có ý nghĩa quan trọng về mặt địa chính trị. Tuy nhiên, các công ty Mỹ sẽ sớm làm theo — và họ sẽ không làm điều đó bằng cách sao chép DeepSeek, mà vì chính họ cũng đang đạt được xu hướng giảm chi phí thông thường.
- Cả DeepSeek và các công ty AI Mỹ đều có nhiều tiền hơn và nhiều chip hơn nhiều so với những gì họ từng dùng để huấn luyện các mô hình chủ lực của mình. Số chip dư thừa được sử dụng cho R&D để phát triển các ý tưởng đằng sau mô hình, và đôi khi để huấn luyện các mô hình lớn hơn chưa sẵn sàng (hoặc cần nhiều hơn một lần thử để hoàn thiện). Có thông tin cho rằng — chúng ta không thể chắc chắn là đúng — DeepSeek thực sự sở hữu [50.000 chip thế hệ Hopper](https://x.com/dylan522p/status/1859302712803807696), con số mà tôi đoán là nằm trong khoảng 2-3 lần so với những gì các công ty AI lớn của Mỹ đang có (ví dụ, nó ít hơn 2-3 lần so với cụm "[Colossus](https://www.tomshardware.com/desktops/servers/first-in-depth-look-at-elon-musks-100-000-gpu-ai-cluster-xai-colossus-reveals-its-secrets)" của xAI). 50.000 chip Hopper đó có giá trị vào khoảng 1 tỷ USD. Do đó, tổng chi tiêu của DeepSeek với tư cách là một công ty (khác với chi phí huấn luyện một mô hình riêng lẻ) không quá khác biệt so với các phòng thí nghiệm AI của Mỹ.
- Cần lưu ý rằng phân tích "đường cong mở rộng" hơi đơn giản hóa, vì các mô hình có sự khác biệt nhất định và có những điểm mạnh, điểm yếu khác nhau; các con số trên đường cong mở rộng chỉ là mức trung bình thô bỏ qua rất nhiều chi tiết. Tôi chỉ có thể nói về các mô hình của Anthropic, nhưng như tôi đã gợi ý ở trên, Claude cực kỳ giỏi trong việc lập trình và có phong cách tương tác với con người được thiết kế tốt (nhiều người sử dụng nó để xin lời khuyên hoặc hỗ trợ cá nhân). Về những tác vụ này và một số tác vụ bổ sung khác, không có gì để so sánh với DeepSeek. Những yếu tố này không xuất hiện trong các con số mở rộng.

[R1](https://github.com/deepseek-ai/DeepSeek-R1), mô hình được phát hành tuần trước và gây ra sự bùng nổ về sự chú ý của công chúng (bao gồm cả việc [giá cổ phiếu Nvidia giảm khoảng 17%](https://www.reuters.com/technology/chinas-deepseek-sets-off-ai-market-rout-2025-01-27/)), lại ít thú vị hơn V3 xét về khía cạnh đổi mới hoặc kỹ thuật. Nó bổ sung giai đoạn huấn luyện thứ hai — học tăng cường, được mô tả ở mục #3 trong phần trước — và về cơ bản sao chép những gì OpenAI đã làm với o1 (họ dường như đang ở quy mô tương tự với kết quả tương tự). Tuy nhiên, vì chúng ta đang ở giai đoạn đầu của đường cong mở rộng, nhiều công ty có thể tạo ra các mô hình loại này, miễn là họ bắt đầu từ một mô hình tiền huấn luyện mạnh. Việc tạo ra R1 từ V3 có lẽ rất rẻ. Do đó, chúng ta đang ở một "điểm giao thoa" thú vị, nơi tạm thời có nhiều công ty có thể tạo ra các mô hình suy luận tốt. Điều này sẽ nhanh chóng không còn đúng nữa khi mọi người tiến xa hơn trên đường cong mở rộng của các mô hình này.

### Kiểm soát xuất khẩu

Tất cả những điều này chỉ là lời mở đầu cho chủ đề chính mà tôi quan tâm: kiểm soát xuất khẩu chip sang Trung Quốc. Dưới ánh sáng của các sự kiện trên, tôi nhìn nhận tình hình như sau:

- Có một xu hướng đang diễn ra là các công ty [chi tiêu ngày càng nhiều](https://epoch.ai/blog/how-much-does-it-cost-to-train-frontier-ai-models#:~:text=The%20cost%20of%20training%20frontier,a%20billion%20dollars%20by%202027.) cho việc huấn luyện các mô hình AI mạnh mẽ, ngay cả khi đường cong liên tục dịch chuyển và chi phí huấn luyện cho một mức độ thông minh nhất định của mô hình đang giảm nhanh chóng. Chỉ là giá trị kinh tế của việc huấn luyện các mô hình ngày càng thông minh hơn là quá lớn đến mức bất kỳ lợi ích nào về chi phí đều bị "nuốt chửng" gần như ngay lập tức — chúng được đổ ngược lại vào việc tạo ra các mô hình thông minh hơn nữa với cùng mức chi phí khổng lồ mà chúng ta dự định chi ban đầu. Trong phạm vi mà các phòng thí nghiệm Mỹ chưa khám phá ra, các cải tiến về hiệu quả mà DeepSeek phát triển sẽ sớm được cả các phòng thí nghiệm Mỹ và Trung Quốc áp dụng để huấn luyện các mô hình trị giá hàng tỷ USD. Những mô hình này sẽ hoạt động tốt hơn các mô hình hàng tỷ USD mà họ dự định huấn luyện trước đó — nhưng họ vẫn sẽ chi hàng tỷ USD. Con số đó sẽ tiếp tục tăng lên, cho đến khi chúng ta đạt được AI thông minh hơn hầu hết con người trong hầu hết mọi việc.
- Việc tạo ra AI thông minh hơn hầu hết con người trong hầu hết mọi việc sẽ đòi hỏi hàng triệu chip, hàng chục tỷ USD (ít nhất), và rất có thể sẽ xảy ra vào năm 2026-2027. Các bản phát hành của DeepSeek không làm thay đổi điều này, vì chúng nằm ở mức xấp xỉ đường cong giảm chi phí dự kiến vốn đã luôn được tính đến trong các phép tính này.
- Điều này có nghĩa là vào năm 2026-2027, chúng ta có thể kết thúc ở một trong hai thế giới hoàn toàn khác biệt. Ở Mỹ, nhiều công ty chắc chắn sẽ có hàng triệu chip cần thiết (với chi phí hàng chục tỷ USD). Câu hỏi đặt ra là liệu Trung Quốc có thể có được hàng triệu chip hay không.
- – Nếu họ làm được, chúng ta sẽ sống trong một thế giới lưỡng cực, nơi cả Mỹ và Trung Quốc đều có các mô hình AI mạnh mẽ, thúc đẩy những tiến bộ cực kỳ nhanh chóng trong khoa học và công nghệ — điều mà tôi gọi là "[các quốc gia của những thiên tài trong trung tâm dữ liệu](https://darioamodei.com/machines-of-loving-grace)". Một thế giới lưỡng cực không nhất thiết sẽ cân bằng vô thời hạn. Ngay cả khi Mỹ và Trung Quốc ngang hàng về hệ thống AI, có vẻ như Trung Quốc có thể hướng nhiều tài năng, vốn và sự tập trung hơn vào các ứng dụng quân sự của công nghệ này. Kết hợp với cơ sở công nghiệp lớn và các lợi thế chiến lược quân sự, điều này có thể giúp Trung Quốc giành vị thế dẫn đầu trên trường quốc tế, không chỉ về AI mà về mọi thứ.
- Nếu Trung Quốc không thể có được hàng triệu con chip, chúng ta sẽ (ít nhất là tạm thời) sống trong một thế giới đơn cực, nơi chỉ có Mỹ và các đồng minh sở hữu những mô hình này. Chưa rõ liệu thế giới đơn cực này sẽ kéo dài bao lâu, nhưng ít nhất có khả năng là vì các hệ thống AI cuối cùng có thể giúp tạo ra những hệ thống AI thông minh hơn nữa, nên một lợi thế tạm thời có thể được chuyển hóa thành một lợi thế bền vững10. Do đó, trong thế giới này, Mỹ và các đồng minh có thể nắm giữ vị thế dẫn đầu áp đảo và lâu dài trên trường quốc tế.
- Các biện pháp kiểm soát xuất khẩu11 được thực thi nghiêm ngặt là điều duy nhất có thể ngăn cản Trung Quốc sở hữu hàng triệu con chip, và do đó là yếu tố quyết định quan trọng nhất đến việc chúng ta sẽ kết thúc ở một thế giới đơn cực hay lưỡng cực.
- Hiệu năng của DeepSeek không có nghĩa là các biện pháp kiểm soát xuất khẩu đã thất bại. Như tôi đã nêu ở trên, DeepSeek sở hữu một lượng chip từ mức trung bình đến lớn, vì vậy không có gì ngạc nhiên khi họ có thể phát triển và sau đó huấn luyện một mô hình mạnh mẽ. Họ không bị hạn chế về tài nguyên hơn đáng kể so với các công ty AI của Mỹ, và các biện pháp kiểm soát xuất khẩu không phải là yếu tố chính khiến họ "đổi mới". Họ đơn giản là những kỹ sư rất tài năng và cho thấy lý do tại sao Trung Quốc là một đối thủ cạnh tranh nghiêm túc của Mỹ.
- DeepSeek cũng không cho thấy rằng Trung Quốc luôn có thể có được số chip họ cần thông qua buôn lậu, hay các biện pháp kiểm soát luôn có lỗ hổng. Tôi không tin rằng các biện pháp kiểm soát xuất khẩu được thiết kế để ngăn Trung Quốc có được vài chục nghìn con chip. 1 tỷ USD hoạt động kinh tế có thể bị che giấu, nhưng rất khó để che giấu 100 tỷ USD hay thậm chí 10 tỷ USD. Một triệu con chip cũng có thể rất khó để buôn lậu về mặt vật lý. Cũng cần xem xét các loại chip mà DeepSeek hiện được báo cáo là đang sở hữu. Đây là sự kết hợp giữa H100, H800 và H20, [theo SemiAnalysis](https://x.com/dylan522p/status/1883934275516654060), tổng cộng là 50 nghìn con. H100 đã bị cấm theo các biện pháp kiểm soát xuất khẩu kể từ khi ra mắt, vì vậy nếu DeepSeek có bất kỳ con chip nào, chúng chắc chắn đã được buôn lậu (lưu ý rằng Nvidia [đã tuyên bố](https://www.axios.com/2025/01/27/nvidia-shares-deepseek-china-ai) rằng các tiến bộ của DeepSeek "hoàn toàn tuân thủ kiểm soát xuất khẩu"). H800 được cho phép theo vòng [kiểm soát xuất khẩu năm 2022](https://www.federalregister.gov/documents/2022/10/13/2022-21658/implementation-of-additional-export-controls-certain-advanced-computing-and-semiconductor) ban đầu, nhưng đã bị cấm vào tháng 10 năm 2023 khi các biện pháp kiểm soát [được cập nhật](https://www.axios.com/2023/10/17/biden-export-restrictions-ai-chips-china), vì vậy những con chip này có lẽ đã được vận chuyển trước lệnh cấm. H20 kém hiệu quả hơn trong việc huấn luyện và hiệu quả hơn trong việc lấy mẫu — và vẫn được cho phép, mặc dù tôi nghĩ chúng nên bị cấm. Tất cả những điều đó cho thấy rằng một phần đáng kể đội ngũ chip AI của DeepSeek bao gồm các loại chip chưa bị cấm (nhưng đáng lẽ phải bị); các loại chip đã được vận chuyển trước khi bị cấm; và một số loại dường như rất có khả năng đã được buôn lậu. Điều này cho thấy các biện pháp kiểm soát xuất khẩu thực sự đang hoạt động và thích ứng: các lỗ hổng đang được bịt lại; nếu không, họ có thể đã sở hữu một đội ngũ toàn chip H100 hàng đầu. Nếu chúng ta có thể bịt các lỗ hổng đủ nhanh, chúng ta có thể ngăn Trung Quốc có được hàng triệu con chip, từ đó tăng khả năng về một thế giới đơn cực với Mỹ dẫn đầu.

Với trọng tâm của tôi là kiểm soát xuất khẩu và an ninh quốc gia Mỹ, tôi muốn làm rõ một điều. Tôi không coi bản thân DeepSeek là đối thủ và mục đích không phải là nhắm vào họ cụ thể. Trong các cuộc phỏng vấn mà họ đã thực hiện, họ có vẻ là những nhà nghiên cứu thông minh, tò mò, những người chỉ muốn tạo ra công nghệ hữu ích.

Nhưng họ phải chịu sự chi phối của một chính phủ độc tài, vốn đã thực hiện các hành vi vi phạm nhân quyền, hành xử hung hăng trên trường quốc tế và sẽ còn tự do hơn trong các hành động này nếu họ có thể bắt kịp Mỹ về AI. Kiểm soát xuất khẩu là một trong [những công cụ mạnh mẽ nhất của chúng ta](https://www.rand.org/pubs/perspectives/PEA3776-1.html) để ngăn chặn điều này, và ý tưởng cho rằng công nghệ ngày càng mạnh mẽ hơn, mang lại hiệu quả cao hơn trên mỗi đơn vị chi phí, là lý do để dỡ bỏ các biện pháp kiểm soát xuất khẩu của chúng ta là hoàn toàn vô lý.

### Chú thích

1. Tôi không đưa ra bất kỳ quan điểm nào về các báo cáo liên quan đến việc chưng cất (distillation) từ các mô hình phương Tây trong bài luận này. Ở đây, tôi chỉ tin vào lời của DeepSeek rằng họ đã huấn luyện nó theo cách họ đã nói trong bài báo.
2. Nhân tiện, tôi nghĩ việc phát hành các mô hình DeepSeek rõ ràng không gây hại cho Nvidia, và việc cổ phiếu của họ giảm hai con số (~17%) để phản ứng với điều này là điều khó hiểu. Lập luận cho rằng việc phát hành này không gây hại cho Nvidia thậm chí còn rõ ràng hơn việc nó không gây hại cho các công ty AI. Nhưng mục tiêu chính của tôi trong bài viết này là bảo vệ các chính sách kiểm soát xuất khẩu.
3. Để chính xác hoàn toàn, đó là một mô hình đã được huấn luyện trước (pretrained) với lượng huấn luyện RL nhỏ đặc trưng của các mô hình trước khi có sự thay đổi mô hình lý luận (reasoning paradigm shift).
4. Nó mạnh hơn ở một số tác vụ rất hẹp.
5. Đây là con số được trích dẫn trong [bài báo của DeepSeek](https://arxiv.org/html/2412.19437v1) — tôi đang chấp nhận nó theo giá trị thực tế và không nghi ngờ phần này, chỉ nghi ngờ sự so sánh với chi phí huấn luyện mô hình của các công ty Mỹ, và sự khác biệt giữa chi phí để huấn luyện một mô hình cụ thể (là 6 triệu USD) và tổng chi phí R&D (cao hơn nhiều). Tuy nhiên, chúng ta cũng không thể chắc chắn hoàn toàn về con số 6 triệu USD — kích thước mô hình có thể kiểm chứng được nhưng các khía cạnh khác như số lượng token thì không.
6. Trong một số [cuộc phỏng vấn](https://www.youtube.com/watch?v=uvMolVW_2v0&t=637s), tôi đã nói họ có "50.000 con H100", đó là một bản tóm tắt hơi không chính xác về các báo cáo và tôi muốn đính chính ở đây. "Chip Hopper" được biết đến nhiều nhất cho đến nay là H100 (đó là loại tôi cho rằng đang được nhắc đến), nhưng Hopper cũng bao gồm H800 và H20, và DeepSeek được báo cáo là sở hữu sự kết hợp của cả ba loại, tổng cộng là 50.000 con. Điều đó không làm thay đổi tình hình nhiều, nhưng rất đáng để đính chính. Tôi sẽ thảo luận thêm về H800 và H20 khi nói về kiểm soát xuất khẩu.
7. Lưu ý: Tôi kỳ vọng khoảng cách này sẽ tăng lên đáng kể ở thế hệ cụm máy tính tiếp theo, do các biện pháp kiểm soát xuất khẩu.
8. Tôi nghi ngờ một trong những lý do chính khiến R1 thu hút nhiều sự chú ý là vì đây là mô hình đầu tiên cho người dùng thấy chuỗi suy luận (chain-of-thought) mà mô hình thể hiện (o1 của OpenAI chỉ hiển thị câu trả lời cuối cùng). DeepSeek đã cho thấy người dùng thấy điều này thú vị. Cần làm rõ rằng đây là lựa chọn giao diện người dùng và không liên quan đến bản thân mô hình.
9. Lưu ý rằng các con chip của riêng Trung Quốc sẽ không thể cạnh tranh với các con chip do Mỹ sản xuất trong thời gian sớm. Như tôi đã viết trong [bài xã luận gần đây](https://www.wsj.com/opinion/trump-can-keep-americas-ai-advantage-china-chips-data-eccdce91) cùng với Matt Pottinger: "Các con chip AI tốt nhất của Trung Quốc, dòng Huawei Ascend, kém năng lực hơn đáng kể so với con chip hàng đầu do Nvidia của Mỹ sản xuất. Trung Quốc cũng có thể không có năng lực sản xuất để theo kịp nhu cầu ngày càng tăng. Hiện nay không có cụm chip Huawei Ascend đáng chú ý nào bên ngoài Trung Quốc, cho thấy Trung Quốc đang chật vật đáp ứng nhu cầu trong nước...".
10. Cần làm rõ rằng mục tiêu ở đây không phải là từ chối Trung Quốc hay bất kỳ quốc gia độc tài nào khác những lợi ích to lớn về khoa học, y tế, chất lượng cuộc sống, v.v. đến từ các hệ thống AI rất mạnh mẽ. Mọi người đều nên được hưởng lợi từ AI. Mục tiêu là ngăn chặn họ giành được ưu thế quân sự.
11. Một vài liên kết, vì đã có nhiều vòng kiểm soát. Để bao quát một số hành động chính: [Một](https://www.reuters.com/article/technology/us-restricts-exports-to-chinese-semiconductor-firm-fujian-jinhua-idUSKCN1N328E/), [hai](https://www.federalregister.gov/documents/2022/10/13/2022-21658/implementation-of-additional-export-controls-certain-advanced-computing-and-semiconductor), [ba](https://www.axios.com/2023/10/17/biden-export-restrictions-ai-chips-china), [bốn](https://www.bis.gov/press-release/biden-harris-administration-announces-regulatory-framework-responsible-diffusion).
