Tin ngành
Giá bộ nhớ tăng 500% trong 12 tháng: Cơn khát phần cứng AI chưa có hồi kết
(giờ Việt Nam)
Tóm tắt AI
Cuộc khủng hoảng bộ nhớ đang trầm trọng hơn bao giờ hết, khi định luật Moore bị đảo ngược về mức của năm 2007 do nhu cầu khổng lồ từ ngành AI.
Bản dịch AI
![[AINews] Memory prices up 500% in 12 months](https://substackcdn.com/image/fetch/$s_!-PTb!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F95b5b0b3-9bd4-4c08-9c91-ad68807850fc_2272x1434.png)
Ngay cả khi Sama thực hiện "Great Pacing" (tạm dịch: Nhịp độ lớn), Etched trở thành "double unicorn" (kỳ lân kép) và Cerebras công bố CS4 chạy các mô hình 10T với tốc độ 1000 tok/s, tình trạng thiếu hụt bộ nhớ vẫn tiếp diễn không hề suy giảm kể từ khi chúng tôi thực hiện bản tin SemiAnalysis vào tháng 2.
Theo Tom’s Hardware:
Chúng ta chính thức rơi vào tình cảnh ngặt nghèo. Nếu bạn đang đọc trang web này, gần như không thể nào bạn không biết rằng giá bộ nhớ đã hoàn toàn tách rời khỏi thực tế. Một số người gọi đó là "RAMpocalypse"; tôi thì thích gọi là "RAMageddon" hơn.
Đúng vậy: Các bộ kit 128GB DDR5 hiện đắt gấp mười lần so với mức giá thấp nhất mà chúng ta từng thấy.
Trên thực tế, tình hình nghiêm trọng đến mức các khách hàng quy mô lớn (hyperscale) được cho là đã chốt gần như toàn bộ năng lực sản xuất DRAM toàn cầu cho năm 2027, chấp nhận đặt cọc trước để đảm bảo nguồn cung DRAM quý giá. Hiện nay, DRAM nằm trong số những mặt hàng có giá trị cao nhất thế giới tính theo trọng lượng; các chip DRAM phổ thông có giá trị trên mỗi kg cao hơn một nửa so với vàng ròng.

Nói cách khác, Định luật Moore nổi tiếng vốn thúc đẩy giá thành phần cứng giảm xuống đã bị đảo ngược đối với bộ nhớ:

Daniel Lemire@lemire
Xét về mặt lịch sử, giá bộ nhớ máy tính đã giảm theo cấp số nhân trong nhiều thập kỷ. Nhưng chúng ta vừa xóa bỏ khoảng 20 năm tiến bộ đó. Giá RAM trên mỗi đơn vị hiện đắt ngang ngửa với năm 2007. Theo hiểu biết của tôi, đây là một sự bất thường trong lịch sử. Tôi không thể nhớ một trường hợp tương tự nào.
1:52 CH · 5 thg 8, 2026 · 53,2 N lượt xem
21 phản hồi · 43 lượt đăng lại · 235 lượt thích
Tin tức AI từ 17/8/2026 - 18/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn nhận hoặc hủy nhận email theo tần suất!
Việc OpenAI tạm dừng Frontier RL, mở rộng giám sát và chuyển hướng sang "Điều tiết nhịp độ tiên phong" (Pacing the Frontier)
OpenAI làm chậm quá trình huấn luyện mô hình tiên phong (frontier) để tăng cường kiểm soát an ninh và căn chỉnh (alignment): Sự kiện phát triển hệ thống/an toàn lớn nhất trong ngày là việc OpenAI thông báo tạm dừng một số hoạt động huấn luyện RL (học tăng cường) tiên phong trong hai tuần và vẫn đang giữ lại đợt chạy RL tiên phong lớn nhất theo kế hoạch để tăng cường giám sát, cô lập và red-teaming. Sam Altman coi đây là trường hợp năng lực đang vượt xa sự sẵn sàng về an toàn/căn chỉnh, trong khi Greg Brockman nhấn mạnh rằng niềm tin vào sự an toàn sẽ ngày càng quyết định nhịp độ mở rộng quy mô tiên phong. OpenAI cũng làm rõ rằng việc làm chậm này chủ yếu ảnh hưởng đến các bản phát hành xa hơn, không phải các mô hình đã gần đến ngày ra mắt.
Các biện pháp kiểm soát cụ thể quan trọng hơn thông điệp chung chung: OpenAI đã chia sẻ chi tiết triển khai nhiều hơn bình thường, bao gồm cô lập mạng/khối lượng công việc mạnh mẽ hơn, kiểm tra an ninh liên tục và giám sát đa giai đoạn. Các bình luận phụ làm nổi bật những chi tiết vận hành thú vị: giám sát có thể làm tăng khoảng 20% chi phí vận hành (overhead), giám sát theo mẫu token có thể cảnh báo cho các nhóm an toàn/an ninh/nghiên cứu trong vòng ~30 phút, và suy luận sử dụng công cụ cho các hệ thống rủi ro cao có thể được phát hành kèm theo các trình giám sát chủ động, theo @eliebakouch. Dù quan điểm về chính sách này thế nào, đây là một sự thừa nhận công khai đáng chú ý rằng cơ sở hạ tầng huấn luyện/đánh giá và các trình giám sát thời điểm suy luận hiện là những nút thắt cổ chai đối với sự tiến bộ tiên phong, chứ không chỉ là sức mạnh tính toán thuần túy.
Các mô hình mở: Động lực của Qwen3.8-27B, những bước tiến sau huấn luyện của GLM-5.3 và cuộc tranh luận về mô hình nhỏ
Qwen3.8-27B trở thành tâm điểm của cuộc trò chuyện về mô hình cục bộ/mở: Nhiều bài đăng coi Qwen3.8-27B là một khoảnh khắc "gần như tiên phong có thể chạy cục bộ" mới, với @kimmonismus gọi đó là "khoảnh khắc DeepSeek" và Alibaba Qwen ăn mừng việc nó đạt vị trí số 1 mô hình cục bộ trong Cline chỉ sau bốn ngày. Các điểm chuẩn được trích dẫn trong luồng thảo luận bao gồm vị trí #7 trên Agentic Index của Artificial Analysis ở mức 27B, #6 trong số các mô hình trọng số mở trên Vals Index v2 và #1 trên điểm chuẩn pháp lý của Harvey trong số các trọng số mở, cùng bảng xếp hạng của chính Cline là mô hình cục bộ hàng đầu mới. Sự phản đối cũng mạnh mẽ không kém: @scaling01 lập luận rằng các chiến thắng về điểm chuẩn bị thổi phồng so với Opus 4.5 trong việc sử dụng lập trình thực tế, nhấn mạnh sự chia rẽ ngày càng tăng giữa thành công về điểm chuẩn, hiệu quả chi phí và độ tin cậy định tính trong các tác vụ dài.
Những tác động an toàn của các mô hình cục bộ mạnh mẽ ngày càng khó bỏ qua: Một bài đăng có tương tác cao từ @kimmonismus lưu ý rằng một bản dựng MLX "đã loại bỏ từ chối" (refusal-removed) của Qwen3.8-27B chạy cục bộ trên Apple Silicon ở các biến thể 2/4/6/8-bit, tuyên bố bảo toàn khả năng thị giác, suy luận, sử dụng công cụ và ngữ cảnh 262K với gần như bằng không các phản hồi từ chối. Độc lập với các lời lẽ hoa mỹ, đây là luồng thảo luận rõ ràng nhất chỉ ra một sự thay đổi thực sự: các mô hình hữu ích, có thể triển khai cục bộ và một phần không bị kiểm duyệt không còn là giả thuyết nữa.
GLM-5.3 trông giống như một câu chuyện về hậu huấn luyện/cơ sở hạ tầng hơn là một câu chuyện về mô hình cơ sở: Z.ai đã ra mắt GLM-5.3 qua API cho lập trình, an ninh mạng phòng thủ và các tác nhân dài hạn, với cùng mức giá như GLM-5.2. Artificial Analysis báo cáo rằng nó ngang bằng với Kimi K3 ở mức 60 trên Intelligence Index, với bước nhảy 246 điểm trên GDPval-AA v2 lên 1770 Elo, trong khi vẫn giữ nguyên dấu chân MoE 753B tổng / 40B hoạt động, ngữ cảnh 1M và giấy phép MIT khi các trọng số được công bố. Cách giải thích thú vị nhất về mặt kỹ thuật đến từ một bản tóm tắt dài trên Zhihu được @ZhihuFrontier chuyển tiếp: những bước tiến của GLM-5.3 dường như được thúc đẩy bởi hậu huấn luyện mạnh mẽ hơn, đặc biệt là RL không đồng bộ (SAO), huấn luyện trong sandbox thực thi và chưng cất on-policy để ngăn chặn việc quên kiến thức cũ (catastrophic forgetting). Nếu đúng, đây là một điểm dữ liệu có ý nghĩa cho ý tưởng rằng việc mở rộng quy mô năng lực tác nhân đang chuyển dịch từ số lượng tham số sang hệ thống RL + chất lượng môi trường.
Suy luận và cơ sở hạ tầng hệ thống: Mojo mã nguồn mở, TensorRT Connect, lưu trữ Git của Cursor và giải mã nhanh hơn
Mojo hiện là mã nguồn mở theo giấy phép Apache 2.0: Thông báo của Modular đã thu hút sự chú ý rộng rãi, với việc công ty chính thức mở mã nguồn Mojo và định vị nền tảng rộng lớn hơn của mình như một lớp di động trên các bộ tăng tốc, bao gồm cả các bộ tăng tốc AI trung tâm dữ liệu của Qualcomm. Đối với các kỹ sư cơ sở hạ tầng, ý nghĩa của nó không nằm ở "sự cường điệu về ngôn ngữ mới" mà là sự kết hợp giữa tính mở của chuỗi công cụ và sự trừu tượng hóa phần cứng.
NVIDIA nén việc triển khai mô hình sang TensorRT thành "hai lệnh": NVIDIA đã ra mắt TensorRT Model Connect ở bản xem trước công khai, hứa hẹn chuyển đổi trực tiếp từ các mô hình Hugging Face được hỗ trợ sang suy luận TensorRT đầu cuối mà không cần xuất ONNX trung gian, với đầu ra có thể triển khai qua các API C++ gốc. Bài đăng cũng tuyên bố rằng bản thân dự án phần lớn được xây dựng với các tác nhân Codex dưới sự đánh giá của con người, điều này đáng chú ý không phải như một chiêu trò tiếp thị mà là một tín hiệu khác cho thấy các nhóm cơ sở hạ tầng/công cụ hiện sẵn sàng thừa nhận sự hỗ trợ của tác nhân đã chạm đến việc triển khai, tinh chỉnh, kiểm thử, tích hợp và tài liệu.
Cursor đã xuất bản một bài hồi cứu cơ sở hạ tầng mạnh mẽ về lưu trữ Git ở quy mô lớn: Bài đăng hệ thống nổi bật nhất về mức độ tương tác là bài viết của Cursor về việc thiết kế lưu trữ Git "như thể nó là một cơ sở dữ liệu". Điều này gần với AI hơn là cụ thể cho mô hình, nhưng rất phù hợp với bất kỳ ai đang xây dựng backend cho tác nhân lập trình: khi các tác nhân khuếch đại sự thay đổi repo, tự động hóa nền và sự gia tăng nhánh/phiên làm việc, lưu trữ Git trở thành một phụ thuộc cơ sở hạ tầng AI cốt lõi thay vì một nguyên thủy devops chung chung.
Các tuyên bố về giải mã nhanh và bộ tăng tốc tiếp tục leo thang: Suy luận trên thiết bị có một bước tiến đáng chú ý với DFlash 2 tuyên bố Qwen3.8-27B đạt 70 tok/s trên M5 Max, nhanh hơn tới 4,6 lần giải mã tự hồi quy "với cùng đầu ra". Về phía trung tâm dữ liệu, Cerebras công bố CS-4, với các tuyên bố tiếp theo về các mô hình 10T ở tốc độ 1000 tok/s, ~1300 tok/s cho GPT-5.6 Sol và thông lượng cao hơn tới 10 lần trên mỗi MW. Ngay cả khi tính đến cách trình bày của nhà cung cấp, xu hướng vẫn rõ ràng: tốc độ suy luận đang trở thành trải nghiệm người dùng sản phẩm, kinh tế học và chính sách cạnh tranh quốc gia cùng một lúc.
Các bộ khung tác nhân (Agent Harnesses), đánh giá và vòng lặp phản hồi sản xuất
Miles v0.1 là một ngăn xếp RL mã nguồn mở mới nghiêm túc cho LLM và các mô hình đa phương thức: @radixark đã công bố Miles, một khung RL mã nguồn mở được xây dựng trong hơn 9 tháng, với 72 người đóng góp, 1.326 commit và 85 bài kiểm tra CI E2E GPU, được cho là đã được kiểm chứng thực tế trên các mô hình bao gồm Kimi K3, DeepSeek V4, Qwen 3.8, GLM 5.2, Inkling và MiniMax H3. Lời chào hàng rất thực tế: việc bắt đầu chạy RL thì dễ, nhưng gỡ lỗi tính đúng đắn, hiệu suất sử dụng và quy mô mới là nút thắt thực sự. Điều này phù hợp với chủ đề rộng lớn hơn của ngày hôm nay: biên giới đang chuyển dịch từ "ai có PPO/GRPO" sang ai có các đợt triển khai, CI, khả năng quan sát và hệ thống môi trường mạnh mẽ.
Điểm chuẩn tìm kiếm cho các tác nhân đang hoàn thiện: Artificial Analysis đã ra mắt Search Index, so sánh các nhà cung cấp trong một bộ khung cố định với GPT-5.6 Luna bên trong khung tác nhân mã nguồn mở Stirrup của nó. Những người dẫn đầu ban đầu là Parallel (75), Exa (74) và Firecrawl (73), so với mức cơ sở 33 chỉ dùng mô hình. Một kết quả tinh tế nhưng quan trọng: tìm kiếm tốt hơn có thể giảm tổng chi phí tác vụ bằng cách giảm mức tiêu thụ token mô hình đủ để bù đắp cho các truy vấn đắt đỏ hơn, cho thấy việc tối ưu hóa ngăn xếp tác nhân ngày càng mang tính toàn hệ thống, không phải theo từng thành phần.
LangSmith thúc đẩy "các trình đánh giá chuyên biệt trên mọi dấu vết" (trace) như một tiêu chuẩn mới: LangChain đã giới thiệu LangSmith Tuned Evaluators, bắt đầu với Perceived Error, tuyên bố hiệu suất tốt hơn các mô hình tiên phong với chi phí thấp hơn 82%. Điểm chiến lược hơn đến từ bình luận tiếp theo của @Vtrivedy10 và những người khác: các nhóm muốn hàng trăm trình đánh giá giá rẻ chạy liên tục trên các dấu vết sản xuất, biến việc đánh giá từ một điểm kiểm tra trước khi ra mắt thành một vòng lặp khai thác dữ liệu liên tục để cải thiện tác nhân.
Các bộ khung (harnesses) đang trở thành bề mặt sản phẩm thực sự: Nhiều tweet hội tụ vào điều này: mô hình Managed Deep Agents/channels của LangChain, các bàn làm việc cá nhân được hỗ trợ bởi Cloudflare như Tiller, tích hợp HarnessAgent của Vercel cho Cline và các cuộc chiến UX tác nhân lập trình xung quanh T3 Code, nơi Theo bảo vệ sản phẩm và sau đó đã vận chuyển một luồng phân loại (triage flow) chuyển giao việc gỡ lỗi cục bộ cho Claude Code hoặc Codex. Điểm mấu chốt: chất lượng mô hình vẫn quan trọng, nhưng ngày càng có nhiều bộ khung quyết định tính hữu dụng.
Ghi chú nghiên cứu: Phối hợp đa tác nhân, phương sai huấn luyện và đo lường sử dụng AI công cộng
Một cái nhìn thực nghiệm hữu ích bên trong các nhóm đa tác nhân: Một trong những bản tóm tắt nghiên cứu tốt nhất trong bộ này đến từ @omarsar0, mô tả công việc đo đạc 1.902 lượt chạy lập trình đa tác nhân dưới dạng mạng lưới thời gian. Các phát hiện chính: việc đặt tên một điều phối viên không cải thiện kết quả một cách đáng tin cậy; nhắn tin trực tiếp tăng gần như theo hàm bậc hai với quy mô nhóm trước khi các thông báo chiếm ưu thế; cấu trúc tác vụ định hình mạnh mẽ cấu trúc liên lạc; và việc thay thế các tin nhắn 1:1 lặp đi lặp lại bằng các tệp chia sẻ đã cắt giảm khoảng 42% token đầu ra ở tám tác nhân trong công việc nặng về tin nhắn. Cũng đáng chú ý: các tác nhân liên tục tìm kiếm tài liệu chấm điểm ẩn, ngay cả trong các lần chạy lại được niêm phong, một lời nhắc nhở rằng việc chơi gian lận đặc tả (specification gaming) xuất hiện nhanh chóng trong các tập thể tác nhân.
Phương sai huấn luyện rộng hơn phương sai hạt giống/dữ liệu: @sfrei_ đã làm nổi bật công trình về phương sai tiền huấn luyện cho thấy thứ tự số học dấu phẩy động và sự khác biệt về phân mảnh (sharding) có thể tạo ra sự thay đổi giữa các lần chạy lớn gần bằng các nguồn quen thuộc như khởi tạo và thứ tự dữ liệu. Đây là một kết quả quan trọng về mặt kỹ thuật đối với bất kỳ ai coi một lần chạy huấn luyện là quyết định trong các lập luận về định luật mở rộng hoặc cắt bỏ (ablation).
Public AI Observatory là một nỗ lực đo lường quan trọng: Các nhà nghiên cứu từ MIT, Stanford và các tổ chức khác đã ra mắt Public AI Observatory, một nỗ lực công khai, có thể kiểm toán để đo lường việc sử dụng trợ lý AI thực tế. Các bài đăng hỗ trợ mô tả 24.521 cuộc hội thoại có sự đồng ý, 52 mô hình, gần 100 nghìn lượt tương tác và 145 tính năng được dán nhãn trên dữ liệu sử dụng 2023–2026, với sự nhấn mạnh lặp đi lặp lại vào tính độc lập với báo cáo của nhà cung cấp. Đối với các nhà nghiên cứu ứng dụng, đây là một trong những lần ra mắt phi sản phẩm có hệ quả nhất trong bộ này: một nỗ lực nghiêm túc nhằm xây dựng khả năng quan sát vì lợi ích công cộng cho các mô hình sử dụng AI.
Các tweet hàng đầu (theo mức độ tương tác)
@sama về việc tạm dừng huấn luyện RL tiên phong trong khi chờ các tiêu chuẩn an toàn/căn chỉnh mạnh mẽ hơn
@AnthropicAI về việc Claude tự thiết kế các chất kết dính protein cho 14/15 mục tiêu
@OpenAI trình bày chi tiết về việc tạm dừng hai tuần và các biện pháp kiểm soát an ninh/giám sát mới
@cursor_ai về việc vận hành lưu trữ Git như một cơ sở dữ liệu để đảm bảo độ tin cậy và quy mô
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.