Tin ngành
AMD thâu tóm Taalas: Cuộc đua chip suy luận AI đang nóng dần lên
(giờ Việt Nam)
Tóm tắt AI
AMD vừa chính thức mua lại Taalas, một động thái chiến lược cho thấy cuộc đua về chip suy luận AI đang trở nên khốc liệt hơn bao giờ hết.
Bản dịch AI
![[AINews] AMD buys Taalas](https://substackcdn.com/image/fetch/$s_!qA0L!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd3b60b0e-d47f-4723-bb40-be9594e9bab4_786x754.png)
Trong bài "The Custom ASIC Thesis", chúng tôi đã nhận định rằng Taalas là cái tên đáng chú ý, và trong bài "The Inference Inflection", chúng tôi đã dự đoán mọi thứ sẽ chuyển sang xu hướng theo chiều dọc (vertical). Tập podcast về Baseten của chúng tôi đã đưa ra một số quan điểm hoài nghi về các LLM được khắc (etched LLMs), chứ không chỉ riêng các ASIC tùy chỉnh, nhưng rõ ràng Lisa Su hiện tại không đồng tình với điều đó.

Taalas Inc.@taalas_inc
Chúng tôi vui mừng thông báo rằng Taalas đã đồng ý gia nhập AMD. Chúng tôi xây dựng Taalas để tái định nghĩa suy luận AI (AI inference) ngay từ nền tảng: phần cứng được thiết kế xoay quanh mô hình, thay vì ngược lại. Kết quả là dòng silicon suy luận nhanh nhất và tiết kiệm chi phí nhất thế giới. Gia nhập AMD.
8:10 Tối · 6 tháng 8, 2026 · 158K Lượt xem
30 Phản hồi · 38 Lượt đăng lại · 317 Lượt thích
Chúc mừng!

Tin tức AI từ 5/8/2026 đến 6/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận/hủy nhận email theo tần suất!
Sự bứt phá của Muse Spark 1.2 từ Meta: Huy chương vàng Olympic, cải thiện điểm chuẩn và hiệu suất giá cạnh tranh.
Muse Spark 1.2 đã nhanh chóng chuyển từ vị thế "không có tên trên bảng xếp hạng" lên hàng ngũ tiên phong. Trên Vals Index, Muse Spark 1.2 lọt vào top 5 với mức giá $0,69/lần kiểm tra, được cho là rẻ hơn 3 lần so với Kimi và rẻ hơn 10 lần so với Fable, Opus và 5.6 Sol. Vals sau đó cho biết mô hình này cũng trở thành mô hình đầu tiên đạt trên 60% trong Finance Agent v2 với mức giá $0,77/lần kiểm tra, so với vị trí số 1 trước đó là Opus 5 với giá $5,12/lần kiểm tra và tốc độ nhanh gấp đôi (ValsAI). Bản vá v4.1.1 của Artificial Analysis cũng ghi nhận một trong những mức tăng điểm lớn nhất cho Muse Spark 1.2 sau khi cập nhật cách chấm điểm (Artificial Analysis).
Meta cũng tuyên bố đạt được kết quả "suy luận thuần túy" mạnh mẽ bất thường. Meta cho biết các mô hình thuộc dòng Muse Spark được đào tạo nội bộ đã đạt hiệu suất cấp huy chương vàng trong năm kỳ thi Olympic STEM, bao gồm điểm số lý thuyết tuyệt đối tại APhO và IPhO, cùng với hiệu suất cấp huy chương vàng tại IMO, IChO và RMM; ba trong số đó được thực hiện dưới điều kiện thi đấu trực tiếp và được chấm điểm chính thức (AI at Meta, Trapit Bansal). Meta nhấn mạnh rằng không sử dụng công cụ—không tìm kiếm, không mã nguồn, không máy tính—và cho rằng một phần thành quả này đến từ việc điều phối đa tác nhân (multi-agent orchestration) với suy luận song song. Tuyên bố đó ngay lập tức làm bùng nổ cuộc tranh luận đang diễn ra về "LLMs vs harnesses vs neurosymbolic", với việc các nhà phê bình và người ủng hộ diễn giải thiết lập này theo những cách khác nhau (fchollet, giffmana).
Điểm rút ra rộng hơn: các kỹ sư ngày càng coi việc điều phối tác nhân (agentic orchestration), TTC và giao thức đánh giá là các tính năng sản phẩm hạng nhất. Câu chuyện về Muse không hẳn là "một mô hình chiến thắng" mà là "chất lượng mô hình + điều phối + giá cả + năng lực phục vụ" hiện đang quyết định sự chấp nhận của thị trường. Khung tư duy đó đã xuất hiện trong các phản ứng so sánh tốc độ hiện tại của Meta với Google một cách tích cực và nhấn mạnh rằng các mô hình "Watermelon" lớn hơn vẫn đang được mong đợi (Rihard Jarc, alexandr_wang).
Hợp nhất mô hình ChatGPT của OpenAI, mở rộng gói miễn phí và thúc đẩy plugin/bảo mật.
OpenAI đã gộp "instant" và "thinking" thành một mô hình chat trả phí duy nhất. Công ty thông báo rằng GPT-5.6 Sol hiện cung cấp năng lượng cho cả Instant và suy luận chuyên sâu cho người dùng Plus/Pro trong ChatGPT, với thanh trượt nỗ lực suy luận mới để lựa chọn giữa tốc độ và độ toàn diện (OpenAI, OpenAI). OpenAI cho biết Sol phiên bản cập nhật mang lại số phản hồi sai lệch thực tế ít hơn 68% so với GPT-5.5 Instant trong một bài đánh giá quan trọng bao gồm tài chính, y tế và luật (OpenAI). Nhiều nhân viên OpenAI coi thay đổi này là một cột mốc về khả năng sử dụng: một mô hình, một giao diện chat, nỗ lực có thể điều chỉnh (gdb, michpokrass).
Kinh tế học của gói miễn phí đã trở nên quyết liệt hơn nhiều. OpenAI cho biết người dùng Free và Go sẽ nhận được các cuộc trò chuyện văn bản không giới hạn với GPT-5.6 Luna bắt đầu từ ngày mai, cộng với nút Think cho các câu hỏi khó hơn (OpenAI). Điều này được hiểu rộng rãi là một động thái phân phối tiêu dùng lớn (sama, kimmonismus). ARC Prize cũng đã chạy lại GPT-5.6 Luna sau khi giảm giá 80% và báo cáo khả năng không đổi với chi phí thấp hơn nhiều: 59,6% trên ARC-AGI-2 với giá $0,18/tác vụ và 90,7% trên ARC-AGI-1 với giá $0,07/tác vụ (arcprize).
Diện tích bề mặt dành cho nhà phát triển cũng được mở rộng. OpenAI đã giới thiệu Agent Plugins, một tiêu chuẩn mở được xây dựng cùng với AWS, Cursor, GitHub, Vercel và những bên khác để đóng gói Agent Skills và cấu hình máy chủ MCP trong một định dạng chia sẻ, với sự hỗ trợ ra mắt trên Codex, ChatGPT, Cursor, GitHub Copilot, Kiro và Code (OpenAIDevs, OpenAIDevs). OpenAI cũng đã ra mắt Codex Security Review trong bản xem trước nghiên cứu, nhằm thực hiện đánh giá bảo mật nhận biết ngữ cảnh repo trực tiếp trên các GitHub PR (OpenAIDevs, gdb).
Theo dõi tin đồn: một vụ rò rỉ chưa được xác minh nhưng được lan truyền mạnh mẽ tuyên bố rằng "Astra"—được mô tả là mô hình tiền huấn luyện lớn mới nhất của OpenAI kể từ GPT-4.5 và được gọi nội bộ là mewfour—có thể ra mắt vào tuần tới (synthwavedd). Tin đồn lan truyền rộng rãi, nhưng không có xác nhận nào trong tập hợp nguồn tin.
Các tác nhân (agents), harnesses và cơ sở hạ tầng MCP đang trở thành chiến trường hệ thống thực sự.
Cloudflare đã thực hiện một trong những bước đẩy cơ sở hạ tầng thực chất nhất trong ngày. Trong Tuần lễ Tác nhân (Agents Week), công ty đã làm nổi bật Kitesurf, một trình duyệt không trạng thái (stateless) chạy hoàn toàn trên Workers, được thiết kế cho các trường hợp sử dụng tác nhân nơi Chromium đầy đủ là quá mức cần thiết. Điểm nhấn kỹ thuật: tách script/DOM khỏi quá trình kết xuất (rendering), khởi tạo các worker kết xuất một cách lười biếng (lazily) chỉ khi cần thiết, và cắt giảm đáng kể chi phí CPU/bộ nhớ so với tự động hóa trình duyệt tiêu chuẩn (ashleypeacock, imluisduarte). Cloudflare cũng thúc đẩy WebMCP, các nâng cấp Tìm kiếm AI, công cụ AI Readiness/AEO cấp bảng điều khiển và một bài blog về lõi không trạng thái được viết lại của MCP phù hợp hơn với cơ sở hạ tầng web hàng hóa như Workers (mattzcarey).
MCP đang chuyển từ sự mới lạ sang điều kiện tiên quyết. Ngoài Cloudflare, Weaviate đã thêm một endpoint /v1/mcp tích hợp trên cùng cổng với REST API với các công cụ kiểm tra bộ sưu tập, liệt kê tenant, tìm kiếm lai và upsert đối tượng—không cần dịch vụ MCP riêng biệt, với RBAC và các nút chuyển đổi độc lập cho quyền truy cập MCP/ghi (weaviate_io). Việc đóng gói plugin tương thích với MCP cũng được thúc đẩy nhờ sự ra mắt Agent Plugins của OpenAI và sự hỗ trợ của Cursor (cursor_ai).
Cuộc tranh luận trong ngành đã chuyển từ "harnesses có quan trọng không?" sang "trí thông minh nằm ở đâu?". François Chollet lập luận rằng một harness suy luận thời gian thực lớn điều phối nhiều cuộc gọi thần kinh (neural calls), theo định nghĩa, là neurosymbolic, và các hệ thống hiện tại thường là "bánh mì kẹp biểu tượng" (symbolic sandwiches) thay vì các chương trình thần kinh đầu-cuối (fchollet, fchollet, fchollet). Những người khác phản bác rằng trong khi harnesses quyết định khả năng, mô hình vẫn là nguồn cốt lõi của trí thông minh/khả năng tổng quát hóa (Andrew Lampinen, Andrew Lampinen). Đây hiện là một câu hỏi kỹ thuật thực tế, không phải triết học: định tuyến, điều phối, lược đồ công cụ và các eval harnesses đang thay đổi kết quả một cách rõ ràng.
Các mô hình đa tác nhân đang được thương mại hóa. Có một số dấu hiệu cho thấy các nhóm đang áp dụng các quy trình làm việc giống như bầy đàn (swarm-like): điều phối tác nhân dựa trên luồng ad hoc (swyx), các tác nhân Gemini tự đặt tên và cộng tác (fofrAI), các thử nghiệm của Hugging Face/Gemma với 149 tác nhân cộng tác và một nỗ lực cộng tác chứng minh toán học mở mới (ClementDelangue, cmpatino_). Cognition cũng dựa nhiều vào các tác nhân đám mây như một năng lực kỹ thuật bền bỉ (cognition).
Phục vụ mô hình mở, định tuyến và kỹ thuật chi phí.
Định tuyến suy luận (Inference routing) đang trở thành một con hào cạnh tranh. Cursor mô tả Router của họ được đào tạo trên hàng triệu tương tác trong sản phẩm mỗi tuần để phân loại và định tuyến các yêu cầu nhằm giảm độ trễ và chi phí, đồng thời thừa nhận rõ ràng rằng không có mô hình đơn lẻ nào thống trị tất cả các loại tác vụ: Grok 4.5 cho các tác vụ thông thường, GPT-5.6 Sol cho lập kế hoạch/hiểu codebase, Opus 5 cho công việc nặng về thực thi, Fable 5 cho gỡ lỗi/triển khai hình ảnh (cursor_ai, cursor_ai).
Tính khả dụng của mô hình mở tiếp tục mở rộng trên các nền tảng. Baseten trở thành nhà cung cấp suy luận chính thức của Hugging Face cho Kimi K3, DeepSeek V4 Flash và GLM-5.2 (baseten); Perplexity Computer chọn GPT-5.6 Terra làm mô hình mặc định cho các tác nhân phụ và Luna cho các tự động hóa theo lịch trình (perplexity_ai, AravSrinivas); và GitHub Copilot bắt đầu triển khai Kimi K3 được lưu trữ bởi Fireworks trước khi tạm dừng do sự cố GitHub Actions, đồng thời công bố giá $3/1M đầu vào, $15/1M đầu ra và $0,30/1M đầu vào được lưu trữ (code, github).
Tối ưu hóa chi phí/hiệu suất vẫn rất quan trọng. Unsloth cho biết DSpark giúp DeepSeek-V4-Flash-0731 GGUFs chạy nhanh hơn 1,4–2 lần tại chỗ mà không làm thay đổi độ chính xác, đạt 120 tok/s trong một số cài đặt (UnslothAI). Các bình luận riêng biệt về kinh tế học của DeepSeek chỉ ra rằng ngay cả khối lượng phục vụ tổng hợp lớn vẫn ngụ ý doanh thu token tổng thể tương đối khiêm tốn ở mức giá hiện nay (thdxr).
vLLM và các công ty hệ sinh thái liên quan tiếp tục định vị xung quanh việc phục vụ mở ở quy mô sản xuất. vLLM quảng bá các công thức phục vụ Kimi K3 đã được xác minh (vllm_project) và các kế hoạch hội nghị, trong khi thông điệp của Inferact/vLLM nhấn mạnh vào 500K+ GPU và cơ sở hạ tầng sản xuất mô hình mở ngày đầu tiên (vllm_project, inferact).
Khoa học, đánh giá và các tập dữ liệu thế giới vật lý.
Google DeepMind đã mở mã nguồn một mô hình thời tiết có tác động cao. WeatherNext 2, được xuất bản trên Nature, được cho là cung cấp thêm khoảng một ngày thời gian dự báo trước về bão nhiệt đới—được mô tả là khoảng một thập kỷ tiến bộ dự báo trong một bước nhảy vọt—và đang được phát hành cùng với mã nguồn và trọng số mô hình (GoogleDeepMind, NewsFromGoogle). Về mặt vận hành, DeepMind cho biết hệ thống hiện tạo ra 1.000 dự đoán xác suất cho mỗi cơn bão và trong cơn bão Hurricane Melissa đã đưa ra dự đoán đổ bộ cấp 5 trước 5 ngày với độ tin cậy 80% (GoogleDeepMind).
Các điểm chuẩn tiếp tục chuyên biệt hóa vào suy luận miền thay vì QA chung chung. Elicit đã giới thiệu BioDecisionBench, một điểm chuẩn bắt nguồn từ 26 trường hợp thất bại trong suy luận khoa học sự sống phức tạp trên 40 biến thể tác vụ, tập trung vào việc liệu các hệ thống có phát hiện được các yếu tố gây nhiễu, vấn đề nhạy cảm, điểm cuối thay thế và các lỗi liên quan trong việc ra quyết định phát triển thuốc hay không (elicitorg). Epoch AI đã ra mắt một điểm chuẩn "câu đố trò chơi" mới sử dụng một trò chơi không được tiết lộ để thăm dò suy luận trong các cài đặt có khả năng nằm ngoài phân phối; Opus 5 hiện dẫn đầu với 59% (EpochAIResearch).
Dữ liệu AI vật lý đã có một bản phát hành mở đáng chú ý. RekaDaily-10k mang đến 10.312 giờ quay phim gia đình góc nhìn thứ nhất không kịch bản, bao gồm ~1.670 giờ ở độ phân giải 4K gốc, được thu thập trên khắp Hoa Kỳ, Mỹ Latinh, Châu Á và Châu Phi, theo giấy phép Apache 2.0. Reka đóng khung đây là "sự lộn xộn thực sự của thế giới thực" cần thiết cho AI vật lý thay vì dữ liệu tổng hợp hoặc được dàn dựng cẩn thận (RekaAILabs).
Khả năng diễn giải và tương tác người dùng-mô hình cũng chứng kiến công việc cụ thể. Transluce báo cáo các hiệu ứng "nhận thức người dùng" trên 21 trong số 24 mô hình được thử nghiệm, nơi hành vi mô hình thay đổi dựa trên danh tính người dùng được cảm nhận; đối với Claude, những thay đổi mạnh nhất tập trung vào các nhà nghiên cứu an toàn AI (TransluceAI). Về khía cạnh khả năng diễn giải, Goodfire nhấn mạnh việc sử dụng Silico để thăm dò các biểu diễn trong các mô hình chuyển động của con người và VLM (GoodfireAI, GoodfireAI).
Các tweet hàng đầu (theo mức độ tương tác, được lọc theo mức độ liên quan kỹ thuật)
Cập nhật OpenAI ChatGPT: hợp nhất GPT-5.6 Sol cho các cuộc trò chuyện trả phí và GPT-5.6 Luna không giới hạn cho người dùng miễn phí/go (OpenAI).
OpenAI Agent Plugins: tiêu chuẩn đa khách hàng mới để đóng gói kỹ năng và cấu hình máy chủ MCP (OpenAIDevs).
Tin đồn OpenAI Astra: tuyên bố được chia sẻ rộng rãi nhưng chưa được xác minh về một mô hình tiền huấn luyện lớn mới sắp ra mắt (synthwavedd).
Kết quả Olympic của Meta: năm hiệu suất cấp huy chương vàng từ các mô hình dòng Muse Spark trong điều kiện không sử dụng công cụ (AIatMeta).
Cập nhật Cloudflare Kitesurf + MCP: một trong những gói thông báo cơ sở hạ tầng tác nhân dày đặc nhất trong ngày (ashleypeacock).
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.