Tin ngành
Tại sao mô phỏng đang dần thay thế huấn luyện AI: Rẻ hơn 100 lần và nhanh hơn 10.000 lần
(giờ Việt Nam)
Tóm tắt AI
Bài viết phân tích xu hướng sử dụng mô phỏng thay vì dữ liệu thực tế trong huấn luyện AI, giúp tối ưu chi phí và tốc độ vượt trội dù độ chính xác giảm nhẹ.
Bản dịch AI
![[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over](https://substackcdn.com/image/fetch/$s_!Vw9p!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc661e612-544b-4eaa-9603-78e5f28276b7_1956x1228.png)
Theo tiêu chuẩn AI hiện nay, thứ Sáu này khá yên ắng, vì vậy đã đến lúc lùi lại một bước và suy ngẫm về những gì thực sự đang diễn ra. Nếu bạn đã đọc danh sách đọc năm 2025 của chúng tôi, theo dõi các bài viết về Z.ai GLM, hiểu về bước ngoặt của Poolside, theo sát các chủ đề AI for Science và lắng nghe podcast Simile hôm nay, thì bạn không chỉ là một trong những độc giả trung thành nhất của Latent Space, mà có lẽ bạn cũng sẽ hình thành được mô hình tư duy này:

Kể từ năm 2022, mỗi năm lại có thêm một thành phần trong quy trình tạo ra trí tuệ máy móc chuyển từ do con người tạo ra sang do mô hình tạo ra. Không phải dần dần, cũng không phải đồng đều — mỗi bước chuyển đổi đều có một "bệnh nhân số 0", một bài báo hoặc sản phẩm mà ở đó phiên bản tổng hợp lần đầu tiên trở thành thành phần chịu tải tại một phòng thí nghiệm tiên phong, và từ đó trở đi, tương lai đơn giản là đã ở đây nhưng chưa được đưa vào sản xuất.
Và nếu nhìn kỹ hơn, những gì chúng ta từng gọi là "dữ liệu tổng hợp" (synthetic data), "rubric tổng hợp", "nhà nghiên cứu AI" và "môi trường RL đầu cuối" (end-to-end RL environments) thực chất chỉ là mô phỏng con người ngày càng tham vọng hơn — tệ hơn 10%, nhưng rẻ hơn 100 lần và nhanh hơn 10.000 lần.
Điều đầu tiên trở nên tổng hợp, trái với trực giác, chính là người đánh giá (judge). InstructGPT đã thiết lập thủ thuật kinh điển hiện nay: thu thập sở thích của con người một lần, huấn luyện một mô hình phần thưởng (reward model), và để chính sách (policy) tối ưu hóa dựa trên mô hình đó thay vì con người. Từ góc độ của chính sách, thứ đưa ra sự phê duyệt vốn đã là một LLM. Constitutional AI đã đẩy xa hơn khi để AI tự phê bình dựa trên một tập hợp các nguyên tắc (RLAIF), và Lee cùng các cộng sự sau đó đã chứng minh phản hồi của AI tương đương với phản hồi của con người với chi phí chỉ bằng một phần nhỏ. Đến khi LLM-as-judge trở thành phương pháp đánh giá mặc định (MT-Bench, AlpacaEval), toàn bộ bộ máy phê duyệt — phần thưởng, phê bình, đánh giá — đều chạy trên các mô hình đánh giá mô hình.
Dòng Phi của Microsoft đã khẳng định điều này ngay trong tiêu đề: Textbooks Are All You Need (Sách giáo khoa là tất cả những gì bạn cần). Một mô hình nhỏ được huấn luyện trên dữ liệu chất lượng như sách giáo khoa do LLM tổng hợp đã đạt hiệu suất vượt xa số lượng tham số của nó, và phi-1.5 đã xác nhận đó không phải là sự ăn may. WRAP của Apple đã khái quát hóa bước đi này: đừng chỉ tạo dữ liệu, hãy diễn giải lại toàn bộ web bằng LLM, và quá trình tiền huấn luyện sẽ hiệu quả hơn khoảng 3 lần. Từ đó, quy trình này được công nghiệp hóa — Nemotron-4 340B của NVIDIA ra mắt với tính năng nổi bật là quy trình tạo dữ liệu tổng hợp được cấp phép rộng rãi, và đến năm 2025, các tập dữ liệu suy luận (các chuỗi suy nghĩ được tạo ra bởi các bộ suy luận mạnh) đã trở thành thành phần tiêu chuẩn trong tiền huấn luyện và huấn luyện trung gian. Tập dữ liệu, thứ vốn được coi là đầu vào không thể thay thế của con người, giờ đây phần lớn đã do mô hình viết.
Vài tuần sau khi API của ChatGPT mở ra, Alpaca của Stanford đã chứng minh rằng việc tinh chỉnh (fine-tune) với giá 600 USD trên các hướng dẫn do GPT tạo ra có thể sao chép phần lớn hành vi của một mô hình tiên phong. Vicuna đã làm điều đó với các cuộc hội thoại được chia sẻ; Orca thực hiện với các giải thích phong phú từ giáo viên thay vì chỉ đưa ra câu trả lời đơn thuần. Kỹ thuật này đã trưởng thành từ việc bắt chước thành một kỷ luật huấn luyện thực thụ — việc chưng cất tri thức tổng quát theo chính sách (on-policy generalized knowledge distillation) đã khắc phục sự không khớp giữa huấn luyện và suy luận — và đạt đến đỉnh cao văn hóa khi DeepSeek-R1 ra mắt một loạt các mô hình chưng cất bên cạnh mô hình chủ lực, biến "giáo viên là một mô hình" thành giả định mặc định cho mọi bản phát hành mô hình nhỏ kể từ đó.
Các giai đoạn 1–3 đã làm cho các đầu vào trở nên tổng hợp; giai đoạn 4 là nơi vòng lặp bắt đầu khép kín, bởi vì mô hình bắt đầu tự quyết định những gì cần học tiếp theo. Các mảnh ghép đã tồn tại từ sớm — Self-Instruct (các mô hình tự viết tập hướng dẫn của riêng chúng) và STaR (các mô hình tự khởi động các chuỗi suy luận của riêng chúng) đều xuất hiện từ năm 2022 — nhưng bước ngoặt thực sự đến khi Self-Rewarding Language Models của Meta và SPIN cho thấy một mô hình có thể tự tạo ra các nhiệm vụ, tự đánh giá đầu ra của chính nó và cải thiện vượt qua giới hạn của dữ liệu sở thích con người. Thiết kế chương trình giảng dạy — về mặt lịch sử là phần thủ công nhất của ML, sự lựa chọn dựa trên thị hiếu về việc nên huấn luyện gì tiếp theo — đã trở thành thứ mà các mô hình tự thực hiện cho chính mình.
Kỷ nguyên hỗ trợ (Copilot, sau đó là SWE-agents) vẫn giữ con người trong vai trò chọn lựa các thí nghiệm. Kỷ nguyên khám phá thì không. AlphaEvolve của DeepMind đã phát triển các thuật toán thực sự mới vào năm 2025, và AI Scientist của Sakana (hiện đã có trên Nature!) đã phác thảo toàn bộ quy trình viết bài báo khoa học. Khoảnh khắc lớn là tính năng autoresearch của Karpathy vào tháng 3 năm 2026: một vòng lặp tự động có chủ đích, nơi một tác nhân lập trình sửa đổi thiết lập huấn luyện LLM thực tế, chạy một thí nghiệm năm phút, chỉ giữ lại thay đổi nếu độ mất mát xác thực (validation loss) được cải thiện, và lặp lại qua đêm. Quá trình chạy mở rộng của chính anh ấy đã tích lũy 700 thí nghiệm thành 20 cải tiến được giữ lại, rút ngắn thời gian đạt đến GPT-2 từ 2,02 xuống 1,80 giờ — những thay đổi mã nguồn thực tế, có thể chuyển đổi được tìm thấy trong khi anh ấy ngủ.
Nút thắt mở rộng của RL đã chuyển từ mô hình sang môi trường: bạn cần hàng ngàn thế giới nhiệm vụ có thể thực thi, xác minh được và thực tế một cách chuyên nghiệp, và con người không thể xây dựng thủ công đủ nhanh. Chúng tôi đã đề cập điều này gần đây trong số báo z.ai / GLM-5.3: Z.ai đã xây dựng các quy trình tổng hợp môi trường từ đầu đến cuối — các tác nhân nghiên cứu khai thác các mô hình làm việc thực tế và chuyển đổi chúng thành các môi trường dài hạn với trạng thái ẩn, một tác nhân đánh giá thử nghiệm từng nhiệm vụ để xác nhận tính khả thi, và các bộ xác minh được tổng hợp mà không cần xem giải pháp tham chiếu, sau đó được kiểm tra áp lực với các kiểm tra oracle, no-op và trạng thái chưa giải quyết cho đến khi phần thưởng nhị phân của chúng đủ tin cậy để huấn luyện trực tiếp. Như bản phát hành GLM-5.3 đã nêu, toàn bộ ngăn xếp môi trường, đánh giá và xác minh đều là tổng hợp từ đầu đến cuối. Cùng tuần đó, Ornith-1.5 ra mắt với tuyên bố tự cải thiện đầu cuối — mô hình tự đề xuất nhiệm vụ và tạo ra các lượt chạy RL của riêng nó. Phòng tập, trọng tài và bảng điểm giờ đây đều là các mô hình.
Nếu các mô hình có thể đóng vai trò là người đánh giá, giáo viên và môi trường, thì vai trò còn lại của con người trong vòng lặp là đối tượng — nguồn gốc của sở thích, hành vi và nhu cầu. Đó là lớp mà Simile đang thay thế. Dòng dõi này bắt đầu từ Generative Agents của Joon Sung Park (Smallville, 2023) thông qua Generative Agent Simulations của 1.000 người, nơi các bản sao kỹ thuật số được xây dựng từ các cuộc phỏng vấn tiểu sử kéo dài hai giờ đã tái tạo lại các phản hồi khảo sát và hành vi của con người gốc chính xác đến 85% so với cách chính những con người đó tự tái tạo sau hai tuần.
Rào cản lớn cần vượt qua: các mô hình tiên phong được huấn luyện để trở thành các mô hình tác nhân, điều này khiến chúng trở thành những mô phỏng tồi về con người thực — vì vậy Simile thực hiện hậu huấn luyện trên các cuộc phỏng vấn, dữ liệu giao dịch và các RCT đã đăng ký từ Open Science Framework để khôi phục lại sự thiên kiến, tính không nhất quán và kết cấu nhân quả của con người, đồng thời báo cáo các quy luật mở rộng sớm cho chất lượng mô phỏng. Với SimGym tại Shopify mô phỏng quỹ đạo người mua sắm và cách tiếp cận tỷ người của Tencent ở mức độ thô sơ, nhóm tập trung (focus group), nghiên cứu người dùng và bảng thử nghiệm A/B đang trở thành các khối lượng công việc suy luận.
Hàng cuối cùng của lưới không bao giờ chuyển sang màu đỏ hoàn toàn, và đó chính là vấn đề. Bức thư "reverse-execuhire" của Poolside đã vạch ra ranh giới chính xác: các vấn đề của thế giới chia thành các vấn đề bị giới hạn bởi trí tuệ (có thể giải quyết bằng cách mở rộng nhận thức, sớm được thương mại hóa bởi các trọng số mở) và các vấn đề bị giới hạn bởi thí nghiệm, nơi "không lượng trí tuệ nào có thể thay thế cho phản hồi thí nghiệm trong thế giới thực — 100.000 bộ óc thiên tài cũng sẽ không chữa được ung thư nếu không có phòng thí nghiệm ướt (wet lab)." Đặt cược của họ là giá trị bền vững của AI sẽ thuộc về bất kỳ ai sở hữu vòng lặp thí nghiệm: AI như "cỗ máy khám phá khoa học giá trị nhất thế giới".
Mảng sinh học đang thực hiện cùng một chiến lược từ hướng ngược lại. CZ Biohub đang hình ảnh hóa Bản đồ tế bào người (Human Cell Atlas) thành một tế bào ảo — bởi vì in silico rẻ hơn và nhanh hơn khoảng 1000 lần so với in vivo — và mở rộng hướng tới một hệ thống miễn dịch ảo, với các phòng thí nghiệm mang hình dáng trung tâm dữ liệu của Chai, Xaira và Lila đang lấp đầy ngăn xếp AI-for-science. Thế giới vật lý là thành phần duy nhất không thể tổng hợp hoàn toàn — chỉ có thể nén lại, từng tế bào một, vào các mô hình.
Đọc lại lưới một lần nữa và một mô hình thứ hai xuất hiện bên dưới mô hình thứ nhất. Mỗi bước chuyển đổi đều được báo trước bởi cùng một sự phản đối — sự sụp đổ của mô hình (model collapse), sự chồng chất ảo giác, rác vào rác ra — và mỗi bước chuyển đổi vẫn xảy ra, đúng vào thời điểm một cơ chế xác minh làm cho phiên bản tổng hợp trở nên đáng tin cậy: lọc tích cực cho sách giáo khoa của Phi, các nghiên cứu đồng thuận giữa các giám khảo cho các đánh giá LLM, các bài kiểm tra đơn vị và trình kiểm tra chứng minh cho RLVR, các kiểm tra oracle/no-op cho các bộ xác minh của z.ai, các RCT đã đăng ký cho các bản sao của Simile, vòng lặp phòng thí nghiệm ướt cho tế bào ảo. Biên giới tổng hợp không tiến lên khi việc tạo ra trở nên tốt hơn. Nó tiến lên khi việc xác minh làm được điều đó.
Điều này gợi ý về hướng đi tiếp theo. Hình tam giác màu xám còn lại ở góc dưới bên trái của lưới — thí nghiệm vật lý, chân lý thực tế được hiện thực hóa — chính xác là khu vực mà việc xác minh chậm nhất và đắt đỏ nhất. Các mô hình đã học cách viết, sau đó là đánh giá, sau đó là thực hành, và sau đó là thí nghiệm. Câu hỏi còn lại của thập kỷ là chúng sẽ cần chạm vào bao nhiêu phần của thực tại — và chúng có thể thoát khỏi việc mô phỏng bao nhiêu phần trong đó.
Tệ hơn 10%, rẻ hơn 100 lần, nhanh hơn 10.000 lần… và đang cải thiện nhanh chóng trên CẢ ba khía cạnh.
Một lần nữa, với cảm xúc:
Tin tức AI từ 20/8/2026-21/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/hủy nhận email theo tần suất!
Các mô hình ẩn danh (Stealth Models), áp lực tiên phong từ Trung Quốc và nỗ lực đa phương thức của DeepSeek
Ox Alpha đã trở thành mô hình bí ẩn trung tâm của ngày: nhiều nhà phát triển báo cáo hiệu suất lập trình và tác nhân mạnh bất thường, với các suy đoán hội tụ về một mô hình thuộc dòng Zhipu/GLM — có thể là GLM-5.3 Vision hoặc một biến thể flash thay vì một mô hình cơ sở khổng lồ mới. Các báo cáo bao gồm Theo nói rằng nó đang "càn quét" các điểm chuẩn nội bộ, sau đó hợp nhất 8 PR dựa trên sự phê duyệt của nó, và Kimmonismus trích dẫn >80% trên 10 nhiệm vụ DeepSWE so với 65% của Fable và 52% của GPT-5.6 Sol. Sự phân phối trong cộng đồng diễn ra nhanh chóng thông qua Hermes Agent/OpenCode/OpenRouter và Cline.
Đọc hiểu kỹ thuật mạnh mẽ nhất từ đám đông là "hậu huấn luyện + cơ sở hạ tầng > quy mô thuần túy": một số ý kiến độc lập lập luận rằng hồ sơ tốc độ và phong cách của Ox Alpha trông giống một dẫn xuất GLM hiệu quả hơn là một con quái vật 1T+. Xem Tim Dettmers về đầu ra nhanh hơn / tiền điền (prefill) một phần yếu hơn cho thấy ít tham số hoạt động hơn, scaling01 lập luận rằng đó có thể là một giáo viên lớn hơn được chưng cất thành các mô hình lớp 5.3, và teortaxesTex liên tục thu hẹp về GLM-5.3/5.4 Vision. Cách giải thích đó phù hợp với luận điểm rộng hơn từ phân tích chi tiết về GLM-5.3: các lợi ích đến từ cùng một cơ sở 743B như GLM-5.2, với các cải tiến được cho là nhờ hậu huấn luyện được mở rộng, các sandbox tốt hơn và SAO để phân bổ tín dụng tinh tế hơn trong các nhiệm vụ tác nhân dài hạn, được tóm tắt trong chuỗi bài của ZhihuFrontier.
DeepSeek đã ra mắt bản phát hành cụ thể nhất trong ngày: DeepSeek-V4-Flash-Vision-Exp bổ sung hỗ trợ đa phương thức trong khi được cho là vẫn giữ nguyên khả năng văn bản của V4-Flash, với DeepSeek tuyên bố hiệu suất tác nhân đa phương thức gần bằng Opus-4.8. Việc triển khai bao gồm hỗ trợ API văn bản + hình ảnh hỗn hợp với 117–384 token hình ảnh được tính phí theo giá Flash và API Files mới cho các tệp tải lên có thể tái sử dụng. Điều này dường như đã giải quyết ít nhất một phần sự nhầm lẫn về Ox Alpha, với các nhà quan sát lưu ý rằng mô hình bí ẩn có khả năng là một "VLM bị làm mù" (blinded VLM) trong một số bài kiểm tra.
Tín hiệu rộng hơn: Các phòng thí nghiệm Trung Quốc đang nén biên giới về cả giá/hiệu năng và các tác nhân đa phương thức. Điều đó được củng cố bởi Kimmonismus khi lập luận rằng một Ox Alpha lớp GLM-5.3 Flash được đồn đại sẽ buộc các phòng thí nghiệm Mỹ phải phản ứng, và bởi SemiAnalysis khi đặt câu hỏi trực tiếp liệu các mô hình mở có đang bắt kịp hay không.
OpenAI, Codex và Kinh tế học về giá cả/sử dụng
OpenAI đã cắt giảm giá GPT-5.6 Sol hơn 20% trong ba tháng cho các sản phẩm API và dựa trên tín dụng, được công bố bởi @OpenAI và @OpenAIDevs. Điều này cộng dồn với các chương trình khuyến mãi cấp sản phẩm như giảm giá 50% của Code đến ngày 3 tháng 9 và ghi chú của Cognition rằng trên Devin, Sol hiện thực tế giảm 76% so với giá niêm yết đến ngày 3 tháng 10 sau khi kết hợp các chiết khấu. Động thái này được hiểu là cả bản cập nhật về hiệu suất/sử dụng và phản ứng cạnh tranh với suy luận giá rẻ của Trung Quốc.
Việc sử dụng Codex dường như đang bùng nổ: thsottiaux cho biết Codex đã đạt 20 triệu người dùng hoạt động và cấp cho tất cả người dùng Codex và ChatGPT Work một "lần đặt lại ngân hàng", nhanh chóng được Theo và Kimmonismus khuếch đại. Cũng có những giai thoại về việc sản phẩm vượt quá giới hạn dự kiến, ví dụ Theo tuyên bố một mục tiêu chạy dài đã tiêu tốn khoảng 800 USD token sau khi anh ấy đã đạt mức 0% còn lại.
OpenAI đã bổ sung các kiểm soát chi tiêu tốt hơn: các nhóm hiện có thể theo dõi việc sử dụng và chi tiêu theo khóa API và đặt giới hạn cứng hàng tháng cho tổ chức/dự án, hữu ích khi khối lượng công việc tác nhân trở nên ít dự đoán được hơn và đồng thời hơn.
Tâm lý thị trường đã chuyển dịch trở lại OpenAI trong các công cụ khởi nghiệp: immad gợi ý rằng thị phần khởi nghiệp của Anthropic có thể đã đạt đỉnh trong quý 1, với Sol và Codex "xoay chuyển tình thế trở lại". Song song đó, một số người dùng coi Sol là mô hình toàn diện tốt nhất hiện nay cho các nhiệm vụ lập trình/toán học/tác nhân, ví dụ như nhận định của DimitrisPapail là "mô hình có khả năng nhất hiện có cho hầu hết mọi nhiệm vụ".
Các tác nhân, bộ khai thác (harnesses) và sự chuyển dịch sang huấn luyện lấy môi trường làm trung tâm
Trọng tâm đang chuyển từ các câu lệnh (prompts) sang môi trường: chủ đề thực chất nhất ở đây một lần nữa là cách giải thích về việc mở rộng sandbox của GLM-5.3: cùng một mô hình cơ sở, nhưng hiệu suất dài hạn tốt hơn từ các môi trường thực thi phong phú hơn và phân bổ tín dụng phản thực tế kiểu SAO. Điều này phù hợp với các công việc khác được chia sẻ hôm nay: EnvHarness / EnvRigger của Google điều chỉnh các môi trường tĩnh bằng cách sử dụng lớp plugin và định hình lại do chính sách chẩn đoán, cải thiện hiệu suất giữ lại lên đến 9 điểm với số bước thực thi ít hơn 9,8%.
Các điểm chuẩn đang trở nên đặc thù hơn theo nhiệm vụ và khó hơn: FACET tạo ra các nhiệm vụ đầu cuối có thể thực thi từ các kỹ năng tác nhân và đã xác thực 6.078 nhiệm vụ; SWE-bench Science giới thiệu 119 nhiệm vụ phần mềm khoa học nơi ngay cả Claude Code + Opus-5 cũng có tỷ lệ pass@1 dưới 50%; CADBench cho thấy các mô hình hàng đầu chỉ đạt tỷ lệ vượt qua 24,6% trên các nhiệm vụ Fusion 360 thực tế; và AI4AI-Bench kiểm tra khả năng tự cải thiện đệ quy trên 10 kho lưu trữ nghiên cứu, với mô hình tốt nhất chỉ đạt điểm trung bình 0,288.
Cơ sở hạ tầng tác nhân đang trở nên thương mại hóa hơn: GitHub đã triển khai các quy trình làm việc tác nhân cộng tác vào Slack và Teams, với Slack mô tả các luồng giống như Devin nơi tác nhân nhận nhiệm vụ, mở PR và lồng ghép thiết kế bên trong kênh chia sẻ (ví dụ). Cũng có công việc liên tục về thời gian chạy tác nhân: nac v0.1.3 đã thêm các cây công việc git được sandbox, tổ chức phiên và đọc hình ảnh nhận thức thị giác; Hermes Agent đã cung cấp Ox Alpha và mở ra "chế độ Blank Slate" cộng với việc cắt tỉa kỹ năng tự động; và OpenHands đã chuyển mặc định miễn phí của mình sang Kimi K3.
Độ chính xác khi phục vụ suy luận trong RL đã có một kết quả hệ thống quan trọng: IsoExec của vLLM giải quyết các sự không khớp logprob khi huấn luyện/triển khai do tính không kết hợp của số dấu phẩy động, thực thi tính chẵn lẻ bitwise trên các bố cục TP/EP/SP. Trên Qwen3.5-35B-A3B với DAPO trên 8xH100, sự khác biệt logprob được báo cáo đã giảm từ 1.6e-2 xuống 6.7e-7 với mức chi phí tăng thêm 25,3%.
Điểm nổi bật nghiên cứu: Định tuyến, Tái tuần hoàn và Robot
Các ý tưởng kiến trúc tại thời điểm suy luận: một bài báo của DeepMind về Tái tuần hoàn (Recirculation) đã thu hút sự chú ý vì đưa các kích hoạt lớp sâu hơn có ngữ cảnh trở lại quá trình xử lý sớm hơn tại thời điểm suy luận, mà không cần huấn luyện lại. Bản tóm tắt trích dẫn các cải tiến bao gồm -60% lỗi ngữ cảnh hóa, -23% độ phức tạp (perplexity) và +21% GSM8K trong các thí nghiệm được báo cáo (chuỗi bài).
Định tuyến mô hình đã được xử lý một cách có nguyên tắc hơn: Pandora’s Router từ Google DeepMind định khung định tuyến như một bài toán tìm kiếm tối ưu với việc kiểm tra tốn kém, thay vì giả định các ước tính định tuyến là miễn phí. Tuyên bố: nó phù hợp với chất lượng ước tính toàn diện trong khi gọi các bộ ước tính đắt tiền ít thường xuyên hơn, bao gồm cả các cài đặt với các LLM chuyên gia và suy luận tại thời điểm suy luận thay đổi.
Robot có hai bản cập nhật mạnh mẽ: NVIDIA AVO được cho là đã giải quyết tất cả 183 cấp độ trên 25 môi trường ARC-AGI-3 công khai, mặc dù François Chollet cảnh báo đây là bộ demo/hướng dẫn công khai thay vì toàn bộ điểm chuẩn. Riêng biệt, Jim Fan đã giới thiệu T-Rex, một ngăn xếp thao tác khéo léo phản ứng xúc giác với các chuyên gia thị giác/xúc giác không đồng bộ cộng với những gì được mô tả là tập dữ liệu xúc giác mở lớn nhất cho đến nay: 50 giờ / ~5.500 tập / phần cứng 22-DoF.
Cơ sở hạ tầng, Tính toán và Các mô hình mở
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.