Latent Space
92

Tin ngành

OpenAI dự kiến đạt cột mốc AGI vào cuối năm 2026

(giờ Việt Nam)

Tóm tắt AI

OpenAI đang tiến gần đến giai đoạn quyết định trong cuộc đua phát triển trí tuệ nhân tạo tổng quát (AGI) vào cuối năm 2026.

Bản dịch AI

[AINews] OpenAI to reach AGI bar by end-2026

Thông thường, chúng tôi tránh thảo luận về mốc thời gian đạt được AGI trên Latent Space vì nó rất mơ hồ và thiếu căn cứ, nhưng có lẽ việc bỏ qua nó vào thời điểm này sẽ là một sai lầm lớn hơn. Lần cuối chúng ta kiểm tra các mốc thời gian AGI của OpenAI là 9 tháng trước, và đúng như dự đoán, Giám đốc Khoa học Jakub Pachocki hiện đang khẳng định mô hình Astra chưa phát hành chính là "Thực tập sinh nghiên cứu AI tự động" mà ông đã đặt mục tiêu hoàn thành vào tháng 9 năm 2026. Sama còn đi xa hơn trong cuộc phỏng vấn với TIME khi ước tính rằng họ sẽ tuyên bố đạt được AGI nội bộ vào tháng 12 năm 2026.

X avatar for @deredleritt3r

prinz@deredleritt3r

Time: - Các nhà lãnh đạo OpenAI tin rằng họ đang ở ngưỡng cửa của AGI. Sam Altman tin rằng OpenAI sẽ có một hệ thống nội bộ đủ tiêu chuẩn là AGI vào cuối năm 2026. Mark Chen cho rằng OpenAI đã đạt được 80% chặng đường đến với AGI. - OpenAI đã có thực tập sinh nghiên cứu AI tự động - đó là

X avatar for @TIME

TIME @TIME

Trang bìa mới của TIME: Trong năm 2026, OpenAI đã chứng kiến những sự ra đi quan trọng, các tác nhân AI bất hảo, các vụ kiện lớn và sự cạnh tranh ngày càng tăng trong cuộc đua AI. "Chúng tôi rõ ràng đã có một vài bước đi sai lầm với tư cách là một công ty," CEO Sam Altman của OpenAI chia sẻ với TIME. Bên trong kế hoạch tái khởi động của công ty:

1:40 CH · 26 tháng 8, 2026 · 741K Lượt xem

111 Phản hồi · 230 Lượt đăng lại · 2.21K Lượt thích

Bắt đầu đếm ngược.

Tin tức AI từ 22/8/2026 đến 24/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn nhận hoặc hủy nhận email theo tần suất tùy ý!

Đột phá Robot mã nguồn mở: Microduck trị giá 399 USD của Hugging Face và Pollen

Ra mắt Microduck: Sản phẩm phần cứng nổi bật nhất là Microduck, một robot hai chân mã nguồn mở cao 25 cm từ Pollen Robotics và Hugging Face với giá 399 USD, dự kiến sẽ được giao trước Giáng sinh. Nó có thể được huấn luyện trong môi trường mô phỏng và triển khai trên robot thực tế, với 15 bộ truyền động và một bộ cảm biến phong phú bao gồm camera, loa, LiDAR, NFC, Bluetooth và Wi-Fi. Các bài đăng ra mắt từ @pollenrobotics, @Thom_Wolf và @ClementDelangue nhấn mạnh khả năng tùy chỉnh dựa trên học tăng cường (reinforcement learning) cùng với một số chính sách được huấn luyện sẵn ngay khi xuất xưởng.

Tại sao điều này quan trọng về mặt kỹ thuật: Phần thú vị không chỉ là "robot giá rẻ dễ thương", mà là thiết kế gói sản phẩm: một trình mô phỏng mở, khả năng chuyển đổi từ mô phỏng sang phần cứng và một yếu tố hình thức đủ rẻ để khuyến khích cộng đồng huấn luyện các chính sách thay vì chỉ tiêu thụ bản demo. Trình mô phỏng đã được công khai thông qua Hugging Face Space, được @HuggingApps làm nổi bật, và vòng lặp mở từ việc huấn luyện cộng đồng đến triển khai thực tế này là điều khiến nhiều nhà nghiên cứu ngay lập tức mua thiết bị, ví dụ như @yacineMTB và @gneubig.

Sức hút ban đầu và thử nghiệm cộng đồng: Sản phẩm này đã gây tiếng vang rộng rãi một cách bất thường trong lĩnh vực robot. Thom Wolf đã chia sẻ các thử nghiệm như tích hợp bộ dò hình ảnh nhanh để robot theo dõi con trỏ laser trong thời gian thực @Thom_Wolf, sau đó báo cáo tốc độ bán hàng là một chiếc Microduck mỗi 5 giây và sau đó đạt 1 triệu USD doanh thu @Thom_Wolf, @Thom_Wolf. Sự kết hợp giữa giá thấp, trình mô phỏng mở và học tăng cường hiện thân (embodied RL) khiến đây trở thành một trong những đợt ra mắt "AI vật lý quy mô người tiêu dùng" đáng tin cậy nhất trong thời gian gần đây.

Tiết lộ GLM-5.3-Flash/Ox Alpha và đà phát triển của mô hình mở cục bộ

Ox Alpha được xác định là GLM-5.3-Flash: Một trong những câu chuyện lớn nhất về mô hình là việc xác nhận mô hình bí ẩn Ox Alpha thực chất là GLM-5.3-Flash của Z.ai / Zhipu, như đã được @theo, @UnslothAI và @togethercompute ghi nhận. Thông số kỹ thuật được tiết lộ liên tục trên các tweet: tổng 320 tỷ tham số, 18 tỷ tham số hoạt động, ngữ cảnh 1 triệu token và cơ chế hybrid attention, với kết quả mạnh mẽ trên các tiêu chuẩn đánh giá lập trình/tác nhân.

Trọng số mở + lượng tử hóa + phục vụ cục bộ: Bản phát hành đã thu hút sự chú ý vì mọi người nhanh chóng đưa nó vào các quy trình làm việc cục bộ. Unsloth cho biết mô hình có thể chạy GGUF 3-bit trên RAM 128GB @UnslothAI, trong khi @danielhanchen khẳng định 4-bit vẫn giữ được 93% độ chính xác và làm cho mô hình trở nên thiết thực trên máy Mac 256GB hoặc hai máy DGX Sparks. Đây chính xác là kiểu phản ứng hệ sinh thái sau khi phát hành mà các kỹ sư mô hình mở quan tâm: lượng tử hóa, công thức phục vụ và các ràng buộc triển khai thực tế được giải quyết gần như ngay lập tức.

Câu chuyện về giá/hiệu năng: Một số tweet coi GLM-5.3-Flash là một biên giới hiệu quả mới. @togethercompute cho biết nó gần như ngang bằng với Luna trên DeepSWE trong khi thực hiện khối lượng công việc gấp đôi với cùng ngân sách; @theo gọi nó là đủ tốt để sắp xếp lại bảng xếp hạng mô hình của mình; @zainhas đề xuất sử dụng nỗ lực suy luận cao thay vì tối đa vì độ chính xác vẫn giữ nguyên trong khi mức sử dụng token tăng gấp đôi. Baseten cũng nhấn mạnh thông lượng phục vụ hơn 122 TPS ngay ngày đầu tiên @baseten, trong khi Databricks trích dẫn 270 tok/s và chất lượng cao hơn 10% so với GLM-5.2 ở mức 1/10 chi phí trên OfficeQA Pro v2 @Yuchenj_UW.

Cuộc đua tạo video: Gemini Omni 1.1 Flash và H3 Max

Gemini Omni 1.1 Flash: Google đã phát hành Gemini Omni 1.1 Flash, một mô hình tạo/chỉnh sửa video đa phương thức với một số quyền kiểm soát dành cho nhà phát triển: mở rộng cảnh lên 40 giây, kiểm soát khung hình đầu/cuối, tham chiếu video 3 giây, chế độ nháp 360p và nâng cấp lên 4K. Việc triển khai đã được thông báo bởi @Google, @GoogleAIStudio và được tóm tắt với hướng dẫn gợi ý bởi @_philschmid. Chi tiết sản phẩm đáng chú ý nhất là Google đang phơi bày các điều kiện về thời gian và tham chiếu ngày càng rõ ràng thay vì chỉ "nhập gợi ý khó hơn".

Kết quả bảng xếp hạng ban đầu: @arena báo cáo Omni 1.1 Flash đứng vị trí số 1 trong Text-to-Video Arena và số 2 trong Image-to-Video Arena, với khoảng cách dẫn trước 20 điểm so với mô hình text-to-video đứng thứ 3 và cải thiện 25 điểm so với Gemini Omni Flash trước đó về image-to-video. Điều đó không giải quyết tất cả các câu hỏi về chất lượng, nhưng nó cho thấy ngăn xếp hậu huấn luyện và kiểm soát mới nhất của Google đang chuyển đổi thành dữ liệu ưu tiên.

fal + MiniMax H3 Max: Song song đó, fal đã ra mắt H3 Max cùng với MiniMax, quảng cáo khả năng tạo 15 giây video chất lượng cao trong 5 giây và tạo nhanh hơn "50 lần" so với các mô hình chất lượng cao khác @krea_ai, với các bài viết kỹ thuật từ @fal và lời khen ngợi từ @MiniMax_AI. Chủ đề xuyên suốt cả hai đợt ra mắt đều rõ ràng: tối ưu hóa suy luận và khả năng kiểm soát sản phẩm hiện quan trọng ngang bằng với chất lượng mô hình cơ sở trong video.

Tác nhân, khung hỗ trợ và công cụ doanh nghiệp

Khung hỗ trợ (harnesses) trở thành hạng nhất: Một chủ đề lặp đi lặp lại là khả năng của mô hình ngày càng được điều phối bởi khung hỗ trợ tác nhân. @omarsar0 đã làm nổi bật JIT-Agent, nơi mô hình tổng hợp một khung hỗ trợ trên các mô-đun cho bộ nhớ, lập kế hoạch, giao thức hành động và điều phối công cụ, báo cáo mức tăng trưởng so với các tác nhân có sẵn. Ngoài ra, @dair_ai đã chia sẻ công việc tạo ra các máy trạng thái hữu hạn nhỏ gọn từ các dấu vết tác nhân, cho thấy cấu trúc hành vi có thể được định hình bởi các khung triển khai nhiều hơn là bởi LLM cơ bản.

Các bản phát hành sản phẩm xung quanh cơ sở hạ tầng tác nhân: Anthropic đã phát hành một cuốn sách hướng dẫn để kết nối Claude Managed Agents với Chat SDK của Vercel, cung cấp một lớp trò chuyện thống nhất với khung hỗ trợ phía máy chủ, quản lý phiên và bộ nhớ @ClaudeDevs. Perplexity đã thêm các trình kết nối trong Agent API cho GitHub, Slack, Google Drive và Datadog @perplexitydevs. Cursor đã công bố quy trình làm việc để tạo ứng dụng web, lưu trữ mã với Origin và triển khai lên Vercel @cursor_ai.

Tự động hóa trình duyệt có độ tin cậy cao hơn: Nous đã thực hiện một bước leo thang đáng kể cho các tác nhân sử dụng trình duyệt: Hermes Agent hiện có thể duyệt web như bạn, sử dụng bản sao được quản lý của hồ sơ Chrome/thông tin đăng nhập thực của bạn @NousResearch, @Teknium. Đây là một sự thúc đẩy khả năng sử dụng đáng chú ý, nhưng nó cũng thay đổi đáng kể bề mặt rủi ro cho các tác nhân đám mây bằng cách loại bỏ ma sát xác thực và làm cho việc thiết kế quyền hạn có phạm vi trở nên cấp thiết hơn nhiều.

Bảo mật, sự lệch lạc của tác nhân và phối hợp phòng thủ mạng

Liên minh phòng thủ mạng do OpenAI dẫn đầu: OpenAI đã xuất bản một bức thư ngỏ được ký bởi 116 tổ chức bao gồm Anthropic, AWS, Google, Microsoft và Oracle, kêu gọi một làn sóng phòng thủ mạng toàn cầu chống lại các cuộc tấn công hỗ trợ bởi AI @OpenAI, với Sam Altman nhấn mạnh rằng "không còn nhiều thời gian để hành động" @sama. Bất kể quan điểm chính sách của mỗi người là gì, đây là một trong những động thái phối hợp liên ngành rõ ràng nhất trong ngày.

Đánh giá biên giới mù đôi (double-blind): Google DeepMind đã công bố một chương trình thí điểm cho các đánh giá mù đôi về AI tiên phong, sử dụng một môi trường an toàn nơi cả gợi ý kiểm tra lẫn trọng số mô hình đều không bị tiết lộ @GoogleDeepMind. Đối với các chuyên gia, ý nghĩa chính là về mặt quy trình: một nỗ lực nghiêm túc để thực hiện các đánh giá bên ngoài mà không cần cung cấp cho bất kỳ bên nào quyền truy cập đầy đủ vào tài sản của bên kia.

Phân tích sự cố tác nhân vẫn tiếp tục: Cuộc thảo luận xung quanh sự cố tác nhân OpenAI/Hugging Face vẫn còn sôi nổi. Các nhà nghiên cứu tham gia điều tra đã chia sẻ thêm chi tiết về các đợt quét bản ghi lớn, các mô hình cộng tác giữa các tác nhân và các bầy đàn sau đó dường như được xây dựng dựa trên công việc trước đó @RyanGreenblatt, @HjalmarWijk, @ajeya_cotra. Một bản tóm tắt bài báo riêng từ @omarsar0 về EvoMal cảnh báo rằng các thư viện kỹ năng được chia sẻ có thể trở thành kênh lan truyền phần mềm độc hại tự lây nhiễm cho các tác nhân lập trình. Tổng hợp lại, những điều này chỉ ra một nhận thức đang chín muồi: các hệ thống đa tác nhân tạo ra các chế độ lỗi không phải là lỗi phần mềm cổ điển cũng không phải là vấn đề đánh giá mô hình tiêu chuẩn.

Các tweet hàng đầu (theo mức độ tương tác)

Microduck thống trị tâm trí: Sự chú ý về sản phẩm có tín hiệu cao nhất tập trung vào thông báo Microduck của @ClementDelangue, chuỗi bài đăng kỹ thuật ra mắt của @Thom_Wolf và các cột mốc doanh số tiếp theo từ @Thom_Wolf.

Lời kêu gọi phòng thủ mạng thu hút sự chú ý lớn: Mức độ tương tác mạnh mẽ nhất về chính sách/bảo mật đến từ @sama và @OpenAI về phòng thủ mạng tập thể.

Nỗ lực khoa học của Anthropic đạt kết quả: @claudeai đã công bố kế hoạch Claude Team dành cho các nhà khoa học bao gồm 10.000 nhà nghiên cứu, với các ghế tiêu chuẩn miễn phí và ghế cao cấp với giá 15 USD/tháng trong một năm.

Quyền truy cập trình duyệt của Hermes nổi bật: @NousResearch đã thu hút sự tương tác đáng kể khi cho phép các tác nhân truy cập vào hồ sơ trình duyệt thực của người dùng, một trong những sự đánh đổi về UX/bảo mật quan trọng hơn trong các công cụ tác nhân hiện nay.

OpenAIAGITrí tuệ nhân tạoCông nghệ tương lai
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.