DịchCuộc thi ARC Prize 2026 đang bước vào giai đoạn nước rút, giải thưởng 37.500 USD sẽ được trao cho giải pháp mã nguồn mở xuất sắc nhất vào ngày 30/9 tới.
Chuyên gia OpenAI Noam Brown tiết lộ chi phí giải bài toán ARC-AGI đã giảm từ 500.000 USD xuống còn 20 USD, đồng thời cảnh báo về rủi ro khi các hệ thống đa tác nhân tự phối hợp gian lận.
Sự hợp tác giữa các chuyên gia toán học hàng đầu và mô hình ngôn ngữ lớn đang mở ra hướng đi mới, khi kết hợp Qwen 4B trên thiết bị di động với sức mạnh đám mây của GLM để chinh phục thử thách ARC-AGI.
Vì sao đáng đọc: Tin tức kết hợp giữa nhân vật tầm cỡ (Huy chương Fields) và công nghệ AI tiên tiến (ARC-AGI) tạo sức hút lớn, mang tính chuyên môn cao và có giá trị tham khảo cho giới nghiên cứu.
Startup Nga Mostik gây sốt khi leo lên top đầu bảng xếp hạng ARC-AGI-3 nhờ kỹ thuật 'cầu nối' cho phép các mô hình AI giao tiếp trực tiếp qua không gian toán học thay vì văn bản, giúp tối ưu hiệu suất vượt trội.
Vì sao đáng đọc: Tin tức độc quyền về đột phá kỹ thuật mới trong AI, kết hợp đội ngũ học thuật danh giá và giải pháp tối ưu hóa mô hình sáng tạo, rất thu hút giới chuyên môn.
DịchFrançois Chollet giới thiệu bài viết từ Le Point về việc mô hình mới của OpenAI đạt điểm gần tuyệt đối trong bài kiểm tra ARC-AGI-3, kèm theo những góc nhìn chuyên sâu từ chính tác giả của bộ tiêu chuẩn đánh giá này.
Kết quả đánh giá GPT-6 Astra gây tranh cãi khi các tổ chức đưa ra con số trái ngược. Tuy nhiên, khả năng giải quyết bài toán ARC-AGI-3 vượt xa con người của mô hình này đang khiến giới chuyên gia phải cân nhắc lại dự báo về thời điểm AGI xuất hiện.
Vì sao đáng đọc: Tin tức quan trọng về mô hình đầu bảng mới nhất, ảnh hưởng trực tiếp đến lộ trình phát triển AGI và gây tranh luận lớn trong cộng đồng AI chuyên sâu.
ARC-AGI-3 is now saturated, GPT-6 Astra reaches 99% with a new provider-adapter harness and beats hu…
DịchGPT-6 Astra dẫn đầu bảng xếp hạng ARC-AGI-3 với 62,7% điểm tiêu chuẩn, và vọt lên 99,9% khi áp dụng khung Provider Adapter, vượt xa khả năng của con người ở 96% các bài kiểm tra.
The lesson from today: we need new benchmarks asap.
DịchTác giả của ARC-AGI 3 xác nhận bộ tiêu chuẩn này đã không còn đủ thách thức cho các mô hình AI hiện nay, đồng thời kêu gọi cộng đồng sớm xây dựng các bài kiểm tra năng lực mới.
DịchGreg Brockman xác nhận GPT-6 Astra đạt SOTA trên ARC-AGI-3 với 99% điểm số, vượt qua con người ở 96% các tác vụ. Đáng chú ý, mô hình này tối ưu hóa chi phí hiệu quả hơn nhờ khả năng suy luận vượt trội, giảm thiểu số lượng token và lượt gọi API cần thiết.
Diễn biến sự kiện · 2 bài →Thêm 2 nguồn khác đưa tinHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Testing Catalog (@testingcatalog)
Vì sao đáng đọc: Tin tức quan trọng về cột mốc AGI. Việc đạt 99% trên ARC-AGI cho thấy bước tiến lớn về khả năng suy luận logic của AI, thu hút sự quan tâm lớn từ cộng đồng công nghệ.
OPENAI 🔥: Astra scored 63% on ARC-AGI-3 with a standard harness. > GPT-6 Astra surpasses the huma…
DịchGPT-6 Astra đạt 99% điểm trong bài kiểm tra ARC-AGI-3 nhờ khả năng tự xây dựng mô hình thế giới và ngôn ngữ logic riêng để giải quyết các tình huống lạ, vượt xa hiệu suất trung bình của con người.
Progress continues to surprise even the best of us. ARC-AGI-3 was the first ARC-AGI benchmark that I…
DịchBenchmark ARC-AGI-3 đã bị mô hình Astra bão hòa chỉ sau nửa năm, nhanh gấp đôi so với dự đoán ban đầu của François Chollet. Sự kiện này cho thấy năng lực của các mô hình AI thế hệ mới đang tiến hóa với tốc độ chóng mặt, thách thức mọi quan điểm cũ về trí tuệ nhân tạo.
Vì sao đáng đọc: Tin tức quan trọng về cột mốc AGI, cho thấy tốc độ phát triển AI đang vượt xa kỳ vọng của các chuyên gia hàng đầu, có giá trị tham khảo cao cho cộng đồng.
Side note: when we released ARC-AGI-3 in March, and frontier models scored <1% on it, a few Singular…
DịchFrançois Chollet khẳng định bộ tiêu chuẩn ARC-AGI-3 được thiết kế chuẩn xác. Việc AI tiến bộ từ dưới 1% lên 100% chỉ trong nửa năm cho thấy tốc độ phát triển trí tuệ nhân tạo đang vượt xa mọi dự đoán ban đầu.
I had to look twice at this table. I know they are just numbers, but how the heck do you beat a com…
DịchElvis Saravia chia sẻ kết quả ấn tượng của GPT-6 Astra khi đạt điểm số gần như tuyệt đối trên FrontierMath và ARC-AGI, vượt xa các đối thủ vừa ra mắt gần đây.
GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems…
DịchFrançois Chollet cho biết GPT-6 Astra đạt bước tiến lớn trong suy luận tương tác, ghi 66% trên ARC-AGI-3 và gần 100% khi kết hợp kỹ thuật tối ưu hóa, dù chi phí mỗi lượt lên tới 360 USD.
Vì sao đáng đọc: Thông tin từ chuyên gia hàng đầu về một cột mốc quan trọng trong đánh giá trí tuệ nhân tạo tổng quát (AGI), có giá trị tham khảo cao cho cộng đồng AI.
Vì sao đáng đọc: Đây là cột mốc quan trọng trong việc đo lường trí tuệ nhân tạo tổng quát (AGI), cho thấy bước tiến vượt bậc của GPT-6 trong các bài toán suy luận logic phức tạp.
Incredible. Fable 5.1 is getting remarkably close to fully saturating ARC-AGI-2, but at materially…
DịchAnthropic ra mắt Fable 5.1 với hiệu suất ấn tượng trên bộ tiêu chuẩn ARC-AGI, đạt 90% ở bản ARC-AGI-2. Nhờ tối ưu hóa token, mô hình này giảm chi phí vận hành trung bình khoảng 32% so với phiên bản tiền nhiệm Fable 5.
Một bài viết trên Hacker News chia sẻ phương pháp đạt 44% điểm trong thử thách ARC-AGI-1 với chi phí cực thấp chỉ 67 cent, thu hút sự quan tâm lớn từ cộng đồng kỹ thuật.
Prime Agent, the harness that put Opus 5 at 95.5% on ARC-AGI-3, now has a technical report. The mec…
DịchPrime Agent giới thiệu cơ chế phân tầng bộ nhớ giúp tối ưu hóa khả năng xử lý của AI thông qua việc quản lý dữ liệu trên nhiều lớp, từ ngữ cảnh hoạt động đến lưu trữ ổ đĩa, giúp chuyển đổi các tác vụ ngữ cảnh dài thành bài toán quản trị thông tin hiệu quả.
NVIDIA built its own coding harness to optimize CUDA GPU kernels and achieved a 100% score on ARC-AG…
DịchNVIDIA vừa ra mắt khung lập trình giúp tối ưu hóa nhân CUDA, đạt tỷ lệ giải quyết 100% các bài toán trong ARC-AGI-3. Bước tiến này hứa hẹn sẽ hạ thấp rào cản kỹ thuật, giúp việc huấn luyện và tối ưu hóa AI trở nên dễ dàng hơn cho mọi người.
This is very nice work from NVIDIA. Like all high-performing approaches on ARC-AGI-3, it uses deep l…
DịchFrançois Chollet đánh giá cao hệ thống AVO của NVIDIA nhưng cảnh báo rằng việc đạt 100% trên tập demo chỉ giống như hoàn thành hướng dẫn, không phản ánh đúng năng lực thực tế trên bộ tiêu chuẩn ARC-AGI-3.
Holy: NVIDIA's coding agent AVO scored 100% on ARC-AGI-3's 25 public games, solving all 183 levels. …
DịchTác nhân AI AVO của NVIDIA đã đạt điểm tuyệt đối 100% trong bài kiểm tra ARC-AGI-3 bằng cách tự học qua thử sai mà không cần quy tắc định sẵn. Được vận hành bởi Claude Opus 5, AVO thể hiện khả năng ghi nhớ dài hạn và giải quyết vấn đề phức tạp vượt trội.
DịchGoogle vừa ra mắt Gemini 3.7 Flash, đạt điểm số ấn tượng 95.5% trên ARC-AGI-1 với chi phí chỉ 0.12 USD mỗi tác vụ, vượt trội hoàn toàn về hiệu suất so với các mô hình hiện nay.
Jeremy's excellent work here is a great illustration of a very powerful type of approach: LLM-guided…
DịchFrançois Chollet nhận định rằng các phương pháp dẫn đầu trong thử thách ARC-AGI-3 đều dựa trên việc dùng LLM để tổng hợp các mô hình thế giới biểu tượng, thông qua việc viết mã thực thi nhằm giải mã cơ chế nhân quả của thế giới.