Nghiên cứu đề xuất khung lý thuyết sử dụng tác động nhóm để định nghĩa sự tương đương trong các biểu diễn AI, giúp làm rõ các giả thuyết khác nhau vốn thường bị nhầm lẫn khi đánh giá mô hình.
HappyWorld-Bench là bộ benchmark toàn diện đầu tiên đánh giá độ tin cậy của các mô hình thế giới thông qua khả năng tương tác, khám phá và thay đổi môi trường trên ba nền tảng: video, không gian và thực thể.
Nghiên cứu 'Look Light, Think Heavy' chỉ ra rằng các mô hình AI như GPT-6 đang dần bỏ qua chi tiết hình ảnh để tập trung vào suy luận ngôn ngữ, dẫn đến sự đứt gãy trong khả năng hiểu thực tế.
Nghiên cứu giới thiệu ScriptMoE, mô hình nhận diện văn bản đa ngôn ngữ hiệu quả hơn các mô hình ngôn ngữ thị giác lớn (VLM) nhờ kiến trúc chuyên gia và bộ dữ liệu tổng hợp quy mô lớn TextMuSS-10M.
Strong agree. There's way less of this than I would expect - partially due to the fact that making a…
DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.
releasing many high quality open-source RL environments is the most impactful thing anyone can do to…
DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.
Multiverse giới thiệu phương pháp cắt tỉa khối LLM bằng cách chuyển đổi thành bài toán tối ưu hóa Ising, giúp chọn cấu hình nén tối ưu mà không cần chạy benchmark. Kết quả trên Llama-3.3-70B cho thấy hiệu suất vượt trội, tăng 23% điểm MMLU so với các phương pháp truyền thống.
JEPA-Anything Learning Predictive Models across Different Worlds paper: https://huggingface.co/pap...
DịchJEPA-Anything giới thiệu phương pháp học mô hình dự đoán linh hoạt, cho phép AI hiểu và dự đoán các trạng thái trong nhiều môi trường khác nhau một cách hiệu quả.
Nghiên cứu giới thiệu khung đánh giá mới nhằm kiểm chứng khả năng suy luận về thế giới vật lý của MiniMax-H3, mô hình tiên phong trong việc hợp nhất hiểu biết ngữ cảnh và tạo sinh âm thanh-hình ảnh.
Stable AI và Đại học Thanh Hoa vừa giới thiệu LimiX-2, mô hình 400M tham số sử dụng mạng cơ chế ngữ cảnh, đạt điểm Elo ấn tượng trên các bảng xếp hạng dữ liệu cấu trúc như TabArena và TALENT.
Nghiên cứu đề xuất phương pháp tinh chỉnh mô hình bằng cách giới hạn độ lệch hành vi, tập trung vào việc chọn hướng cập nhật tối ưu thay vì chỉ quan tâm đến khoảng cách, giúp bảo toàn năng lực gốc của mô hình.
Nghiên cứu giới thiệu bài toán ghi nhớ dài hạn, nơi mô hình phải học 100 tác vụ liên tiếp mà không bị quên kiến thức cũ. Nhóm tác giả đề xuất kết hợp các cơ chế bổ trợ để tối ưu hóa việc lưu giữ thông tin qua nhiều lần cập nhật trọng số.
Banger paper from Google on agent harnesses for long-horizon tasks. (bookmark it) Google Research …
DịchStellar Colosseum là khung đa tác nhân độc lập với mô hình, chuyên giải quyết các bài toán toán học và khoa học máy tính phức tạp bằng cách chia nhỏ vấn đề, song song hóa chiến lược chứng minh và phản biện.
TempCloze là bộ tiêu chuẩn đánh giá mới giúp kiểm tra khả năng hiểu trình tự thời gian của Video-LLM bằng cách yêu cầu mô hình chọn đoạn video bị thiếu ở giữa. Nghiên cứu chỉ ra rằng các mô hình hiện nay vẫn gặp khó khăn lớn trong việc nắm bắt sự liên kết và tiến trình của các sự kiện.
HyQuant tối ưu hóa hiệu suất LLM bằng cách kết hợp lượng tử hóa bit thấp cho hầu hết các trạng thái Attention, đồng thời giữ độ chính xác cao cho các vùng dữ liệu quan trọng, giúp giảm thiểu sai số mà vẫn đảm bảo tốc độ.
DịchMarigold V2 tối ưu hóa kiến trúc Diffusion Transformer để nâng cao độ chính xác và hiệu quả trong việc ước tính độ sâu từ ảnh đơn, mở ra tiềm năng mới cho thị giác máy tính.
Kalman Delta Networks (KDNs) cải tiến cơ chế attention tuyến tính bằng cách áp dụng bộ lọc Kalman để quản lý độ bất định trong bộ nhớ, giúp mô hình tối ưu hóa việc ghi nhớ thông tin dựa trên bằng chứng tích lũy thay vì chỉ dựa vào token hiện tại.
Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong kiến trúc mô hình ngôn ngữ, giải quyết bài toán tối ưu hóa bộ nhớ dài hạn bằng phương pháp toán học xác suất, rất có giá trị cho giới nghiên cứu AI.
New Tencent paper shows, if an agent keeps improving, its training tasks cannot stay still: continuo…
DịchTencent chứng minh rằng các tác vụ huấn luyện AI cần tăng dần độ khó thay vì giữ nguyên, giúp cải thiện điểm số trên Terminal-Bench 2.1. Khi môi trường trở nên quá dễ, AI sẽ không còn nhận được tín hiệu học tăng cường (RL) hiệu quả để tiếp tục tiến bộ.
Harness engineering is a top skill right now. I saw a great overview of harness engineering in a re…
DịchHarness Engineering đang trở thành kỹ năng thiết yếu trong lĩnh vực AI. Bài viết này tổng hợp danh sách các tài liệu nghiên cứu chất lượng cao từ YC Paper Club, giúp người đọc nắm bắt nền tảng kỹ thuật quan trọng này.
Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.
Vì sao đáng đọc: Bài viết đi sâu vào cơ chế cốt lõi của các mô hình AI thế hệ mới, giải thích hiện tượng 'trí tuệ không gian' bằng góc nhìn kỹ thuật nhưng vẫn dễ hiểu, rất giá trị với người làm AI.
What if you could pay the reasoning cost once, then reuse what the model learned across future tasks…
DịchNghiên cứu mới từ Microsoft cho phép chuyển đổi chi phí suy luận đắt đỏ thành các 'kỹ năng' dạng Markdown. Bằng cách tổng hợp các mẫu lỗi từ lịch sử, mô hình nhỏ có thể khôi phục 55-100% khả năng suy luận mà không cần tốn thêm token.
Kiến trúc Recurrent Transformer đang trở thành tâm điểm nhờ GPT-6, trong khi Alibaba đã sớm khẳng định vị thế với hai bài báo nghiên cứu quan trọng tại các hội nghị hàng đầu.
Apple giới thiệu khung huấn luyện IVT, cho phép mô hình học cách dự đoán tương lai thông qua biểu diễn ẩn thay vì phải tạo ảnh trực tiếp, giúp tăng tốc độ suy luận video gấp 5 lần mà vẫn giữ được độ chính xác.
Vì sao đáng đọc: Nghiên cứu quan trọng từ Apple giải quyết bài toán tối ưu hóa suy luận video thời gian thực, có tính ứng dụng cao trong robot và trợ lý ảo.
SimLoss tối ưu hóa mô hình ngôn ngữ thị giác bằng cách căn chỉnh biểu diễn ẩn với dữ liệu hình ảnh trực tiếp, giúp mô tả chi tiết vật thể mà không cần tăng độ trễ như các hệ thống đa giai đoạn hiện nay.
Super interesting paper from Meta. Long-horizon research agents are coming. But one common problem…
DịchMeta giới thiệu mô hình AI Research Preference Models giúp các tác nhân AI đánh giá và chọn lọc các hướng thử nghiệm hứa hẹn nhất trước khi thực thi, giải quyết bài toán hạn chế về GPU và khả năng tư duy sáng tạo trong nghiên cứu.
Một bài viết trên Hacker News chia sẻ phương pháp đạt 44% điểm trong thử thách ARC-AGI-1 với chi phí cực thấp chỉ 67 cent, thu hút sự quan tâm lớn từ cộng đồng kỹ thuật.
DIEM là khung làm việc tự động giúp tối ưu hóa việc chọn lọc dữ liệu trong quá trình tinh chỉnh mô hình bằng học tăng cường (RFT), bằng cách đánh giá đóng góp của từng mẫu dữ liệu theo thời gian thực để cải thiện hiệu suất học tập.
New Amazon paper shows KV-cache policy is not just an inference optimization; but it can change the …
DịchNghiên cứu mới của Amazon chỉ ra rằng việc đồng bộ hóa chiến lược KV Cache trong quá trình tinh chỉnh (fine-tuning) giúp mô hình tránh lỗi mất ngữ cảnh khi xử lý văn bản dài, thay vì chỉ tập trung vào tối ưu suy luận như trước đây.
RCCA là khung học tăng cường mới giúp cải thiện khả năng tạo ứng dụng web bằng cách chia nhỏ phản hồi chức năng thành các tín hiệu tối ưu hóa cục bộ, thay vì đánh giá toàn bộ mã nguồn như các phương pháp truyền thống.
Các nhà nghiên cứu từ NUS và Oxford giới thiệu V-RAE, phương pháp sử dụng các mô hình thị giác tiền huấn luyện để xây dựng không gian tiềm ẩn giàu ngữ nghĩa, giúp cải thiện hiệu quả tạo và dự đoán video thay vì chỉ tập trung vào tái tạo pixel truyền thống.
Nghiên cứu đề xuất phương pháp R2-OPD giúp lọc phản hồi từ giáo viên trong quá trình chưng cất mô hình, đảm bảo việc học tập tập trung vào tiến trình suy luận thực tế thay vì chỉ bắt chước đầu ra của giáo viên.
Google DeepMind's new routing idea is trying to solve a great practical question. Routing is suppos…
DịchGoogle DeepMind giới thiệu Pandora's Router, phương pháp điều hướng thông minh giúp giảm thiểu chi phí bằng cách chỉ kích hoạt các mô hình mạnh khi cần thiết. Hệ thống này tối ưu hóa đáng kể hiệu suất và chi phí vận hành trên các tác vụ như MATH và RAG.
Banger paper from Google DeepMind. It's on the very hot topic of model routing. Routers assume the…
DịchDeepMind đề xuất phương pháp định tuyến mô hình mới dựa trên bài toán 'Chiếc hộp Pandora', giúp tối ưu hóa việc chọn chuyên gia xử lý mà không cần tốn kém chi phí đánh giá toàn diện, đạt hiệu suất cao với chi phí thấp.
5× context compression did surprisingly little to GPT-5.5's final task result. The compressed agent…
DịchNghiên cứu cho thấy việc nén ngữ cảnh 5 lần không làm giảm đáng kể kết quả tác vụ của GPT-5.5. Thay vì mất đi khả năng xử lý, mô hình chuyển sang dựa vào cơ chế truy xuất dữ liệu để bù đắp thông tin bị lược bỏ.
Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…
DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.
TSDS-Toolbox là khung làm việc toàn diện giúp chuẩn hóa việc so sánh, đánh giá và mở rộng các phương pháp đo độ tương đồng trong dữ liệu chuỗi thời gian, hỗ trợ đắc lực cho việc lựa chọn tập dữ liệu nguồn khi tinh chỉnh các mô hình AI.