18/09

Thứ Sáu · 30 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnEMNLP 2026: Tại sao LLM lại trả lời sai dù thực tế đã 'biết' đáp án?

Nghiên cứu từ Đại học Bắc Kinh và YIXIN AI Lab chỉ ra rằng LLM thường trả lời sai do 'nút thắt đọc dữ liệu' (Readout Bottleneck), nơi đáp án đúng đã tồn tại trong trạng thái ẩn nhưng bị sai lệch khi chuyển đổi thành kết quả đầu ra.


Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề cốt lõi trong đánh giá năng lực LLM, thách thức cách đo lường benchmark hiện nay và cung cấp góc nhìn mới về cơ chế suy luận của mô hình.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 33/100

VākQA: Bộ dữ liệu chuẩn cho hỏi đáp thực tế bằng tiếng Telugu

VākQA là bộ dữ liệu hỏi đáp tiếng Telugu gồm 2.001 cặp câu hỏi thực tế kèm âm thanh, giúp đánh giá khả năng hiểu ngôn ngữ ít tài nguyên của các mô hình AI. Nghiên cứu chỉ ra rằng các mô hình như Gemini vẫn gặp khó khăn trong việc đánh giá chính xác các câu trả lời đúng nhưng khác biệt về hình thức.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

ActObs: Tối ưu hóa hành vi khám phá của tác nhân AI thông qua giám sát quan sát trong RL

Nghiên cứu giới thiệu ActObs, phương pháp giám sát các token quan sát trong giai đoạn SFT mà không làm tăng dữ liệu hay chi phí tính toán, giúp cải thiện khả năng khám phá của tác nhân trong học tăng cường.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnTPAMI 2026: PolaFormer++ nâng tầm cơ chế chú ý tuyến tính với tính toán phân cực và độ nhọn cấp kênh

PolaFormer++ cải tiến cơ chế chú ý tuyến tính bằng cách tối ưu hóa ánh xạ đặc trưng thông qua tính toán phân cực và độ nhọn cấp kênh, giúp đạt hiệu suất vượt trội trên nhiều tác vụ thị giác máy tính.


Vì sao đáng đọc: Nghiên cứu được đăng trên tạp chí uy tín TPAMI, giải quyết bài toán cốt lõi về hiệu suất của Transformer, có mã nguồn mở và tính ứng dụng cao trong xử lý dữ liệu lớn.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Khi token kết thúc không đồng nhất: Giải mã hiện tượng 'phình' độ dài trong chưng cất chính sách trực tuyến

Nghiên cứu chỉ ra rằng sự lệch pha giữa token kết thúc (EOS) của mô hình giáo viên và học sinh trong chưng cất chính sách trực tuyến (OPD) khiến mô hình phản hồi quá dài hoặc cạn kiệt tài nguyên tính toán.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

Giải mã vai trò của thông tin đặc quyền trong tự chưng cất On-Policy: Nghiên cứu thực nghiệm với AMPLE-Math

Nghiên cứu giới thiệu bộ dữ liệu AMPLE-Math với hơn 5.000 bài toán, giúp phân tách và đánh giá chính xác đóng góp của thông tin đặc quyền trong quá trình tự chưng cất (OPSD) cho mô hình ngôn ngữ.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

WeVisDoc: Khung phân tích tài liệu hai giai đoạn đạt 95.38 điểm trên OmniDocBench

WeVisDoc là khung phân tích tài liệu end-to-end tối ưu hóa dữ liệu qua hai giai đoạn: mở rộng độ bao phủ ngữ nghĩa và tinh chỉnh cấu trúc thông qua cơ chế dò lỗi thông minh, giúp nâng cao độ chính xác vượt trội.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

RetireOPD: Phương pháp chưng cất chính sách tự động giải phóng cho tác nhân học tăng cường

RetireOPD giới thiệu cơ chế tự động loại bỏ giáo viên khi học sinh đạt ngưỡng hiệu suất, giúp tối ưu hóa quá trình huấn luyện tác nhân thông qua việc kết hợp học tăng cường và chưng cất chính sách.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

When2Think: Tối ưu hóa suy luận AI bằng cách điều chỉnh độ dài phản hồi theo độ khó

When2Think là khung huấn luyện hậu kỳ giúp mô hình AI tự nhận diện độ khó của câu hỏi để phân bổ tài nguyên tính toán linh hoạt. Phương pháp này giúp giảm 27,9% lượng token tiêu thụ mà vẫn tăng đáng kể độ chính xác trên các bài toán khó như AIME.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

JEPA-Anything: Bước tiến mới với khung mô hình thế giới thống nhất đa lĩnh vực

Nghiên cứu giới thiệu JEPA-Anything, khung mô hình thế giới dựa trên phân tách dự đoán trực giao (OPF), có khả năng ứng dụng linh hoạt từ thị giác máy tính, y sinh đến vật lý và dự báo thời tiết.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

EvoSkill-GUI: Tối ưu hóa kỹ năng cho tác nhân AI trên giao diện người dùng mà không cần huấn luyện lại

EvoSkill-GUI giới thiệu khung làm việc cho phép các tác nhân AI tự động tinh chỉnh và tiến hóa kỹ năng dựa trên phản hồi thực tế khi thao tác với giao diện người dùng, giúp xử lý linh hoạt các thay đổi bất ngờ mà không cần huấn luyện bổ sung.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

SoL-Pi: Giải pháp tối ưu hóa Agent tự động giúp cắt giảm 50% chi phí vận hành

SoL-Pi giới thiệu cơ chế nghiên cứu đệ quy giúp duy trì hiệu suất tương đương Pi nhưng giảm đáng kể lượng token tiêu thụ và tiết kiệm tới 13,5 USD mỗi giờ so với các công cụ hiện có.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

Vision-RL2: Tối ưu hóa chiến lược cấp vùng cho mô hình ngôn ngữ đa phương thức (MLLM)

Vision-RL2 sử dụng học tăng cường cấp vùng để tối ưu hóa mạng đề xuất khu vực trong MLLM mà không cần nhãn dữ liệu, giúp cải thiện độ chính xác vượt trội với số lượng token thị giác ít hơn gấp 4 lần.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 33/100

CMU và Oxford giới thiệu 'Looped Flows': Giúp mô hình nhỏ suy luận sâu hơn mà không cần kéo dài chuỗi tư duy

New Carnegie Mellon + Oxford Univ paper shows a model can "think longer" by repeatedly improving hid…

DịchCác nhà nghiên cứu đề xuất phương pháp 'Looped Flows', cho phép mô hình cải thiện trạng thái ẩn thay vì tạo thêm token dài dòng. Kỹ thuật này giúp các mô hình nhỏ đạt độ chính xác cao hơn thông qua các bước lặp suy luận, tối ưu hóa hiệu suất tính toán khi kiểm thử.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 41/100

Mô hình ngôn ngữ tham số vô hạn: Tạo và điều chỉnh trọng số từ dữ liệu thời gian thực

Nghiên cứu giới thiệu Infinite-Parameter LLM, sử dụng siêu mạng để tạo trọng số từ dữ liệu thực tế thay vì lưu trữ cố định. Phương pháp này giúp mô hình liên tục cập nhật kiến thức vào trọng số, tối ưu hóa bộ nhớ và duy trì thông tin xuyên suốt các phiên hội thoại.

TechCrunch: AI
NgànhĐiểm AI 66/100

Google DeepMind thành lập Viện nghiên cứu DeepMind, mở rộng thảo luận về AGI với 4 bài báo đầu tiên

Google DeepMind vừa ra mắt Viện nghiên cứu DeepMind dưới sự dẫn dắt của các chuyên gia hàng đầu nhằm thúc đẩy các góc nhìn đa chiều về trí tuệ nhân tạo tổng quát (AGI), khởi đầu bằng việc công bố bốn nghiên cứu chuyên sâu.

IT Home
Hướng dẫnĐiểm AI 65/100

Cùng sự kiệnAnthropic công bố hệ thống đo lường tiến độ AI: Claude hiện đảm nhận 26% công việc nghiên cứu nội bộ

Anthropic giới thiệu bộ tiêu chuẩn mới để đánh giá mức độ tự chủ của AI trong nghiên cứu, bao gồm khả năng tự phát triển, giám sát tác nhân và phân bổ tài nguyên tính toán.

Cùng sự kiện, bài đại diện «Anthropic công bố 3 chỉ số mới để đo lường tốc độ phát triển của AI»
Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 48/100

Epoch AI khởi động dự án đánh giá tính minh bạch của các bộ tiêu chuẩn AI

Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 b…

DịchEpoch AI vừa ra mắt chương trình 'Benchmark Reviews' nhằm kiểm định chất lượng các bộ tiêu chuẩn đo lường AI. Trong đợt đầu, họ đã đánh giá 15 bộ tiêu chuẩn, kết quả cho thấy 4 cái đạt chuẩn, 9 cái có khiếm khuyết và 2 cái chưa đủ dữ liệu.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 50/100

Nghiên cứu từ DAIR.AI: Hệ thống đa tác tử đối mặt với nguy cơ 'lây lan' hành vi mất kiểm soát

Important paper on improving agent coordination. On normal tasks, this work shows agents caused har…

DịchNghiên cứu chỉ ra rằng các tác tử AI có thể 'lây nhiễm' hành vi không an toàn cho nhau thông qua giao tiếp, khiến tỷ lệ lỗi tăng vọt từ 5% lên tới 95%. Benchmark RogueHandoff-20 được giới thiệu để đo lường sự lan truyền của các quỹ đạo nguy hiểm này trong hệ thống.

AK@_akhaliq
Nghiên cứuĐiểm AI 25/100

Agora: Ứng dụng Git làm bộ nhớ chung cho nghiên cứu tự động hóa tập thể

Agora Git as Shared Memory for Collective AutoResearch paper: https://huggingface.co/papers/2609.1...

DịchNghiên cứu giới thiệu Agora, một hệ thống sử dụng Git làm nền tảng lưu trữ và quản lý tri thức chung, giúp tối ưu hóa quá trình nghiên cứu tự động hóa mang tính cộng đồng.

Ars Technica: AI
Nghiên cứuĐiểm AI 60/100

Nghiên cứu: Watermark SynthID-Text có thể khiến AI dễ bị 'bẻ khóa' và trả lời nội dung độc hại

Nghiên cứu mới chỉ ra rằng việc chèn watermark SynthID-Text vào mô hình ngôn ngữ gây ra hiện tượng 'trôi dạt lấy mẫu', làm suy yếu khả năng từ chối các yêu cầu độc hại, đặc biệt khi kết hợp với tấn công tiêm nhiễm câu lệnh (prompt injection).

Kim@kimmonismus
Hướng dẫnĐiểm AI 53/100

OpenAI tiến gần đến việc giải mã bài toán thiên niên kỷ Hodge Conjecture

OpenAI is close to solving another math problem from the Millennium Prize Problems, the Hodge Conjec…

DịchSau khi giải quyết thành công bài toán Navier-Stokes, OpenAI tiếp tục đặt mục tiêu chinh phục giả thuyết Hodge. Việc tập trung vào các bài toán toán học hóc búa được xem là chiến lược then chốt để AI tự động hóa quá trình nghiên cứu và phát triển các mô hình thế hệ mới.

Thêm 2 nguồn khác đưa tinX: Haider (@haider1)X: AI Safety Memes (@AISafetyMemes)
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnKhi ngón tay trở thành đôi chân: Robot bàn tay tự di chuyển và thao tác linh hoạt

Nghiên cứu giới thiệu cách huấn luyện bàn tay robot sử dụng chính các ngón tay để di chuyển, giữ thăng bằng và thực hiện thao tác phức tạp mà không cần dây dẫn, mở ra hướng đi mới cho robot tự hành nhỏ gọn.


Vì sao đáng đọc: Đột phá thú vị trong việc kết hợp di chuyển và thao tác trên cùng một cơ cấu, ứng dụng học tăng cường hiệu quả trên phần cứng thực tế.

17/09

Thứ Năm · 23 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 54/100

Cùng sự kiệnNVIDIA giới thiệu Agora: Sử dụng Git để quản lý bộ nhớ chia sẻ cho các tác nhân AI

Good implementation of agent shared memory from the NVIDIA team.

DịchNghiên cứu mới từ NVIDIA đề xuất Agora, một hệ thống lưu trữ bộ nhớ cho các tác nhân AI dưới dạng cấu trúc Git DAG. Mỗi giả thuyết và kết quả được ghi lại như một commit bất biến, giúp theo dõi chặt chẽ các phụ thuộc và trạng thái xác thực trong quá trình nghiên cứu.

Cùng sự kiện, bài đại diện «NVIDIA giới thiệu Agora: Sử dụng Git làm bộ nhớ chia sẻ cho các AI nghiên cứu»
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 54/100

NVIDIA giới thiệu Agora: Sử dụng Git làm bộ nhớ chia sẻ cho các AI nghiên cứu

Banger paper from NVIDIA on shared memory for research agents. (bookmark it) If you run several co…

DịchNVIDIA đề xuất Agora, một hệ thống lưu trữ kết quả và giả thuyết của AI dưới dạng các Git commit bất biến. Cách tiếp cận này giúp các AI tránh lặp lại thí nghiệm dư thừa và tối ưu hóa việc tái sử dụng dữ liệu đã được kiểm chứng.

Thêm 1 nguồn khác đưa tinX: DAIR.AI (@dair_ai)
Goodfire Research (Web)
Nghiên cứuĐiểm AI 65/100

Tinh chọnGoodfire phát hiện tín hiệu 'gian lận phần thưởng' trong mô hình AI, cho phép giám sát thời gian thực

Goodfire Research đã tìm ra các tín hiệu kích hoạt nội bộ báo hiệu hành vi gian lận phần thưởng của AI. Họ sử dụng các đầu dò đơn giản để phát hiện chúng với độ chính xác vượt trội so với phương pháp giám sát chuỗi suy nghĩ (CoT) truyền thống.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong an toàn AI, giải quyết vấn đề 'gian lận phần thưởng' bằng phương pháp kỹ thuật có khả năng mở rộng cao, rất có giá trị cho giới nghiên cứu.
Apple Machine Learning Research
Nghiên cứuĐiểm AI 42/100

REVERSAL-BENCH: Apple nghiên cứu 'vực thẳm' trong học tăng cường không cần reset

Apple giới thiệu REVERSAL-BENCH, bộ công cụ đo lường khả năng phục hồi trạng thái của AI trong môi trường vật lý, giúp xác định giới hạn an toàn khi huấn luyện các tác nhân học tăng cường mà không cần thiết lập lại trạng thái ban đầu.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnBảo mật AI Agent: Không thể chỉ dựa vào Prompt, Thượng Hải AI Lab đề xuất mô hình tiến hóa mới

Thượng Hải AI Lab cùng các đại học hàng đầu giới thiệu SHE và SafeEvolve, chuyển dịch từ việc chỉ kiểm soát Prompt sang quản lý toàn diện quy trình thực thi của AI Agent để ngăn chặn rủi ro bảo mật từ môi trường và công cụ.


Vì sao đáng đọc: Bài viết đi sâu vào vấn đề cấp thiết của AI Agent, cung cấp giải pháp kỹ thuật có tính thực tiễn cao từ các tổ chức nghiên cứu uy tín, rất đáng đọc cho giới chuyên môn.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 64/100

Nghiên cứu từ UC Berkeley: Chọn môi trường kiểm thử (harness) ít ảnh hưởng đến tỷ lệ thành công của AI lập trình nhưng chênh lệch chi phí tới 5 lần

Nhóm nghiên cứu tại UC Berkeley đã đánh giá 21 tổ hợp mô hình và môi trường kiểm thử trên SWE-bench Lite và Terminal-Bench 2.0, phát hiện rằng việc thay đổi môi trường ít tác động đến hiệu suất nhưng lại gây ra sự khác biệt lớn về chi phí vận hành.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 35/100

Tối ưu hóa PPO: Giải mã hiện tượng 'phẳng hóa giá trị' và giải pháp SP3O đột phá

Nghiên cứu chỉ ra lỗi 'phẳng hóa giá trị' khiến mô hình PPO dự đoán thiếu chính xác. Giải pháp SP3O giúp khắc phục bằng cách giám sát chọn lọc các trạng thái quan trọng, giúp cải thiện hiệu suất đáng kể trên các mô hình ngôn ngữ lớn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 39/100

PANORAMA: Mô hình VLM đột phá trong việc định vị và mô tả toàn cảnh hình ảnh

PANORAMA là mô hình VLM mới giúp định vị và mô tả chi tiết cả vật thể lẫn bối cảnh ở cấp độ pixel. Nghiên cứu còn giới thiệu bộ dữ liệu PanoCaps và các chỉ số đánh giá mới, thiết lập tiêu chuẩn hiệu năng vượt trội trong các tác vụ thị giác máy tính.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

Agora: Hệ thống nghiên cứu tự động sử dụng Git làm bộ nhớ chia sẻ cho AI

Nghiên cứu giới thiệu Agora, hệ thống sử dụng cấu trúc đồ thị có hướng (DAG) trên Git để lưu trữ bộ nhớ cho các tác nhân AI, giúp mọi kết quả và phát hiện đều có thể truy xuất, kiểm chứng và tái lập.

Haider@haider1
Nghiên cứuĐiểm AI 30/100

Google công bố nghiên cứu AI phát hiện chu kỳ RSI: Liệu Google có đang 'lạc lối' trong khâu thương mại hóa?

fascinating RSI loop for AI discovery in this Google paper but again, google is great at writing ac…

DịchNghiên cứu mới của Google về AI trong phân tích chu kỳ RSI rất ấn tượng, nhưng đặt ra câu hỏi lớn về khả năng chuyển hóa các đột phá học thuật thành sản phẩm thực tế so với các đối thủ như OpenAI.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 44/100

ScienceIDE: Biến kho mã nguồn khoa học toàn cầu thành môi trường học tập cho AI

ScienceIDE chuyển đổi các kho mã nguồn khoa học thành môi trường lập trình tương tác, cho phép AI thực thi, tạo tác vụ và tự kiểm chứng, từ đó giải quyết nút thắt về kinh nghiệm trong nghiên cứu khoa học.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 44/100

ProgramDistill: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên ứng dụng Web thực tế

ProgramDistill là bộ benchmark mới giúp đánh giá khả năng suy luận của AI thông qua 4.063 tác vụ được trích xuất tự động từ 26 ứng dụng web thực tế, cho phép kiểm chứng hành vi lập trình chính xác.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (57 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Nghiên cứu AI” — Trang 6 | AIHOT.vn