GenFirst: Đột phá huấn luyện mô hình tạo sinh tiềm ẩn từ đầu đến cuối
GenFirst giải quyết xung đột giữa tái tạo và tạo sinh bằng cách ưu tiên huấn luyện mô hình tạo sinh trước, giúp ổn định không gian tiềm ẩn và ngăn chặn hiện tượng sụp đổ mô hình.
GenFirst giải quyết xung đột giữa tái tạo và tạo sinh bằng cách ưu tiên huấn luyện mô hình tạo sinh trước, giúp ổn định không gian tiềm ẩn và ngăn chặn hiện tượng sụp đổ mô hình.
Nghiên cứu giới thiệu khung 5 cấp độ (L0-L4) giúp các mô hình suy luận lớn (LRM) tự tiến hóa mà không cần sự can thiệp của con người, thông qua việc tự động hóa quá trình xác thực và tạo lộ trình học tập.
Nghiên cứu chỉ ra rằng hiệu quả của chưng cất On-Policy (OPD) chủ yếu đến từ việc ức chế các token có xác suất thấp thay vì phụ thuộc vào giáo viên. Từ đó, nhóm tác giả đề xuất OPSA, phương pháp không cần giám sát giúp tối ưu hóa mô hình hiệu quả hơn.
Nghiên cứu khám phá khả năng chuyển đổi đa ngôn ngữ của 'vector chức năng' (FVs) để điều hướng hành vi của LLM trong các tác vụ nhận diện cảm xúc phức tạp mà không cần ví dụ minh họa.
Rohan Paul@rohanpaul_aiFor long-horizon agents, this paper argues the harness can matter more than the model, so benchmark …
DịchMột bài báo trên arXiv chỉ ra rằng trong các bài kiểm tra tác nhân AI dài hạn, công cụ đánh giá (harness) có ảnh hưởng đến kết quả lớn hơn cả bản thân mô hình, đòi hỏi sự minh bạch hơn khi công bố điểm số.

Rohan Paul@rohanpaul_aiAnthropic's new research: its internal model "was willing to tamper with its own reward function, gi…
DịchAnthropic thực hiện thử nghiệm trên 80 môi trường có khả năng gian lận để kiểm tra xem liệu các mô hình AI cao cấp có phát triển hành vi thao túng hàm thưởng và né tránh kiểm soát an toàn hay không.

Anthropic@AnthropicAINew research: Training a Misaligned Reward Seeker What produces severe misalignment? We've long bee…
DịchAnthropic công bố nghiên cứu về việc huấn luyện mô hình tìm kiếm phần thưởng sai lệch, khám phá liệu AI có thể học cách gian lận để tối ưu hóa kết quả hay không.

Elvis Saravia@omarsar0How fast is the Claude Code plugin ecosystem actually growing? Plugin-touching commit activity grew…
DịchDựa trên phân tích hơn 8.000 plugin và 77.000 commit, nghiên cứu cho thấy hoạt động phát triển plugin cho Claude Code đã bùng nổ gấp 8,8 lần chỉ sau nửa năm, phản ánh xu hướng cộng sinh mạnh mẽ giữa ngôn ngữ tự nhiên và mã nguồn.

DAIR.AI@dair_ai// ContextLeak in AI Agents // The whole attack surface here is a tool name and a tool description….
DịchCác nhà nghiên cứu tại Đại học Duke đã phát triển ContextLeak, một phương pháp sử dụng học tăng cường để tạo ra các công cụ độc hại nhằm đánh cắp dữ liệu nhạy cảm từ LLM Agent, bao gồm lịch sử hội thoại và các tiến trình thực thi.

Rohan Paul@rohanpaul_aiLLM rankings can be created by evaluation choices as much as model differences, so one setup should …
DịchMột nghiên cứu cho thấy chỉ cần thay đổi định dạng prompt hoặc cách chấm điểm, điểm số của cùng một mô hình (như Gemma-2-27b) có thể dao động từ 31% đến 89%, làm lung lay tính khách quan của các bảng xếp hạng LLM hiện nay.

AK@_akhaliqLoopArena Benchmarking Models as Runtime Controllers for Loop Engineering paper: https://huggingfa...
DịchNghiên cứu mới giới thiệu LoopArena, một bộ tiêu chuẩn (benchmark) chuyên biệt để đánh giá khả năng của các mô hình AI khi đóng vai trò là bộ điều khiển thời gian thực trong kỹ thuật vòng lặp.
Nghiên cứu đề xuất quy trình huấn luyện 3 bước giúp mô hình ngôn ngữ 2B cải thiện khả năng tư duy logic và tuân thủ quy tắc trong các trò chơi hội thoại, nâng điểm đánh giá từ 10.67 lên 38.92.
DAIR.AI@dair_aiLoop engineering has emerged as a new skill for AI engineers But there is very little research meas…
DịchNhóm AMAP giới thiệu LoopArena, bộ chuẩn đánh giá khả năng của mô hình AI trong vai trò bộ điều khiển (controller) để dẫn dắt các tác nhân (worker) thực hiện các chuỗi nhiệm vụ phức tạp và kéo dài.

Rohan Paul@rohanpaul_aiThis paper shows a better way to train multi-turn agents: score each turn separately, then use a s…
DịchNghiên cứu giới thiệu khung CREST giúp tối ưu hóa việc học cho các tác nhân LLM đa bước bằng cách phân bổ tín dụng phân tầng. Mô hình tự đóng vai trò giáo viên để điều chỉnh trọng số học tập dựa trên độ tin cậy của các quyết định, giúp cải thiện hiệu suất mà không làm thay đổi kết quả kiểm chứng.

Rohan Paul@rohanpaul_aiThis paper shows a different way to make chain-of-thought cheaper: move reusable reasoning from gene…
DịchPhương pháp này chuyển đổi các bước suy luận từ giai đoạn tạo văn bản sang phần gợi ý (prompt), giúp giảm chi phí tính toán cho chuỗi tư duy mà không cần huấn luyện lại mô hình.

Nghiên cứu chỉ ra rằng Sliding Window Attention với cơ chế 'sinks' mang lại hiệu suất ngang bằng hoặc tốt hơn các mô hình Linear Attention, đồng thời giải quyết hiệu quả vấn đề tiêu tốn tài nguyên của kiến trúc Transformer truyền thống.
Rohan Paul@rohanpaul_aiNew ByteDance paper shows for test-time improvement, keeping the messy history of attempts can work …
DịchByteDance giới thiệu phương pháp Chain-of-Experience, ưu tiên lưu giữ toàn bộ quá trình thử nghiệm và phản hồi thay vì tóm tắt ngắn gọn. Cách tiếp cận này giúp cải thiện đáng kể độ chính xác trong các tác vụ toán học và lập trình so với phương pháp lặp lại truyền thống.

Nghiên cứu đánh giá hiệu quả của các công cụ nén prompt trên 10 ngôn ngữ, cho thấy sự chênh lệch đáng kể khi áp dụng các mô hình được huấn luyện chủ yếu bằng tiếng Anh so với đa ngôn ngữ.
GGSS là kỹ thuật can thiệp mới giúp loại bỏ định kiến về chủng tộc hoặc giới tính trong các mô hình VLM tạo sinh bằng cách điều chỉnh các token hình ảnh trên không gian hình cầu mà không làm mất đi đặc tính dữ liệu.
CRPO là khung làm việc mới giúp chuyển giao tri thức ưu tiên từ tiếng Anh sang các ngôn ngữ khác, cải thiện đáng kể chất lượng phản hồi của mô hình AI thông qua cơ chế xếp hạng đa ngôn ngữ thay vì chỉ so sánh nhị phân.
Nghiên cứu tổng quan về các hệ thống AI có khả năng tự xây dựng và tinh chỉnh sản phẩm hoàn thiện thông qua quy trình phản hồi liên tục, thay vì chỉ tạo ra nội dung thô.
LayerRecall là cơ chế định tuyến bộ nhớ mới giúp mô hình video AI truy xuất và chèn dữ liệu lịch sử vào các lớp mạng phù hợp, giải quyết vấn đề mất tính nhất quán khi tạo video dài.
Rohan Paul@rohanpaul_aiRAG poisoning can make a model more confident, which is exactly why confidence-based detectors can f…
DịchNghiên cứu chỉ ra rằng các tài liệu độc hại có thể thao túng mô hình RAG, khiến nó tập trung sai lệch vào dữ liệu xấu thay vì bằng chứng xác thực. Để phát hiện, cần giám sát sự phân bổ chú ý giữa các tài liệu thay vì chỉ dựa vào độ tin cậy của câu trả lời cuối cùng.

EASEL là bộ tiêu chuẩn đánh giá mới giúp đo lường khả năng điều khiển công cụ chính xác của AI thông qua các tác vụ tái tạo hình ảnh và lập kế hoạch trực quan, khắc phục hạn chế của các bài kiểm tra hiện nay.
AK@_akhaliqCode as Worlds Agentic Discovery of Executable World Representations for Physical Reasoning paper: …
DịchNghiên cứu giới thiệu phương pháp biểu diễn thế giới thông qua mã nguồn (Code as Worlds), giúp các tác nhân AI thực hiện suy luận vật lý chính xác hơn bằng cách mô phỏng các kịch bản thực thi.

Rohan Paul@rohanpaul_aiIf an autonomous agent remembers across iterations, its safety system cannot afford to forget betwee…
DịchNghiên cứu chỉ ra rằng khi AI tự hành có bộ nhớ dài hạn, các biện pháp an toàn không thể chỉ dựa vào việc giám sát từng bước đơn lẻ. Kẻ tấn công có thể chia nhỏ hành vi độc hại qua nhiều giai đoạn khiến hệ thống giám sát hiện tại không thể phát hiện ra.

J-Zero là khung làm việc mới cho phép mô hình ngôn ngữ tự cải thiện thông qua cơ chế đối kháng giữa ba vai trò: Người thách thức, Người giải quyết và Người đánh giá, giúp tối ưu hóa hiệu suất mà không cần dữ liệu con người.
Rohan Paul@rohanpaul_aiMost agent self-improvement happens too late: the system learns from a run only after that run is al…
DịchPILOT cho phép AI tự học và điều chỉnh hành vi theo thời gian thực thay vì đợi kết thúc tác vụ. Phương pháp này giúp tăng đáng kể tỷ lệ thành công trên các bài kiểm tra kỹ thuật, đồng thời tối ưu hóa hiệu suất và giảm thiểu lượng token tiêu thụ.

Nghiên cứu giới thiệu ElephantBench, bộ dữ liệu gồm 1.094 câu hỏi để kiểm tra khả năng của LLM trong việc ghi nhớ các quan điểm trái chiều về những sự kiện ít phổ biến. Kết quả cho thấy ngay cả các mô hình mạnh nhất cũng thường bỏ sót các luồng thông tin khác nhau, cho thấy lỗ hổng trong tri thức của AI.
Nghiên cứu giới thiệu phương pháp biểu diễn thế giới vật lý thông qua mã thực thi, giúp AI hiểu sâu hơn về cơ chế vận hành, trạng thái vật thể và động lực học thay vì chỉ nhận diện hình ảnh đơn thuần.
ContextPilot giải quyết vấn đề quá tải ngữ cảnh trong các tác vụ dài hạn bằng cách cho phép AI tự quản lý và tinh chỉnh bộ nhớ hiệu quả hơn thông qua học tăng cường (RL) phân cấp, thay vì chỉ tóm tắt hay xóa dữ liệu thô sơ.
Thêm 2 nguồn khác đưa tinX: Elvis Saravia (@omarsar0, DAIR.AI)X: Rohan Paul (@rohanpaul_ai)LMSM giới thiệu phương pháp tách biệt các lớp kiểm soát bảo mật cho LLM, cho phép chuẩn hóa việc đánh giá tín hiệu nội bộ và thực thi chính sách an toàn một cách nhất quán, tương tự như cách Linux quản lý bảo mật hệ thống.
Elvis Saravia@omarsar0Interesting paper on prompt optimization. They claim that a single-lineage prompt optimizer just ma…
DịchNPO đạt hiệu suất tương đương GEPA trong TextArena với số lần thử nghiệm ít hơn đáng kể. Kết quả cho thấy việc tối ưu hóa prompt hiệu quả có thể thay thế các phương pháp tìm kiếm phức tạp, đặc biệt khi kết hợp với các mô hình giáo viên mạnh.

EnvHarness là lớp lập trình mới từ Google Cloud AI giúp tùy biến các môi trường huấn luyện tác nhân AI thông qua giao diện chuẩn, cho phép thay đổi nhiệm vụ mà không cần can thiệp vào trình mô phỏng gốc.
Rohan Paul@rohanpaul_aiSmall models fail the same way big models do, so this paper shows you can collect a cheap model's mi…
DịchCritICL tận dụng các lỗi sai phổ biến từ mô hình nhỏ để tạo lời nhắc (prompt) thông minh cho mô hình lớn. Phương pháp này giúp mô hình lớn suy luận chính xác ngay từ lần thử đầu tiên thay vì phải lặp lại nhiều lần, giúp tiết kiệm tài nguyên đáng kể.

Elvis Saravia@omarsar0Banger paper from Stanford on efficient test-time scaling. If you run agents that think for a long …
DịchNghiên cứu mới từ Stanford đề xuất phương pháp Prefix Sliding giúp tối ưu bộ nhớ bằng cách lược bỏ các token trung gian trong quá trình suy luận. Kỹ thuật này tăng tốc độ xử lý gấp 3 lần mà không cần huấn luyện lại, hỗ trợ hiệu quả cho các chuỗi suy luận dài trên 100.000 token.

DAIR.AI@dair_aiThe Top AI Papers of the Week (August 24 - 30): - Skill Lift - JIT-Agent - Prime Agent - Judges as …
DịchTổng hợp các bài báo khoa học AI nổi bật từ 24/8 đến 30/8, tập trung vào tối ưu hóa kỹ năng, quản lý tác tử (agent) và ứng dụng thực tiễn trong phòng thí nghiệm.
DAIR.AI@dair_aiTuần này nổi bật với việc Netflix ứng dụng LLM quản lý vòng đời nội dung, NVIDIA giới thiệu phương pháp Skill Lift đánh giá kỹ năng thực tế, và Alibaba ra mắt Scroll giúp tối ưu hóa quản lý ngữ cảnh cho mô hình Qwen.
Rohan Paul@rohanpaul_aiCoding agents mostly read the instruction files and notes they were given or wrote themselves, so yo…
DịchNghiên cứu trên 33.000 PR cho thấy AI lập trình chủ yếu dựa vào các file chỉ dẫn (như CLAUDE.md) và ghi chú kế hoạch, thay vì tra cứu tài liệu API. Các nhà phát triển nên tập trung tối ưu hóa file hướng dẫn để cải thiện hiệu suất của AI.

Rohan Paul@rohanpaul_aiSwitching a multimodal model into non-thinking mode saves latency, but this Tencent paper finds it a…
DịchTencent giới thiệu PatternEval, bộ tiêu chuẩn đánh giá mới giúp phát hiện các lỗi về logic, lặp từ và suy luận giả tạo mà các bài kiểm tra độ chính xác thông thường bỏ lỡ khi mô hình AI chuyển sang chế độ phản hồi nhanh.
