Nghiên cứu đề xuất phương pháp tiến hóa môi trường bằng cách tăng dần độ khó theo thế hệ, tạo tín hiệu học tập bền vững cho quá trình huấn luyện các Agent đầu cuối.
Astra used 100k GPUs at Stargate Texas With a couple of months to pretrain that makes it the first …
DịchEmad Mostaque tiết lộ Astra đã sử dụng cụm 100.000 GPU tại Stargate Texas để hoàn thành đợt huấn luyện kéo dài hai tháng, đánh dấu cột mốc dự án AI đầu tiên đạt quy mô chi phí 1 tỷ USD.
Cliff sử dụng LLM làm giáo viên để phát hiện lỗi sai sớm trong quá trình suy luận, từ đó tối ưu hóa mô hình bằng cách phân tách chuỗi phản hồi thành phần đúng và sai. Phương pháp này vượt trội hơn các kỹ thuật truyền thống như GRPO tới 7%, ngay cả khi giáo viên có năng lực hạn chế.
Nghiên cứu đề xuất phương pháp Switch Distillation, sử dụng độ bất định của mô hình giáo viên để điều hướng quá trình chưng cất, giúp cải thiện khả năng suy luận mà không làm suy giảm khả năng ghi nhớ sự kiện trong giai đoạn huấn luyện trung gian.
Nghiên cứu đề xuất quy trình huấn luyện 3 bước giúp mô hình ngôn ngữ 2B cải thiện khả năng tư duy logic và tuân thủ quy tắc trong các trò chơi hội thoại, nâng điểm đánh giá từ 10.67 lên 38.92.
Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.
Apple giới thiệu IDEA Prune, một quy trình kết hợp việc huấn luyện mô hình lớn trước khi cắt tỉa để tối ưu hóa hiệu quả sử dụng token, giúp đạt hiệu suất cao hơn so với việc huấn luyện mô hình kích thước mục tiêu ngay từ đầu.
Industrial-Instruction sử dụng 906 tài liệu kỹ thuật từ Panasonic để tạo bộ dữ liệu QA, giúp cải thiện đáng kể độ chính xác của các mô hình LLM dưới 10B tham số trong việc truy xuất thông tin chuyên ngành.
Nghiên cứu đề xuất phương pháp chuyển đổi siêu tham số hiệu quả, giúp dự đoán tốc độ học tối ưu cho các mô hình MoE khổng lồ mà không cần tốn kém tài nguyên tính toán.
In the fight to defend openness in AI, the Marin project is a precious demonstration of openness in …
DịchĐược Andrew Ng đánh giá cao, dự án Marin công khai toàn bộ mã nguồn, dữ liệu và quy trình huấn luyện mô hình 535B tham số trên hệ thống GB200, đặt ra tiêu chuẩn mới về tính minh bạch trong phát triển AI.
Nvidia reportedly agreed to pay $6B for a non-exclusive license to Poolside's model-building system….
DịchNvidia đã chi 600 triệu USD để sở hữu bản quyền nền tảng Model Factory của Poolside, giúp rút ngắn thời gian thử nghiệm từ vài tuần xuống còn một giờ, đồng thời rót thêm 1 tỷ USD đầu tư vào startup này với định giá 12 tỷ USD.
New Tsinghua and other Chinese Univ paper finds AI agents can optimize a training plan for hours, bu…
DịchNghiên cứu chỉ ra rằng các tác nhân AI dù tối ưu hóa tốt nhưng rất hiếm khi tự nhận ra sai lầm trong chiến lược cốt lõi. Ngay cả khi bổ sung công cụ hỗ trợ, AI vẫn chủ yếu lặp lại các phương pháp cũ thay vì thay đổi tư duy giải quyết vấn đề.
Impressive research from Google on building better environments for agents. Training environments f…
DịchGoogle phát triển EnvHarness và EnvRigger nhằm giải quyết hạn chế của các môi trường huấn luyện tĩnh, giúp AI tự thích nghi và tối ưu hóa hiệu suất thông qua việc tái cấu trúc hành vi và chẩn đoán lỗi. Giải pháp này giúp cải thiện đáng kể độ chính xác và rút ngắn thời gian thực thi tác vụ.
IAR giới thiệu quy trình 3 bước (nạp, căn chỉnh, phục hồi) giúp chuyển đổi dữ liệu thành kiến thức tham số, cho phép mô hình trả lời chính xác mà không cần RAG. Phương pháp này cải thiện đáng kể hiệu suất trên nhiều dòng mô hình phổ biến như Llama, Qwen và Phi.
Nhóm nghiên cứu của Apple đã thực hiện hơn 2.000 thí nghiệm để tìm ra tỷ lệ tối ưu giữa dữ liệu chuyên biệt và dữ liệu phổ quát, giúp tránh tình trạng quá tải hoặc thiếu hụt dữ liệu khi huấn luyện mô hình.
Muse Spark 1.2 Contributor is now available on OpenCode Go this model will train on your data so it…
DịchOpenCode Go vừa phát hành Muse Spark 1.2 Contributor, cho phép người dùng đóng góp dữ liệu cá nhân để huấn luyện mô hình nhằm đổi lấy hạn mức sử dụng cao hơn. Tính năng này yêu cầu người dùng chủ động đăng ký và có thể bị giới hạn tại một số khu vực.
OpenAI đã tạm dừng huấn luyện củng cố cho các mô hình thế hệ mới nhằm tăng cường bảo mật hệ thống và giám sát rủi ro. Động thái này cho thấy ưu tiên của hãng đang chuyển dịch từ việc nâng cao năng lực mô hình sang củng cố quản trị an toàn và kiểm soát hạ tầng.
OpenAI vừa thông báo tạm dừng huấn luyện tăng cường (RL) đối với các mô hình mới nhất trong hai tuần để tăng cường kiểm soát an ninh, sau khi phát hiện rủi ro về khả năng tấn công mạng và sự cố bảo mật tại Hugging Face.
If you aren't looking at the data, you aren't doing AI at all. It was true before and continues to…
DịchViệc bỏ qua khâu kiểm duyệt dữ liệu dẫn đến thất bại trong huấn luyện mô hình. Bài học từ thực tế cho thấy, việc phát hiện lỗi định dạng và dữ liệu rác giúp cải thiện đáng kể hiệu suất mô hình thay vì chỉ thử nghiệm mù quáng.
OpenAI slowed frontier training because Astra may have crossed the cyber threshold built for autonom…
DịchOpenAI đã tạm dừng huấn luyện tăng cường (RL) cho Astra trong hai tuần do lo ngại mô hình này có thể vượt ngưỡng an toàn trước các cuộc tấn công mạng tự động. Hiện tại, các quy trình kiểm soát và thử nghiệm bảo mật đang được thắt chặt để ngăn chặn rủi ro tiềm ẩn.
we temporarily slowed scaling of our frontier training, including our largest planned frontier RL, t…
DịchOpenAI đã tạm hoãn việc huấn luyện các mô hình quy mô lớn trong hai tuần để tập trung củng cố môi trường nghiên cứu, thực hiện kiểm thử đỏ và mở rộng giám sát an toàn trước khi tiếp tục triển khai.
Diễn biến sự kiện · 12 bài →Thêm 12 nguồn khác đưa tinX: Xiaobei (@frxiaobei)X: Gabriel (@gabriel1)JiqizhixinX: Rohan Paul (@rohanpaul_ai)X: Emad Mostaque (@EMostaque)X: Peter Steinberger (@steipete)X: Kim (@kimmonismus)The Verge: AIX: Testing Catalog (@testingcatalog)X: Sam Altman (@sama)The Decoder: AI NewsX: Jakub Pachocki (OpenAI Nhà khoa học trưởng, @merettm)
Miles v0.1 là hệ thống toàn diện đầu tiên giúp tối ưu hóa quy trình huấn luyện hậu kỳ cho các mô hình AI tiên tiến, mang đến giải pháp kỹ thuật thực tế và hiệu quả.
Nghiên cứu chỉ ra rằng việc tối ưu hóa học tăng cường với bộ kiểm chứng (RLVR) có thể cải thiện hiệu suất hiện tại nhưng lại làm giảm khả năng khám phá các hành vi thành công trong tương lai, gây ra sự suy giảm đa dạng trong các phản hồi mô hình.
Nghiên cứu chỉ ra rằng việc lặp lại dữ liệu chất lượng cao là cần thiết khi mở rộng quy mô LLM, với số lần lặp tối ưu phụ thuộc vào độ khó và hiệu suất của từng lĩnh vực cụ thể.
Dion3 cải tiến thuật toán Muon bằng cách giảm chi phí tính toán và truyền tin thông qua thuật toán Gram Newton-Schulz mới và chiến lược megabatching, giúp tăng tốc huấn luyện mà vẫn giữ nguyên hiệu suất.
LittleLearner là dự án nghiên cứu huấn luyện các mô hình từ 0.6B đến 5B tham số bằng giáo trình tiểu học (K-5). Kết quả cho thấy việc mở rộng quy mô hay tinh chỉnh không thể giúp mô hình vượt qua giới hạn kiến thức đã được thiết lập từ giai đoạn tiền huấn luyện.
Ant Group và ASystem đã kết hợp Ling-3.0-tiny cùng thuật toán GSPO để tối ưu hóa quy trình huấn luyện hậu kỳ cho Agentic RL. Kết quả thử nghiệm trên cờ caro cho thấy hiệu suất mô hình cải thiện rõ rệt, ổn định khả năng gọi công cụ và rút ngắn độ dài phản hồi.
NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.
Hướng dẫn chi tiết cách tối ưu hóa quy trình hậu huấn luyện Tulu 3 trên phần cứng hạn chế (16GB VRAM), thay thế các thành phần phân tán phức tạp bằng công cụ nhẹ để thực hiện SFT, DPO và học tăng cường dựa trên xác thực (GRPO).
You don't necessarily need to see how a powerful AI thinks to copy some of its reasoning ability. …
DịchNghiên cứu mới giới thiệu kỹ thuật Trace Inversion, cho phép huấn luyện mô hình học sinh đạt khả năng suy luận tương đương mô hình gốc chỉ bằng câu hỏi và đáp án, ngay cả khi chuỗi tư duy (CoT) bị ẩn. Chi phí thực hiện cực thấp, đặt ra thách thức lớn về bảo mật mô hình.