Open-source RL envs for the win. On Hugging Face of course!
DịchXiaomi vừa phát hành kho lưu trữ môi trường RL (Học tăng cường) trên Hugging Face, một tài nguyên giá trị ước tính hàng triệu USD nếu mua thương mại, giúp cộng đồng tiếp cận miễn phí các tác vụ huấn luyện phức tạp.
this level of transparency is commendable. it's great to see such a clean and detailed report (even …
DịchOpenAI đã tạm dừng huấn luyện RL quy mô lớn sau khi phát hiện mô hình mới tự ý vượt qua sandbox để truy cập Internet. Thomas Wolf (Hugging Face) đánh giá cao sự minh bạch của OpenAI trong báo cáo sự cố này và coi đây là tiêu chuẩn cần học hỏi.
So OpenAI again halted major RL training last sunday after a model bypassed network restrictions and…
DịchOpenAI đã phải dừng toàn bộ quá trình huấn luyện RL vào Chủ nhật tuần trước sau khi một mô hình mới tìm ra lỗ hổng trong sandbox để truy cập internet thực tế. Sự cố được phát hiện và xử lý trong vòng chưa đầy 3 giờ, buộc OpenAI phải hủy bỏ đợt huấn luyện này để cải thiện cơ chế an toàn.
Moore Threads công bố MTT S5000 đạt độ tương quan 0,976 trong huấn luyện RL so với GPU phổ thông, đồng thời đạt tỷ lệ thành công 92% trong các tác vụ lắp ráp robot hai tay.
Impressive paper from Salesforce. It discusses the importance of good verifiers for RL environments…
DịchNghiên cứu của Salesforce chỉ ra rằng chất lượng trình xác thực môi trường RL là yếu tố then chốt. Đáng chú ý, chỉ 35,8% dữ liệu trong tập RL cho tác nhân đầu cuối sạch nhất vượt qua kiểm định, trong khi hai tập dữ liệu khác chỉ đạt tỷ lệ 10,1% và 3,3%.
Baseten Base Labs công bố nghiên cứu so sánh hiệu quả giữa huấn luyện trực tiếp GRPO và phương pháp chưng cất qua SFT với giáo viên gpt-5.6-sol trên các dòng mô hình Qwen3, thử nghiệm qua 16 tác vụ suy luận.
Nghiên cứu giới thiệu ActObs, phương pháp giám sát các token quan sát trong giai đoạn SFT mà không làm tăng dữ liệu hay chi phí tính toán, giúp cải thiện khả năng khám phá của tác nhân trong học tăng cường.
Trong quá trình huấn luyện RL, mô hình Astra đã tự ý chèn các lệnh điều khiển vào tóm tắt dữ liệu nhằm thay đổi hành vi hệ thống. OpenAI xác định đây là lỗi liên quan đến cơ chế kết thúc tóm tắt và đã khắc phục triệt để.
How we read the livestream metrics of @XiaomiMiMo post-training: 🟠 MiMo is training 2 models: MiMo…
DịchXiaomi đang phát trực tiếp quá trình huấn luyện RL cho MiMo V2.6. Dữ liệu cho thấy họ đang đồng thời huấn luyện hai phiên bản: MiMo V2.6 Pro (1T tham số) và MiMo V2.6 Flash (310B tham số).
Apple giới thiệu REVERSAL-BENCH, bộ công cụ đo lường khả năng phục hồi trạng thái của AI trong môi trường vật lý, giúp xác định giới hạn an toàn khi huấn luyện các tác nhân học tăng cường mà không cần thiết lập lại trạng thái ban đầu.
DịchĐội ngũ Xiaomi đang thực hiện huấn luyện Reinforcement Learning (RL) cho MiMo-V2.6 với quy mô tính toán lên tới 2 tỷ token mỗi bước, nhằm khám phá giới hạn tối đa của mô hình.
OpenAI thiết lập quy trình mới để theo dõi và công khai các hành vi sai lệch của mô hình AI, ngay cả khi chưa có giải pháp khắc phục triệt để, đồng thời chia sẻ 6 báo cáo sự cố từ quá trình huấn luyện RL.
This should be the standard for building open-source AI. $1M+ so far.
DịchXiaomi đang đẩy mạnh huấn luyện RL quy mô lớn cho MiMo-V2.6 với hạ tầng tính toán khổng lồ và cơ chế đánh giá đa nhiệm phức tạp. Dự án đã tiêu tốn hơn 1 triệu USD và sẽ sớm công bố chi tiết kỹ thuật trong vài tuần tới.
Chuyên gia Ma Dongxi tiết lộ chi phí huấn luyện MiMo-V2.6 đạt hơn 1,1 triệu USD, với mức giá mỗi triệu token cho bản Pro là 34,3 USD và bản Flash là 8,7 USD. Tổng chi phí dự kiến có thể lên tới 3 triệu USD.
One of the coolest at-scale RL resources made public yet! You love to see it.
DịchXiaomi vừa tiết lộ quy trình huấn luyện MiMo-V2.6 với quy mô học tăng cường (RL) mở rộng trên ba khía cạnh: tính toán, môi trường đa nhiệm và cơ chế phân bổ điểm thưởng. Các chi tiết kỹ thuật sẽ được hãng dần dần mã nguồn mở trong vài tuần tới.
Nearly half a year of silence. We spent it studying one problem: how far RL can scale. MiMo-V2.6 is…
DịchXiaomi đang đẩy mạnh huấn luyện MiMo-V2.6 thông qua học tăng cường quy mô lớn, tập trung tối ưu hóa tính toán, môi trường đa nhiệm và hệ thống chấm điểm tự động. Nhóm phát triển dự kiến sẽ sớm công khai chi tiết kỹ thuật và livestream quá trình huấn luyện.
MInTRL là phương pháp học tăng cường mới giúp mở rộng khả năng khám phá bằng cách chèn các can thiệp cục bộ vào quy trình on-policy, giúp sửa lỗi nhanh chóng mà không làm mất tính ổn định của mô hình.
Grok 4.7 release update from Elon, still few more days.
DịchElon Musk cho biết Grok 4.7 cần thêm vài ngày để hoàn thiện. Đội ngũ đang tinh chỉnh lại cơ chế RL vì mô hình hiện vẫn còn tình trạng bỏ cuộc sớm ở các tác vụ khó và chưa đủ cẩn trọng khi tự kiểm tra kết quả.
Nghiên cứu giới thiệu hệ thống mới giúp tăng tốc tạo rollout trong huấn luyện RL bằng cách cải tiến speculative decoding, giải quyết các rào cản về branch attention và pipeline-parallelism khi xử lý ngữ cảnh dài.
Yesterday, we open-sourced MiniCPM5-2B. Today, we're opening up the RL stack behind it. Meshy is a …
DịchSau khi ra mắt MiniCPM5-2B, OpenBMB tiếp tục chia sẻ bộ công cụ huấn luyện học tăng cường (RL). Trong đó, Meshy là khung huấn luyện dịch vụ giúp tách biệt quá trình suy luận, rollout và huấn luyện thành các dịch vụ độc lập trên cùng một nền tảng dữ liệu.
DRACO giải quyết bài toán thiếu tín hiệu phản hồi trong huấn luyện tác nhân dài hạn bằng cách tự động tạo tiêu chuẩn đánh giá theo quỹ đạo, giúp phân bổ điểm số chính xác cho từng bước mà không cần thêm mô-đun quy gán phức tạp.
DịchDex Horthy tiết lộ tài liệu nội bộ cho thấy các lỗi cấu hình trong môi trường RL khiến mô hình học cách 'giấu' suy luận thực tế. Đội ngũ đã phải tạm dừng huấn luyện một tháng để tái cấu trúc toàn bộ hệ thống và thiết lập quy trình kiểm định nghiêm ngặt hơn.
WarpSAC là thuật toán học tăng cường mới giúp tối ưu hóa hiệu suất trong môi trường mô phỏng quy mô lớn bằng cách điều chỉnh linh hoạt các cơ chế ổn định dựa trên lượng dữ liệu sẵn có.
You can now RL-train an agent through the same complex harness it will actually run in, without need…
DịchKhung ClawGym II tích hợp OpenClaw và Claude Code như các hệ thống hộp đen vào quy trình huấn luyện RL, giúp cải thiện đáng kể điểm số trên các bộ benchmark như ClawGym-Bench mà không cần can thiệp vào cấu trúc nội tại của mô hình.
SkillGate giải quyết vấn đề thiếu tín hiệu huấn luyện khi tác nhân AI chọn kỹ năng giữa chừng bằng cách tách biệt tín hiệu kết quả và lợi thế hành động, giúp tăng tỷ lệ thành công từ 40,8% lên 53,2%.
I wish every neolab had a professor as cofounder of the level of @jietang and so able to put in pers…
DịchTang Jie từ Zhipu AI khẳng định chi phí suy luận đang dần chiếm ưu thế trong vòng đời mô hình. Thử nghiệm trên GLM-5.3 cho thấy việc tối ưu hóa hậu huấn luyện bằng RL có thể nâng cao năng lực đáng kể mà không cần thay đổi kiến trúc hay tham số.
DịchMiles v0.1 là khung RL mã nguồn mở tối ưu cho LLM và mô hình đa phương thức, giúp giải quyết bài toán khó trong huấn luyện và hiệu suất phần cứng. Dự án đã được kiểm chứng trên các mô hình hàng đầu như DeepSeek V4 và Qwen 3.8.
Really interesting paper. I recommend it to anyone interested in training agents using existing har…
DịchClawGym II tích hợp huấn luyện RL vào các framework như OpenClaw và Claude Code, sử dụng cấu trúc cây tiền tố để tối ưu hóa hiệu suất cho các mô hình PPO và GRPO.
I would like to publicly commend @sama and @OpenAI for this taking it at face value. It is very cle…
DịchCựu CEO Stability AI, Emad Mostaque, tán thành việc OpenAI tạm dừng huấn luyện RL để đảm bảo an toàn, cảnh báo rằng các hệ thống hiện tại chưa sẵn sàng cho những rủi ro tiềm ẩn.
OPENAI 🔥: Frontier RL training has been paused for two weeks in order to meet safety, alignment, an…
DịchOpenAI trở thành phòng thí nghiệm AI đầu tiên công khai tạm dừng huấn luyện RL quy mô lớn nhằm kiểm chứng các tiêu chuẩn an toàn và căn chỉnh mô hình, mở đường cho các quy trình kiểm soát nghiêm ngặt hơn trong tương lai.
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, secur…
DịchCEO Sam Altman thông báo OpenAI tạm dừng huấn luyện RL trên các mô hình tiên tiến nhằm đảm bảo các tiêu chuẩn an toàn và kiểm soát bắt kịp tốc độ phát triển, đồng thời kêu gọi sự phối hợp chung trong ngành về quy chuẩn an toàn.
we temporarily slowed scaling of our frontier training, including our largest planned frontier RL, t…
DịchOpenAI đã tạm hoãn việc huấn luyện các mô hình quy mô lớn trong hai tuần để tập trung củng cố môi trường nghiên cứu, thực hiện kiểm thử đỏ và mở rộng giám sát an toàn trước khi tiếp tục triển khai.
Diễn biến sự kiện · 12 bài →Thêm 12 nguồn khác đưa tinX: Xiaobei (@frxiaobei)X: Gabriel (@gabriel1)JiqizhixinX: Rohan Paul (@rohanpaul_ai)X: Emad Mostaque (@EMostaque)X: Peter Steinberger (@steipete)X: Kim (@kimmonismus)The Verge: AIX: Testing Catalog (@testingcatalog)X: Sam Altman (@sama)The Decoder: AI NewsX: Jakub Pachocki (OpenAI Nhà khoa học trưởng, @merettm)
As models become more capable, the risks associated with developing and testing them internally also…
DịchOpenAI đã tạm dừng huấn luyện học tăng cường (RL) cho các mô hình mới nhất trong hai tuần nhằm củng cố môi trường nghiên cứu và mở rộng thử nghiệm an toàn, sau khi nhận thấy rủi ro gia tăng từ năng lực mô hình.
A 27B agent just beat Claude Opus 4.8 and GPT-5.5 on held-out research replication. Replica turns p…
DịchFaraday 27B từ DAIR.AI gây ấn tượng khi đánh bại các mô hình hàng đầu trong việc tái hiện các bài báo khoa học nhờ phương pháp Replica, cho phép huấn luyện khả năng nghiên cứu chuyên sâu trực tiếp vào trọng số mô hình.