Mô hình
Tencent Hunyuan và ĐH Nhân dân Trung Quốc ra mắt PlanningBench: Khung đánh giá năng lực lập kế hoạch cho LLM
(giờ Việt Nam)
Tóm tắt AI
Tencent Hunyuan hợp tác cùng ĐH Nhân dân Trung Quốc phát hành mã nguồn mở PlanningBench, bộ khung giúp đánh giá và huấn luyện khả năng lập kế hoạch thực tế cho các mô hình ngôn ngữ lớn, hỗ trợ hơn 30 tác vụ kiểm chứng tự động.

Bản dịch AI
Tencent Hunyuan đã hợp tác với Viện Trí tuệ nhân tạo Gaoling thuộc Đại học Nhân dân Trung Quốc để ra mắt PlanningBench, một khung đánh giá và huấn luyện khả năng lập kế hoạch cho các mô hình ngôn ngữ lớn (LLM) dưới dạng mã nguồn mở.
Khung công cụ này được thiết kế với khả năng mở rộng và kiểm chứng linh hoạt, nhằm giải quyết các thách thức trong việc đánh giá năng lực thực thi của AI. PlanningBench bao gồm hơn 30 tác vụ lập kế hoạch trong thế giới thực, hỗ trợ quy trình kiểm chứng và huấn luyện tự động.
Mục tiêu cốt lõi của dự án là thúc đẩy sự phát triển của các mô hình ngôn ngữ lớn, chuyển dịch từ khả năng "nói" sang khả năng "làm" thông qua các kỹ năng lập kế hoạch thực tế.
Hiện tại, toàn bộ tài nguyên liên quan đến dự án đã được công bố công khai trên các nền tảng arXiv, GitHub và Hugging Face để cộng đồng nghiên cứu có thể tiếp cận và đóng góp.
Ý chính từ bài gốc
- Tencent Hunyuan và Đại học Nhân dân Trung Quốc hợp tác phát triển PlanningBench.
- Khung công cụ mã nguồn mở hỗ trợ đánh giá và huấn luyện khả năng lập kế hoạch cho LLM.
- Cung cấp hơn 30 tác vụ lập kế hoạch thực tế với cơ chế kiểm chứng tự động.
- Hướng tới mục tiêu giúp LLM chuyển đổi từ khả năng ngôn ngữ sang khả năng thực thi.
- Tài nguyên dự án đã có sẵn trên arXiv, GitHub và Hugging Face.
Bài viết được AI dịch và tổng hợp tự động từ X/Twitter. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.