Viện An toàn AI Anh (AISI) áp dụng khung tiêu chuẩn Every Eval Ever và Evaluation Cards của EvalEval nhằm minh bạch hóa và đảm bảo tính tái lập cho các kết quả kiểm định mô hình AI.
People outside the AI labs should have a real say in how this technology develops, and a clear way t…
DịchOpenAI kêu gọi sự tham gia rộng rãi của cộng đồng trong việc định hình tiêu chuẩn AI, nhằm ngăn chặn sự tập trung quyền lực và thúc đẩy tính minh bạch, cạnh tranh công bằng trên toàn cầu.
brief break from regularly scheduled muse programming, but great progress by @scale_AI on RSI benchm…
DịchScale AI đạt cột mốc quan trọng với hơn 600 đề xuất cho chuẩn RSI, đồng thời mời nhà tiên phong Schmidhuber làm cố vấn cấp cao để hoàn thiện quy trình xác thực.
OpenAI kêu gọi thiết lập các tiêu chuẩn kỹ thuật quốc tế để quản lý rủi ro từ khả năng tự cải tiến đệ quy (RSI) của AI, nhấn mạnh vai trò dẫn dắt của Mỹ và sự cần thiết của các giao thức giám sát chặt chẽ trước khi tiến tới AI tự chủ hoàn toàn.
Baidu Cloud phối hợp cùng Viện Tiêu chuẩn hóa Điện tử Trung Quốc công bố 4 tiêu chuẩn quốc gia về AI, sẽ bắt đầu có hiệu lực từ ngày 27/8/2026 dưới sự quản lý của Ủy ban Tiêu chuẩn hóa Công nghệ Thông tin quốc gia.
Sierra vừa công bố đạt chứng nhận AIUC-1 sau quá trình kiểm định độc lập từ Schellman và các bài kiểm tra chuyên sâu từ Artificial Intelligence Underwriting Company.
Các ông lớn AI gồm OpenAI, Anthropic và xAI đã cùng ký kết tiêu chuẩn AEF-1, đặt nền móng cho quy trình đánh giá độc lập và minh bạch hơn trong ngành công nghiệp AI.
Broken record here, but GDPval-AA is a very bad benchmark. 1) AIs give answers to the public questio…
DịchChuyên gia Ethan Mollick chỉ trích GDPval-AA là bộ tiêu chuẩn kém chất lượng vì dùng AI chấm điểm AI thay vì con người. Việc các phòng thí nghiệm vẫn sử dụng nó, dù kết quả gây tranh cãi như việc GPT-6 bị Kimi K3 vượt mặt, đang đặt ra dấu hỏi lớn về tính khách quan.