Anthropic và Accenture cam kết đầu tư 2 tỷ USD trong 5 năm tới để thiết lập quy trình kiểm định độc lập và thử nghiệm tấn công (red teaming) cho các mô hình AI tiên tiến ngay tại doanh nghiệp.
Epoch AI đã thực hiện kiểm định độc lập trên bộ tiêu chuẩn HealthBench Professional của OpenAI và phát hiện một nửa trong số 50 tác vụ được lấy mẫu ngẫu nhiên gặp vấn đề nghiêm trọng về chất lượng.
Vì sao đáng đọc: Đây là báo cáo quan trọng về tính minh bạch và độ tin cậy của các bộ tiêu chuẩn đánh giá AI trong lĩnh vực y tế, thu hút sự quan tâm lớn từ giới nghiên cứu.
18/08
Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Ventor-QTest giới thiệu kỹ thuật kiểm định hộp đen mới giúp đánh giá độ tin cậy của các API mô hình lớn mà không cần truy cập xác suất đầu ra, thông qua việc đo lường tổn thất độ trung thực trung bình và cực hạn để phát hiện rủi ro trong các tác vụ thông minh dài hạn.