A benchmark for difficult scientific discovery from @tianqiao_chen now shows GPT-6 Astra improving a…
DịchApodex AI giới thiệu bộ tiêu chuẩn TRACES, đánh giá toàn diện năng lực giải quyết các vấn đề khoa học phức tạp của AI dựa trên 6 tiêu chí chuyên sâu thay vì chỉ dựa vào điểm số tổng quát.
Very important paper accelerating research around AI discovery. https://x.com/omarsar0/status/20958...
DịchTRACES là bộ benchmark mới giúp đo lường năng lực suy luận và khám phá khoa học của các mô hình AI khi đối mặt với những vấn đề chưa được xác thực trong thực tế.
New benchmark from @Apodex_AI worth digging into. TRACES scores AI systems on discoveries where the…
DịchApodex giới thiệu khung Discovery và chuẩn TRACES để đo lường năng lực giải quyết các vấn đề chưa có đáp án xác thực. Với dữ liệu từ 16 ngành công nghiệp, hệ thống này đã vượt qua các mô hình SOTA hiện tại 7% trong lĩnh vực thiết kế protein.
Most benchmarks assume the answer exists somewhere. Scientific discovery often starts precisely beca…
DịchApodex giới thiệu TRACES, bộ benchmark gồm 423 câu hỏi khoa học thực tế từ 561 lĩnh vực, được các chuyên gia STEM biên soạn nhằm kiểm tra khả năng tư duy và khám phá của AI đối với những vấn đề chưa có đáp án xác định.
TRACES là bộ tiêu chuẩn đánh giá AI dựa trên quy trình nghiên cứu có bằng chứng, thay vì chỉ kiểm tra kết quả cuối cùng. Nó theo dõi toàn bộ chuỗi từ lập kế hoạch đến sửa lỗi, giúp đảm bảo tính minh bạch và khả năng kiểm chứng trong các tác vụ phức tạp như thử nghiệm lâm sàng.
This is a good example of why final-answer accuracy can hide bad agent behaviour. Most AI benchmark…
DịchApodex giới thiệu TRACES, chuẩn mực đánh giá AI chuyển dịch từ việc truy xuất câu trả lời có sẵn sang quy trình điều tra toàn diện cho các vấn đề chưa có lời giải, định nghĩa lại cách đo lường trí tuệ nhân tạo.
DịchApodex_AI giới thiệu TRACES, bộ tiêu chuẩn đánh giá khả năng giải quyết các vấn đề không có đáp án sẵn thông qua quy trình kiểm chứng khoa học, thay vì chỉ dựa vào điểm số đơn thuần.