13/09

Chủ Nhật · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 45/100

GPT-6 Astra dẫn đầu bảng xếp hạng TRACES về khả năng khám phá khoa học

A benchmark for difficult scientific discovery from @tianqiao_chen now shows GPT-6 Astra improving a…

DịchApodex AI giới thiệu bộ tiêu chuẩn TRACES, đánh giá toàn diện năng lực giải quyết các vấn đề khoa học phức tạp của AI dựa trên 6 tiêu chí chuyên sâu thay vì chỉ dựa vào điểm số tổng quát.

04/09

Thứ Sáu · 3 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 32/100

Cùng sự kiệnApodex ra mắt TRACES: Bộ tiêu chuẩn đánh giá khả năng khám phá khoa học của AI với các câu hỏi chưa có lời giải

Very important paper accelerating research around AI discovery. https://x.com/omarsar0/status/20958...

DịchTRACES là bộ benchmark mới giúp đo lường năng lực suy luận và khám phá khoa học của các mô hình AI khi đối mặt với những vấn đề chưa được xác thực trong thực tế.

Cùng sự kiện, bài đại diện «Apodex ra mắt TRACES: Bộ tiêu chuẩn đánh giá khả năng giải quyết các bài toán khoa học chưa có lời giải»
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 36/100

Cùng sự kiệnApodex ra mắt TRACES: Chuẩn đánh giá khả năng khám phá khoa học của AI

New benchmark from @Apodex_AI worth digging into. TRACES scores AI systems on discoveries where the…

DịchApodex giới thiệu khung Discovery và chuẩn TRACES để đo lường năng lực giải quyết các vấn đề chưa có đáp án xác thực. Với dữ liệu từ 16 ngành công nghiệp, hệ thống này đã vượt qua các mô hình SOTA hiện tại 7% trong lĩnh vực thiết kế protein.

Cùng sự kiện, bài đại diện «Apodex ra mắt TRACES: Bộ tiêu chuẩn đánh giá khả năng giải quyết các bài toán khoa học chưa có lời giải»
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 46/100

Apodex ra mắt TRACES: Bộ tiêu chuẩn đánh giá khả năng giải quyết các bài toán khoa học chưa có lời giải

Most benchmarks assume the answer exists somewhere. Scientific discovery often starts precisely beca…

DịchApodex giới thiệu TRACES, bộ benchmark gồm 423 câu hỏi khoa học thực tế từ 561 lĩnh vực, được các chuyên gia STEM biên soạn nhằm kiểm tra khả năng tư duy và khám phá của AI đối với những vấn đề chưa có đáp án xác định.

Thêm 2 nguồn khác đưa tinX: DAIR.AI (@dair_ai)X: Elvis Saravia (@omarsar0, DAIR.AI)

22/08

Thứ Bảy · 1 tin
Ma Dongxi NLP@dongxi_nlp
Nghiên cứuĐiểm AI 35/100

TRACES: Tiêu chuẩn mới đánh giá khả năng suy luận và tính minh bạch của AI

TRACES là bộ tiêu chuẩn đánh giá AI dựa trên quy trình nghiên cứu có bằng chứng, thay vì chỉ kiểm tra kết quả cuối cùng. Nó theo dõi toàn bộ chuỗi từ lập kế hoạch đến sửa lỗi, giúp đảm bảo tính minh bạch và khả năng kiểm chứng trong các tác vụ phức tạp như thử nghiệm lâm sàng.

20/08

Thứ Năm · 2 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

TRACES: Hệ thống chuẩn mực đầu tiên đánh giá năng lực 'AI khám phá'

This is a good example of why final-answer accuracy can hide bad agent behaviour. Most AI benchmark…

DịchApodex giới thiệu TRACES, chuẩn mực đánh giá AI chuyển dịch từ việc truy xuất câu trả lời có sẵn sang quy trình điều tra toàn diện cho các vấn đề chưa có lời giải, định nghĩa lại cách đo lường trí tuệ nhân tạo.

Ma Dongxi NLP@dongxi_nlp
Nghiên cứuĐiểm AI 36/100

Ra mắt TRACES: Bộ tiêu chuẩn đầu tiên đo lường 'Trí tuệ khám phá' của AI

Discovery becomes an engineered verb Ambition -> formulation -> action -> observation -> verificati…

DịchApodex_AI giới thiệu TRACES, bộ tiêu chuẩn đánh giá khả năng giải quyết các vấn đề không có đáp án sẵn thông qua quy trình kiểm chứng khoa học, thay vì chỉ dựa vào điểm số đơn thuần.

Tổng 7 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (29 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “TRACES” | AIHOT.vn