OpenAI cho biết mô hình nội bộ của họ đã giải được hơn 100 bài toán toán học lâu đời, bao gồm cả bài toán Navier-Stokes. Để đối phó với những hoài nghi từ giới chuyên môn, công ty đã thành lập hội đồng cố vấn toán học với sự tham gia của các nhà toán học đạt giải Fields.
GPT-6 Astra đã chính thức vượt qua ngưỡng thử thách khó nhất của FrontierMath Tier 4, đánh dấu bước ngoặt lịch sử khi AI giải quyết thành công các bài toán toán học cấp độ cao.
Vì sao đáng đọc: Đây là cột mốc quan trọng trong khả năng suy luận logic của AI, thu hút sự quan tâm lớn từ cộng đồng công nghệ và giới nghiên cứu toán học.
Another exciting reasoning benchmark, MazeBench, where GPT-Astra outperforms any other model, especi…
DịchMazeBench, bộ tiêu chuẩn đánh giá khả năng suy luận mới, đã xác nhận GPT-Astra dẫn đầu thị trường, vượt xa các đối thủ như Fable 5.1. Thành tích này củng cố vị thế của Astra trước thềm OpenAI ra mắt mô hình thế hệ tiếp theo.
Nghiên cứu chỉ ra rằng các chiến lược truy vấn chỉ mục ngược truyền thống gặp giới hạn lý thuyết nghiêm trọng, dẫn đến sự bùng nổ độ phức tạp theo hàm mũ khi xử lý các truy vấn Boolean phức tạp trong suy luận thần kinh-biểu tượng.
ENTLORE là khung benchmark mới giúp đánh giá khả năng truy xuất và suy luận các mối quan hệ tổ chức phức tạp từ tài liệu doanh nghiệp, vốn thường bị ẩn đi trong các nguồn dữ liệu rời rạc.
Khung làm việc mới giúp LLM giải quyết các câu hỏi logic phức tạp bằng cách phân tách lựa chọn thành các thành phần nguyên tử, sau đó sử dụng lập trình tuyến tính để tổng hợp kết quả. Phương pháp này cải thiện đáng kể độ chính xác trên các bộ dữ liệu logic khó.