ExplorationBench sử dụng các môi trường giả lập với quy tắc logic mới lạ, buộc AI phải tự khám phá thay vì dựa vào dữ liệu huấn luyện sẵn, giúp đánh giá chính xác tư duy khoa học của mô hình.
Could a language model derive General Relativity yet still be unable to invent it? This Google Deep…
DịchDeepMind chỉ ra rằng LLM gặp khó khăn trong việc tạo ra các đột phá khoa học như thuyết tương đối vì thiếu khả năng 'suy luận ngược' (abduction). Dù giỏi xử lý dữ liệu, mô hình ngôn ngữ vẫn bị giới hạn bởi cơ chế nén dữ liệu thay vì tư duy sáng tạo vượt bậc.