Nghiên cứu
Hơn 30% bài báo mới trên ArXiv có dấu hiệu được viết bởi AI
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu trên 12.750 bài báo cho thấy 32% nội dung trên ArXiv có đặc điểm giống văn bản do AI tạo ra, trong đó lĩnh vực Khoa học máy tính chiếm tỷ lệ cao nhất với 65%.
Bản dịch AI
Chúng tôi đã chấm điểm toàn văn của 12.750 bài báo trên arXiv và nhận thấy khoảng một phần ba số bài báo mới có văn phong giống như do máy viết. Dưới đây là phương pháp, kết quả và một bản tường trình trung thực về các hạn chế của nghiên cứu.
Ngưỡng dương tính giả
Có một kiểu tiêu đề dạng "N% của X hiện là AI", và hầu hết đều không đáng đọc, bởi vì công cụ phát hiện đằng sau con số đó cũng gắn cờ một phần văn bản do con người viết thực sự. Nếu một công cụ đánh dấu 40% bài báo mới là do máy viết nhưng cũng đánh dấu 20% bài báo được viết trước khi ChatGPT tồn tại, thì câu chuyện thực sự nằm ở con số 20% mà không ai nhắc đến đó.
Vì vậy, chúng tôi đã xây dựng nghiên cứu dựa trên sự phản đối đó. Công cụ phát hiện của chúng tôi, được mô tả tại đây, đã được hiệu chỉnh cho văn phong học thuật; với tỷ lệ dương tính giả là 0,4%, nó loại bỏ 99,6% văn bản khoa học thuần túy trước thời LLM và phát hiện được 85% văn bản học thuật do AI viết. Chúng tôi lấy tỷ lệ dương tính giả đó làm mốc. Chúng tôi đã lấy các bài báo được gửi vào năm 2021 và 2022, trước khi có ChatGPT, coi chúng là dữ liệu gốc của con người và thiết lập ngưỡng gắn cờ sao cho đúng 0,4% trong số đó bị gắn cờ. Đường đó chính là ngưỡng sàn. Mỗi con số chúng tôi báo cáo đều là tỷ lệ các bài báo nằm trên ngưỡng mà văn bản trước thời LLM thực sự nằm ở mức 0,4% theo thiết kế. Các năm trước ChatGPT đóng vai trò là nhóm đối chứng tích hợp: nếu sự gia tăng là một lỗi của công cụ phát hiện, thì năm 2021 và 2022 sẽ có tỷ lệ gắn cờ cao như năm 2026. Hình đầu tiên cho thấy điều đó không xảy ra.
Những gì chúng tôi đã đo lường
Chúng tôi đã lấy mẫu mười nhóm lĩnh vực, khoảng 25 bài báo mỗi lĩnh vực mỗi tháng, từ tháng 1 năm 2023 đến tháng 7 năm 2026, cộng với tám tháng đối chứng trong năm 2021 và 2022, tổng cộng là 12.750 bài báo. Đối với mỗi bài, chúng tôi lấy tệp PDF phiên bản 1, vì vậy một bài báo được sửa đổi vào năm 2026 không thể làm rò rỉ văn bản hiện đại vào vị trí năm 2023 của nó. Chúng tôi chấm điểm toàn bộ phần thân văn bản thay vì phần tóm tắt, vì phần tóm tắt làm giảm tín hiệu: chúng tôi đã thấy cùng một bài báo có điểm dưới 20% ở phần tóm tắt nhưng lại trên 70% ở phần thân. Mỗi số liệu được báo cáo đều đi kèm với khoảng tin cậy bootstrap 95%.
Kết quả
Tỷ lệ bị gắn cờ duy trì ổn định ở mức 0,4% trong suốt năm 2021 và 2022, bắt đầu tăng lên chỉ vài tháng sau khi ChatGPT ra mắt và leo thang thành hai đợt lên khoảng 32% trong quý hoàn chỉnh gần đây nhất, đạt đỉnh gần 39% vào đầu năm 2026. Sự phân bổ giữa các lĩnh vực là rất lớn, và bảng cùng hình thứ hai sẽ thể hiện rõ điều đó. Các giá trị dưới đây là tỷ lệ bị gắn cờ của mỗi lĩnh vực trong 12 tháng tính đến tháng 7 năm 2026, cùng với mức đối chứng trước thời LLM của lĩnh vực đó.
Khoa học máy tính dẫn đầu với khoảng 65%. Toán học thấp nhất, gần 0,7%, và phần hạn chế sẽ giải thích lý do tại sao giá trị thấp này khó diễn giải. Cột đối chứng là tỷ lệ gắn cờ từ năm 2021 đến 2022 của mỗi lĩnh vực được tính trung bình trên ba cài đặt độ nhạy; các lĩnh vực tăng mạnh nhất không phải là những lĩnh vực có mức đối chứng trước thời LLM cao nhất, vì vậy điểm xuất phát cao không giải thích được sự gia tăng này.
Hạn chế
Quy mô mẫu đối chứng. Mẫu đối chứng trước ChatGPT của mỗi lĩnh vực là 200 bài báo. Với tỷ lệ gắn cờ 0,4%, chỉ có tám bài báo bị gắn cờ trên tổng số 2.000 bài báo đối chứng, phân bổ rải rác trên mười lĩnh vực, vì vậy tỷ lệ đối chứng theo từng lĩnh vực với một ngưỡng duy nhất là khá thô. Ngưỡng sàn chung được ước tính tốt và là cơ sở của nghiên cứu, nhưng các mức đối chứng theo từng lĩnh vực chỉ là xấp xỉ, và một mẫu đối chứng lớn hơn cũng không khắc phục được điều này: việc xác định tỷ lệ phần trăm nhỏ cho mỗi lĩnh vực sẽ đòi hỏi hàng nghìn bài báo đối chứng mỗi lĩnh vực mà khối lượng bài báo trên arXiv trước năm 2023 không đáp ứng được.
Điểm số thấp có thể cho thấy mức độ áp dụng thấp hoặc điểm mù của công cụ phát hiện. Toán học là trường hợp rõ ràng nhất. Các bài báo toán học bị chi phối bởi ký hiệu và cấu trúc định lý-chứng minh, và khi các phương trình và tài liệu tham khảo được loại bỏ, phần văn xuôi còn lại rất thưa thớt và không giống với tiếng Anh khoa học mà công cụ phát hiện đã được huấn luyện. Một bài báo toán học được soạn thảo với sự hỗ trợ mạnh mẽ từ mô hình có thể đạt điểm thấp vì văn phong của nó nằm ngoài phân phối mà công cụ phát hiện đã học, vì vậy điểm thấp trong toán học là bằng chứng yếu cho thấy con người đã viết bài báo đó. Kết quả này nhất quán với hai cách giải thích rất khác nhau: mức độ áp dụng thấp hơn hoặc độ nhạy của công cụ phát hiện giảm trong lĩnh vực đó, và dữ liệu này không thể phân tách chúng. Các lĩnh vực có giả định trong phân phối mạnh nhất, tức là các lĩnh vực nhiều văn xuôi, cũng là những lĩnh vực tăng mạnh nhất, vì vậy yếu tố gây nhiễu này không giải thích được xu hướng tổng thể. Tuy nhiên, ở các lĩnh vực có điểm số thấp, thứ hạng nên được hiểu là giới hạn dưới của mức độ áp dụng.
Phạm vi bao phủ của công cụ phát hiện. Công cụ phát hiện nhạy bén hơn với một số trình tạo văn bản so với những trình khác, và chúng tôi không thể đánh giá nó dựa trên sự kết hợp chính xác, riêng tư giữa các mô hình và câu lệnh (prompt) mà các tác giả thực sự sử dụng. Phạm vi bao phủ không đầy đủ làm giảm tỷ lệ gắn cờ, vì vậy mức độ phổ biến được báo cáo là giới hạn dưới: tỷ lệ thực tế ít nhất là bằng những gì chúng tôi đã đo lường. Tài liệu về công cụ phát hiện có báo cáo hiệu suất theo từng trình tạo.
Bị gắn cờ không đồng nghĩa với việc xác định quyền tác giả. Công cụ phát hiện ước tính liệu văn bản có đọc như do máy viết hay không, ở một xác suất đã hiệu chỉnh với tỷ lệ sai số đã biết. Nó không thể phân biệt một tài liệu được chỉnh sửa nhẹ với một tài liệu hoàn toàn do máy tạo ra, và một điểm số đơn lẻ không bao giờ là căn cứ để buộc tội một cá nhân cụ thể. Chúng tôi báo cáo mức độ phổ biến của văn phong giống máy, bao gồm cả việc chỉnh sửa có sự hỗ trợ mạnh mẽ của AI.
Hãy thử nghiệm
Công cụ phát hiện này vận hành với chi phí thấp và chúng tôi không kiếm tiền từ nó. Bạn có thể dùng thử miễn phí trên bất kỳ bài báo arXiv nào tại đây, và trên văn bản của chính bạn tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.