Simon Willison
85

Tin ngành

Khi các trình thu thập dữ liệu trở thành gánh nặng cho hạ tầng Linux Kernel

(giờ Việt Nam)

Tóm tắt AI

Konstantin Ryabitsev cảnh báo về việc các trình thu thập dữ liệu (crawlers) đang tiêu tốn tài nguyên CPU khổng lồ trên git.kernel.org, vượt xa nhu cầu truy cập hợp lệ. Vấn đề này đặt ra thách thức lớn cho các hệ thống web có dữ liệu mở trong kỷ nguyên AI.

Bản dịch AI

Ngày 7 tháng 9 năm 2026 - Link Blog

Creepy crawlies (via) Konstantin Ryabitsev thảo luận về việc "bức xạ nền" từ các trình thu thập dữ liệu (crawler) lạm dụng đã trở nên tồi tệ như thế nào dưới góc nhìn của git.kernel.org, kho lưu trữ Git chính thức của nhân Linux:

TL;DR: chúng tôi tiêu tốn nhiều chu kỳ CPU để hiển thị (render) các commit cho các trình thu thập dữ liệu hơn là cho tất cả các loại truy cập hợp lệ khác cộng lại, bao gồm cả git clone. Tại bất kỳ thời điểm nào, trên 5 nút phân tán theo địa lý, có 14 nhân CPU chỉ làm mỗi việc là hiển thị các git commit dưới dạng html.

Tôi rất lo lắng về điều này dưới góc độ của Datasette, nền tảng phục vụ một lượng lớn các trang web có thể thu thập dữ liệu.

crawlinglinuxhạ tầngdữ liệuai-ethics
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Simon Willison. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.