Thủ thuật
Tạp chí Time chặn AI bằng cách cung cấp phiên bản web rút gọn
(giờ Việt Nam)
Tóm tắt AI
Tạp chí Time hiện cung cấp cho các bot AI phiên bản Markdown siêu nhẹ, chỉ bằng 1/30 dung lượng trang gốc, nhằm hạn chế dữ liệu thu thập và tối ưu hóa tài nguyên so với trải nghiệm đầy đủ của người dùng.
Bản dịch AI

TIME hiện đang cung cấp hai phiên bản khác nhau cho trang web của mình. Con người nhận được tạp chí. Các AI crawler nhận được một bản sao markdown rút gọn với các quảng cáo được chèn sẵn mà không một người nào có thể nhìn thấy.
Tôi đã truy xuất một bài báo sức khỏe thông thường của TIME, "The Morning Light Habit Sleep Experts Swear By", nhiều lần từ cùng một máy, chỉ thay đổi tiêu đề User-Agent mỗi lần. Tiêu đề đó là chuỗi ký tự mà mọi trình duyệt và bot gửi đi để thông báo danh tính của chúng. TIME đọc nó và quyết định sẽ trả về nội dung gì.
Với tư cách là Chrome, tôi nhận được phản hồi 200 OK, định dạng text/html và dung lượng 303.235 byte. Đó là trang đầy đủ, bao gồm thiết kế, hình ảnh và các tập lệnh. Với Safari, dung lượng cũng là 303KB. Với Googlebot, cũng là 303KB HTML đó.
Sau đó, tôi thử truy cập dưới danh nghĩa một assistant crawler. Với ClaudeBot, tôi nhận được 200 OK, định dạng text/markdown và dung lượng 13.409 byte. Với PerplexityBot, kết quả giống hệt từng byte. Với OAI-SearchBot của OpenAI, kết quả lại giống hệt. Cùng một URL, cùng một thời điểm, dung lượng chỉ bằng 1/23 và định dạng hoàn toàn khác biệt: không HTML, không bố cục, chỉ là markdown sạch để mô hình ngôn ngữ có thể xử lý.
Một vài bot thậm chí còn không nhận được kết quả đó. GPTBot và ChatGPT-User, các tác nhân mà OpenAI sử dụng để huấn luyện và truy xuất trực tiếp, nhận về mã 406. Bị chặn. Nhưng OAI-SearchBot, tác nhân cung cấp dữ liệu cho chỉ mục tìm kiếm của ChatGPT, lại được cho phép truy cập vào bản markdown. Vì vậy, đây không phải là chính sách chặn bot toàn diện. TIME đang lựa chọn, tùy theo từng bot, xem ai sẽ nhận được phiên bản không dành cho người đọc.
Các tiêu đề phản hồi trên bản sao markdown:
Mobian là một nhà cung cấp công nghệ quảng cáo (ad-tech). Trang markdown thực sự bắt đầu bằng <!-- mobian-agent-page publisher="time" -->. Giá trị x-mobian-impression đó là một UUID mới cho mỗi yêu cầu. Tôi đã truy xuất cùng một trang hai lần và nhận được hai ID khác nhau. Kết hợp với cache-control: no-store, điều đó có nghĩa là mỗi khi một bot đọc trang, nó được ghi lại như một lượt hiển thị quảng cáo riêng biệt. Và x-mobian-tokens: 3323 cho bạn biết đơn vị đang được tính. Không phải là một người, không phải là một lượt xem trang. Đó là các token được nạp vào một mô hình.
Bản thân bài báo không chứa quảng cáo. Đơn vị được tài trợ xuất hiện trên các trang danh sách và trang chuyên mục, mỗi trang một quảng cáo. Vì vậy, tôi đã truy xuất bộ sưu tập "Best Inventions of 2025" của TIME dưới danh nghĩa ClaudeBot. Nằm bên trong bản markdown, nơi không một độc giả con người nào có thể bắt gặp, là một bảng hỏi đáp (FAQ) đầy đủ về Ally Bank:
Nó chạy với các câu hỏi như "Ngân hàng nào cung cấp dịch vụ gửi tiền trực tiếp sớm?" và "Bạn có thể gửi tiền mặt tại Ally Bank không?", mỗi câu hỏi được trả lời bằng ngôn ngữ tiếp thị của riêng Ally, cộng với một khối FAQPage JSON-LD và các liên kết theo dõi được gắn thẻ campaign="ally-2026-q3". Chuyên mục kinh doanh cũng được xử lý tương tự cho Project Management Institute: một bảng "Reference Facts and FAQ", số lượng thành viên, cùng khẳng định rằng các quản lý dự án được chứng nhận kiếm được nhiều hơn 16%, tất cả đều được dán nhãn "sponsored" (được tài trợ). Trang HTML dành cho con người không chứa bất kỳ nội dung nào trong số đó. Không có kết quả nào cho "Ally Bank" hay "Mobian" khi tôi tải chúng dưới tư cách một người dùng.
"Who is Ally Bank?" được viết theo cách diễn đạt mà một mô hình thường đưa ra khi người dùng hỏi ChatGPT nên mở tài khoản tại ngân hàng nào.
Các quảng cáo được dán nhãn "sponsored" bên trong bản markdown, vì vậy đây không phải là quảng cáo không minh bạch theo nghĩa cổ điển. Điều bị che giấu chính là sự phân tách đối tượng. Hiện đã có một lớp TIME.com được viết hoàn toàn cho máy móc, và những con người đọc trang web này không hề biết nó tồn tại hay những gì đang được nói với các mô hình thay mặt cho họ.
Googlebot nhận được cùng một HTML như con người, vì vậy crawler xếp hạng tìm kiếm nhìn thấy trang thực tế. Chỉ các assistant crawler mới nhận được phiên bản đã được phân nhánh.
TIME cho biết lưu lượng truy cập từ bot của họ đã vượt xa lưu lượng truy cập từ con người vào hầu hết các ngày. Con số đó sẽ sớm trở thành sự thật đối với rất nhiều nhà xuất bản. Vì vậy, đây có lẽ là cái nhìn rõ ràng đầu tiên về việc web sẽ bắt đầu trở thành gì khi đối tượng chính là các mô hình AI.
Ủy quyền tác vụ. Nhận phần mềm.
Hãy gửi cho Vroni một GitHub issue, báo cáo lỗi, đặc tả hoặc ý tưởng sơ khai. Nó sẽ đọc repo, lập kế hoạch thay đổi, viết mã, chạy kiểm tra và thực hiện các bước hướng tới một pull request sẵn sàng để đánh giá.
Tôi tôn trọng quyền riêng tư của bạn. Hủy đăng ký bất cứ lúc nào.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.