Ai có liên hệ nội bộ với OpenAI, xin hãy nhờ họ xử lý vấn đề bot nhện
(mailman.nanog.org)Vấn đề GPTBot của OpenAI thu thập dữ liệu website quá mức
-
Tác giả gặp vấn đề GPTBot của OpenAI truy cập website của mình là web.sp.am và thu thập dữ liệu trang quá mức
- Mỗi ngày bot yêu cầu khoảng 3 triệu trang, trong đó 1,8 triệu là yêu cầu tới robots.txt
- Website của tác giả có dạng Content Farm với cấu trúc gồm 6,859 tỷ website, mỗi website chỉ có 1 trang
- Tất cả các trang trông gần như giống hệt nhau và đều dùng cùng một IP, cùng một chứng chỉ SSL wildcard, nên crawler không phải là khó để nhận ra tình huống này
-
Khoảng 1–2 tháng trước, crawler của Amazon cũng gây ra vấn đề tương tự, nhưng tác giả đã có thể liên hệ để khiến họ ngừng crawl
-
Tác giả đang hỏi liệu có ai có thể liên hệ với OpenAI hay không
-
Tác giả đùa rằng có vẻ dữ liệu website của mình đang được dùng để huấn luyện GPT-5
Ý kiến của GN⁺
- Việc crawler không diễn giải robots.txt đúng cách và gửi yêu cầu quá mức, dù không mang ác ý, vẫn là một vấn đề nghiêm trọng có thể gây thiệt hại cho dịch vụ từ phía bên kia. Có vẻ OpenAI cũng cần sớm cải thiện logic của crawler
- Đặc biệt với những nơi vận hành vô số domain như Content Farm, cần cân nhắc các biện pháp như lọc dựa trên IP để tránh crawl từng site riêng lẻ
- Có vẻ cần một quy trình và hệ thống để giám sát hoạt động của bot crawl, phát hiện dấu hiệu bất thường và phản ứng nhanh
- Cần giao tiếp chặt chẽ với quản trị viên của các site bị crawl để giảm thiểu thiệt hại. Không nên chỉ tập trung vô điều kiện vào việc thu thập dữ liệu, mà góc nhìn cùng có lợi là rất quan trọng
1 bình luận
Các ý kiến trên Hacker News
Nhớ đến việc GPT-2/3/J từng gặp https://reddit.com/r/counting. Đây là nơi người dùng Reddit đếm vô hạn bằng cách tăng từng con số một; có lẽ những tên người dùng như SolidGoldMagikarp trông như các chuỗi quá phổ biến trên Internet nên trong quá trình token hóa chúng được xử lý như token độc lập
https://www.alignmentforum.org/posts/8viQEp8KBg2QSW4Yc/solid...
https://www.lesswrong.com/posts/LAxAmooK4uDfWmbep/anomalous-...
Từ vựng không phải vô hạn, và được biết GPT-3 cũng chỉ có 50.257 token trong từ vựng. Tôi cũng tò mò liệu có thể đo được chênh lệch giữa chi phí điện năng bổ sung phát sinh vì thú vui ngách này trên Reddit, với việc phân bổ chỗ đó cho các chuỗi con thường gặp hơn trong văn bản thực tế để giảm số token đầu vào trung bình hay không
Sẽ buồn cười nếu phụ đề của trang OP, IECC ChurnWare 0.3, trở thành token của GPT-5
Thực tế, ở những nơi không phải đối thoại một-một, câu trả lời “tôi không biết” thường không hữu ích. Vì trong một nhóm, nếu không biết thì im lặng đã thể hiện điều đó rồi
https://www.youtube.com/watch?v=WO2X3oZEJOA
Tôi tò mò hơn là content farm kia dùng để làm gì. Trông có vẻ vô nghĩa, nhưng chắc có động cơ kinh tế kỳ lạ nào đó. Có link affiliate thật, nhưng không biết kiếm được bao nhiêu từ đó
Ông ấy là một nhân vật chống spam nổi tiếng, đã hoạt động nhiều mặt từ hàng chục năm trước. Việc khéo léo thả link landing page trong tin nhắn NANOG cũng là cách để bot cắn mồi
https://compilers.iecc.com/
Trên trang https://www.iecc.com/linker/, trước đây ông ấy từng công khai bản nháp cuốn sách ở nhiều định dạng; khi nó được đăng lên https://news.ycombinator.com/item?id=18424233, tôi đã gói các tệp lại để đọc offline, rồi sau đó dòng chữ trên trang đổi thành “không còn cung cấp nữa do nạn sao chép lậu kinh niên”
Tôi đã gửi email hỏi xem có ổn không, nhưng nhận được câu trả lời thiếu thân thiện rằng tôi đã sao chép lậu các tệp, nên tôi gỡ link xuống và phía họ cũng sửa câu chữ. Tôi không phải tác giả cuốn sách, còn họ là tác giả, nên họ có thể làm vậy. Chỉ là tôi đã đề xuất nên ghi rõ trên trang rằng đừng làm như thế, nhưng họ chọn cách triệt để hơn
Không biết có phải chỉ mình tôi từng hy vọng nội dung là các máy chủ farm của OpenAI thật sự bị nhện hoành hành và bò sang rack của người khác không. Tôi biết không thể nào như vậy, nhưng vẫn đã mong thế
robots.txt chưa được thiết lập đúng. Phần thực sự chặn đã bị comment lại
Disallow: /cho cả Amazonbot và GPTBot đều bị comment, và hiện chỉ có chặn/archivechoUser-agent: *là có hiệu lựcNếu tuân theo robots.txt, OpenAI có vấn đề cả về chặn bot lẫn thu thập dữ liệu: https://x.com/AznWeng/status/1777688628308681000
Trong số 100.000 website hàng đầu, 11% đã chặn crawler của OpenAI, nhiều hơn tổng cộng tất cả các đối thủ Google, FB, Anthropic và Perplexity
Xét việc robots.txt không có tính ràng buộc và trong các ngữ cảnh khác họ có vẻ khá không ngại hút dữ liệu công khai, thật bất ngờ khi họ để thứ này trở thành rào cản đối với trải nghiệm người dùng
Tôi nghĩ cứ để vậy cũng được. Nếu muốn Internet thì đây mới là Internet thật sự. Có vẻ anh ta cũng không quá bận tâm việc họ lấy hàng triệu trang, nên cứ để họ làm thôi
Trong thế giới an ninh mạng, thứ như thế này được gọi là tarpit. Có thể trì hoãn tấn công, quét và các hình thức tự động hóa khác bằng cách gửi dữ liệu cực chậm hoặc gây đệ quy vô hạn
Kết quả là làm lãng phí thời gian và năng lượng của kẻ tấn công, đồng thời có thể giúp phía mình có thêm thời gian củng cố phòng thủ
Tarpit thì khác, vì nó được thiết kế để làm chậm việc quét hoặc scraping và cố ý lãng phí tài nguyên của đối phương. Có nhiều kỹ thuật, nhưng phần lớn là giới hạn phản hồi hoặc tốc độ phản hồi theo cấp số nhân
Năm 2011 cũng từng có chuyện tương tự khi dự án picolisp công bố một “ticker” kiểu chuỗi Markov, tạo trang ngay tại chỗ
https://picolisp.com/wiki/?ticker
Đây là một dạng honeypot khá ổn
Cuối cùng, gần như tất cả các công ty giống OpenAI sẽ huấn luyện mô hình bằng nội dung do AI tạo ra, và xét từ góc độ Q&A, loại nội dung đó khá thường xuyên sai lệch đôi chút, nên chất lượng câu trả lời của AI được huấn luyện trên đó cũng sẽ nhanh chóng tệ đi
Hiện nay phần lớn nội dung Internet do con người viết, nhưng 5 năm nữa có thể không còn như vậy. Tôi nghĩ đây là một trong những vấn đề lớn mà lĩnh vực AI cần nhanh chóng giải quyết. Như câu nói xưa: rác vào thì rác ra
Sự trớ trêu của toàn bộ tình huống này thật khắc nghiệt
Trông nó giống vấn đề bootstrapping hơn là ouroboros
Tôi nghĩ thời đại của transformer chỉ xử lý văn bản đã qua rồi
Tôi nghĩ OpenAI có đọc robots.txt, nhưng vẫn lập chỉ mục. Có điều có lẽ họ chỉ đánh dấu rằng đó là nội dung không được phép lập chỉ mục