- Phần lớn các trường hợp Googlebot gửi nhiều yêu cầu đến mức gây sự cố cho trang web thực ra bắt nguồn từ các bot bên ngoài mạo danh Googlebot, chứ không phải từ Google
- HTTP
User-Agentcó thể do bên gửi yêu cầu tự ý đặt, nên chỉ dựa vào chuỗiGooglebot/2.1trong log thì không thể bảo đảm đó là Googlebot thật - Các bot mạo danh dùng tên Googlebot để vượt qua cơ chế chặn, và cũng có thể là một chiến dịch crawler độc hại quy mô lớn duy nhất huy động máy chủ từ nhiều nhà cung cấp hosting
- Muốn xác minh có phải Googlebot thật hay không thì phải dùng lệnh
hosthoặc đối chiếu với dải IP do Google công bố; ngay cả IP có thông tin đăng ký là Google LLC cũng có thể là địa chỉ Google Cloud nên cần kiểm tra thêm - Không có dữ liệu cho thấy quá nửa toàn bộ lưu lượng Googlebot là giả, nhưng lưu lượng Googlebot gây cản trở dịch vụ dường như chủ yếu đến từ bot mạo danh
Những hiểu lầm xoay quanh lưu lượng Googlebot
- Có những phàn nàn từ quản trị viên rằng crawler tìm kiếm của Google gây ra lưu lượng quá mức, làm trang web gặp sự cố hoặc hoạt động như một cuộc DDoS
- Tuy nhiên, loại lưu lượng mang tính phá hoại này có thể là các yêu cầu mạo danh được gửi bởi chủ thể khác, dùng tên Googlebot, chứ không phải từ Google
- Chỉ vì phát hiện chuỗi Googlebot trong log máy chủ không có nghĩa có thể kết luận Google là nguồn gốc của lưu lượng đó
User-Agent không phải là bằng chứng danh tính
- Các yêu cầu trông như đến từ Googlebot thường chứa giá trị như sau
User-Agent: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
- Chuỗi tương tự cũng có thể được ghi lại trong log nginx, nhưng header User-Agent có thể được bên gửi yêu cầu tự do đặt thành bất kỳ giá trị nào họ muốn
- User-Agent chỉ là tự nhận dạng mang tính tự nguyện, không phải thông tin xác thực đã được kiểm chứng, nên ai cũng có thể tự xưng là Googlebot
Nguồn gốc và quy mô của bot mạo danh
- Có vẻ như bên mạo danh dùng User-Agent của Googlebot để vượt qua các cơ chế chặn bot hiện có
- IP trong log ví dụ được xác nhận là máy chủ do nhà cung cấp hosting Virtual Machine Solutions LLC cung cấp, không phải Google
- Việc mạo danh Googlebot là thủ đoạn đã được dùng phổ biến từ lâu, và gần đây quy mô của nó được quan sát là đã lớn hơn
- Chris Siebenmann cho rằng thay vì là một thủ đoạn cũ đột nhiên phổ biến đồng thời ở nhiều nơi, có thể đây là chiến dịch quy mô lớn của một crawler độc hại duy nhất đã gom được nhiều máy chủ từ nhiều nhà cung cấp hosting
Cách xác minh Googlebot thật
- Theo tài liệu xác minh Googlebot của Google, có thể chạy lệnh
hostvài lần hoặc đối chiếu với các dải IP do Google công bố - Phần lớn các crawler lớn đều công bố danh sách IP, nhưng định dạng cụ thể và cách vận hành thì khác nhau
- JAFAR là một đề xuất nhằm chuẩn hóa danh sách IP của crawler, và hiện vẫn đang trong quy trình tiêu chuẩn hóa
- Ngay cả khi thông tin đăng ký IP hiển thị là Google LLC thì đó vẫn có thể là địa chỉ hosting của Google Cloud, nên cần xác minh riêng
- Tác giả chưa xác nhận được trường hợp mạo danh gần đây nào thông qua Google Cloud
- Nếu kết quả xác minh cho thấy Googlebot thật đang crawl quá mức, thì cần làm theo tài liệu xử lý crawl quá mức của Google
Xác thực bot đáng tin cậy
- Chỉ thêm một trường đơn giản cũng không khiến tác nhân độc hại có lý do gì để thiết lập giá trị đó một cách trung thực
- Cái gọi là
evil bittrong RFC 3514 là một cách châm biếm thực tế rằng các tác nhân độc hại sẽ không tuân theo kiểu tiêu chuẩn này - Web Bot Auth HTTP Signatures phức tạp hơn việc thêm một trường riêng, nhưng là hướng tiếp cận nhằm triển khai User-Agent đáng tin cậy thông qua chữ ký mật mã
Giới hạn của cách nói “phần lớn”
- Không có dữ liệu chứng minh rằng trong toàn bộ lưu lượng Googlebot, bot giả thực sự chiếm quá nửa
- Tuy vậy, phần lớn các trường hợp lưu lượng Googlebot gây cản trở nghiêm trọng cho trang web dường như bắt nguồn từ Googlebot giả mạo
- Theo kinh nghiệm, Googlebot thật hoạt động rất ổn định, trong khi bot mạo danh có thể gửi yêu cầu cho đến khi trang web gặp sự cố
1 bình luận
Các ý kiến trên Lobste.rs