1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Tòa án đã bác yêu cầu cho rằng việc SerpAPI thu thập kết quả tìm kiếm Google là vi phạm lào luật cấm né tránh theo Mục 1201 DMCA, nhưng vẫn để ngỏ khả năng Google có thể thu hẹp phạm vi rồi nộp lại
  • SearchGuard, công cụ chặn các yêu cầu tự động, được áp dụng cho toàn bộ kết quả tìm kiếm bất kể có được bảo hộ bản quyền hay không, nên không được công nhận là biện pháp bảo vệ kỹ thuật kiểm soát quyền truy cập vào tác phẩm có bản quyền
  • Trong kết quả tìm kiếm có thể xuất hiện Knowledge Panel chứa hình ảnh được cấp phép từ bên thứ ba, nhưng không phải mọi kết quả hay mọi panel đều có nội dung được bảo hộ bản quyền
  • Theo DMCA, biện pháp kỹ thuật phải kiểm soát quyền truy cập vào tác phẩm theo thẩm quyền của chủ sở hữu bản quyền, nhưng Google cũng không trình bày đủ việc SearchGuard được triển khai và vận hành theo thẩm quyền của chủ sở hữu bản quyền đó
  • Google có thể thu hẹp yêu cầu xuống nội dung mà chính họ nắm quyền, và SerpAPI cũng có thể loại phần đó khỏi phạm vi thu thập, nên chiến lược dùng DMCA để kiểm soát toàn bộ thông tin tìm kiếm công khai đã bị chặn lại

Tranh chấp giữa Google và SerpAPI

  • Google đã khởi kiện SerpAPI vào tháng 12/2025 theo Mục 1201 DMCA vì hành vi thu thập kết quả tìm kiếm Google
  • Tòa án đã bác đơn kiện, nhưng vẫn để lại khả năng Google sửa yêu cầu rồi nộp lại
  • SerpAPI thu thập các trang kết quả của công cụ tìm kiếm để cung cấp trên thực tế một API kết quả tìm kiếm không chính thức, hỗ trợ nhà phát triển, công ty AI, nhà nghiên cứu và doanh nghiệp tiếp cận thông tin tìm kiếm công khai
  • Khi giá trị dữ liệu tăng cao trong kỷ nguyên AI, các nỗ lực dựng rào cản truy cập với một phần web công khai đang gia tăng, và trong quá trình đó người dùng bình thường cũng có thể bị chặn theo

Liên hệ với vụ kiện của Reddit

  • Reddit đã đệ đơn kiện riêng vào mùa thu 2025 nhằm vào SerpAPI, Perplexity và các bên khác
    • Reddit cho rằng SerpAPI đã cung cấp nội dung Reddit cho doanh nghiệp khác thông qua kết quả tìm kiếm Google, từ đó vi phạm điều khoản cấm né tránh của DMCA
    • Bản quyền các bài đăng Reddit thuộc về người dùng, và đối tượng mà SerpAPI trực tiếp thu thập cũng là Google chứ không phải Reddit
    • Reddit và Google có hợp đồng API, nhưng các bị đơn không phải là bên tham gia hợp đồng đó
  • Trong vụ Reddit, đề nghị bác đơn của các bị đơn vẫn đang được xem xét, còn trong vụ Google thì tòa đã bác đơn kiện trước

Phạm vi áp dụng của Mục 1201 DMCA

  • Mục 1201 DMCA ban đầu được tạo ra để quy trách nhiệm đối với chính hành vi né tránh biện pháp bảo vệ kỹ thuật như DRM
    • Quy định này được viết rất rộng để việc phá DRM hoặc chỉ dẫn cách né tránh cũng có thể dẫn đến trách nhiệm vi phạm bản quyền
    • Biện pháp bảo vệ kỹ thuật cũng từng được dùng trong các trường hợp không liên quan trực tiếp đến bản quyền, như hạn chế dùng mực in của bên thứ ba hoặc bộ mở cửa gara
  • Tòa án cũng xem xét tiền lệ liên quan đến máy in Lexmark, nhưng cho rằng không áp dụng được cho vụ này
    • Tiền lệ liên quan bất lợi cho Lexmark xuất phát từ luật nhãn hiệu chứ không phải DMCA, và yêu cầu theo Mục 1201 của Lexmark cũng không thành công

Cách SearchGuard hoạt động

  • SearchGuard sẽ gửi một bài kiểm tra JavaScript khi Google nhận được yêu cầu tìm kiếm từ nguồn mà họ không nhận diện, để xác minh đó là người dùng thật hay phần mềm tự động
    • Trình duyệt sẽ gửi về Google một phản hồi chứa thông tin nhất định về người dùng và môi trường
    • Trên trình duyệt của con người, JavaScript chạy tự động nên gần như không làm gián đoạn trải nghiệm
    • Các hệ thống truy vấn tự động quy mô lớn thường không giải được bài kiểm tra nên bị từ chối truy cập kết quả tìm kiếm Google
  • Google cho rằng việc thu thập tự động chỉ tạo ra tổn thất thuần (deadweight loss) cho họ, và SearchGuard có tác dụng ngăn truy cập tự động trái phép
  • Tuy nhiên, SearchGuard không chọn lọc riêng nội dung có bản quyền mà kiểm soát truy cập tự động với toàn bộ kết quả tìm kiếm, bất kể có được bảo hộ hay không

Vì sao toàn bộ kết quả tìm kiếm không phải đều là tác phẩm có bản quyền

  • Kết quả tìm kiếm Google là kết quả hiển thị được sắp xếp theo mức độ liên quan từ thông tin công khai lấy trên internet
  • Google không hề lập luận rằng google.com hoặc chính các kết quả tìm kiếm hiển thị ở đó được bảo hộ bởi luật bản quyền
  • Trong kết quả tìm kiếm đôi khi có Knowledge Panel, có thể chứa hình ảnh bản quyền được cấp phép từ bên thứ ba
    • Knowledge Panel không xuất hiện trong mọi kết quả tìm kiếm
    • Ngay cả khi panel xuất hiện, nó cũng không phải lúc nào cũng chứa nội dung có bản quyền
  • Vì vậy, đối tượng mà SearchGuard kiểm soát bao gồm lẫn cả kết quả có và không có tài liệu bản quyền
  • DMCA không áp dụng nếu đối tượng bị biện pháp kỹ thuật kiểm soát không được bảo hộ theo luật bản quyền, nên các yêu cầu theo §1201(a)(1)(A) và §1201(a)(2) liên quan đến kết quả tìm kiếm không có nội dung bản quyền là không thể đứng vững về mặt pháp lý

Yêu cầu về thẩm quyền của chủ sở hữu bản quyền

  • Theo §1201(a)(3)(B), để một biện pháp kỹ thuật được coi là kiểm soát hiệu quả quyền truy cập vào tác phẩm, thông tin, quy trình hoặc xử lý cần thiết cho việc truy cập phải được áp dụng theo thẩm quyền của chủ sở hữu bản quyền
  • Án lệ của Ninth Circuit cũng diễn giải rằng nguyên đơn phải nêu và chứng minh việc biện pháp đó được triển khai và vận hành theo thẩm quyền của chủ sở hữu bản quyền
  • Google phản bác rằng cần xem ai có thể vượt qua SearchGuard hơn là ai triển khai biện pháp này, nhưng tòa không chấp nhận
    • Các vụ Disney Enterprises v. VidAngel và Universal City Studios v. Corley mà Google viện dẫn là án lệ diễn giải §1201(a)(3)(A), quy định về “né tránh biện pháp kỹ thuật”
    • Vấn đề ở đây lại thuộc §1201(a)(3)(B), quy định điều kiện để biện pháp kỹ thuật được coi là kiểm soát hiệu quả quyền truy cập vào tác phẩm
  • Google cho rằng các chủ sở hữu bản quyền ủng hộ việc được bảo vệ thông qua SearchGuard, nhưng điều đó vẫn không đáp ứng yêu cầu rằng biện pháp này phải được triển khai và vận hành theo thẩm quyền của chính chủ sở hữu bản quyền

Phạm vi yêu cầu có thể có sau khi bị bác đơn

  • Không phải mọi phản biện của SerpAPI đều được chấp nhận, nhưng hiện tại toàn bộ yêu cầu DMCA của Google đã bị bác
  • Google không thể nộp lại cùng một yêu cầu đối với các kết quả tìm kiếm mà họ không nắm bản quyền
  • Tuy vậy, họ vẫn có thể nộp một yêu cầu hẹp hơn, chỉ giới hạn ở nội dung mà Google nắm quyền như Knowledge Panel
  • SerpAPI cũng có thể thay đổi cách thu thập để loại trừ nội dung do Google tạo ra và tránh yêu cầu đã bị thu hẹp đó
  • Trong phản hồi về quyết định bác đơn, SerpAPI nói rằng nỗ lực dùng DMCA để kiểm soát cả quyền truy cập vào các trang công khai đã bị bác bỏ, và họ sẽ tiếp tục hỗ trợ các nhà phát triển, công ty AI, nhà nghiên cứu và doanh nghiệp phụ thuộc vào thông tin tìm kiếm công khai
  • Việc Google, một công ty xây nền tảng kinh doanh bằng thu thập dữ liệu web, lại dùng DMCA để ngăn việc thu thập kết quả tìm kiếm của chính mình chẳng khác nào đá đổ chiếc thang tiếp cận của internet mở sau lưng người khác

1 bình luận

 
Ý kiến trên Hacker News
  • Nếu Google cung cấp một API đúng nghĩa cho kết quả tìm kiếm thì cách làm này hẳn sẽ dễ chấp nhận hơn. Nhưng API cũ đã bị khai tử và cũng không có phương án thay thế, nên cho đến khi họ đổi chính sách, tôi vẫn sẽ tiếp tục dùng các dịch vụ bên thứ ba scrape kết quả Google

    • Tò mò không biết tình hình sẽ thay đổi thế nào khi EU buộc Google chia sẻ dữ liệu tìm kiếm
      https://abcnews.com/Technology/wireStory/eu-forces-google-sh...
    • Nên hồi sinh API tìm kiếm cũ của Nelson Minar hoặc một dịch vụ tương tự. Câu trả lời dựa trên tìm kiếm của Gemini API thì tiện, nhưng thiếu tính đa dụng
    • Tôi đã ngừng dùng Google sau khi họ bắt đầu yêu cầu JavaScript cho tìm kiếm, và cảm giác như đó mới là ngày web mở thực sự chết
  • Đây là hành vi điển hình của một tập đoàn lớn có nguồn lực khổng lồ. Google có thể đã kỳ vọng đạt được thỏa thuận dàn xếp, hoặc cho rằng SerpAPI, vốn có vẻ nhỏ hơn họ rất nhiều, sẽ không chịu nổi chi phí kiện tụng
    Google nhiều tiền đến mức ngay cả khi áp dụng nguyên tắc bên thua chịu án phí, họ có lẽ cũng không từ bỏ kiện tụng

  • EU bảo vệ nhà sản xuất cơ sở dữ liệu nếu đã có khoản đầu tư đáng kể về chất hoặc lượng vào việc thu thập, xác minh và trình bày nội dung, bất kể có biểu đạt sáng tạo hay không. Luật bản quyền Mỹ chỉ bảo hộ khi việc lựa chọn, điều phối hoặc sắp xếp dữ liệu có mức độ sáng tạo tối thiểu
    Kết quả tìm kiếm Google là các sự kiện đơn thuần, nhưng ranh giới sẽ mơ hồ nếu nói bản đồ thì được bảo hộ bản quyền còn kết quả tìm kiếm thì không. Việc crawl web và xếp hạng tốn công sức khổng lồ, và tôi cho rằng bản thân PageRank cũng nên được bảo hộ bản quyền

    • Bản đồ không phải đối tượng so sánh phù hợp; ảnh chụp là ví dụ tốt hơn. Bản đồ không phải là sao chép nguyên trạng bản gốc hay hiển thị trực tiếp không thay đổi, mà phải quyết định đưa gì vào, bỏ gì ra, phóng đại và bóp méo thế nào, nên rõ ràng cần tính sáng tạo. Đó là lý do bản đồ của cùng một khu vực vẫn có thể rất khác nhau
      Ngược lại, kết quả tìm kiếm là nhiều đoạn văn bản từ các trang được ghép lại nguyên văn, nên mức độ sáng tạo trong đó có lẽ tương tự ảnh chụp
    • Google đã bắt đầu vượt hẳn ranh giới đó khi bắt đầu cung cấp chính câu trả lời của nội dung ngay trong kết quả tìm kiếm
    • Bài báo về PageRank đã hơn 20 năm tuổi và Google cũng đã ngừng dùng PageRank khoảng 15 năm trước, nên tôi nghĩ luận điểm đó đã qua rồi
  • Một lý do quan trọng khiến các trang kết quả tìm kiếm phải có thể bị scrape là vì Google vẫn tiếp tục hiển thị các quảng cáo lừa đảo như các trang đại lý ETA/ESTA: https://www.bbc.co.uk/news/technology-56886957

    • Cũng đáng tưởng tượng thế giới sẽ khác ra sao nếu các gã khổng lồ quảng cáo Internet chịu một phần trách nhiệm về lừa đảo và mã độc mà họ đã phát tán
    • Dịch vụ đăng ký đất đai của Anh cũng tương tự. Dù biết phải tìm trang .gov, vẫn phải thử vài lần; lần trước, chỉ đến khi bị yêu cầu trả tiền cho một dịch vụ miễn phí trên trang chính phủ thì tôi mới nhận ra mình đã vào trang quảng cáo
  • Thật mỉa mai khi thành công của Google được xây dựng từ việc crawl và lập chỉ mục web mở. Có thể hiểu mong muốn bảo vệ sản phẩm của họ, nhưng nếu loại bỏ API giá rẻ rồi còn chặn cả các bên thứ ba lấp vào khoảng trống đó, họ sẽ tự tạo ra nhu cầu scrape mà họ muốn kìm hãm

  • Tôi hơi bối rối không biết điều này có nghĩa là giờ ai cũng có thể scrape kết quả tìm kiếm Google một cách hợp pháp hay không

    • Hợp pháp là một chuyện, còn việc Google không dùng mọi biện pháp có thể để ngăn chặn lại là chuyện hoàn toàn khác
  • Bài blog đã bỏ sót việc vụ kiện này được khởi kiện vì OpenAI đã thu thập kết quả tìm kiếm Google thông qua SerpApi. Alphabet cũng là nhà đầu tư của Anthropic, và tôi đang chờ đơn khiếu nại sửa đổi sẽ được nộp trước ngày 10 tháng 8
    https://searchengineland.com/inside-google-searchguard-46767...

  • Một ngày nào đó cần cải cách DMCA

    • Không phải điều gì mới, nhưng bài này lại cho thấy DMCA là một đạo luật tệ hại đến mức nào. Không hiểu sao đến giờ vẫn chưa sửa được
    • Nên bãi bỏ luôn chế độ bản quyền
  • Phán quyết lần này có thể khiến người ta hả hê, nhưng nó cũng củng cố rằng việc scrape của chính Google là hoàn toàn hợp pháp. Khi khởi kiện, Google có thể đã nhìn thấy đây là thế thắng cả hai đường: hoặc hạ gục đối thủ, hoặc dù thua thì cũng có án lệ bảo vệ chính họ trong tương lai

    • Tôi không thích Google, nhưng nếu biến việc scrape dữ liệu công khai thành bất hợp pháp thì khả năng bị lạm dụng sẽ quá lớn, nên kết quả này là tốt nhất
    • Tôi cho rằng Google không còn hào lũy nữa. Xung quanh tôi hầu như chẳng ai dùng Google Search; các mô hình lập trình cho phép phát triển sâu hơn nhiều; và rất nhiều kỹ sư mất việc có thể dùng các công cụ lập trình giúp tăng năng suất gấp 10 lần để lấn vào các mảng sản phẩm của Google
      Gần đây có người đã sao chép Google G Suite và tạo ra kết quả rất tốt; Drive và Search cũng sẽ trở thành những hàng hóa có thể thay thế. Chắc hẳn cũng có hàng nghìn người muốn tự làm hệ điều hành điện thoại, và Chrome cũng có vẻ có thể bị thay thế. Firefox tháng trước đã tăng 1 điểm phần trăm thị phần
      Tuy nhiên, hiệu ứng mạng của YouTube sẽ khó bị phá vỡ, và Google Cloud có lẽ cũng sẽ không biến mất