1 điểm bởi GN⁺ 2024-06-11 | 1 bình luận | Chia sẻ qua WhatsApp
  • Khi PDF học thuật được chia sẻ, nếu metadata theo từng lần tải xuống được kết hợp với thời điểm truy cập, thì ngay cả cùng một file bài báo cũng có thể bị dùng để truy vết nguồn gốc
  • Có thể kiểm tra giá trị định danh bằng exiftool, và có thể xóa metadata cấp cao bằng tổ hợp exiftool + qpdf
  • PDF còn chứa thẻ NISO biểu thị “final published version” (VoR) và cả giới hạn miền được phép, và Elsevier quét các PDF có loại metadata này
  • Có vẻ metadata đó vẫn còn trong các bài báo lấy từ Sci-Hub, nên có thể dẫn tới việc nhận diện tài khoản học thuật đã được dùng để tải bài báo
  • Hai file PDF có thẻ nhận diện khác nhau, sau khi xóa metadata và xử lý bằng qpdf --deterministic-id, cho kết quả giống hệt nhau theo diff, nhưng khó có thể khái quát rằng hoàn toàn không có watermark bổ sung

Metadata PDF Elsevier thay đổi theo từng lần tải xuống

  • PDF của Elsevier được chèn một hàm băm duy nhất dưới dạng metadata cho mỗi lần tải xuống
  • Khi tải cùng một bài báo hai lần rồi so sánh metadata, sẽ thấy các giá trị khác nhau
  • Nếu giá trị này được kết hợp với thời điểm truy cập, nó có thể được dùng để xác định PDF được chia sẻ xuất phát từ lần tải nào

Công cụ dùng để kiểm tra và xóa

  • Có thể kiểm tra trực tiếp metadata PDF bằng exiftool
  • Lệnh xóa metadata cấp cao:
    • exiftool -all:all= <path.pdf> -o <output1.pdf>
    • qpdf --linearize <output1.pdf> <output2.pdf>
  • Có thể dùng dangerzone hoặc mat2 để xóa toàn bộ metadata
  • Công cụ liên quan:
    • exiftool: công cụ đọc/ghi metadata
    • qpdf: công cụ xử lý PDF
    • dangerzone: công cụ GUI render PDF thành ảnh rồi OCR lại
    • mat2: công cụ xóa metadata render PDF thành ảnh nhưng không OCR

Script dọn dẹp tự động và trích xuất thẻ

  • Shell script được cung cấp sẽ tìm PDF theo cách đệ quy trong thư mục chỉ định hoặc thư mục hiện tại rồi xóa metadata
  • Môi trường mục tiêu là macOS và các hệ Unix, cần cài qpdfexiftool
  • Với mỗi PDF, script tạo một bản đã dọn dẹp với hậu tố _clean.pdf, rồi áp dụng exiftoolqpdf --linearize
  • Sau đó, một gist đã được bổ sung các thẻ được trích xuất đúng cách và mã Python có thể dùng để trích xuất trực tiếp
  • Ban đầu giá trị này được gọi là “hash”, nhưng giá trị được trích xuất có mẫu hình rõ ràng, và hiện vẫn chưa rõ chính xác nó chứa gì

Thẻ NISO và dấu vết còn lại trên Sci-Hub

  • Metadata PDF có chứa thẻ NISO biểu thị trạng thái tài liệu
    • Trạng thái tài liệu được ghi là “final published version” (VoR)
    • Đồng thời còn có giới hạn về miền mà tài liệu được phép tồn tại
  • Elsevier quét các PDF có metadata này, vì vậy khi chia sẻ bản sao thì cần xóa metadata
  • Có vẻ metadata này vẫn được giữ nguyên trong các bài báo lấy từ Sci-Hub
  • Nếu Sci-Hub tải bài báo bằng thông tin xác thực học thuật đã thu thập được, nhà xuất bản có thể dùng metadata này để xác định tài khoản cần bị đóng hoặc bảo vệ

Khả năng có watermark bổ sung và kết quả kiểm chứng

  • Ngoài metadata, vẫn còn khả năng tồn tại watermark tinh vi hơn
  • Kết quả thử nghiệm trên hai file có thẻ nhận diện khác nhau:
    • Xóa metadata
    • Tái tuyến tính hóa bằng cờ --deterministic-id của qpdf
    • PDF kết quả giống hệt nhau theo diff
  • Chỉ từ kết quả này thì cần thận trọng khi khái quát rằng không có watermark bổ sung
  • Metadata đặc biệt dễ thấy như một phương tiện nhận diện vì có thể quét nhanh trên số lượng lớn PDF

1 bình luận

 
GN⁺ 2024-06-11
Ý kiến trên Hacker News
  • Có thể hình dung họ sẵn sàng đi xa đến mức truy ra những người đã chia sẻ các ý tưởng mà ngay từ đầu họ không hề tạo ra hay tài trợ, rồi trừng phạt vì không trả tiền
    Những công ty như vậy đơn giản trông như thứ cản trở sự tiến bộ của nhân loại

    • Thực ra chuyện đó không quá khó, nhưng tôi đồng ý với ý chính
      Hơn nữa, những công ty như thế còn thu của tác giả những khoản tiền vô lý cho các dịch vụ bổ sung như in hình màu
      Trong tương lai xa, có lẽ trường học và đại học sẽ lấy những công ty này làm ví dụ về ký sinh xã hội
    • Bản thân công ty không hẳn là vấn đề mà gần giống một triệu chứng hơn
      Vấn đề thật sự, theo tôi, là chính phủ — đặc biệt là chính phủ Mỹ — đã giúp các công ty này thực thi mô hình kinh doanh đó bằng cách dùng độc quyền cưỡng chế
    • Cũng cần nghĩ đến việc viết ra một cuốn sách đòi hỏi bao nhiêu công sức
      Có tác giả viết trong nhiều năm, nhiều người ít nhất cũng mất 1 năm, và có học giả dành vài năm cho chỉ một bài báo
      Elsevier cũng là một đối tác tham gia đáng kể vào việc sản xuất và tài trợ cho công việc này, và nhân viên của họ phụ trách biên tập, dàn trang và phân phối
      Các tác giả cũng là đối tác trong quá trình này, và nhiều người còn nhận tiền bản quyền từ Elsevier
      Thế nhưng vẫn có những người bịa ra đủ loại ngụy biện để biện minh cho việc sao chép lậu
      Nếu có tác giả nghèo, thì phải nhìn nhận rằng vi phạm bản quyền đang làm suy giảm khả năng kiếm sống bằng việc bán tác phẩm của họ
    • Mỗi khi Elsevier muốn thực thi bản quyền thì HN coi họ như quỷ dữ, nhưng cứ đến chủ đề dữ liệu huấn luyện AI thì lại đột nhiên biến thành những chiến binh sở hữu trí tuệ nghiêm khắc nhất mà tôi từng thấy, thật buồn cười
    • Theo tôi hiểu thì đây không chỉ là lỗi của Elsevier, mà vấn đề nằm ở cơ chế chính phủ phân bổ kinh phí nghiên cứu và thăng tiến dựa trên số bài đăng trên tạp chí Elsevier
  • Trước khi công khai tài liệu, lấy bản sao từ hai nguồn khác nhau rồi so sánh hash có vẻ là một thói quen tốt
    Dữ liệu có thể được nhúng vào bất cứ đâu: hình ảnh, tệp âm thanh, PDF, chương trình, v.v.
    Ít nhất trong trường hợp của Elsevier thì việc họ dùng khóa để theo dõi người dùng có vẻ khá rõ ràng

    • Dù sao thì PDF đâu có popup xin đồng ý cookie
      Biết đâu cuối cùng lại có thể dùng luật đó vào việc hữu ích
  • Có một công cụ tự do mã nguồn mở tên là DangerZone, thường dùng để loại bỏ mã độc tiềm ẩn khỏi tệp PDF, và nó cũng có thể xóa metadata
    Có thể hơi quá tay nếu chỉ muốn dọn metadata đơn thuần, nhưng vẫn đáng nhắc tới
    https://dangerzone.rocks/

    • Có khi vấn đề không chỉ nằm ở metadata
      Một PDF đủ dài có rất nhiều cách để giấu một định danh 128-bit
      Hình chữ nhật trắng trên nền trắng, vài pixel hơi khác màu đen rải rác, kiểu gì cũng được
      Nhiều cách còn có thể sống sót cả sau khi in ra rồi quét lại
  • Tôi đang dùng một script nhỏ để dọn toàn bộ PDF và cũng giảm kích thước của nó
    Đại khái như thế này
    pdftops -paper A4 -expand -level3 file.pdf
    ps2pdf14 -dEmbedAllFonts=true \
    -dUseFlateCompression=true \
    -dOptimize=true \
    -dProcessColorModel=/DeviceRGB \
    -r72 \
    -dDownsampleGrayImages=true \
    -dGrayImageResolution=150 \
    -dAutoFilterGrayImages=false \
    -dGrayImageDownsampleType=/Bicubic \
    -dDownsampleMonoImages=true \
    -dMonoImageResolution=150 \
    -dMonoImageDownsampleType=/Subsample \
    -dDownsampleColorImages=true \
    -dColorImageResolution=150 \
    -dAutoFilterColorImages=false \
    -dColorImageDownsampleType=/Bicubic \
    -dPDFSETTINGS=/ebook \
    -dNOSAFER \
    -dALLOWPSTRANSPARENCY \
    -dShowAnnots=false \
    file.pdf file.pdf
    Nếu cần thì sau đó có thể thêm metadata khác
    Nó không được thiết kế riêng để loại bỏ một kiểu theo dõi cụ thể nào, nhưng trong đa số trường hợp thì khá đơn giản và đủ hữu ích

  • Tải PDF từ Elsevier, mở bằng trình xem PDF của bạn, bấm in, rồi ở phần chọn máy in hãy chọn Print to PDF là xong

    • Bước 0 là phải tắt lưu Zone Identifier hoặc dùng công cụ để xóa nó
      Thông tin này rất có thể được giữ nguyên khi sao chép tệp, và tùy công cụ hay định dạng, nó còn có thể đi vào file nén rồi được khôi phục về sau
      https://www.digital-detective.net/forensic-analysis-of-zone-...
      Trong các plugin của Total Commander có cái còn cho biết một tệp cụ thể được tải từ đâu xuống
      Tôi cài mấy cái nên không chắc chính xác là cái nào, nhưng có lẽ là plugin này: https://totalcmd.net/plugring/ntfsstreamviewer.html
    • Tải PDF từ nhà xuất bản, mở bằng trình xem PDF, bấm in, rồi in ra giấy thật
      Sau đó quét lại các trang PDF đã in, ghép thành tài liệu PDF bằng convert, pdfunite, rồi nén bằng ghostscript
    • Làm vậy vẫn có thể giữ nguyên mọi loại steganography ẩn trong kerning, màu sắc, giãn dòng v.v.
    • Một cách khác là sau khi tải PDF từ Elsevier, chuyển từng trang thành ảnh PNG, ghép lại thành PDF mới rồi chạy OCR
    • Cách đó sẽ phá nát hoàn toàn các tag và thông tin trợ năng có trong PDF
      Nếu không thật sự chắc là bắt buộc cần làm vậy thì xin đừng làm thế
  • Để lại đây vì có liên quan đến chủ đề này
    https://github.com/kanzure/pdfparanoia

    https://github.com/firstlookmedia/pdf-redact-tools

    • Trên trang pdf-redact-tools có ghi như sau: “Warning: This project is no longer maintained. A much better tool is dangerzone.”
      Có thể tìm thấy liên kết DangerZone trong chuỗi Mastodon được gửi ban đầu
  • Cần tạo ra các công cụ giúp chia sẻ và mở tri thức của nhân loại

  • Việc Elsevier và những thực thể tương tự vẫn có thể tiếp tục tồn tại, và việc mọi người thực sự trả tiền cho các hệ thống ký sinh như vậy, là điều cần truy tìm và phân tích nguyên nhân gốc rễ
    Một số manh mối có thể là giới học thuật rốt cuộc lười biếng và không có ý định sửa hệ thống, họ quá đắm chìm vào nghiên cứu nên chất lượng của những việc không liên quan trực tiếp đến công việc chính của mình thì rất tệ, và còn có cấu trúc khuyến khích quay trở lại với những người duy trì hệ thống này
    Có manh mối nào khác không

    • Tùy lĩnh vực mà khác nhau
      Ví dụ, các lĩnh vực kỹ thuật đã chuyển khá nhiều sang tạp chí truy cập mở, và điều đó cũng hoạt động tốt cho việc thăng tiến của nhà nghiên cứu
      Nhưng chừng nào biên chế lâu dài và những thứ tương tự còn phụ thuộc vào việc được đăng trên Nature, thì trong tương lai gần rất khó để đẩy Nature ra ngoài
  • Siêu dữ liệu là mục tiêu cực kỳ dễ bị nhắm tới trong đóng dấu nước tài liệu
    Thông thường, trình kết xuất PDF sẽ dùng khoảng cách, kerning, ký tự vô hình và đủ loại steganography để làm cho mỗi bản sao là duy nhất
    Tôi nghi ngờ một giá trị hash thì có ý nghĩa gì, và trên thực tế nhiều khả năng đó là một mã xác thực thông điệp trộn giữa giá trị bí mật và bản sao duy nhất
    Khi đó nó sẽ giúp nhà xuất bản nhận diện các bản sao đã được tẩy rửa
    Nếu có từ hai bản sao trở lên thì có thể ẩn danh hóa lại, và tôi cũng tò mò liệu các mô hình ngôn ngữ tóm tắt có hữu ích cho việc này không
    Tất nhiên cũng có thể đưa các biến đổi kiểu steganography vào cả biểu đồ
    PDF là một loại tài liệu lộn xộn nên gần như lúc nào tôi cũng chuyển nó sang văn bản thuần, và thường không bị mất nghĩa

  • Việc làm này có hợp pháp ở EU không

    • Elsevier là công ty Hà Lan và thuộc sở hữu của một công ty Anh, nên có lẽ không có vấn đề gì lớn