- Khi PDF học thuật được chia sẻ, nếu metadata theo từng lần tải xuống được kết hợp với thời điểm truy cập, thì ngay cả cùng một file bài báo cũng có thể bị dùng để truy vết nguồn gốc
- Có thể kiểm tra giá trị định danh bằng
exiftool, và có thể xóa metadata cấp cao bằng tổ hợp exiftool + qpdf - PDF còn chứa thẻ NISO biểu thị “final published version” (VoR) và cả giới hạn miền được phép, và Elsevier quét các PDF có loại metadata này
- Có vẻ metadata đó vẫn còn trong các bài báo lấy từ Sci-Hub, nên có thể dẫn tới việc nhận diện tài khoản học thuật đã được dùng để tải bài báo
- Hai file PDF có thẻ nhận diện khác nhau, sau khi xóa metadata và xử lý bằng
qpdf --deterministic-id, cho kết quả giống hệt nhau theodiff, nhưng khó có thể khái quát rằng hoàn toàn không có watermark bổ sung
Metadata PDF Elsevier thay đổi theo từng lần tải xuống
- PDF của Elsevier được chèn một hàm băm duy nhất dưới dạng metadata cho mỗi lần tải xuống
- Khi tải cùng một bài báo hai lần rồi so sánh metadata, sẽ thấy các giá trị khác nhau
- Nếu giá trị này được kết hợp với thời điểm truy cập, nó có thể được dùng để xác định PDF được chia sẻ xuất phát từ lần tải nào
Công cụ dùng để kiểm tra và xóa
- Có thể kiểm tra trực tiếp metadata PDF bằng
exiftool - Lệnh xóa metadata cấp cao:
exiftool -all:all= <path.pdf> -o <output1.pdf>qpdf --linearize <output1.pdf> <output2.pdf>
- Có thể dùng dangerzone hoặc mat2 để xóa toàn bộ metadata
- Công cụ liên quan:
- exiftool: công cụ đọc/ghi metadata
- qpdf: công cụ xử lý PDF
- dangerzone: công cụ GUI render PDF thành ảnh rồi OCR lại
- mat2: công cụ xóa metadata render PDF thành ảnh nhưng không OCR
Script dọn dẹp tự động và trích xuất thẻ
- Shell script được cung cấp sẽ tìm PDF theo cách đệ quy trong thư mục chỉ định hoặc thư mục hiện tại rồi xóa metadata
- Môi trường mục tiêu là macOS và các hệ Unix, cần cài
qpdfvàexiftool - Với mỗi PDF, script tạo một bản đã dọn dẹp với hậu tố
_clean.pdf, rồi áp dụngexiftoolvàqpdf --linearize - Sau đó, một gist đã được bổ sung các thẻ được trích xuất đúng cách và mã Python có thể dùng để trích xuất trực tiếp
- Ban đầu giá trị này được gọi là “hash”, nhưng giá trị được trích xuất có mẫu hình rõ ràng, và hiện vẫn chưa rõ chính xác nó chứa gì
Thẻ NISO và dấu vết còn lại trên Sci-Hub
- Metadata PDF có chứa thẻ NISO biểu thị trạng thái tài liệu
- Trạng thái tài liệu được ghi là “final published version” (VoR)
- Đồng thời còn có giới hạn về miền mà tài liệu được phép tồn tại
- Elsevier quét các PDF có metadata này, vì vậy khi chia sẻ bản sao thì cần xóa metadata
- Có vẻ metadata này vẫn được giữ nguyên trong các bài báo lấy từ Sci-Hub
- Nếu Sci-Hub tải bài báo bằng thông tin xác thực học thuật đã thu thập được, nhà xuất bản có thể dùng metadata này để xác định tài khoản cần bị đóng hoặc bảo vệ
Khả năng có watermark bổ sung và kết quả kiểm chứng
- Ngoài metadata, vẫn còn khả năng tồn tại watermark tinh vi hơn
- Kết quả thử nghiệm trên hai file có thẻ nhận diện khác nhau:
- Xóa metadata
- Tái tuyến tính hóa bằng cờ
--deterministic-idcủaqpdf - PDF kết quả giống hệt nhau theo
diff
- Chỉ từ kết quả này thì cần thận trọng khi khái quát rằng không có watermark bổ sung
- Metadata đặc biệt dễ thấy như một phương tiện nhận diện vì có thể quét nhanh trên số lượng lớn PDF
1 bình luận
Ý kiến trên Hacker News
Có thể hình dung họ sẵn sàng đi xa đến mức truy ra những người đã chia sẻ các ý tưởng mà ngay từ đầu họ không hề tạo ra hay tài trợ, rồi trừng phạt vì không trả tiền
Những công ty như vậy đơn giản trông như thứ cản trở sự tiến bộ của nhân loại
Hơn nữa, những công ty như thế còn thu của tác giả những khoản tiền vô lý cho các dịch vụ bổ sung như in hình màu
Trong tương lai xa, có lẽ trường học và đại học sẽ lấy những công ty này làm ví dụ về ký sinh xã hội
Vấn đề thật sự, theo tôi, là chính phủ — đặc biệt là chính phủ Mỹ — đã giúp các công ty này thực thi mô hình kinh doanh đó bằng cách dùng độc quyền cưỡng chế
Có tác giả viết trong nhiều năm, nhiều người ít nhất cũng mất 1 năm, và có học giả dành vài năm cho chỉ một bài báo
Elsevier cũng là một đối tác tham gia đáng kể vào việc sản xuất và tài trợ cho công việc này, và nhân viên của họ phụ trách biên tập, dàn trang và phân phối
Các tác giả cũng là đối tác trong quá trình này, và nhiều người còn nhận tiền bản quyền từ Elsevier
Thế nhưng vẫn có những người bịa ra đủ loại ngụy biện để biện minh cho việc sao chép lậu
Nếu có tác giả nghèo, thì phải nhìn nhận rằng vi phạm bản quyền đang làm suy giảm khả năng kiếm sống bằng việc bán tác phẩm của họ
Trước khi công khai tài liệu, lấy bản sao từ hai nguồn khác nhau rồi so sánh hash có vẻ là một thói quen tốt
Dữ liệu có thể được nhúng vào bất cứ đâu: hình ảnh, tệp âm thanh, PDF, chương trình, v.v.
Ít nhất trong trường hợp của Elsevier thì việc họ dùng khóa để theo dõi người dùng có vẻ khá rõ ràng
Biết đâu cuối cùng lại có thể dùng luật đó vào việc hữu ích
Có một công cụ tự do mã nguồn mở tên là DangerZone, thường dùng để loại bỏ mã độc tiềm ẩn khỏi tệp PDF, và nó cũng có thể xóa metadata
Có thể hơi quá tay nếu chỉ muốn dọn metadata đơn thuần, nhưng vẫn đáng nhắc tới
https://dangerzone.rocks/
Một PDF đủ dài có rất nhiều cách để giấu một định danh 128-bit
Hình chữ nhật trắng trên nền trắng, vài pixel hơi khác màu đen rải rác, kiểu gì cũng được
Nhiều cách còn có thể sống sót cả sau khi in ra rồi quét lại
Tôi đang dùng một script nhỏ để dọn toàn bộ PDF và cũng giảm kích thước của nó
Đại khái như thế này
pdftops -paper A4 -expand -level3 file.pdfps2pdf14 -dEmbedAllFonts=true \-dUseFlateCompression=true \-dOptimize=true \-dProcessColorModel=/DeviceRGB \-r72 \-dDownsampleGrayImages=true \-dGrayImageResolution=150 \-dAutoFilterGrayImages=false \-dGrayImageDownsampleType=/Bicubic \-dDownsampleMonoImages=true \-dMonoImageResolution=150 \-dMonoImageDownsampleType=/Subsample \-dDownsampleColorImages=true \-dColorImageResolution=150 \-dAutoFilterColorImages=false \-dColorImageDownsampleType=/Bicubic \-dPDFSETTINGS=/ebook \-dNOSAFER \-dALLOWPSTRANSPARENCY \-dShowAnnots=false \file.pdf file.pdfNếu cần thì sau đó có thể thêm metadata khác
Nó không được thiết kế riêng để loại bỏ một kiểu theo dõi cụ thể nào, nhưng trong đa số trường hợp thì khá đơn giản và đủ hữu ích
Tải PDF từ Elsevier, mở bằng trình xem PDF của bạn, bấm in, rồi ở phần chọn máy in hãy chọn Print to PDF là xong
Thông tin này rất có thể được giữ nguyên khi sao chép tệp, và tùy công cụ hay định dạng, nó còn có thể đi vào file nén rồi được khôi phục về sau
https://www.digital-detective.net/forensic-analysis-of-zone-...
Trong các plugin của Total Commander có cái còn cho biết một tệp cụ thể được tải từ đâu xuống
Tôi cài mấy cái nên không chắc chính xác là cái nào, nhưng có lẽ là plugin này: https://totalcmd.net/plugring/ntfsstreamviewer.html
Sau đó quét lại các trang PDF đã in, ghép thành tài liệu PDF bằng
convert,pdfunite, rồi nén bằngghostscriptNếu không thật sự chắc là bắt buộc cần làm vậy thì xin đừng làm thế
Để lại đây vì có liên quan đến chủ đề này
https://github.com/kanzure/pdfparanoia
và
https://github.com/firstlookmedia/pdf-redact-tools
pdf-redact-toolscó ghi như sau: “Warning: This project is no longer maintained. A much better tool is dangerzone.”Có thể tìm thấy liên kết DangerZone trong chuỗi Mastodon được gửi ban đầu
Cần tạo ra các công cụ giúp chia sẻ và mở tri thức của nhân loại
https://en.m.wikipedia.org/wiki/Sci-Hub
Dù vậy, sẽ tốt nếu có thể tự động gỡ những dấu vết kiểu này
Việc Elsevier và những thực thể tương tự vẫn có thể tiếp tục tồn tại, và việc mọi người thực sự trả tiền cho các hệ thống ký sinh như vậy, là điều cần truy tìm và phân tích nguyên nhân gốc rễ
Một số manh mối có thể là giới học thuật rốt cuộc lười biếng và không có ý định sửa hệ thống, họ quá đắm chìm vào nghiên cứu nên chất lượng của những việc không liên quan trực tiếp đến công việc chính của mình thì rất tệ, và còn có cấu trúc khuyến khích quay trở lại với những người duy trì hệ thống này
Có manh mối nào khác không
Ví dụ, các lĩnh vực kỹ thuật đã chuyển khá nhiều sang tạp chí truy cập mở, và điều đó cũng hoạt động tốt cho việc thăng tiến của nhà nghiên cứu
Nhưng chừng nào biên chế lâu dài và những thứ tương tự còn phụ thuộc vào việc được đăng trên Nature, thì trong tương lai gần rất khó để đẩy Nature ra ngoài
Siêu dữ liệu là mục tiêu cực kỳ dễ bị nhắm tới trong đóng dấu nước tài liệu
Thông thường, trình kết xuất PDF sẽ dùng khoảng cách, kerning, ký tự vô hình và đủ loại steganography để làm cho mỗi bản sao là duy nhất
Tôi nghi ngờ một giá trị hash thì có ý nghĩa gì, và trên thực tế nhiều khả năng đó là một mã xác thực thông điệp trộn giữa giá trị bí mật và bản sao duy nhất
Khi đó nó sẽ giúp nhà xuất bản nhận diện các bản sao đã được tẩy rửa
Nếu có từ hai bản sao trở lên thì có thể ẩn danh hóa lại, và tôi cũng tò mò liệu các mô hình ngôn ngữ tóm tắt có hữu ích cho việc này không
Tất nhiên cũng có thể đưa các biến đổi kiểu steganography vào cả biểu đồ
PDF là một loại tài liệu lộn xộn nên gần như lúc nào tôi cũng chuyển nó sang văn bản thuần, và thường không bị mất nghĩa
Việc làm này có hợp pháp ở EU không