- Các công ty AI đang cắt gáy những cuốn sách hiếm mua với số lượng lớn để quét tốc độ cao, rồi nghiền nát bản gốc
- ISBNdb hỗ trợ đơn hàng lên đến 1 triệu cuốn, ẩn danh người mua và NDA, đồng thời khuyến nghị khách hàng gọi quy trình này là “bảo tồn số”
- Các ấn phẩm xuất bản trước năm 2022 được đánh giá cao vì là dữ liệu không lẫn văn bản do AI tạo ra; Anthropic cũng đang thúc đẩy việc thu gom sách trên diện rộng
- Một thẩm phán liên bang phán quyết rằng cách loại bỏ bản gốc để mỗi thời điểm chỉ còn một bản sao là sử dụng hợp lý, nhưng cả những cuốn sách có số lượng còn tồn tại cực kỳ ít cũng bị đưa vào xử lý
- Bản cuối cùng còn tồn tại của một cuốn sách thế kỷ 18 không thể thay thế sau khi bị nghiền nát, nên phán quyết hợp pháp có thể đẩy nhanh sự hủy hoại không thể đảo ngược
Quá trình sách hiếm biến thành dữ liệu huấn luyện
- Các công ty AI mua sách với số lượng lớn, sau đó cắt gáy sách để quét tốc độ cao và nghiền nát bản gốc
- ISBNdb môi giới các đơn hàng lên đến 1 triệu cuốn, đồng thời che giấu danh tính người mua
- Cung cấp NDA như một tính năng dịch vụ
- Khuyến nghị khách hàng gọi công việc này là “bảo tồn số”
- Trên website của mình, họ nêu rằng “cụm từ ‘công ty AI phá hủy 2 triệu cuốn sách’ không phải là một tiêu đề dễ tạo thiện cảm”
- Các ấn phẩm xuất bản trước năm 2022 được xem là dữ liệu cao cấp vì không chứa văn bản do AI tạo ra
- Anthropic đã tuyển cựu phụ trách hợp tác Google Books để thu thập “mọi cuốn sách trên thế giới”
Tính không thể đảo ngược mà phán quyết sử dụng hợp lý để lại
- Một thẩm phán liên bang phán quyết hoạt động này là sử dụng hợp lý, dựa trên lập luận rằng nếu loại bỏ bản gốc thì tại một thời điểm chỉ tồn tại một bản sao
- Một người trong ngành sách nói với 404 Media rằng cả những cuốn sách hiếm gần như không còn bản nào cũng được đưa vào quy trình xử lý
- Website có thể đăng lại và sách bán chạy có thể tái bản, nhưng sách thực vật học thế kỷ 18 chỉ còn ba bản cuối cùng thì không thể thay thế sau khi bị nghiền nát
- Khác với việc cào dữ liệu Internet, torrent thư viện hay thu thập nhạc trái phép, việc nghiền nát bản gốc là không thể đảo ngược; sau phán quyết hợp pháp, các hoạt động như vậy có thể tăng tốc
1 bình luận
Ý kiến trên Hacker News
Tôi không mấy đồng cảm với các nhà xuất bản. Họ trói sách trong tình trạng ngừng in cho đến khi hết hạn bản quyền, biến những cuốn sách hoàn toàn bình thường thành sách hiếm, và ngay cả sách còn bán cũng thường chỉ dùng giấy dễ cong vì ẩm và kiểu đóng gáy keo mà vài năm là bung thành từng tờ
Với những cuốn sách đã bị nhà xuất bản cho ngừng in, nhà xuất bản khác nên được phép xuất bản mà không cần bồi thường cho nhà xuất bản gốc, nhưng có thể đàm phán lại với tác giả về tiền bản quyền. Ngay cả khi họ không phát hành bản bìa cứng dùng giấy bền và khâu tay, luật bản quyền nên được sửa đổi để nhà xuất bản khác có thể làm bản cao cấp
Các streamer nhỏ cũng không có đủ khả năng pháp lý để chống lại. Kênh đó là https://www.youtube.com/@diggingthegreats/videos
Khi đó sách là món xa xỉ mà phần lớn mọi người không thể mua nổi, và chỉ khi kiểu đóng sách sản xuất hàng loạt giá rẻ phổ biến thì khả năng tiếp cận mới tăng lên. Ngay cả bây giờ vẫn tồn tại thị trường các nghệ nhân tháo sách bán sẵn rồi làm lại bìa và kiểu đóng tùy chỉnh chất lượng cao
Thay vì cho rằng nhà xuất bản cố tình phớt lờ nhu cầu ẩn với bản cao cấp, cách giải thích đơn giản hơn là họ biết từ dữ liệu bán hàng rằng nó sẽ không bán được. Nếu mục tiêu là bảo tồn, thì thay vì ép dùng loại giấy tốt hơn đôi chút, nên xây dựng kho lưu trữ số vững chắc chứ không phải dựa vào kho hàng tồn hay kệ sách của nhà sưu tập
Tôi đang tái bản các sách cũ sau khi kiểm tra bản quyền. Tất cả sách đều là bản xuất bản trước năm 1930, và tùy việc chủ sở hữu quyền có gia hạn hay không, khá nhiều sách đến tận 1964 hoặc 1973 cũng có thể làm được
Sau khi cắt gáy sách bằng máy cắt chuyên dụng, tôi cho từng tờ vào túi nhựa niêm phong để bảo quản vĩnh viễn, đồng thời lưu cả file gốc không nén trên đĩa từ để phòng khi cần quét lại. Tôi cũng tìm trước các bản hiếm sau năm 1931 để có thể xuất bản ngay khi hết hạn bản quyền, nhưng chưa có công ty AI nào từng yêu cầu được huấn luyện bằng toàn bộ bản scan cả
Bản thân cổ thư rất thú vị và rất đáng được bảo tồn, nhưng lại kém hữu ích hơn cho mục đích trộn vào một bộ dữ liệu huấn luyện khổng lồ
Nếu đối tượng quét chỉ là sách còn bản quyền, thì thật khó hiểu vì sao sách thực vật học thế kỷ 18 lại được đưa vào. Việc quét một cuốn sách mình sở hữu phải là hành vi hợp pháp về mặt bản quyền, và không nên bị buộc phải phá hủy
Với các tác phẩm đã xuất bản hơn 50 năm và có nguy cơ bị lãng quên, nên áp dụng quy định về tác phẩm bị bỏ mặc, buộc chủ sở hữu quyền phải chứng minh rằng chúng đang được lưu giữ tại nhiều thư viện v.v., hoặc cho phép sao chép thêm, hoặc từ bỏ bản quyền
Lý do OpenAI không thể mua bản số của một cuốn sách năm 2018 trên Amazon rồi dùng ngay không chỉ là vi phạm giấy phép, mà còn vì DMCA cấm cả việc gỡ DRM
Nếu Archive.org không bị kiện chỉ vì cho mượn sách giấy mà họ đang nắm giữ, có lẽ đã tránh được kết cục này. Các nhà xuất bản lẽ ra nên suy nghĩ cẩn trọng hơn về hệ quả mà họ mong muốn
Các nhà xuất bản đã kiện những công ty AI huấn luyện bằng dữ liệu từ thư viện bóng tối, hy vọng kiếm được các hợp đồng nội dung giá trị lớn, nhưng các công ty AI đã tận dụng lỗ hổng analog. Mua sách cũ với giá 5 USD rồi chi 25 USD cho quét phá hủy vẫn rẻ hơn tiền bản quyền rất nhiều
Tuy vậy, đối tượng không phải là cổ thư mà là sách còn bản quyền, và sách cũ cũng không tự động có giá trị. Thư viện loại bỏ những cuốn không có nhu cầu và chỉ tốn phí lưu trữ, nên các đơn vị quét có thể mua rất rẻ
Nội dung này giống nhà máy “xé hủy rồi quét” trong 《Rainbows End》 của Vernor Vinge hơn là 《Fahrenheit 451》 của Bradbury
Việc số hóa sách hiếm cũng có thể khắc phục phần nào thiệt hại từ vụ Authors Guild v. Google. Có thể cho phép công ty AI quét sách nhưng bắt buộc công khai bản sao số, đồng thời dành vài năm trì hoãn để bảo vệ lợi thế của đơn vị quét đầu tiên: https://en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,...
Ngược lại, sẽ hợp lý hơn nhiều nếu số hóa chất lượng cao, công bố miễn phí vĩnh viễn, cho phép truy cập qua LLM công cộng miễn phí tại thư viện và trên mạng, và nếu không còn bản in vật lý nào khác thì sau khi xác minh đầy đủ phải lưu giữ trong kho lưu trữ sách hiếm công cộng
Nếu vì luật bản quyền ngớ ngẩn mà đây là cách hợp pháp duy nhất công ty AI có thể chọn, thì khó có thể đổ toàn bộ trách nhiệm cho họ. Có thể ủng hộ thư viện bóng tối địa phương: https://annas-archive.pk/donate
Chỉ dựa trên các tư liệu được trích dẫn thì vẫn thiếu bằng chứng rằng sách hiếm thực sự đang bị phá hủy. Dù có bổ sung ví dụ về một cuốn sách thực vật học thế kỷ 18 không thể thay thế, vẫn chưa thể loại trừ khả năng đối tượng thực tế là sách đang bán hoặc sách phổ biến
Ở đây, “sách hiếm” dường như không phải là bản thảo trung cổ quan trọng về mặt lịch sử, mà là những cuốn sách tương đối gần đây vẫn còn bản quyền nhưng có ít bản in lưu hành. Việc phá hủy một cuốn như vậy để bảo tồn nội dung dưới dạng số không hẳn là xấu, và với sách còn bản quyền thì giá trị thường nằm ở nội dung hơn là vật mang tin vật lý