Trực quan hóa mọi ISBN
(annas-archive.org)-
Trực quan hóa ISBN
- Anna's Archive cung cấp danh mục sách mở lớn nhất trong lịch sử nhân loại.
- Mỗi pixel đại diện cho 2.500 ISBN, và pixel sẽ hiển thị màu xanh lá nếu có tệp.
- Chỉ 16% tổng số sách đã được sao lưu, và vẫn cần thêm nhiều công việc.
-
Bối cảnh
- Anna's Archive lập danh mục sách bằng cách sử dụng số ISBN để sao lưu tri thức của nhân loại.
- ISBN được gán cho các cuốn sách được xuất bản ở hầu hết các quốc gia từ thập niên 1970.
- Hệ thống hoạt động theo mô hình phân tán không có cơ quan trung ương, với số được cấp theo thứ tự quốc gia, nhà xuất bản lớn, rồi nhà xuất bản nhỏ.
- Anna's Archive thu thập dữ liệu từ nhiều nguồn metadata khác nhau như ISBNdb, Worldcat, Google Books và hơn thế nữa, nhờ đó sở hữu metadata sách mở lớn nhất.
- Việc xác định và bảo tồn các cuốn sách hiếm và đang bị đe dọa là rất quan trọng.
-
Trực quan hóa
- Có thể xem riêng từng tập dữ liệu khác nhau, và chuyển đổi bằng menu thả xuống cùng các nút bấm.
- Các tập dữ liệu bao gồm Anna's Archive, Google Books, Goodreads, Internet Archive và các nguồn khác.
- Có thể quan sát các mẫu như đường kẻ và khối đều đặn, cũng như các vùng trống trong phần trực quan hóa.
-
Giải thưởng $10,000
- Có một giải thưởng để cải thiện phần trực quan hóa, và cần nộp mã nguồn mở trước ngày 31 tháng 1 năm 2025.
- Bài nộp tốt nhất sẽ nhận $6,000, hạng nhì $3,000, hạng ba $1,000, và được chi trả bằng Monero (XMR).
- Một phần tiền thưởng vẫn có thể được trao ngay cả khi chưa đáp ứng tiêu chí tối thiểu.
- Bài nộp cần cải thiện phần trực quan hóa bằng cách chỉnh sửa HTML, đồng thời phải hoạt động tốt trên desktop và mobile.
- Điểm cộng thêm sẽ được chấm dựa trên tính tiện dụng và sức hấp dẫn thị giác.
-
Mã nguồn
- Mã tạo ảnh và ví dụ nằm trong một thư mục cụ thể.
- Dữ liệu ISBN được cung cấp dưới dạng định dạng nén 75MB.
- Không bắt buộc phải dùng định dạng này để tham gia giải thưởng, nhưng đây là định dạng thuận tiện nhất để bắt đầu.
- Toàn bộ mã phải được cung cấp dưới dạng mã nguồn mở.
1 bình luận
Ý kiến trên Hacker News
Thấy có treo tiền thưởng ở phía dưới nên coi như tôi tự bỏ qua cơ hội trúng, nhưng trực quan hóa này có vẻ rất hợp để ánh xạ lên đường cong Hilbert [0]
Nếu biến dữ liệu thành các “sọc” như hiện nay, những điểm gần nhau theo thứ tự sắp xếp cũng có thể nằm khá xa nhau. Vì khoảng cách đi xuống một ô theo trục Y sẽ nhảy qua cả một dòng dữ liệu, còn khoảng cách theo trục X thì tương ứng 1:1 với dữ liệu gốc
Nếu ánh xạ lên đường cong Hilbert thì bản thân trục X và Y sẽ không còn ý nghĩa, nhưng các điểm gần nhau trong danh sách đã sắp xếp cũng sẽ gần nhau về mặt thị giác trong ảnh đầu ra
ISBN có phần đầu là quốc gia, phần thứ hai là nhà xuất bản, phần thứ ba là nhan đề, và cuối cùng là checksum, nên tôi nghĩ sẽ bỏ checksum rồi sắp xếp từng phần như các số lớn, không có dấu gạch nối
Khi đó các vùng rộng do những quốc gia xuất bản lớn chiếm giữ sẽ trông như những “hòn đảo”, và bên trong các đảo đó mã nhà xuất bản sẽ hiện thành các điểm sáng. Nếu còn gắn nhãn cho những vùng như vậy thì đáng được điểm thưởng
Trước đây tôi từng làm một bản áp dụng cách này cho dữ liệu thời tiết để dùng khi phỏng vấn [1]. Dữ liệu theo mùa được gom lại với nhau nên tính mùa vụ hiện rất rõ
[0] https://en.wikipedia.org/wiki/Hilbert_curve
[1] https://graypegg.com/hilbert (nếu muốn dùng đoạn mã này để thử giành tiền thưởng thì có thể tham khảo https://github.com/graypegg/hilbertcurveplayground. Nếu tái sử dụng thì ít nhất mong bạn nhắc đến tên tôi, dù tôi cũng không thể ngăn được)
[0] https://github.com/jakubcerveny/gilbert
[1] https://jakubcerveny.github.io/gilbert/demo/
Tôi lo rằng đường cong Hilbert thực ra chỉ là sản phẩm của cấu trúc đường cong, nhưng lại làm kết quả trông như các vùng phân chia “hình vuông” rõ rệt của dữ liệu [0]. Theo nghĩa đó, trực quan hóa hiện tại hữu ích hơn vì dễ nhận ra ngay vị trí của từng quốc gia
[0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
Vấn đề là ISBN không có tính phân cấp. ISBN được mua theo khối, hoặc cũng có thể mua lẻ với một khoản phụ phí vô lý. Tôi nói vậy với tư cách người từng mua một mã để tái bản đúng một cuốn sách
Vì thế trực quan hóa này không cho thấy điều gì đặc biệt thú vị hay hữu ích
Tôi nghĩ một trực quan hóa dùng Phân loại Thư viện Quốc hội Mỹ hoặc Phân loại thập phân Dewey sẽ hữu ích hơn nhiều, đặc biệt nếu liên kết được đến các kho lưu trữ và danh mục thuộc phạm vi công cộng hoặc tự do bản quyền. Chẳng hạn như một phiên bản tương tác và trực quan của tư liệu của John Mark Ockerbloom
https://onlinebooks.library.upenn.edu/
Ảnh có kích thước 1000×800 pixel và mỗi pixel đại diện cho 2500 ISBN, tức là trực quan hóa 2 tỷ ISBN. ISBN-13 gồm 12 chữ số cộng 1 chữ số kiểm tra, nên bình thường có thể kỳ vọng nó lớn hoặc dày đặc hơn ảnh hiện tại 500 lần
Kích thước hiện tại có vẻ có nghĩa là chỉ bao gồm các ISBN có tiền tố 978 và 979, và vì nửa dưới thưa hơn nên có lẽ đó là dải 979 mới
Theo mô tả thì lẽ ra phải phân biệt được pixel đỏ và xanh lục, nhưng tôi tưởng mình không nhìn thấy vì rối loạn sắc giác. Tôi chỉ thấy đỏ và đen
Nhưng ngay cả khi dùng tiện ích trình duyệt hiệu chỉnh rối loạn sắc giác, tôi cũng không phân biệt được thêm màu nào. Không biết chỉ mình tôi như vậy, hay biểu đồ có vấn đề
Cuộn xuống để tìm công cụ trực quan hóa tương tác, rồi đổi sang “Files in Anna's Archive [md5]” thì vị trí các pixel xanh lục sẽ được tô nổi bật bằng màu xám
Nhấp chuột phải vào ảnh, chọn “Inspect”, rồi thêm một bộ lọc CSS hue-rotate mới vào phần tử
element { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }Thông thường tôi dùng
filter: saturate(100);, nhưng với ảnh này thì không hợp lắm. Có thể cần chỉnh góc xoay, còn với tôi thì -90 độ là hợp nhấtAnna's Archive là một trong những kỳ quan của thế giới. Nếu nhân loại gần như tự hủy diệt mà Anna's Archive vẫn sống sót, thì sẽ có hy vọng tái thiết tương đối nhanh
IP máy chủ có vẻ bị chặn ở EU. Trên mạng Ziggo Internet ở Hà Lan hiện thông báo này
“Trang web này đã bị chặn
Lệnh trừng phạt của châu Âu
Hội đồng châu Âu đã quyết định rằng các trang web RT (trước đây là Russia Today) và Sputnik News không còn được phép truyền tải nữa. Trang web mà bạn đang cố truy cập thuộc diện lệnh trừng phạt châu Âu này
VodafoneZiggo có nghĩa vụ thực thi lệnh trừng phạt nên đã chặn trang web”
https://web.archive.org/web/20250106112552/https://annas-arc...
Có ai khác cũng thấy thông báo này không?
“Máy chủ này không thể chứng minh nó là annas-archive.org. Chứng chỉ bảo mật của nó được cấp cho *.hs.llnwd.net. Điều này có thể do cấu hình sai hoặc do kẻ tấn công đang chặn kết nối”
Bất kể trang nào, nếu bỏ qua cảnh báo để vào thì đều ra lỗi HTTP 400
Theo Wikipedia, www.ukispcourtorders.co.uk từng là trang liệt kê các tên miền bị chặn và các lệnh tòa liên quan
https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
Trong biểu đồ này khá khó biết cái gì tương ứng với cái gì. Nếu ai đó đánh dấu Bookland, tức 978, nằm ở đâu thì có lẽ sẽ dễ định hướng hơn
Tải xuống và dùng tệp ISBN ở đó có bất hợp pháp không? Tôi không hiểu việc sở hữu thông tin như vậy thì có vấn đề gì
Bài viết nói “Mỗi pixel đại diện cho 2.500 ISBN. Nếu có tệp của ISBN tương ứng, chúng tôi làm pixel đó xanh hơn”, nhưng tôi không hiểu xanh hơn nghĩa là gì. Tôi không thấy sắc xanh nào có độ đậm nhạt cả
Và có phải pixel màu đen là ISBN chưa được đăng ký không?
Tôi thấy thông báo này
“Lệnh trừng phạt của châu Âu
Hội đồng châu Âu đã quyết định rằng các trang web RT (trước đây là Russia Today) và Sputnik News không còn được phép truyền tải nữa. Trang web mà bạn đang cố truy cập thuộc diện lệnh trừng phạt châu Âu này”
Ở Ý thì chỉ thất bại với NS_ERROR_CONNECTION_REFUSED