Những người đoạt giải bounty trực quan hóa ISBN trị giá $10k
(annas-archive.org)- Vài tháng trước, đã công bố phần thưởng $10.000 cho người trực quan hóa không gian ISBN của dữ liệu Anna’s Archive tốt nhất
- Bản trực quan hóa này cho thấy các tệp đã được lưu trữ và chưa được lưu trữ, đồng thời bao gồm tập dữ liệu thể hiện số lượng thư viện đang nắm giữ các ISBN đó
- Rất nhiều người đã tham gia và đưa ra các ý tưởng sáng tạo. Niềm đam mê và năng lượng dành cho dự án này thật ấn tượng
- Mục tiêu là xác định trong số những cuốn sách tồn tại trên thế giới, đã có bao nhiêu cuốn được lưu trữ, và những cuốn nào cần được ưu tiên trong thời gian tới
Bản trực quan hóa cơ bản
- Hình ảnh dưới 300kb thể hiện ngắn gọn “danh mục sách” lớn nhất trong lịch sử loài người.
- Bao gồm nhiều nguồn dữ liệu khác nhau: All ISBNs, Anna’s Archive, Google Books, Internet Archive, v.v.
Thử thách và người chiến thắng
- Ban đầu dự định trao giải nhất $6.000, giải nhì $3.000 và giải ba $1.000. Do có quá nhiều bài tham gia, đã quyết định trao giải ba cho bốn người, mỗi người $500.
- Giải nhất $6.000: phiresky - Nổi bật nhờ các tùy chọn trực quan hóa linh hoạt cùng phần triển khai nhanh và mượt mà.
- Giải nhì $3.000: hypha - Ấn tượng với cách trực quan hóa ở cấp độ vĩ mô và giao diện UI thân thiện với người dùng.
- Giải ba $500 #1: maxlion - Ấn tượng với nhiều chế độ xem khác nhau, đặc biệt là chế độ so sánh và chế độ theo nhà xuất bản.
- Giải ba $500 #2: abetusk - Tính năng so sánh rất nổi bật.
- Giải ba $500 #3: conundrumer0 - Gây ấn tượng với công cụ trực quan hóa có độ linh hoạt cao.
- Giải ba $500 #4: charelf - Cung cấp các tính năng đơn giản nhưng hiệu quả.
Những ý tưởng đáng chú ý
- BWV_1011: tòa nhà chọc trời cho độ hiếm
- robingchan: thống kê theo thời gian thực
- reguster: chú thích và thống kê theo thời gian thực
- orangereporter: chế độ xem bản đồ và bộ lọc độc đáo
- joe.davis: bảng màu mặc định đẹp mắt và heatmap
- timharding: chuyển đổi dễ dàng để so sánh nhanh các tập dữ liệu
- j1618: nhãn đẹp mắt
- immartian: thước tỷ lệ hiển thị số lượng sách
- backrndsource: nhiều thanh trượt để so sánh các tập dữ liệu như một DJ
Kết luận
- Tác phẩm đoạt giải nhất sẽ được tích hợp vào website chính, và các tác phẩm khác cũng đang được cân nhắc.
- Đang suy nghĩ về cách tổ chức quy trình xác định, xác minh và lưu trữ các cuốn sách hiếm.
- Xin cảm ơn tất cả mọi người đã tham gia, và cảm ơn vì rất nhiều người đã quan tâm đến dự án này.
1 bình luận
Ý kiến trên Hacker News
Tác phẩm đoạt giải là bản trực quan hóa gần đây cũng đã được HN đề cập
Ấn tượng cả về lựa chọn kỹ thuật lẫn thiết kế đồ họa, trực quan hóa một cách thanh nhã 2 tỷ cuốn sách trông như những kệ sách
Thảo luận HN liên quan: https://news.ycombinator.com/item?id=42897120
Tôi hơi bất ngờ khi tác phẩm của mình đạt hạng 3. Có lẽ họ đánh giá cao sự đơn giản và phần trực quan hóa
Vẫn có thể xem tại https://isbnviz.pages.dev
Nói thật thì tôi nghĩ hai tác phẩm dưới đây tốt hơn: https://bwv-1011.github.io/isbn-viewer/, https://anna.candyland.page/map-sample.html
Đặc biệt tác phẩm của bwv tương tự về mặt kỹ thuật nhưng nhìn chung tốt hơn của tôi rất nhiều, và gần với hình thức mà tôi muốn làm
Tuy nhiên nếu so sánh tác phẩm của bạn với tác phẩm của bwv, tôi không đồng ý rằng bwv vượt trội về kỹ thuật ở mọi mặt
Nó thiếu tính năng so sánh, chọn ISBN và tạo liên kết; bwv tập trung vào một chức năng là làm nổi bật sách hiếm, nhưng có vẻ ít đáp ứng các yêu cầu khác mà Anna’s Archive mong muốn hơn
Vì nhìn bề ngoài, đó có vẻ là mục tiêu chính của lần thử này
Thật sự rất tuyệt. Tuy nhiên tôi phát hiện một điểm lạ
Khi tìm ‘Stubborn Attachments’ thì kết quả hiện ra tốt, và trên cùng kệ có nhiều cuốn của Stripe Press
Trong số đó có một cuốn tên “Zero to One Hundred” của Stephanie Friedman, nhưng khi tìm trên Amazon thì tiêu đề lại khác. Vì sách chưa xuất bản nên có thể tiêu đề chưa chốt, điều đó thì hiểu được: https://a.co/d/bQX5CNf
Điều lạ là nếu tìm theo tiêu đề hiển thị trên kệ sách, “Zero to One Hundred”, thì không ra, nhưng tìm theo ISBN thì lại ra, và tên trong kết quả tìm kiếm lại hiển thị bằng một tiêu đề khác
Vì vậy cùng một vị trí trên kệ lại trông khác nhau tùy theo đã tìm gì. Tôi chưa đọc bài blog về cách bản trực quan hóa này hoạt động nên không biết nguyên nhân
Khi tìm ISBN trên web thì “Zero to One Hundred” xuất hiện cùng bìa “Built to Grow”, và ngược lại cũng vậy
Cùng ISBN đó cũng xuất hiện với “Experiment, Build, Scale” trong khi gắn với hai tiêu đề trước, còn trong bản trực quan hóa thì hiển thị là cuốn này
Trong các sách của Stephanie, có vẻ Google Books chỉ có “Experiment, Build, Scale”, còn Worldcat có “Zero to One Hundred” với bìa “Built to Grow”
Phần lớn hiệu sách trực tuyến đều lẫn lộn kiểu này, nên có vẻ gần với vấn đề chất lượng dữ liệu ở upstream hơn, khó có thể đổ lỗi cho công cụ
Thú vị. Nếu phóng to ở https://archive.anarchy.cool/maps/isbn.html thì thấy nhiều thứ. Tiếc là dường như không có liên kết trực tiếp theo tọa độ hay mức zoom
Ở phía đông khu vực tiếng Đức có thể thấy các nhà xuất bản như Hueber Verlag, với một mẫu hình như thể các số ISBN được rải cách nhau khoảng 1.360.000
Tôi biết ISBN có checksum nên sẽ có khoảng trống giữa các số, nhưng vì thế mà tạo ra một mẫu lặp lại có nhiều khoảng trống, trông như đang lãng phí đáng kể dải số lớn mà nhà xuất bản sở hữu
Không có quy tắc nào về việc nhà xuất bản nên phân bổ số như thế nào sao? Sẽ tốt nếu các block chưa dùng và không còn cần thiết có thể được trả lại
Cũng có thể hình dung rằng nếu xuất bản tài liệu học tập bằng 30 ngôn ngữ thì người ta có thể nảy ra nhiều “ý tưởng” trong việc cấp ISBN: https://de.wikipedia.org/wiki/Hueber_Verlag
Với những bản trực quan hóa tập dữ liệu lớn thuộc kiểu mong người dùng tự “khám phá”, tôi thường cảm thấy chúng đẹp thì có đẹp, nhưng không đặc biệt đem lại giác ngộ gì
Thay vì truyền tải một thông điệp hay câu chuyện cụ thể, chúng chỉ khiến người ta đi loanh quanh xem, và các bản trực quan hóa lần này có vẻ đặc biệt như vậy
Nếu không phải mô hình hóa một thể tích 3 chiều thực sự như trong ảnh y khoa hay CAD, thì phần “bắt buộc phải khám phá” mà 3D thêm vào chỉ che giấu insight mà thôi
Thông tin nó truyền tải chỉ có vậy, và không có cấu trúc phân cấp nào giúp phát hiện hay tổ chức nội dung
Hơn nữa, cùng một văn bản có thể xuất hiện nhiều lần dưới các kiểu đóng bìa khác nhau, mà từ góc nhìn ebook thì đó cũng là khác biệt không mấy ý nghĩa
Vấn đề lớn hơn là “Anna’s Archive” không phải kho sách hợp pháp mà là một trang vi phạm bản quyền, và thứ họ phô bày là mức độ hoàn chỉnh của việc đánh cắp, cùng sự thiếu vắng đền bù đi kèm, một cách trơ trẽn
Nếu đây là một giao diện dựa trên hệ thống phân cấp như LoC, cho phép truy cập các sách hợp pháp thực sự có thể tiếp cận trên https://www.gutenberg.org/, các sách đăng trên http://onlinebooks.library.upenn.edu/, hoặc các sách đang được làm trên https://www.wikibooks.org/, thì hẳn đã thú vị hơn nhiều
Vừa nhìn thấy hình ở trên cùng là tôi phản xạ muốn bật chương trình chống phân mảnh ổ đĩa ngay
Bản thân việc tham gia đã rất vui rồi, xin chúc mừng tất cả những ai liên quan
Ai tò mò thì bài dự thi của tôi vẫn còn sống ở đây: https://d199hl4t3ts6d9.cloudfront.net/
Gửi tình cảm chân thành đến tất cả các shadow library. Họ thực sự đang làm việc của thánh
Khi nhìn vào “giá sách” của nước mình, tôi buồn vì có quá nhiều tựa bị thiếu
Đến mức tôi muốn đến thư viện địa phương để tự số hóa những cuốn sách cũ, đã tuyệt bản và hiện không còn mua được nữa
Quá nhiều tri thức đang biến mất
Tôi thắc mắc vì sao trong trực quan hóa ISBN này lại không thấy rõ một khối nói tiếng Tây Ban Nha
Tiếng Anh có 2 ô, Pháp, Đức, Nhật, Liên Xô, Trung Quốc v.v. đều có khu vực lớn, nhưng Tây Ban Nha thì không có khu vực lớn nào
Sách tiếng Tây Ban Nha thật sự ít đến vậy sao? Hay phân bố này chủ yếu thiên về khối nói tiếng Anh?
Là người lớn lên trong các thư viện và hiệu sách tiếng Tây Ban Nha, xung quanh toàn sách tiếng Tây Ban Nha, tôi thấy hơi lạ khi phần của chúng tôi trên bản đồ thế giới này trông quá nhỏ
ISBN và tiêu đề được trích xuất từ dataset tại https://annas-archive.li/datasets, trong đó chủ yếu gồm tạp chí và sách tiếng Trung, tiếng Anh, tiếng Pháp
Ví dụ, Đức xuất bản sách nhiều gấp 5 lần Hà Lan, còn Tây Ban Nha xuất bản nhiều gấp 2 lần Hà Lan: https://internationalpublishers.org/wp-content/uploads/2023/11/IPA-Nielsen-BookData-IPA-Full-Report-23022024.pdf
Nhưng trong bản trực quan hóa, Đức trông tương đương Hà Lan, còn Tây Ban Nha và Mexico thì không khớp lắm với các nhãn cấp cao: https://software.annas-archive.li/AnnaArchivist/annas-archive/-/issues/244#note_2913
Có một khối lớn trông giống Argentina hoặc Peru, và các tiêu đề nằm ở rìa của khối lớn đó
Không giống các khối lớn khác, nó không có tên ở giữa mà để trống; nếu toàn bộ khối đó là Argentina thì tôi sẽ hơi ngạc nhiên, còn nếu khối đó là khối nói tiếng Tây Ban Nha thì khá hợp lý
Tác phẩm thắng giải hơi giống trình quản lý tệp Eagle mode, nơi bạn phóng to để xem các tệp trong thư mục, rồi tiếp tục phóng to để vào thư mục con
https://eaglemode.sourceforge.net/emvideo.html