2 điểm bởi GN⁺ 2025-02-27 | 1 bình luận | Chia sẻ qua WhatsApp
  • Vài tháng trước, đã công bố phần thưởng $10.000 cho người trực quan hóa không gian ISBN của dữ liệu Anna’s Archive tốt nhất
  • Bản trực quan hóa này cho thấy các tệp đã được lưu trữ và chưa được lưu trữ, đồng thời bao gồm tập dữ liệu thể hiện số lượng thư viện đang nắm giữ các ISBN đó
  • Rất nhiều người đã tham gia và đưa ra các ý tưởng sáng tạo. Niềm đam mê và năng lượng dành cho dự án này thật ấn tượng
  • Mục tiêu là xác định trong số những cuốn sách tồn tại trên thế giới, đã có bao nhiêu cuốn được lưu trữ, và những cuốn nào cần được ưu tiên trong thời gian tới

Bản trực quan hóa cơ bản

  • Hình ảnh dưới 300kb thể hiện ngắn gọn “danh mục sách” lớn nhất trong lịch sử loài người.
  • Bao gồm nhiều nguồn dữ liệu khác nhau: All ISBNs, Anna’s Archive, Google Books, Internet Archive, v.v.

Thử thách và người chiến thắng

  • Ban đầu dự định trao giải nhất $6.000, giải nhì $3.000 và giải ba $1.000. Do có quá nhiều bài tham gia, đã quyết định trao giải ba cho bốn người, mỗi người $500.
  • Giải nhất $6.000: phiresky - Nổi bật nhờ các tùy chọn trực quan hóa linh hoạt cùng phần triển khai nhanh và mượt mà.
  • Giải nhì $3.000: hypha - Ấn tượng với cách trực quan hóa ở cấp độ vĩ mô và giao diện UI thân thiện với người dùng.
  • Giải ba $500 #1: maxlion - Ấn tượng với nhiều chế độ xem khác nhau, đặc biệt là chế độ so sánh và chế độ theo nhà xuất bản.
  • Giải ba $500 #2: abetusk - Tính năng so sánh rất nổi bật.
  • Giải ba $500 #3: conundrumer0 - Gây ấn tượng với công cụ trực quan hóa có độ linh hoạt cao.
  • Giải ba $500 #4: charelf - Cung cấp các tính năng đơn giản nhưng hiệu quả.

Những ý tưởng đáng chú ý

  • BWV_1011: tòa nhà chọc trời cho độ hiếm
  • robingchan: thống kê theo thời gian thực
  • reguster: chú thích và thống kê theo thời gian thực
  • orangereporter: chế độ xem bản đồ và bộ lọc độc đáo
  • joe.davis: bảng màu mặc định đẹp mắt và heatmap
  • timharding: chuyển đổi dễ dàng để so sánh nhanh các tập dữ liệu
  • j1618: nhãn đẹp mắt
  • immartian: thước tỷ lệ hiển thị số lượng sách
  • backrndsource: nhiều thanh trượt để so sánh các tập dữ liệu như một DJ

Kết luận

  • Tác phẩm đoạt giải nhất sẽ được tích hợp vào website chính, và các tác phẩm khác cũng đang được cân nhắc.
  • Đang suy nghĩ về cách tổ chức quy trình xác định, xác minh và lưu trữ các cuốn sách hiếm.
  • Xin cảm ơn tất cả mọi người đã tham gia, và cảm ơn vì rất nhiều người đã quan tâm đến dự án này.

1 bình luận

 
GN⁺ 2025-02-27
Ý kiến trên Hacker News
  • Tác phẩm đoạt giải là bản trực quan hóa gần đây cũng đã được HN đề cập
    Ấn tượng cả về lựa chọn kỹ thuật lẫn thiết kế đồ họa, trực quan hóa một cách thanh nhã 2 tỷ cuốn sách trông như những kệ sách
    Thảo luận HN liên quan: https://news.ycombinator.com/item?id=42897120

  • Tôi hơi bất ngờ khi tác phẩm của mình đạt hạng 3. Có lẽ họ đánh giá cao sự đơn giản và phần trực quan hóa
    Vẫn có thể xem tại https://isbnviz.pages.dev
    Nói thật thì tôi nghĩ hai tác phẩm dưới đây tốt hơn: https://bwv-1011.github.io/isbn-viewer/, https://anna.candyland.page/map-sample.html
    Đặc biệt tác phẩm của bwv tương tự về mặt kỹ thuật nhưng nhìn chung tốt hơn của tôi rất nhiều, và gần với hình thức mà tôi muốn làm

    • Tôi cũng ngạc nhiên khi bạn được hạng 3
      Tuy nhiên nếu so sánh tác phẩm của bạn với tác phẩm của bwv, tôi không đồng ý rằng bwv vượt trội về kỹ thuật ở mọi mặt
      Nó thiếu tính năng so sánh, chọn ISBN và tạo liên kết; bwv tập trung vào một chức năng là làm nổi bật sách hiếm, nhưng có vẻ ít đáp ứng các yêu cầu khác mà Anna’s Archive mong muốn hơn
    • Tôi tò mò vì sao trong tác phẩm của các bạn và của bwv, Spain/Italy v.v. trông như những hòn đảo nổi tách riêng, nhưng đồng thời cũng xuất hiện trong khối chính
    • Rất vui vì bạn nói vậy. Tôi cũng ngạc nhiên khi bwv-1011 chỉ nhận giải khuyến khích dù đã đặt trọng tâm kỹ thuật vào trực quan hóa độ hiếm
      Vì nhìn bề ngoài, đó có vẻ là mục tiêu chính của lần thử này
  • Thật sự rất tuyệt. Tuy nhiên tôi phát hiện một điểm lạ
    Khi tìm ‘Stubborn Attachments’ thì kết quả hiện ra tốt, và trên cùng kệ có nhiều cuốn của Stripe Press
    Trong số đó có một cuốn tên “Zero to One Hundred” của Stephanie Friedman, nhưng khi tìm trên Amazon thì tiêu đề lại khác. Vì sách chưa xuất bản nên có thể tiêu đề chưa chốt, điều đó thì hiểu được: https://a.co/d/bQX5CNf
    Điều lạ là nếu tìm theo tiêu đề hiển thị trên kệ sách, “Zero to One Hundred”, thì không ra, nhưng tìm theo ISBN thì lại ra, và tên trong kết quả tìm kiếm lại hiển thị bằng một tiêu đề khác
    Vì vậy cùng một vị trí trên kệ lại trông khác nhau tùy theo đã tìm gì. Tôi chưa đọc bài blog về cách bản trực quan hóa này hoạt động nên không biết nguyên nhân

    • Có vẻ không phải vấn đề của công cụ mà là dữ liệu sách tự thân bị rối
      Khi tìm ISBN trên web thì “Zero to One Hundred” xuất hiện cùng bìa “Built to Grow”, và ngược lại cũng vậy
      Cùng ISBN đó cũng xuất hiện với “Experiment, Build, Scale” trong khi gắn với hai tiêu đề trước, còn trong bản trực quan hóa thì hiển thị là cuốn này
      Trong các sách của Stephanie, có vẻ Google Books chỉ có “Experiment, Build, Scale”, còn Worldcat có “Zero to One Hundred” với bìa “Built to Grow”
      Phần lớn hiệu sách trực tuyến đều lẫn lộn kiểu này, nên có vẻ gần với vấn đề chất lượng dữ liệu ở upstream hơn, khó có thể đổ lỗi cho công cụ
  • Thú vị. Nếu phóng to ở https://archive.anarchy.cool/maps/isbn.html thì thấy nhiều thứ. Tiếc là dường như không có liên kết trực tiếp theo tọa độ hay mức zoom
    Ở phía đông khu vực tiếng Đức có thể thấy các nhà xuất bản như Hueber Verlag, với một mẫu hình như thể các số ISBN được rải cách nhau khoảng 1.360.000
    Tôi biết ISBN có checksum nên sẽ có khoảng trống giữa các số, nhưng vì thế mà tạo ra một mẫu lặp lại có nhiều khoảng trống, trông như đang lãng phí đáng kể dải số lớn mà nhà xuất bản sở hữu
    Không có quy tắc nào về việc nhà xuất bản nên phân bổ số như thế nào sao? Sẽ tốt nếu các block chưa dùng và không còn cần thiết có thể được trả lại
    Cũng có thể hình dung rằng nếu xuất bản tài liệu học tập bằng 30 ngôn ngữ thì người ta có thể nảy ra nhiều “ý tưởng” trong việc cấp ISBN: https://de.wikipedia.org/wiki/Hueber_Verlag

  • Với những bản trực quan hóa tập dữ liệu lớn thuộc kiểu mong người dùng tự “khám phá”, tôi thường cảm thấy chúng đẹp thì có đẹp, nhưng không đặc biệt đem lại giác ngộ gì
    Thay vì truyền tải một thông điệp hay câu chuyện cụ thể, chúng chỉ khiến người ta đi loanh quanh xem, và các bản trực quan hóa lần này có vẻ đặc biệt như vậy

    • Đó chính là vấn đề tôi cảm nhận ở các nỗ lực cố biến trực quan hóa thành 3D
      Nếu không phải mô hình hóa một thể tích 3 chiều thực sự như trong ảnh y khoa hay CAD, thì phần “bắt buộc phải khám phá” mà 3D thêm vào chỉ che giấu insight mà thôi
    • Thứ ISBN ánh xạ là nhà xuất bản, các tiêu đề đã được cấp và thứ tự xuất bản đại khái
      Thông tin nó truyền tải chỉ có vậy, và không có cấu trúc phân cấp nào giúp phát hiện hay tổ chức nội dung
      Hơn nữa, cùng một văn bản có thể xuất hiện nhiều lần dưới các kiểu đóng bìa khác nhau, mà từ góc nhìn ebook thì đó cũng là khác biệt không mấy ý nghĩa
      Vấn đề lớn hơn là “Anna’s Archive” không phải kho sách hợp pháp mà là một trang vi phạm bản quyền, và thứ họ phô bày là mức độ hoàn chỉnh của việc đánh cắp, cùng sự thiếu vắng đền bù đi kèm, một cách trơ trẽn
      Nếu đây là một giao diện dựa trên hệ thống phân cấp như LoC, cho phép truy cập các sách hợp pháp thực sự có thể tiếp cận trên https://www.gutenberg.org/, các sách đăng trên http://onlinebooks.library.upenn.edu/, hoặc các sách đang được làm trên https://www.wikibooks.org/, thì hẳn đã thú vị hơn nhiều
  • Vừa nhìn thấy hình ở trên cùng là tôi phản xạ muốn bật chương trình chống phân mảnh ổ đĩa ngay

    • Animation của Windows 98 là đỉnh nhất. Từ sau đó trở đi cái nào cũng tệ, thật tiếc
  • Bản thân việc tham gia đã rất vui rồi, xin chúc mừng tất cả những ai liên quan
    Ai tò mò thì bài dự thi của tôi vẫn còn sống ở đây: https://d199hl4t3ts6d9.cloudfront.net/

  • Gửi tình cảm chân thành đến tất cả các shadow library. Họ thực sự đang làm việc của thánh

    • Họ đang làm một nửa công việc, mà chỉ riêng nửa đó thôi đã rất khổng lồ. Nửa còn lại là do các tình nguyện viên số hóa sách thực hiện
      Khi nhìn vào “giá sách” của nước mình, tôi buồn vì có quá nhiều tựa bị thiếu
      Đến mức tôi muốn đến thư viện địa phương để tự số hóa những cuốn sách cũ, đã tuyệt bản và hiện không còn mua được nữa
      Quá nhiều tri thức đang biến mất
  • Tôi thắc mắc vì sao trong trực quan hóa ISBN này lại không thấy rõ một khối nói tiếng Tây Ban Nha
    Tiếng Anh có 2 ô, Pháp, Đức, Nhật, Liên Xô, Trung Quốc v.v. đều có khu vực lớn, nhưng Tây Ban Nha thì không có khu vực lớn nào
    Sách tiếng Tây Ban Nha thật sự ít đến vậy sao? Hay phân bố này chủ yếu thiên về khối nói tiếng Anh?
    Là người lớn lên trong các thư viện và hiệu sách tiếng Tây Ban Nha, xung quanh toàn sách tiếng Tây Ban Nha, tôi thấy hơi lạ khi phần của chúng tôi trên bản đồ thế giới này trông quá nhỏ

    • Dataset được tạo từ các cuốn sách có trong Anna’s Archive, và mỗi cuốn được nhận diện bằng ISBN
      ISBN và tiêu đề được trích xuất từ dataset tại https://annas-archive.li/datasets, trong đó chủ yếu gồm tạp chí và sách tiếng Trung, tiếng Anh, tiếng Pháp
      Ví dụ, Đức xuất bản sách nhiều gấp 5 lần Hà Lan, còn Tây Ban Nha xuất bản nhiều gấp 2 lần Hà Lan: https://internationalpublishers.org/wp-content/uploads/2023/11/IPA-Nielsen-BookData-IPA-Full-Report-23022024.pdf
      Nhưng trong bản trực quan hóa, Đức trông tương đương Hà Lan, còn Tây Ban Nha và Mexico thì không khớp lắm với các nhãn cấp cao: https://software.annas-archive.li/AnnaArchivist/annas-archive/-/issues/244#note_2913
    • Tôi cũng có đúng thắc mắc đó, và dù hoàn toàn không có căn cứ, tôi có một giả thuyết
      Có một khối lớn trông giống Argentina hoặc Peru, và các tiêu đề nằm ở rìa của khối lớn đó
      Không giống các khối lớn khác, nó không có tên ở giữa mà để trống; nếu toàn bộ khối đó là Argentina thì tôi sẽ hơi ngạc nhiên, còn nếu khối đó là khối nói tiếng Tây Ban Nha thì khá hợp lý
  • Tác phẩm thắng giải hơi giống trình quản lý tệp Eagle mode, nơi bạn phóng to để xem các tệp trong thư mục, rồi tiếp tục phóng to để vào thư mục con
    https://eaglemode.sourceforge.net/emvideo.html