1 điểm bởi GN⁺ 2026-04-23 | 1 bình luận | Chia sẻ qua WhatsApp
  • Là bản kỹ thuật số của ấn bản thứ 11 của Encyclopædia Britannica giai đoạn 1910–1911, cung cấp tìm kiếm toàn văn, tham chiếu chéo và chú giải
  • Cung cấp các mục điều hướng phía trên gồm Articles, Contributors, Topics, Ancillary
  • Tiêu đề ghi rõ Encyclopædia BritannicaEleventh Edition · 1910–1911
  • Câu giới thiệu hiển thị trực tiếp Fully searchable, cross-referenced, and annotated
  • Không cung cấp thêm mô tả nội dung, ví dụ hay giới thiệu chi tiết về tính năng

Tổng quan

  • Là bản kỹ thuật số của ấn bản thứ 11 của Encyclopædia Britannica giai đoạn 1910–1911, cung cấp tìm kiếm toàn văn, tham chiếu chéo và chú giải
  • Cung cấp các mục điều hướng phía trên gồm Articles, Contributors, Topics, Ancillary
  • Tiêu đề ghi rõ Encyclopædia Britannica, Eleventh Edition · 1910–1911
  • Câu giới thiệu hiển thị trực tiếp Fully searchable, cross-referenced, and annotated
  • Không có thêm mô tả nội dung, ví dụ hay giải thích chi tiết về tính năng

Thông tin được cung cấp

  • Có thể xác nhận trực tiếp các đặc tính cốt lõi của bản kỹ thuật số là khả năng tìm kiếm, tham chiếu chéobổ sung chú giải
  • Không bao gồm phần diễn giải mở rộng tương ứng với nội dung bài viết hay phần giới thiệu chi tiết cho từng mục
  • Siêu dữ liệu như thông tin tác giả, thông tin xuất bản và tài liệu tham khảo được loại khỏi phạm vi tóm tắt

1 bình luận

 
GN⁺ 2026-04-23
Ý kiến trên Hacker News
  • Tôi đã làm lại bản Encyclopædia Britannica 1911 thành một trang web khám phá có cấu trúc, gọn gàng. Có thể xem tại https://britannica11.org/
    Tôi đã phục dựng khoảng 37 nghìn bài theo đúng các tập gốc, đồng thời thêm mục lục có thể bấm theo từng phần, liên kết tham chiếu chéo, tìm kiếm theo tác giả đóng góp, hiển thị tập và số trang gốc, liên kết tới bản scan gốc của từng trang, tài liệu phụ lục, chỉ mục chủ đề và tìm kiếm toàn văn kèm metadata
    Phần việc cốt lõi là xử lý pipeline phục dựng cho cấu trúc tiêu đề, các bài kéo dài qua nhiều trang, bảng, công thức, đa ngôn ngữ, chú thích chân trang và bản khắc minh họa
    Mục tiêu là giữ được cảm giác của bản gốc nhưng đồng thời biến nó thành thứ thực sự dùng được
    Tôi đặc biệt muốn nhận phản hồi về chất lượng tìm kiếm, việc di chuyển giữa các phần và tham chiếu chéo, cũng như những chỗ cấu trúc trông còn gượng gạo
    Câu hỏi về pipeline hay mô hình dữ liệu cũng rất được hoan nghênh

    • Tôi nghĩ một thứ rất hợp để thêm vào phần phụ lục là The Reader's Guide to the Encyclopaedia Britannica. Văn bản public domain có tại https://www.gutenberg.org/ebooks/74039, bản scan ở https://archive.org/details/readersguidetoen00londuoft
    • Cảm giác là bạn làm quá tốt. Về gợi ý tính năng, tôi nghĩ sẽ hay nếu pipeline hỗ trợ cả tạo EPUB. Như vậy dù site có bị hạ thì vẫn có thể tìm kiếm và đọc ngoại tuyến, và nhờ nén EPUB nên kích thước toàn bộ bộ bách khoa có thể cũng không lớn như tưởng tượng
    • Tôi thấy có vấn đề escape ở phần mục lục. Ví dụ trong bài United States, cách hiển thị Roosevelt's bị vỡ. https://britannica11.org/article/27-0635-united-states-the/united_states__the
    • Nó hay đến mức tôi đã thực sự ngồi xem loanh quanh vài chủ đề khá lâu
      Tuy nhiên sau khi vào một bài thì ô tìm kiếm trên cùng, "Search titles and full text...", lại không hoạt động khi tôi muốn chuyển sang chủ đề khác
      Ngoài ra lúc mới vào tôi hơi khựng lại vì không rõ nên bắt đầu từ đâu, và không lập tức hiểu rằng phải bấm "Articles" hoặc "Topics" thì mới bắt đầu khám phá. Có lẽ tôi đã kỳ vọng chính hình ảnh ở trang chủ sẽ đóng vai trò lối vào
    • Tôi nghĩ sẽ còn hay hơn nữa nếu có liên kết nội bộ kiểu Wikipedia nối các chủ đề được nhắc tới trong một bài sang bài khác
  • Dự án này thật sự rất tuyệt. Tôi cũng đã nghĩ từ lâu về việc thử làm thứ gì đó tương tự ở quy mô nhỏ hơn
    Britannica 1911 đặc biệt nổi tiếng vì nhiều lý do, nhưng theo tôi điểm được biết đến rộng rãi nhất là nó là bộ bách khoa toàn thư cuối cùng trước Thế chiến thứ nhất
    Vì vậy trong đó vẫn còn nguyên thứ lạc quan kiểu hơi nước của cách mạng công nghiệp lần thứ nhất, thứ hai và Progressive Era, chưa bị phủ bóng bởi cú sốc của "cuộc chiến chấm dứt mọi cuộc chiến"
    Tôi vừa thử vào https://britannica11.org và tìm ngẫu nhiên Portuguese East Africa, kết quả hiện ra ngay và hiển thị rất tốt, ở https://britannica11.org/article/22-0177-portuguese-east-africa/portuguese_east_africa
    Một mong muốn lịch sự là sẽ rất tuyệt nếu có tùy chọn xem song song giữa văn bản và ảnh trang gốc
    Khi đó người đọc có thể tự kiểm tra độ trung thực của OCR đồng thời ngắm luôn chất lượng in ấn đẹp mắt, lại không cần mở cửa sổ mới cho từng trang
    Cá nhân tôi muốn dùng site này làm điểm vào tài liệu, rồi đọc thiên về ảnh, và chỉ chuyển sang văn bản khi cần kiểm tra hoặc sao chép
    Hiện tại tôi biết là có ảnh gốc, nhưng chúng chưa đủ nổi bật đến mức tôi phải vào tới lần thứ ba mới tìm thấy liên kết bên cạnh. Một phương án trung gian như thumbnail có thể chọn cũng có vẻ ổn
    Trên hết là tốc độ rất nhanh

  • Khi xem những bài như "Adolescence", tôi cảm thấy có thể bắt gặp những niềm tin mà ngày nay đọc lên khá sốc
    Ví dụ, có đoạn nói rằng vào khoảng tuổi dậy thì thì nên giảm vận động và gánh nặng giáo dục trí tuệ cho các bé gái, thậm chí buộc phải nghỉ ngơi

    • Tôi cũng nghĩ vậy. Đó là một trong những lý do khiến tôi thấy bản 1911 thú vị: các tác giả có thể bộc lộ quan điểm của mình trực tiếp hơn, và những quan điểm đó tự nhiên phản chiếu các chuẩn mực phổ biến của thời đại
    • Tôi cảm thấy những điều như vậy cũng chỉ trở nên gây sốc khi chúng được viết ra thành lời
      Trên thực tế vẫn có rất nhiều người đang sống theo những khuôn mẫu tương tự, và phong trào nữ quyền cũng từng mạnh mẽ thúc đẩy điều ngược lại rồi về sau phần nào điều chỉnh sang nhấn mạnh cả quyền tự do lựa chọn không tham gia thị trường lao động
      Sở thích với cái gọi là "soft life" không phụ thuộc thời đại, và tôi nghĩ nếu nam giới cũng có một lựa chọn văn hóa rộng mở là được người khác chu cấp kinh tế, thì tỷ lệ chọn những vai trò ít gánh nặng trí tuệ hơn và theo lộ trình dần dần cũng sẽ tăng lên đáng kể
      Khi đó, sự mất cân bằng đại diện ở các lĩnh vực khác cũng có thể được giải tỏa phần nào không phải bằng cách ép đưa thêm phụ nữ vào mà bằng việc nam giới tự nguyện rút bớt ra, theo góc nhìn đó
    • Giờ đây nếu là văn bản public domain thì tôi cảm thấy gần như thứ gì cũng có thể đưa vào các LLM đời mới như Kimi hay GLM để lấy bản tóm tắt bằng ngôn ngữ hiện đại khá tốt
      Việc LLM sắp xếp lại những đoạn văn dày đặc kiểu tài liệu lịch sử bằng format hơi mạnh tay thực ra lại hữu ích ngoài mong đợi
      Và nếu đưa thêm một prompt kiểu "Ngày nay văn bản này sẽ được tiếp nhận như thế nào?" thì nó cũng sẽ chỉ ra khá chi tiết những chỗ theo chuẩn hiện tại là không phù hợp hoặc khó chấp nhận
  • Tôi tò mò thông tin bên trong được cấu trúc ra sao. Gần đây tôi mới biết trong giới digital humanities người ta hay dùng kiểu đánh dấu ngữ nghĩa như XML-TEI cho những việc thế này
    Tôi đã học BaseX và XQuery từ việc xem dữ liệu mã hóa từ điển Latin-English Lewis & Short bằng XML-TEI, rồi thấy rất vui khi có thể đặt những câu hỏi như "tác giả cổ điển nào dùng một từ chỉ xuất hiện đúng một lần trong toàn bộ corpus" hay "từ hapax dài nhất là gì"
    Việc Tufts University công khai các dữ liệu như vậy cũng thật tuyệt
    Tôi cảm thấy nếu đưa Britannica 1911 vào BaseX rồi đào bới đủ thứ bằng XQuery thì sẽ rất vui

    • Cấu trúc nội bộ không dựa trên XML-TEI mà là dữ liệu quan hệ và pipeline. Tôi đã phục dựng ranh giới bài viết, các phần, tác giả đóng góp, tham chiếu chéo và thông tin nguồn trang gốc thành các bản ghi có cấu trúc
      Bản thân văn bản là public domain, nhưng tôi vẫn chưa công khai bản export cấu trúc hóa ở quy mô lớn
      Tuy vậy, trong thread này cũng có khá nhiều yêu cầu xin truy cập dataset nên tôi đang nghiêm túc cân nhắc, và nếu công khai thì tôi muốn phát hành theo dạng giữ nguyên cấu trúc chứ không phải dump văn bản thuần
  • Tôi thấy thú vị ở chỗ văn phong và cấu trúc của nó khác khá nhiều so với văn bản hiện đại
    Ví dụ xem mục Copenhagen https://britannica11.org/article/07-0111-copenhagen/copenhagen, bài viết mô tả chính xác địa lý và các điểm đáng chú ý chính, nhưng đồng thời các tác giả cũng không ngại đưa vào những tính từ giàu cảm xúc và ý kiến cá nhân về những thứ họ cho là thú vị hoặc kỳ lạ
    Hơn nữa, đoạn Battle of Copenhagen ở phía dưới lại chuyển đột ngột từ mô tả địa lý sang tường thuật theo từng cảnh của một trận hải chiến, tạo cảm giác như chính thể loại văn bản đã đổi hẳn

    • Tôi cũng thấy vậy. Đó là một trong những điều tôi thích nhất ở bản này. Các bài viết có giọng điệu cá nhân hơn và ít bị đồng nhất hơn
      Địa lý, lịch sử, thậm chí đôi khi là những quan điểm khá mạnh đều trộn lẫn vào một chỗ, và tôi lại thấy nhờ vậy mà đọc còn hay hơn
      Tôi cũng có viết về điểm này trong bài giới thiệu của mình tại https://britannica11.org/about.html
    • Ngay khi mở mục Victor Hugo, tôi đã thấy một câu mà ai đọc cũng biết tác giả là fan
      Đoạn ca ngợi Les Misérables là "cuốn tiểu thuyết sử thi và kịch tính vĩ đại nhất từng được sáng tạo hay hình dung" chính là ví dụ như vậy
  • Tôi đã nghĩ từ lâu về chuyện liệu có kiếm được những bộ bách khoa tương đối gần đây như Encarta hay Britannica bản 2021 không
    Ở cái ranh giới mơ hồ giữa thời kỳ trước LLM và sau COVID, tôi đã kỳ vọng đó sẽ giống như nguồn thông tin cuối cùng còn ít bị ô nhiễm bởi AI
    Một trong những món đồ tôi quý nhất lúc nhỏ là bộ bách khoa CD-ROM, và vào những buổi chiều mưa khi Internet còn chưa phổ biến, cảm giác mở các mục mình thích ra để đọc và học thật sự rất tuyệt

  • Nếu thích 1911 Encyclopedia Britannica thì có lẽ bạn cũng sẽ thấy https://OldEncyc.com thú vị
    Ở đó có thể đào sâu các bộ bách khoa cũ từ 1728 đến 1926, qua 22 lần xuất bản, theo từng tập và dải chữ cái. Nó không thiên về tìm kiếm như site của OP nhưng độ bao phủ tư liệu rất rộng

    • Đây là site tôi chưa từng biết, nhưng cảm giác là một bộ sưu tập thực sự rất tốt. Tôi đặc biệt thích việc nó bao quát rộng nhiều lần xuất bản khác nhau
  • Một báo lỗi rất nhỏ thôi, nhưng font hiện đang chọn không hỗ trợ ký tự ℔ nên các bài như https://britannica11.org/article/22-0688-s2/putting_the_shot trông khá kỳ
    Cũng có thể cân nhắc chuẩn hóa nó thành lb, cách viết quen thuộc hơn hiện nay

    • Nhận xét rất hay. Đó là vấn đề bao phủ glyph, nên tôi đang nghĩ либо thêm font fallback cho các ký tự thiếu, hoặc chuẩn hóa trong những trường hợp như vậy
      Trông thì nhỏ nhưng dự án này thực ra đầy rẫy những trường hợp kiểu đó
  • Đúng là thế giới nhỏ. Hiện giờ tôi đang dọn lại bản scan của EB 9th edition để đưa lên một site MediaWiki, và vì còn cả minh họa lẫn bản khắc nên tôi mới chỉ đi được khoảng một phần ba
    Tôi đã thử nhiều công cụ OCR khác nhau, và đến nay paddleOCR là thứ gây ấn tượng nhất. Nó làm khá tốt việc tách cột văn bản, gắn nhãn minh họa và nhận diện văn bản ở lề
    Tất nhiên nó chưa hoàn hảo nên tôi vẫn đang sửa tay một số bảng, và cũng định đưa lên cả các trang nguồn để có thể xem qua lại giữa trang scan gốc và văn bản điện tử

    • Nhân tiện, bản 9th edition năm 1875 nổi tiếng là scholar's edition vì có rất nhiều nhân vật học thuật tên tuổi tham gia, và tôi thấy nó là một lát cắt rất cuốn hút của cuối thế kỷ 19
      Theo cách này, những thứ khác cũng sẽ rất thú vị nếu được đưa lên mạng với hyperlink và chỉ mục, như atlas địa lý, atlas y học hay cẩm nang du lịch Baedeker
    • Nghe rất đáng mong đợi. Bản 9 vốn đã tuyệt vời, và rất nhiều nội dung của nó tiếp tục được dùng lại trong bản 11
      Tôi nghĩ ngay đến những mục về chim đồ sộ của Alfred Newton hay vài bài tiểu luận kinh điển của Macaulay
  • Tôi thấy có những đoạn giờ đọc lại khá vừa buồn cười vừa kỳ lạ. Ví dụ trong mục stars https://britannica11.org/article/25-0806-star/star#section-10, có đoạn nói rằng nếu các ngôi sao phân bố vô hạn và đồng đều trong không gian vũ trụ, lại không có hấp thụ ánh sáng, thì nền trời lẽ ra phải sáng rực

    • Tôi thử tìm "computer" thì không thấy máy tính theo nghĩa hiện đại, mà chỉ ra Chauncey Wright, người làm computer như một chức danh nghề nghiệp cho American Ephemeris and Nautical Almanac
      Kết quả là https://britannica11.org/article/28-0872-wright-chauncey/wright__chauncey?q=computer&match=1, và điều đó khiến tôi thấy thời đại đã khác thật rồi
    • Mục Sun cũng khá thú vị. Họ chưa biết đến nhiệt hạch, nhưng phần lớn đã bác bỏ các giả thuyết như cháy hóa học hay co hấp dẫn để giải thích vì sao Mặt Trời phát ra năng lượng lớn đến vậy
      Thay vào đó, họ cho rằng một kiểu tái sắp xếp nào đó trong cấu trúc nguyên tử của các nguyên tố là lời giải thích có vẻ hợp lý nhất, và mô tả việc tinh vân ngưng tụ thành Mặt Trời, trong quá trình vật chất phát triển thành các nguyên tố đã biết thì giải phóng năng lượng
      Xét theo mức độ tri thức thời đó, tôi thấy đây là một phỏng đoán gần đúng đáng ngạc nhiên
    • Tôi nghĩ đoạn đó có thể hiểu cùng với Olbers' paradox