Britannica11.org - Bản cấu trúc hóa của Encyclopædia Britannica năm 1911
(britannica11.org)- Là bản kỹ thuật số của ấn bản thứ 11 của Encyclopædia Britannica giai đoạn 1910–1911, cung cấp tìm kiếm toàn văn, tham chiếu chéo và chú giải
- Cung cấp các mục điều hướng phía trên gồm Articles, Contributors, Topics, Ancillary
- Tiêu đề ghi rõ Encyclopædia Britannica và Eleventh Edition · 1910–1911
- Câu giới thiệu hiển thị trực tiếp Fully searchable, cross-referenced, and annotated
- Không cung cấp thêm mô tả nội dung, ví dụ hay giới thiệu chi tiết về tính năng
Tổng quan
- Là bản kỹ thuật số của ấn bản thứ 11 của Encyclopædia Britannica giai đoạn 1910–1911, cung cấp tìm kiếm toàn văn, tham chiếu chéo và chú giải
- Cung cấp các mục điều hướng phía trên gồm Articles, Contributors, Topics, Ancillary
- Tiêu đề ghi rõ Encyclopædia Britannica, Eleventh Edition · 1910–1911
- Câu giới thiệu hiển thị trực tiếp Fully searchable, cross-referenced, and annotated
- Không có thêm mô tả nội dung, ví dụ hay giải thích chi tiết về tính năng
Thông tin được cung cấp
- Có thể xác nhận trực tiếp các đặc tính cốt lõi của bản kỹ thuật số là khả năng tìm kiếm, tham chiếu chéo và bổ sung chú giải
- Không bao gồm phần diễn giải mở rộng tương ứng với nội dung bài viết hay phần giới thiệu chi tiết cho từng mục
- Siêu dữ liệu như thông tin tác giả, thông tin xuất bản và tài liệu tham khảo được loại khỏi phạm vi tóm tắt
1 bình luận
Ý kiến trên Hacker News
Tôi đã làm lại bản Encyclopædia Britannica 1911 thành một trang web khám phá có cấu trúc, gọn gàng. Có thể xem tại https://britannica11.org/
Tôi đã phục dựng khoảng 37 nghìn bài theo đúng các tập gốc, đồng thời thêm mục lục có thể bấm theo từng phần, liên kết tham chiếu chéo, tìm kiếm theo tác giả đóng góp, hiển thị tập và số trang gốc, liên kết tới bản scan gốc của từng trang, tài liệu phụ lục, chỉ mục chủ đề và tìm kiếm toàn văn kèm metadata
Phần việc cốt lõi là xử lý pipeline phục dựng cho cấu trúc tiêu đề, các bài kéo dài qua nhiều trang, bảng, công thức, đa ngôn ngữ, chú thích chân trang và bản khắc minh họa
Mục tiêu là giữ được cảm giác của bản gốc nhưng đồng thời biến nó thành thứ thực sự dùng được
Tôi đặc biệt muốn nhận phản hồi về chất lượng tìm kiếm, việc di chuyển giữa các phần và tham chiếu chéo, cũng như những chỗ cấu trúc trông còn gượng gạo
Câu hỏi về pipeline hay mô hình dữ liệu cũng rất được hoan nghênh
Tuy nhiên sau khi vào một bài thì ô tìm kiếm trên cùng, "Search titles and full text...", lại không hoạt động khi tôi muốn chuyển sang chủ đề khác
Ngoài ra lúc mới vào tôi hơi khựng lại vì không rõ nên bắt đầu từ đâu, và không lập tức hiểu rằng phải bấm "Articles" hoặc "Topics" thì mới bắt đầu khám phá. Có lẽ tôi đã kỳ vọng chính hình ảnh ở trang chủ sẽ đóng vai trò lối vào
Dự án này thật sự rất tuyệt. Tôi cũng đã nghĩ từ lâu về việc thử làm thứ gì đó tương tự ở quy mô nhỏ hơn
Britannica 1911 đặc biệt nổi tiếng vì nhiều lý do, nhưng theo tôi điểm được biết đến rộng rãi nhất là nó là bộ bách khoa toàn thư cuối cùng trước Thế chiến thứ nhất
Vì vậy trong đó vẫn còn nguyên thứ lạc quan kiểu hơi nước của cách mạng công nghiệp lần thứ nhất, thứ hai và Progressive Era, chưa bị phủ bóng bởi cú sốc của "cuộc chiến chấm dứt mọi cuộc chiến"
Tôi vừa thử vào https://britannica11.org và tìm ngẫu nhiên Portuguese East Africa, kết quả hiện ra ngay và hiển thị rất tốt, ở https://britannica11.org/article/22-0177-portuguese-east-africa/portuguese_east_africa
Một mong muốn lịch sự là sẽ rất tuyệt nếu có tùy chọn xem song song giữa văn bản và ảnh trang gốc
Khi đó người đọc có thể tự kiểm tra độ trung thực của OCR đồng thời ngắm luôn chất lượng in ấn đẹp mắt, lại không cần mở cửa sổ mới cho từng trang
Cá nhân tôi muốn dùng site này làm điểm vào tài liệu, rồi đọc thiên về ảnh, và chỉ chuyển sang văn bản khi cần kiểm tra hoặc sao chép
Hiện tại tôi biết là có ảnh gốc, nhưng chúng chưa đủ nổi bật đến mức tôi phải vào tới lần thứ ba mới tìm thấy liên kết bên cạnh. Một phương án trung gian như thumbnail có thể chọn cũng có vẻ ổn
Trên hết là tốc độ rất nhanh
Và ở bản của OP cũng có vài vấn đề về độ trung thực. Trong https://britannica11.org/article/18-0684-s2/molecule, một phần công thức dưới "the molecules of other kinds" đã bị thiếu; có thể xác nhận bằng cách so sánh [1] https://britannica11.org/article/18-0684-s2/molecule#:~:text=the%20molecules%20of%20other%20kinds và [2] https://en.wikisource.org/wiki/Page:EB1911_-_Volume_18.djvu/688
Ngoài ra chú thích 1 trong bản của OP đang gắn vào "as they have always done", trong khi thực tế nó phải gắn với "Atom" ở p. 654. Có thể so sánh qua [3] https://britannica11.org/article/18-0684-s2/molecule#:~:text=as%20they%20have%20always%20done và [4] https://en.wikisource.org/wiki/Page:EB1911_-_Volume_18.djvu/684#cite_note-654f1-1
Vì các lý do bạn nói mà tôi cũng từng nghĩ xem văn bản và trang gốc cạnh nhau sẽ rất hay, nhưng vẫn chưa làm
Phản hồi rằng liên kết tới bản scan chưa đủ nổi bật cũng rất hữu ích, tôi thấy mình nên làm nó rõ ràng hơn
Nhân tiện, nếu bấm vào liên kết vol:page ở lề trái thì bạn sẽ đi thẳng tới bản scan của đúng trang đang đọc
Khi xem những bài như "Adolescence", tôi cảm thấy có thể bắt gặp những niềm tin mà ngày nay đọc lên khá sốc
Ví dụ, có đoạn nói rằng vào khoảng tuổi dậy thì thì nên giảm vận động và gánh nặng giáo dục trí tuệ cho các bé gái, thậm chí buộc phải nghỉ ngơi
Trên thực tế vẫn có rất nhiều người đang sống theo những khuôn mẫu tương tự, và phong trào nữ quyền cũng từng mạnh mẽ thúc đẩy điều ngược lại rồi về sau phần nào điều chỉnh sang nhấn mạnh cả quyền tự do lựa chọn không tham gia thị trường lao động
Sở thích với cái gọi là "soft life" không phụ thuộc thời đại, và tôi nghĩ nếu nam giới cũng có một lựa chọn văn hóa rộng mở là được người khác chu cấp kinh tế, thì tỷ lệ chọn những vai trò ít gánh nặng trí tuệ hơn và theo lộ trình dần dần cũng sẽ tăng lên đáng kể
Khi đó, sự mất cân bằng đại diện ở các lĩnh vực khác cũng có thể được giải tỏa phần nào không phải bằng cách ép đưa thêm phụ nữ vào mà bằng việc nam giới tự nguyện rút bớt ra, theo góc nhìn đó
Việc LLM sắp xếp lại những đoạn văn dày đặc kiểu tài liệu lịch sử bằng format hơi mạnh tay thực ra lại hữu ích ngoài mong đợi
Và nếu đưa thêm một prompt kiểu "Ngày nay văn bản này sẽ được tiếp nhận như thế nào?" thì nó cũng sẽ chỉ ra khá chi tiết những chỗ theo chuẩn hiện tại là không phù hợp hoặc khó chấp nhận
Tôi tò mò thông tin bên trong được cấu trúc ra sao. Gần đây tôi mới biết trong giới digital humanities người ta hay dùng kiểu đánh dấu ngữ nghĩa như XML-TEI cho những việc thế này
Tôi đã học BaseX và XQuery từ việc xem dữ liệu mã hóa từ điển Latin-English Lewis & Short bằng XML-TEI, rồi thấy rất vui khi có thể đặt những câu hỏi như "tác giả cổ điển nào dùng một từ chỉ xuất hiện đúng một lần trong toàn bộ corpus" hay "từ hapax dài nhất là gì"
Việc Tufts University công khai các dữ liệu như vậy cũng thật tuyệt
Tôi cảm thấy nếu đưa Britannica 1911 vào BaseX rồi đào bới đủ thứ bằng XQuery thì sẽ rất vui
Bản thân văn bản là public domain, nhưng tôi vẫn chưa công khai bản export cấu trúc hóa ở quy mô lớn
Tuy vậy, trong thread này cũng có khá nhiều yêu cầu xin truy cập dataset nên tôi đang nghiêm túc cân nhắc, và nếu công khai thì tôi muốn phát hành theo dạng giữ nguyên cấu trúc chứ không phải dump văn bản thuần
Tôi thấy thú vị ở chỗ văn phong và cấu trúc của nó khác khá nhiều so với văn bản hiện đại
Ví dụ xem mục Copenhagen https://britannica11.org/article/07-0111-copenhagen/copenhagen, bài viết mô tả chính xác địa lý và các điểm đáng chú ý chính, nhưng đồng thời các tác giả cũng không ngại đưa vào những tính từ giàu cảm xúc và ý kiến cá nhân về những thứ họ cho là thú vị hoặc kỳ lạ
Hơn nữa, đoạn Battle of Copenhagen ở phía dưới lại chuyển đột ngột từ mô tả địa lý sang tường thuật theo từng cảnh của một trận hải chiến, tạo cảm giác như chính thể loại văn bản đã đổi hẳn
Địa lý, lịch sử, thậm chí đôi khi là những quan điểm khá mạnh đều trộn lẫn vào một chỗ, và tôi lại thấy nhờ vậy mà đọc còn hay hơn
Tôi cũng có viết về điểm này trong bài giới thiệu của mình tại https://britannica11.org/about.html
Đoạn ca ngợi Les Misérables là "cuốn tiểu thuyết sử thi và kịch tính vĩ đại nhất từng được sáng tạo hay hình dung" chính là ví dụ như vậy
Tôi đã nghĩ từ lâu về chuyện liệu có kiếm được những bộ bách khoa tương đối gần đây như Encarta hay Britannica bản 2021 không
Ở cái ranh giới mơ hồ giữa thời kỳ trước LLM và sau COVID, tôi đã kỳ vọng đó sẽ giống như nguồn thông tin cuối cùng còn ít bị ô nhiễm bởi AI
Một trong những món đồ tôi quý nhất lúc nhỏ là bộ bách khoa CD-ROM, và vào những buổi chiều mưa khi Internet còn chưa phổ biến, cảm giác mở các mục mình thích ra để đọc và học thật sự rất tuyệt
Một trong những động lực của dự án này cũng là thử khơi lại cảm giác khám phá đó dựa trên nguyên tác năm 1911 và cấu trúc của nó
Nếu thích 1911 Encyclopedia Britannica thì có lẽ bạn cũng sẽ thấy https://OldEncyc.com thú vị
Ở đó có thể đào sâu các bộ bách khoa cũ từ 1728 đến 1926, qua 22 lần xuất bản, theo từng tập và dải chữ cái. Nó không thiên về tìm kiếm như site của OP nhưng độ bao phủ tư liệu rất rộng
Một báo lỗi rất nhỏ thôi, nhưng font hiện đang chọn không hỗ trợ ký tự ℔ nên các bài như https://britannica11.org/article/22-0688-s2/putting_the_shot trông khá kỳ
Cũng có thể cân nhắc chuẩn hóa nó thành lb, cách viết quen thuộc hơn hiện nay
Trông thì nhỏ nhưng dự án này thực ra đầy rẫy những trường hợp kiểu đó
Đúng là thế giới nhỏ. Hiện giờ tôi đang dọn lại bản scan của EB 9th edition để đưa lên một site MediaWiki, và vì còn cả minh họa lẫn bản khắc nên tôi mới chỉ đi được khoảng một phần ba
Tôi đã thử nhiều công cụ OCR khác nhau, và đến nay paddleOCR là thứ gây ấn tượng nhất. Nó làm khá tốt việc tách cột văn bản, gắn nhãn minh họa và nhận diện văn bản ở lề
Tất nhiên nó chưa hoàn hảo nên tôi vẫn đang sửa tay một số bảng, và cũng định đưa lên cả các trang nguồn để có thể xem qua lại giữa trang scan gốc và văn bản điện tử
Theo cách này, những thứ khác cũng sẽ rất thú vị nếu được đưa lên mạng với hyperlink và chỉ mục, như atlas địa lý, atlas y học hay cẩm nang du lịch Baedeker
Tôi nghĩ ngay đến những mục về chim đồ sộ của Alfred Newton hay vài bài tiểu luận kinh điển của Macaulay
Tôi thấy có những đoạn giờ đọc lại khá vừa buồn cười vừa kỳ lạ. Ví dụ trong mục stars https://britannica11.org/article/25-0806-star/star#section-10, có đoạn nói rằng nếu các ngôi sao phân bố vô hạn và đồng đều trong không gian vũ trụ, lại không có hấp thụ ánh sáng, thì nền trời lẽ ra phải sáng rực
Kết quả là https://britannica11.org/article/28-0872-wright-chauncey/wright__chauncey?q=computer&match=1, và điều đó khiến tôi thấy thời đại đã khác thật rồi
Thay vào đó, họ cho rằng một kiểu tái sắp xếp nào đó trong cấu trúc nguyên tử của các nguyên tố là lời giải thích có vẻ hợp lý nhất, và mô tả việc tinh vân ngưng tụ thành Mặt Trời, trong quá trình vật chất phát triển thành các nguyên tố đã biết thì giải phóng năng lượng
Xét theo mức độ tri thức thời đó, tôi thấy đây là một phỏng đoán gần đúng đáng ngạc nhiên