1 điểm bởi GN⁺ 2023-10-13 | 1 bình luận | Chia sẻ qua WhatsApp
  • Cuộn giấy Herculaneum bị than hóa trong vụ phun trào núi lửa Vesuvius năm 79 mỏng manh đến mức có thể vỡ vụn nếu mở ra, nhưng đã được xác nhận là có thể đọc chữ bên trong bằng chụp CT và machine learning
  • Thí sinh Vesuvius Challenge Luke Farritor đã tìm thấy một từ hoàn chỉnh bên trong cuộn giấy chưa mở và nhận giải $40,000 First Letters Prize
  • Từ được phát hiện là chữ cổ ΠΟΡΦΥΡΑϹ, cách ghi hiện đại là “porphyras”, có nghĩa là “màu tím”, nhưng ngữ cảnh và ranh giới từ vẫn còn khó xác định
  • Việc Casey Handmer phát hiện crackle pattern đã dẫn tới cải tiến mô hình của Luke và Youssef Nader, và Youssef nhận giải nhì $10,000 nhờ kết quả độc lập rõ nét hơn ở cùng khu vực
  • Cuộc thi công khai, công cụ mã nguồn mở và công việc segmentation kết hợp với nhau, đưa mục tiêu giành $700,000 Grand Prize đến gần hơn như một đích đến thực tế

Từ đầu tiên xuất hiện từ một cuộn giấy không thể mở trong 2.000 năm

  • Papyrus Herculaneum là những cuộn giấy cổ từng nằm trong thư viện của một biệt thự tư nhân gần Pompeii, bị chôn vùi và than hóa trong vụ phun trào núi lửa Vesuvius năm 79 sau Công nguyên
  • Thư viện này là thư viện duy nhất từ thời cổ đại còn tồn tại đến nay, và đã bị chôn dưới 20m bùn núi lửa suốt khoảng 2.000 năm
  • Dù được khai quật từ thế kỷ 18, các cuộn giấy quá mong manh, chỉ cần xử lý sai là có thể thành bột, nên rất khó mở ra để đọc theo cách vật lý
  • Luke Farritor trở thành người đầu tiên nhìn thấy một từ hoàn chỉnh bên trong cuộn giấy chưa mở vào tháng 8/2023 và nhận giải $40,000 First Letters Prize
    • Để nhận giải này, cần tìm được ít nhất 10 ký tự trong một vùng 4cm² của cuộn giấy
  • Youssef Nader cũng độc lập phát hiện cùng từ đó trong chính khu vực ấy và nhận giải nhì $10,000 nhờ kết quả rõ hơn
  • Mã nguồn đã được công khai trên GitHub của LukeYoussef

Chụp CT, dữ liệu ground truth và điểm khởi đầu của Vesuvius Challenge

  • Năm 2019, giáo sư Brent Seales của EduceLab thuộc University of Kentucky đã chụp các cuộn giấy Herculaneum bằng máy gia tốc hạt để tạo ra ảnh CT 3D có độ phân giải tối đa 4µm
  • Nhóm nghiên cứu cũng quét và chụp ảnh các mảnh tách rời còn lưu lại mực có thể nhìn thấy, từ đó xây dựng bộ dữ liệu ground truth
  • Stephen Parsons đã dùng machine learning để phát hiện mực trong ảnh CT của các mảnh tách rời và đạt kết quả trên các mảnh này
  • Nat Friedman và Daniel Gross đã khởi động Vesuvius Challenge để tăng tốc tiến triển đó
    • Tháng 3/2023, họ mở cuộc thi công khai
    • Bên cạnh giải lớn $700,000 Grand Prize, họ còn đưa ra nhiều giải nhỏ để phát triển công cụ và kỹ thuật mã nguồn mở
  • Từ đầu mùa hè, đội segmentation tham gia để lập bản đồ cấu trúc 3D của cuộn giấy, và đến tháng 7 đã segment được hàng trăm cm² papyrus để mở ra theo cách ảo

Tín hiệu mực mà Casey Handmer tìm thấy

  • Đầu tháng 8/2023, Casey Handmer sau khi quan sát các segment CT trong thời gian dài đã phát hiện crackle pattern trông giống mực
  • Trước đó Stephen Parsons từng thấy bằng chứng trực tiếp của mực trên các mảnh tách rời, nhưng bên trong cuộn giấy chưa mở thì vẫn chưa được xác nhận
  • Casey trở thành người đầu tiên sau 2.000 năm tìm thấy mực và chữ viết bên trong cuộn giấy chưa mở
  • Phát hiện này trở thành điểm xuất phát trực tiếp cho cả mô hình của Luke lẫn cách tiếp cận của Youssef, và Casey nhận $10,000 First Ink Prize

Mô hình của Luke Farritor và “porphyras”

  • Luke Farritor là sinh viên đại học và thực tập sinh mùa hè tại SpaceX Starbase, biết đến Vesuvius Challenge qua cuộc phỏng vấn Nat Friedman của Dwarkesh Patel
  • Sau khi thấy thảo luận về crackle pattern của Casey trên Discord, anh đã dùng các buổi tối và ban đêm để huấn luyện một mô hình machine learning học mẫu này
  • Mỗi khi phát hiện crackle mới, mô hình lại được cải thiện, và mô hình được cải thiện tiếp tục làm lộ ra thêm nhiều crackle hơn, tạo thành một chu kỳ lặp
  • Mô hình đã tìm được vài chục nét mực và một số ký tự hoàn chỉnh, rồi chúng được dùng làm dữ liệu nhãn để huấn luyện
  • Theo thời gian, mô hình còn làm lộ ra cả những dấu vết crackle mà mắt người không thể thấy, và các dấu vết này trở thành manh mối về ký tự và từ
  • Trong bài nộp đầu tiên của Luke, ΠΟΡΦΥΡΑϹ, tức “porphyras”, hiện ra một cách mờ nhạt
  • Khi giáo sư Brent Seales cho các papyrologist xem hình ảnh này, họ lập tức đọc ra “porphyras” dù các ký tự rất mờ
  • Sau khi rà soát kỹ thuật, các hình ảnh mới được gửi tới một hội đồng papyrologist, và họ đã độc lập, nhất trí chú giải 13 ký tự
    • Mức độ tin cậy được chia thành trên 80%, 50~80%, và dưới 50%
  • “porphyras” có nghĩa là “màu tím” và là một từ rất hiếm trong văn liệu cổ
  • Một papyrologist cho rằng do thiếu ngữ cảnh, chưa thể loại trừ khả năng đó là danh từ “thuốc nhuộm tím hoặc vải tím”, tính từ “màu tím”, hoặc thuộc về một ranh giới từ khác
  • Văn bản thời đó không dùng khoảng trắng, nên việc xác định ranh giới từ càng khó hơn

Cách tiếp cận độc lập của Youssef Nader

  • Youssef Nader là nghiên cứu sinh cao học ngành biorobotics người Ai Cập tại Berlin, được truyền cảm hứng từ kết quả của Casey và Luke để thử một phương pháp khác
  • Trước tiên anh xem lại các bài thắng cuộc của Kaggle Ink Detection prize
    • Cuộc thi này tập trung vào việc cải thiện cách tiếp cận machine learning dựa trên các mảnh tách rời của Stephen Parsons
  • Youssef chuyển mô hình sang phù hợp với dữ liệu cuộn giấy bằng pretraining không giám sát trên dữ liệu cuộn giấy và fine-tuning bằng nhãn từ các mảnh
  • Sau khi nhận một giải nhỏ với ý tưởng “Ink Detection Followup Prize”, anh tập trung vào cùng khu vực khi kết quả ban đầu của Luke được chia sẻ trên X và Discord
  • Với mô hình biến thể từ cuộc thi Kaggle, anh tìm được một số ký tự và không dò crackle thủ công như cách của Casey
  • Anh chú giải những hình dạng trông giống ký tự làm dữ liệu nhãn, rồi mở rộng chúng bằng pseudo-labeling lặp lại
  • Mô hình cuối cùng được huấn luyện chỉ bằng các segment bên trong cuộn giấy, và kết quả này giúp anh giành giải nhì First Letters Prize
  • Các papyrologist đồng thuận mạnh hơn về các ký tự trong kết quả của Youssef, đồng thời còn xem xét khả năng có từ “ανυοντα / ANYONTA” ở phía trên và “ομοιων / OMOIωN” ở phía dưới
  • Nếu các từ này là đúng, cuộn papyrus đó có thể đang chứa một văn bản hoàn toàn mới chưa từng được thế giới hiện đại biết đến

Mối liên kết được tạo ra bởi cuộc thi công khai và mã nguồn mở

  • Khi đóng góp của nhiều người nối trực tiếp với nhau trên con đường đi đến phát hiện, đây trở thành một ví dụ cho thấy competition + open source cùng cấu trúc giải thưởng theo từng bước thực sự có hiệu quả
  • Youssef đã tận dụng mô hình từ cuộc thi Kaggle và nhìn vào cùng khu vực nhờ cảm hứng từ kết quả của Luke
  • Việc Luke tìm crackle bắt đầu trực tiếp từ công trình của Casey
  • Casey có thể xem xét nhiều tờ papyrus nhờ đội segmentation đã lập bản đồ sẵn hàng trăm cm²
  • Đội segmentation có thể lập bản đồ trên diện rộng nhờ các công cụ do thí sinh của Segmentation Tooling Prizes phát triển
    • Bao gồm công việc của nhiều thí sinh như Julian Schilliger, Chuck, Yao Hsiao
  • Các cải tiến công cụ này được xây dựng trên bộ công cụ mã nguồn mở sẵn có của nhóm Brent Seales
    • Nền tảng này dựa trên công việc của nhiều người như Seth Parker, Stephen Parsons
  • Nhìn vào tiến trình cho tới nay, gần như mọi yếu tố trong cách tổ chức cuộc thi đều đóng vai trò load-bearing, và tiến triển có thể mong manh và phụ thuộc vào may mắn hơn những gì nhìn lại sau này gợi ra

Bước tiếp theo hướng tới $700,000 Grand Prize

  • Đội segmentation và các thí sinh vẫn đang tiếp tục tiến bộ, và chỉ vài ngày trước mô hình của Youssef đã tạo ra một hình ảnh mới lớn hơn, rõ hơn
  • Trong hình ảnh mới, có thể thấy rõ 4.5 cột văn bản được phân tách bằng lề trắng
  • Nhiều ký tự hơn đã hiện ra, nhưng không phải tất cả đều có thể được đọc ngay, và đội papyrus vẫn đang điều tra thêm
  • Vesuvius Challenge cho rằng tiến triển lần này đã biến $700,000 Grand Prize thành một mục tiêu có thể đạt được
  • Người tham gia có thể gia nhập qua cộng đồng Discord, bản tin Substack và tài khoản X, rồi bắt đầu bằng cách xem dữ liệu, tutorial, công trình của người đoạt giải và các công cụ cộng đồng
  • Mục tiêu là mở khóa tri thức bên trong hàng trăm cuộn giấy, nhân đôi lượng văn liệu cổ đại, và mở ra khả năng đọc được cả hàng nghìn cuộn giấy vẫn chưa được khai quật

1 bình luận

 
GN⁺ 2023-10-13
Ý kiến trên Hacker News
  • Chữ được phát hiện khi họ chú thích dữ liệu huấn luyện bằng cách tìm kết cấu vết nứt trông giống hình dạng chữ cái Hy Lạp trong các mảnh giấy cói từ ảnh chụp CT
    Tuy nhiên, loại kết cấu vết nứt đó ở phần lớn giấy cói không thể nhìn thấy bằng mắt thường, có lẽ chỉ hiện ra như vậy ở những chỗ mực bám rất dày
    Trong ảnh kính hiển vi điện tử https://scrollprize.org/img/tutorials/sem.png, sự khác biệt về kết cấu hiện rõ hơn nhiều, đặc biệt nổi bật ở mép nơi mực bị đẩy ra
    Thật đáng ngạc nhiên là các vết nứt chỉ được phát hiện sau cuộc thi phát hiện mực trên Kaggle. Casey Handmer cũng viết tại https://caseyhandmer.wordpress.com/2023/08/05/reading-ancien... rằng ông đã tìm các kết cấu “bùn nứt” và “vảy mỏng” tương ứng với mực của các chữ đã biết, nhưng chỉ chiếm khoảng 10% trong số các chữ đã biết
    Ảnh mới tốt hơn kỳ vọng rất nhiều, nhưng hiện vẫn chỉ là một vùng nhỏ, nên tôi vẫn bi quan về việc liệu có thể đọc được hơn vài câu kỳ lạ hay không

    • Khi tham gia thử thách một thời gian ngắn, tôi đã dùng cách tiếp cận tương tự, nhưng thay vì tìm chính các vết nứt, tôi giả định hiệu ứng “nứt” đó là các lát dữ liệu đi qua nhiều khe trong tấm da, còn dữ liệu mực nằm trên đa tạp bị uốn cong và nứt vỡ đó
      Không phải chữ nào cũng sẽ hiện rõ với mắt người; trong ảnh quét có rất nhiều lớp, nên tôi nghĩ phải lật qua các ảnh một thời gian thì mẫu hình mới bắt đầu xuất hiện
      Tôi đã viết mã để “căn chỉnh” các khối ảnh bằng cách nội suy song tuyến tính từng cột pixel lên xuống và làm phẳng kết cấu vết nứt, nếu nhớ đúng là nhằm tối thiểu hóa tổn thất phương sai tổng thể
      Sau đó tôi định dùng mạng nơ-ron tích chập 2D được tối ưu cho ảnh đã “làm phẳng”; nhìn mặt cắt cuộn giấy, có những vùng bị ép cục bộ khá nhất quán như gỗ, nên tôi nghĩ nội suy có thể là đủ
      Vì vậy tôi không mấy đồng tình với việc dùng tích chập 3D cho vấn đề này. Mực được bôi rồi khô sẽ tuân theo một mẫu hình có thể dự đoán một phần và phát hiện được bằng tích chập 2D, còn các bất biến mong muốn có thể được cấu trúc trước dễ hơn
      Nếu ai quan tâm đến mã, tôi có thể tìm lại và chia sẻ
  • Thông báo của Nat trên Twitter cũng đáng xem: https://twitter.com/natfriedman/status/1712470683207532906
    700.000 USD là số tiền có thể thay đổi cuộc đời, nên rất dễ bị cám dỗ bỏ hết mọi thứ để dấn thân như một tu sĩ theo đuổi khai sáng cổ đại bằng machine learning hiện đại
    Cũng buồn cười ở chỗ cuộn giấy có thể chỉ là danh sách đồ giặt

    • Nếu phương pháp này có thể mở rộng, về sau sẽ có hơn 600 cuộn giấy có thể đọc được
      Hơn nữa, “việc khai quật chưa hoàn tất, và nhiều nhà sử học tin rằng còn hàng nghìn cuộn giấy nữa nằm dưới lòng đất”: https://scrollprize.org
    • Hoặc có thể là khiếu nại của khách hàng: https://www.thearchaeologist.org/blog/complaint-tablet-to-ea...
    • Có lẽ khả năng cao là không phải danh sách đồ giặt. Có vẻ họ bắt đầu từ những cuộn giấy mà mặt ngoài còn đọc được, và chúng được biết là các tác phẩm nhỏ về triết học Khắc kỷ Hy Lạp
      Nếu là danh sách đồ giặt thì người ta hẳn đã viết trên bảng sáp có thể tái sử dụng, chứ không phải giấy cói đắt tiền
    • Có lẽ có khả năng là nhắc đến hoàng đế. Vải màu tím cực kỳ hiếm và đắt, là màu các hoàng đế mặc
      Về sau, người ngoài hoàng tộc mặc màu tím thậm chí trở thành tội bị xử tử; tôi không biết vào thời điểm núi Vesuvius phun trào đã như vậy chưa, nhưng Wikipedia nói Caligula có thể đã giết ai đó vì người đó mặc màu tím
    • Có lẽ khoảng một nửa trong 700.000 USD sẽ đi vào tiền thuế
  • Tôi rất khuyến khích thử nhập môn văn học cổ điển. Nó thực sự đáng kinh ngạc và vượt xa tưởng tượng; tôi từng tiếp xúc một chút trong chương trình học, nhưng mãi gần đây mới nhận ra nó tuyệt vời đến mức nào
    Với người mới bắt đầu, tôi khuyên đọc Life of Pythagoras của Iamblichus, The Golden Ass của Apuleius of Numenia (bản dịch Robert Graves), Life of Alexander của Plutarch, Education of Cyrus của Xenophon, và Parmenides của Plato
    SHWEP.net cũng rất hữu ích vì dẫn dắt qua nhiều tác phẩm cổ điển một cách nhẹ nhàng nhưng nghiêm cẩn, và có thiên hướng khá huyền học, điểm đó tôi cũng thích

    • Mong bạn giải thích thêm một chút vì sao bạn thấy nó đáng kinh ngạc và vượt xa tưởng tượng như vậy
      Tôi đã vài lần thử đọc văn học cổ điển nhưng luôn thấy khó đọc nên không có nhiều động lực đọc đến cuối, và tôi tò mò không biết mình có đang bỏ lỡ điều gì ở thể loại này không
    • Life of Pythagoras đã ảnh hưởng lớn đến đời tôi. Tôi được truyền cảm hứng rất nhiều từ cách Pythagoras dốc 100% cho việc tìm kiếm chân lý, khiêm nhường đi khắp thế giới để thu thập tri thức, thực hành và kỹ năng, thử rất nhiều điều rồi dành phần lớn cuộc đời cho việc giảng dạy
      Pythagoras có lẽ là triết gia vĩ đại nhất trong lịch sử. Tôi cũng khuyên đọc Archytas, người kế thừa tinh thần của ông; các suy nghĩ của ông ấy về toán học, cơ học, âm nhạc, học tập và triết học thật đáng kinh ngạc
    • Tôi không khuyên dùng Parmenides làm tác phẩm nhập môn Plato. Đây thuộc nhóm khó nhất trong các đối thoại của ông
      Nếu chọn tác phẩm nhập môn Plato tốt nhất, tôi muốn đề xuất Alcibiades. Nó đủ nhẹ để đọc thú vị, nhưng đồng thời sâu sắc và thâm thúy: https://www.gutenberg.org/ebooks/1676
    • Quy mô kho ngữ liệu giờ có thể sẽ bùng nổ. Theo bài viết, nếu những từ này thực sự là những gì chúng ta nghĩ, thì cuộn giấy cói này có khả năng chứa văn bản hoàn toàn mới mà thế giới hiện đại chưa từng thấy
    • Tôi tự hỏi có bản tiếng Đức của Life of Pythagoras không. Không rõ vì sao nhưng tôi không tìm được, chỉ thấy trên Amazon có một cuốn với một đánh giá nói rằng có vẻ là dịch máy
  • Gần đây tôi xem một video YouTube rất hay về chủ đề này: https://www.youtube.com/watch?v=Z_L1oN8y7Bs
    Tiêu đề là “Herculaneum scrolls: A 20-year journey to read the unreadable”, và video có nói qua về công nghệ đã làm nên việc này
    Các bản quét đã có từ 10 năm trước, nhưng để phân biệt giấy với mực trên đó thì cần huấn luyện học máy; còn 20 năm trước, việc này đã làm được với một nhóm cuộn khác làm từ vật liệu có độ tương phản lớn hơn
    Deep learning đang giải mã những dataset mà trước đây người ta cho là thuật toán không thể giải được

    • Cách giải thích đó khá dễ gây hiểu lầm. Bước đột phá thực sự là tìm mẫu bằng kiểm tra trực quan, rồi dùng chúng làm dữ liệu huấn luyện tốt hơn
      Cho đến giờ có vẻ họ cũng chưa tìm được nhiều chữ quá khó để nhìn bằng mắt
      Đọc trong bài gốc về quy trình lặp lại giữa việc chú thích thủ công theo gợi ý từ đầu ra của mô hình và huấn luyện lại mô hình bằng dữ liệu bổ sung thì rất thú vị
      Nếu ngay từ đầu chỉ chạy deep learning với dữ liệu nhãn đúng sẵn có và không biết mô hình nên nhìn vào đặc trưng nào, thì thực tế gần như không hoạt động
      Hơn nữa, quá trình trải cuộn ảo hiện nay cũng phần lớn là thủ công và rất tốn công
    • Điều này rất dễ gây hiểu nhầm. Thứ thực sự tạo ra phát hiện không phải deep learning mà là tìm kiếm thủ công
      Hiện họ đang cố để mô hình deep learning làm những việc con người đã làm ở đây, nhưng vẫn chưa thành công trong việc thực sự tìm ra chữ
  • Việc này giống như được trải nghiệm mở lăng mộ Tutankhamun trong thế kỷ 21
    Thật đáng kinh ngạc đến mức khó tin rằng trong tương lai trung hạn, rất có thể ta sẽ mua được trên Amazon những tác phẩm dịch mới mà không ai đọc được suốt hàng nghìn năm

  • Thật tuyệt. Tôi tò mò không biết chúng ta sẽ học được gì từ đây
    Nhân tiện, bức ảnh “Professor Seales và đội ngũ đang quét trong máy gia tốc hạt” trông như một cảnh trong phim truyền hình. Cảm giác kiểu “cứ nói ‘enhance’ với máy tính là sẽ đọc được thôi”

  • Có thể xếp đây vào một trong những ví dụ khôi phục dữ liệu cực đoan nhất mà tôi từng thấy
    Không biết 2000 năm nữa liệu có chuyện như “tệp đầu tiên được tìm thấy trên đĩa cứng bị vứt bỏ” không

  • 30 phút đầu của cuộc phỏng vấn này giải thích rất rõ điều đang diễn ra. Thực sự thú vị
    https://youtu.be/qcvMjoJdck4?si=RL1WnAAj4loS1D2s

  • Cụm từ “ex-JPL startup founder and polymath” thật thú vị
    Tôi chưa từng được khen như vậy vì là một người đa tài; những gì tôi nhận được là “generalist” và “sau khi cân nhắc kỹ, chúng tôi quyết định không tiếp tục quy trình ứng tuyển của bạn”

    • Có vẻ những nhà bác học thực thụ thường tránh bị gọi như vậy
      Ngay cả khi họ quyết tâm được công nhận, tôi từng thấy họ bị gạt ra vì tội không thể tha thứ là “chưa đủ nổi tiếng”
  • https://scrollprize.org/ giải thích thử thách ban đầu
    Các nghiên cứu khác đã cho thấy có thể trải cuộn ảo dựa trên bản quét CT, nhưng với những cuộn này, mực không hiện rõ trên CT/tia X nên họ phải quay sang các thay đổi cấu trúc tinh vi hơn
    Không rõ là cấu trúc giấy đã thay đổi, hay mực thật sự vẫn thấy được nhưng kém rõ hơn