1 điểm bởi GN⁺ 2024-10-15 | 2 bình luận | Chia sẻ qua WhatsApp
  • Tư liệu tiếng Tây Tạng không phù hợp với giả định về các đoạn văn ngắn của trình xử lý văn bản thông thường, nên từ lâu đã gặp những hạn chế thực tế trong các công cụ biên tập và xuất bản số
  • BDRC đã thúc đẩy các cải tiến kỹ thuật để tiếng Tây Tạng được xử lý đúng cách trong môi trường số, và lần này hỗ trợ các đoạn văn rất dài của LibreOffice là một bước tiến then chốt
  • Luồng văn bản dài không có ngắt dòng cưỡng bức và ít khoảng trắng khác với cách xử lý tài liệu tiếng Anh, nên dễ phát sinh vấn đề hiệu năng khi mở hoặc chuyển đổi các tư liệu tiếng Tây Tạng dài
  • Nhờ bản sửa của Jonathan Clark, ngay cả một văn bản “một đoạn” dài 153 trang như Yishindzö của Longchenpa cũng có thể được mở và chỉnh sửa nhanh chóng; tác vụ chuyển đổi RDF sang PDF từng đứng hơn 45 phút nay hoàn tất trong 13 giây
  • Hỗ trợ các đoạn văn rất dài đã được tích hợp vào LibreOffice 24.8.2, phát hành ngày 27/9/2024, giúp người dùng tiếng Tây Tạng có thể tận dụng công cụ xuất bản mã nguồn mở miễn phí một cách thực tế hơn

Vì sao hỗ trợ số cho tiếng Tây Tạng lại quan trọng

  • Một trong những nhiệm vụ quan trọng của BDRC là đổi mới công nghệ để đưa tiếng Tây Tạng trở thành công dân hạng nhất trong thế giới số
  • Kể từ khi Phật giáo du nhập vào thế kỷ 8, người Tây Tạng đã đầu tư rất nhiều năng lượng và nguồn lực vào chữ viết, đổi mới và công nghệ
    • Chữ viết Tây Tạng và ngôn ngữ cổ điển được tạo ra để dịch các kinh văn Phật giáo tiếng Phạn và tiếng Trung sang một ngôn ngữ mà người Tây Tạng có thể hiểu được
    • Vào thế kỷ 14, in mộc bản được áp dụng rộng rãi để sản xuất hàng loạt các bản dịch kinh điển và hàng nghìn tập tư liệu Phật giáo tiếng Tây Tạng của các tác giả vùng Himalaya
    • Sự xuất hiện của phông chữ máy tính tiếng Tây Tạng và việc được đưa vào Unicode Standard là một bước nhảy vọt lớn trong quá trình tiếng Tây Tạng hòa nhập vào thế giới số

Cấu trúc tư liệu tiếng Tây Tạng không phù hợp với trình xử lý văn bản thông thường

  • Tư liệu tiếng Tây Tạng có những đặc tính mà chưa phải mọi công cụ và ứng dụng đều hỗ trợ đầy đủ
  • Đặc biệt, khái niệm đoạn văn theo kiểu các ngôn ngữ châu Âu không áp dụng theo cùng một cách
    • Văn bản tiếng Tây Tạng thường cần được xử lý như một luồng dài liên tục không có ngắt dòng cưỡng bức
    • Luồng này đôi khi có thể kéo dài hàng trăm hoặc hàng nghìn trang
  • Các trình xử lý văn bản thông thường vốn được thiết kế với văn bản tiếng Anh trong đầu
    • Chúng giả định các đoạn văn tương đối ngắn
    • Chúng giả định có khoảng trắng giữa các từ và độ rộng của các khoảng trắng đó có thể được điều chỉnh linh hoạt
  • Tư liệu tiếng Tây Tạng có độ dài đoạn văn gần như không giới hạn và rất ít khoảng trắng, nên xung đột với những giả định này
  • Kết quả là khi mở văn bản tiếng Tây Tạng dài, trình xử lý văn bản có thể trở nên rất chậm hoặc hoàn toàn không hoạt động, khiến chúng khó dùng cho các dự án xuất bản nghiêm túc

Bản sửa của LibreOffice và thay đổi hiệu năng thực tế

  • LibreOffice là một trong những trình xử lý văn bản mã nguồn mở trưởng thành và ổn định, lấy cảm hứng từ MS Word, và có thể dùng miễn phí trên nhiều nền tảng, bao gồm Linux
  • Phần mềm thương mại như Word hay InDesign có thể xử lý văn bản tiếng Tây Tạng dài, nhưng chi phí cao và ở nhiều khu vực châu Á chúng thường được dùng dưới dạng bản sao lậu
  • Trong thời gian LibreOffice chưa xử lý được các đoạn văn dài, gần như không có công cụ miễn phí thực sự nào cho xuất bản tiếng Tây Tạng
  • CTO của BDRC, Elie Roux, đã báo cáo vấn đề này cho LibreOffice vào năm 2015
    • Việc can thiệp vào mã của LibreOffice là một dự án lớn, cần nhiều tuần nghiên cứu và phát triển, nên trong một thời gian không có tiến triển
  • Vài tuần trước, Jonathan Clark đã tiếp nhận và sửa vấn đề này
    • Yishindzö của Longchenpa là một văn bản dài gồm một “đoạn” 153 trang
    • Giờ đây có thể mở và chỉnh sửa nhanh chóng trong LibreOffice
    • Văn bản này có thể xem tại yid bzhin mdzod trong kho lưu trữ BDRC
  • Tác vụ chuyển đổi tệp RDF của văn bản cụ thể này sang PDF trước đây vẫn bị treo sau 45 phút, nhưng nay hoàn tất trong 13 giây
  • Hỗ trợ các đoạn văn rất dài đã được tích hợp vào LibreOffice 24.8.2, phát hành ngày 27/9/2024
  • BDRC kêu gọi phản hồi về những thiếu sót và trải nghiệm sử dụng trong phần mềm biên tập tiếng Tây Tạng, đồng thời muốn tiếp tục cải thiện các công cụ số cho tiếng Tây Tạng thông qua hợp tác cộng đồng

2 bình luận

 
GN⁺ 2024-10-15
Ý kiến trên Hacker News
  • Jim Woolsey, một hippie và hacker máy tính thời kỳ đầu đến từ New Hope, Pennsylvania, là một trong những nhân vật quan trọng ban đầu trong việc số hóa tiếng Tây Tạng
    Cuộc phỏng vấn năm 1993 https://www.mcall.com/1993/10/08/new-hope-man-computer-guru-... là một time capsule thú vị, và bản thân nó cũng đáng đọc
    Ông là người quen của gia đình tôi, và tôi luôn ngưỡng mộ sự tận tâm độc nhất của ông đối với công việc quan trọng nhưng bị đánh giá thấp này

    • Tiếc là liên kết đó chỉ hiển thị “This content is not available in your region
  • Có lẽ cũng nên đưa “tài liệu có các đoạn văn ngắn vừa phải” vào danh sách những giả định sai mà lập trình viên tin về văn bản

    • Ở một số nước, văn bản pháp luật không được có ngắt đoạn, nên có thể xuất hiện một tài liệu với một đoạn văn kéo dài hàng trăm trang
      OpenOffice từng có giới hạn cứng 65534 ký tự cho mỗi đoạn, và LibreOffice đã phải tốn khá nhiều công sức để loại bỏ giới hạn này: https://bugs.documentfoundation.org/show_bug.cgi?id=30668
    • Tôi chưa từng nghĩ đến yếu tố này trong cấu trúc giữa các ngôn ngữ
      Hướng văn bản, dấu phụ, dấu câu thì tất nhiên là tôi có nghĩ đến, nhưng tôi cứ tưởng việc chia khối là phổ quát
      Nhưng hóa ra không phải: “Khái niệm dàn trang về đoạn văn trong các ngôn ngữ châu Âu trên thực tế không tồn tại theo cùng cách trong văn bản tiếng Tây Tạng. Kết quả là văn bản tiếng Tây Tạng thường phải được xử lý như một luồng văn bản dài không bị ngắt, không có ngắt dòng bắt buộc, đôi khi dài tới hàng trăm hoặc hàng nghìn trang”
    • Chắc hẳn có lập trình viên nào đó ở đâu đó đã tạo một buffer 4096 ký tự rồi tìm ký tự '\n' tiếp theo, và bị tiếng Tây Tạng đánh bại
  • Nói với tất cả sự tôn trọng, tính đổi mới của người Tây Tạng cũng được ghi nhận trong The Nine Billion Names of God: https://en.wikipedia.org/wiki/The_Nine_Billion_Names_of_God

    • Unsong cũng lấy cảm hứng từ đây: https://unsongbook.com/
    • Tôi không biết trong sách diễn đạt thế nào, nhưng Phật giáo Tây Tạng không có thần
      Và sự đổi mới của họ rộng hơn nhiều so với cuốn sách này, hay ít nhất là so với phần tóm tắt cốt truyện trên Wikipedia
  • Tôi thích cách diễn đạt kiểu “các đoạn văn tương đối ngắn, có lẽ tối đa vài trang”, vì nó cho thấy tôi đang nhìn thế giới từ một góc nhìn cụ thể đến mức nào
    Tôi nghĩ mình còn chưa từng viết một đoạn văn dài một trang
    Ví dụ gần nhất tôi nghĩ đến là một tác giả nào đó, tôi quên tên, đã viết vài trang theo kiểu dòng ý thức mà không có đoạn văn và dấu câu

    • Các nhà văn hiện đại chủ nghĩa và hậu hiện đại chủ nghĩa nổi tiếng với kiểu này
      Ví dụ có James JoyceDavid Foster Wallace
  • Công việc này đã diễn ra từ khá lâu rồi
    Có cả một HyperCard stack cũ dạy phát âm tiếng Tây Tạng, kèm cả âm thanh 16-bit: https://hcsimulator.com/Learn-Tibetan

    • Chỉ có một nguyên âm AH thôi à?
  • Nhiều lối viết dòng ý thức hoặc các văn phong liên quan cũng tránh dùng đoạn văn, đôi khi còn tránh cả những cấu trúc truyền thống khác, nên việc trình xử lý văn bản gặp khó với đoạn văn dài khiến tôi hơi ngạc nhiên
    Dù không quá phổ biến, chuyện đó không phải là không tồn tại, và tôi tưởng các tác giả cùng nhà xuất bản bằng cách nào đó vẫn xử lý được
    Một ví dụ ngẫu nhiên gần đây: https://en.wikipedia.org/wiki/Ducks,_Newburyport

    • Theo tôi hiểu thì cũng không có khoảng trắng
  • Tôi tò mò chi tiết về việc hỗ trợ các đoạn văn siêu dài, hoặc cách họ giải quyết khi thiếu hỗ trợ đó
    Có ai biết không?

    • https://gerrit.libreoffice.org/c/core/+/172801
      Đây là một thay đổi khá ngắn, dùng cache để giảm tác động O(n^2)
      Thay đổi này bao gồm cải thiện khả năng mở rộng cho các tài liệu có đoạn văn cực lớn
      Bằng cách giảm kích thước layout context để xét đến ký tự điều khiển LF, và do mẫu truy cập điển hình trong quá trình bố trí đoạn văn khiến VCL gọi vcl::ScriptRun::next() theo O(n^2), nó chuyển sang dùng cache LRU toàn cục hiện có để tránh overhead đáng kể
  • Tôi nghe nói Bengali và Assamese dùng chữ Tây Tạng, có ai biết chúng giống chữ mà người Tây Tạng dùng cho ngôn ngữ của họ đến mức nào không?

    • Chữ Bengali/Assamese và chữ Tây Tạng đều phát triển từ chữ Gupta, nhưng các ngôn ngữ thực tế thì rất khác nhau
      Bengali và Assamese thuộc ngữ hệ Indo-Aryan, còn tiếng Tây Tạng thuộc ngữ hệ Sino-Tibetan, một ngữ hệ hoàn toàn khác
      Là người nói tiếng Bengali, khi tôi đến Bhutan, nơi dùng một ngôn ngữ được cho là có khả năng hiểu lẫn nhau 50% với tiếng Tây Tạng, tôi chẳng hiểu gì cả
      Tôi từng nghĩ chắc sẽ có khá nhiều từ vay mượn từ Phật giáo, nhưng ngạc nhiên là ngay cả những từ như dharma, karma trong tiếng Tây Tạng cũng nghe hoàn toàn khác
    • Liên kết tham khảo: https://en.wikipedia.org/wiki/Bengali%E2%80%93Assamese_scrip...
      https://en.wikipedia.org/wiki/Tibetan_script
  • Ngôn ngữ là một thực thể thật thú vị
    Có ngôn ngữ dễ học và đóng vai trò trung gian giao tiếp trên một khu vực rộng lớn, cũng có ngôn ngữ khó lĩnh hội nhưng cho phép tạo ra những cấu trúc và ý tưởng rất phức tạp, rồi truyền đạt chúng giữa những người nói
    Tiếng Tây Tạng nằm ở đâu đó trên phổ này?

    • Tôi không rõ hai điều đó có loại trừ lẫn nhau hay không
      Những chủ đề mang tính kỹ thuật cao thường có thuật ngữ chuyên môn rất kỹ thuật
      Nhưng tôi không chắc lượng sắc thái tinh tế mà một ngôn ngữ có có liên quan đến độ phức tạp của những ý tưởng có thể được diễn đạt bằng ngôn ngữ đó hay không
  • Tôi là Eyal, tình nguyện viên của dự án LibreOffice, và tôi làm khá nhiều việc đảm bảo chất lượng liên quan đến các hệ chữ viết từ phải sang trái và các script bố cục chữ phức tạp
    Cảm ơn thunderbong3 đã đăng liên kết bài viết đó, và xin chân thành cảm ơn Jonathan Clark, lập trình viên mới phụ trách RTL-CTL-CJK của The Document Foundation, người đã triển khai cải thiện hiệu năng cho tiếng Tây Tạng
    Phần lớn lỗi tôi gặp và báo cáo trong LibreOffice là các vấn đề chung, không giới hạn ở một hệ chữ cụ thể
    Ví dụ, đó là trường hợp mã quên mất rằng nội dung có thể là từ phải sang trái và vì thế hoạt động sai
    Trong số các lỗi theo từng hệ chữ, khá nhiều liên quan đến chữ Arabic được dùng nhiều nhất; chữ này cũng được dùng cho Farsi, Urdu, Javanese, v.v.
    Dù vậy vẫn có những vấn đề liên quan đến các hệ chữ ít phổ biến hơn như Tibetan hay Mongolian: https://bugs.documentfoundation.org/show_bug.cgi?id=115607
    Meta bug này theo dõi các vấn đề của Mongolian, Tibetan, Uyghur, Zhuang, Kazak, Xibo, Dai, Yi, Miao, Jingpo, Lisu, Lahu, Wa, v.v.
    Không rõ là các vấn đề đặc thù với những ngôn ngữ này thật sự ít, hay là vì mức sử dụng không nhiều và người dùng không có đủ động lực để gửi lỗi
    Dù vậy, như bản sửa gần đây của Jonathan cho thấy, rõ ràng vẫn có sự quan tâm đến việc giải quyết chúng khi có thời gian của lập trình viên
    Nếu ai quan tâm đến sự công bằng trong soạn thảo tài liệu giữa các hệ chữ và giữa các quốc gia, văn hóa này, thì mong hãy thử dùng LibreOffice bằng ngôn ngữ mình biết và nếu phát hiện lỗi thì đăng lên BugZilla: https://bugs.documentfoundation.org/
    Cũng xin cân nhắc hỗ trợ tài chính cho The Document Foundation, tổ chức quản lý dự án LibreOffice: https://www.libreoffice.org/donate/
    Chúng tôi là một trong những dự án nguồn mở tự do lớn trên thế giới, có hàng chục triệu, có lẽ hơn 100 triệu người dùng thường xuyên, và có ban giám đốc đến từ hàng chục quốc gia
    Nhưng không có tập đoàn lớn nào đầu tư đáng kể tiền bạc hay thời gian vào dự án
    Một số công ty thương mại như Collabora và Allotropia có đóng góp, nhưng nhiều vấn đề căn bản không đủ gần với nhu cầu của khách hàng của họ
    Vì vậy chúng tôi đã quyết định trực tiếp tuyển Jonathan để tăng cường hỗ trợ RTL-CTL-CJK, và những công việc như vậy được thực hiện nhờ các khoản đóng góp của người dùng cá nhân

    • Nếu hỗ trợ cả Dzongkha thì thật sự rất biết ơn
 
kayws426 2024-10-15

Nếu tiếng Hàn không có khoảng trắng thì chắc là khó thật.