1 điểm bởi GN⁺ 2023-10-21 | 1 bình luận | Chia sẻ qua WhatsApp
  • Wikipedia vừa có các bài viết phổ biến đạt hàng triệu lượt xem mỗi tuần, vừa có những bài viết cực kỳ không phổ biến trong hơn 6 triệu bài viết, mỗi năm chỉ được đọc ở mức một chữ số
  • Trong một mẫu khoảng 32.000 bài viết năm 2021, nhóm ở đáy có nhiều trang định hướng; nếu loại chúng ra, các bài sơ khai ngắn như loài bướm đêm, loài ruồi, làng ở Iran, họ người chỉ dừng ở 7–9 lượt xem mỗi năm
  • Nút “Random article” có xác suất chọn khác nhau tùy theo random gap giữa giá trị page_random của mỗi bài và giá trị liền trước, nên một số bài được hiển thị ít hơn nhiều so với mức trung bình
  • Khi thu hẹp phạm vi còn 600.000 bài có gap bằng khoảng 1/10 mức trung bình trở xuống, các bài có lượt xem thấp nhất năm 2021 là Trichromia phaeocrotaOpharus corticea, mỗi bài ghi nhận 3 lượt xem được cho là từ con người
  • Trong 500 bài cuối bảng có nhiều taxon côn trùng, một số loài chân bụng và nấm, địa hình địa lý, bài set index; các bài về loài và khu dân cư thường vẫn tồn tại chỉ với nguồn yếu do tiêu chí độ nổi bật thấp

Đặc điểm của các bài viết không phổ biến lộ ra từ mẫu

  • Wikipedia có hơn 6 triệu bài viết, và các bài phổ biến nhận hàng triệu lượt xem mỗi tuần
  • Ngược lại, cũng có những bài khó đạt vài lượt xem mỗi ngày; ví dụ như sau
  • Trong số các bài do tác giả tạo, bài kém phổ biến nhất là Sunday reading periodical, một bài về thể loại tạp chí thời Victoria, với trung bình khoảng 12 lượt xem mỗi tháng
  • Dữ liệu lượt xem Wikipedia được công khai qua dump thô và API, nhưng không có cách dễ dàng để sắp xếp trực tiếp các bài viết có ít lượt xem nhất

Phân tích mẫu ngẫu nhiên 32.000 bài

  • Dữ liệu lượt xem năm 2021 được thu thập từ một mẫu khoảng 32.000 bài viết Wikipedia
  • Trung vị lượt xem hằng năm của mẫu thấp hơn 1.000 một chút, còn trung bình vào khoảng 13.000 do phần đuôi dài
  • Trong mẫu có gần 100 bài có tổng lượt xem năm 2021 chỉ ở mức một chữ số
  • Tuy nhiên, 50 bài thấp nhất đều là trang định hướng, và trong phân tích không được xem là “bài viết thực sự”
  • Nếu loại các trang định hướng, các bài có lượt xem hằng năm ở mức một chữ số thu hẹp lại thành một số ít bài sơ khai trong khoảng 7–9 lượt

Nút “Random article” và random gap

  • Lượt xem cực thấp có thể là kết quả từ việc người dùng nhấn nút Random article rồi được dẫn tới
  • Từ năm 2015, nút Random article được triển khai để bỏ qua các trang định hướng, điều này có thể giải thích hiện tượng các trang định hướng tập trung ở nhóm lượt xem thấp nhất trong mẫu
  • Khi được tạo, mỗi bài viết Wikipedia nhận một giá trị ngẫu nhiên giữa 0 và 1 là page_random
  • Khi có yêu cầu Random article, máy chủ tạo một số ngẫu nhiên giữa 0 và 1, rồi trả về bài có page_random lớn hơn giá trị đó và gần nhất
  • Cách này không hoàn toàn công bằng
    • Xác suất một bài được chọn bằng độ lớn random gap, tức chênh lệch giữa giá trị page_random của bài đó và giá trị page_random của bài ngay trước nó
    • Bài có gap nhỏ cũng có xác suất được chọn trong Random article thấp hơn

Quan hệ giữa đáy lượt xem và random gap

  • Nếu Wikipedia có khoảng 6 triệu bài, random gap trung bình là khoảng 1/6,000,000, tức 1.67e-7
  • Trong mẫu, Erygia sigillata, bài có ít lượt xem nhất, có giá trị page_random0.500764585777, còn bài ngay trước đó Katherine Hanley0.500764582314
  • Chênh lệch giữa hai giá trị là khoảng 3e-9, nhỏ hơn 98% so với random gap trung bình và có xác suất được chọn trong Random article thấp hơn 50 lần so với bài trung bình
  • Random gap của 5 bài khác có lượt xem hằng năm một chữ số cũng là 3e-9, 9e-9, 8e-9, 4e-9, 8e-9, 2e-8, tất cả đều nhỏ hơn mức trung bình khoảng một bậc độ lớn
  • Trong toàn bộ mẫu 32.000 bài, quan hệ giữa random gap và lượt xem không rõ ràng
    • Nhưng trong các tập hợp có vẻ vốn đã ít được quan tâm, như các bài dưới 200 lượt xem/năm hoặc khoảng 1.500 bài trong Category:Phaegopterina stubs, mối quan hệ này trở nên rõ hơn

Bài viết có lượt xem thấp nhất năm 2021

  • Bài có lượt xem thấp nhất không chỉ phải là chủ đề ít được công chúng quan tâm, mà còn phải là bài có random gap rất nhỏ
  • Phân tích giới hạn phạm vi vào các bài có gap từ 1.7e-8 trở xuống, khoảng 1/10 gap trung bình, để xem xét 600.000 bài “kém may mắn nhất”
  • Ngay cả 600.000 bài này cũng đều có ít nhất vài lượt xem trong năm 2021
  • Vị trí bài có lượt xem thấp nhất năm 2021 thuộc về hai bài đồng hạng, mỗi bài ghi nhận 3 lượt xem được cho là từ con người
  • Cả hai đều là bài về loài bướm đêm

Các mẫu lặp lại trong 500 bài cuối bảng

  • Danh sách 500 bài cuối bảng có thể xem tại Least viewed articles in 2021
  • Phân bố chủ đề rất nhất quán
    • Một số lượng đáng kể là bài về loài côn trùng hoặc các taxon côn trùng khác
    • Cũng có 17 loài chân bụng và 1 loài nấm tên Harknessiella
    • Nhóm phổ biến tiếp theo là địa hình địa lý, đặc biệt các làng ở Iran và Sri Lanka xuất hiện thường xuyên
    • Cũng có các bài địa lý ngắn như Kälberbuckel
  • Một nhóm lặp lại khác là các bài set index
  • Set index article trông giống và hoạt động tương tự trang định hướng, nhưng theo phân loại của Wikipedia thì không phải là trang định hướng
  • Một số ít bài cũng gợi nhớ tới các tiêu chí đưa vào lỏng lẻo của Wikipedia trước đây, như DMZ//38 hoặc EuroNanoForum 2009

Vì sao có nhiều bướm đêm?

  • Wikipedia áp dụng yêu cầu nguồn nghiêm ngặt đối với các chủ đề như người còn sống, công ty, ban nhạc
  • Các chủ đề này có thể bị lạm dụng để chỉnh sửa nhằm mục đích quảng bá, lợi ích hoặc tranh chấp, nên khó được đưa vào chỉ bằng việc xác minh từ nguồn sơ cấp đơn giản; chúng cần các bài viết đáng kể từ nhiều nguồn thứ cấp độc lập
  • Vì vậy, các chủ đề đáp ứng yêu cầu này nhiều khả năng sẽ có người quan tâm ngoài người dùng Random article, nên hầu như không xuất hiện trong 500 bài cuối bảng
  • Ngược lại, bài về loàibài về khu dân cư thường không bị xóa
    • Chúng thường vẫn tồn tại ngay cả khi chủ đề chỉ có nguồn yếu
    • Nhiều bài ở nhóm cuối bảng thường dựa vào một nguồn duy nhất như cơ sở dữ liệu, từ điển địa danh, hoặc nhắc đến ngắn trong sách hay tạp chí học thuật
  • Do tiêu chí thấp, một số bài trông như bài sơ khai được tạo theo kiểu máy móc
    • Pottallinda là một bài sơ khai 12 từ và có 5 lượt xem trong năm 2021
    • Bài được User:Ser Amantio di Nicolao tạo vào ngày 18 tháng 1 năm 2011, và trong vòng 60 giây đã tạo nhiều bài tương tự như Polmalagama, Polommana, Polpitiya, Polwatta
  • Những bài siêu nhỏ và không phổ biến này có thể khiến người dùng Random article thất vọng, nhưng cũng có thể trở thành nền móng để các biên tập viên khác mở rộng về sau

Dữ liệu và mã nguồn

  • Dữ liệu lượt xem cùng mã scraping và phân tích được công khai trong kho GitHub wiki-pageview-floor

1 bình luận

 
GN⁺ 2023-10-21
Ý kiến trên Hacker News
  • Lý do những chuyện như thế này xảy ra trên Wikipedia không phải vì kiếm tiền hay quan điểm gây tranh cãi, mà vì tiêu chí độ nổi bật xuất phát từ tính chất và chất lượng của các nguồn được trích dẫn là căn cứ thường được dùng nhất khi quyết định xóa bài
    Trước đây từng có hướng dẫn rằng những người thi đấu thể thao ở cấp quốc tế nhìn chung được xem là nổi bật, nên ngay cả một cầu thủ bóng đá chỉ chơi một trận cho đội tuyển quốc gia cũng có thể tránh bị xóa chỉ với các nguồn yếu
    Nhưng khi hướng dẫn đó bị bỏ và quay lại hướng dẫn chung về độ nổi bật (GNG), với nhân vật thì cần có các bài viết tiểu sử đáng kể từ những cơ quan truyền thông chính thống, đáng tin cậy ở cấp toàn quốc; các báo cáo trận đấu, phỏng vấn địa phương và truyền thông của người hâm mộ nhìn chung bị loại trừ
    Kết quả là hàng trăm bài sơ khai và hàng chục bài đầy đủ về cầu thủ bóng đá nữ quốc tế, dù là người vô địch World Cup, vẫn không đáp ứng được GNG vì tương đối thiếu đưa tin từ truyền thông chính thống; và khi một biên tập viên đưa hàng loạt bài như vậy ra đề nghị xóa sau khi World Cup nữ khai mạc mùa hè này, gần như tất cả đều bị xóa
    Vì vậy, lý do các bài về bướm đêm hay địa điểm vẫn tồn tại không phải vì kiếm tiền hay tính tranh cãi, mà vì với sự vật và địa điểm—những thứ không thể kiện biên tập viên Wikipedia vì phỉ báng—người ta áp dụng một bộ tiêu chí độ nổi bật hoàn toàn khác

    • Sáng nay tôi còn đang đọc bài Interstate 94 rồi lần tới WikiProject quản lý nó là US Roads, và thấy họ đã viết một thư ngỏ cách đây một tháng nói rằng vì quá khổ sở trước việc bài bị xóa theo những hướng dẫn độ nổi bật tùy tiện, họ sẽ rời Wikipedia để lập wiki riêng
      https://en.wikipedia.org/wiki/Wikipedia:WikiProject.U.S._Roads/Newsletter/Issues/Volume10/Issue01
    • Tôi đã viết bài về The Mexican Runner, một nhân vật khá ngách, và đã phải tranh luận đôi chút để thuyết phục các biên tập viên khác rằng người này đủ nổi bật
      Tôi cho rằng có bài của Polygon và Kotaku là đủ, nhưng ban đầu đó là một việc khó
      Một người bấm nút cực nhanh liệu có thật sự là nhân vật nổi bật không?
    • Có ai tin rằng tiêu chí “nguồn chính thống, đáng tin cậy ở cấp toàn quốc” thực sự được áp dụng nhất quán không?
      Tôi nghĩ có vô số bài Wikipedia về những người có nhiều vai trò và chức vụ trong công nghệ, học thuật, chính trị địa phương, v.v. sẽ không đáp ứng nổi tiêu chí đó
    • Wikipedia không phải là một thực thể đơn nhất; ở đây có lẽ đang nói tới Wikipedia tiếng Anh, nhưng tôi biết các phiên bản Wikipedia ở ngôn ngữ khác có những yêu cầu về độ nổi bật riêng, đôi khi khá khác biệt
    • Các hướng dẫn về độ nổi bật của Wikipedia đã quá khắt khe từ rất lâu rồi
      Tôi vẫn nhớ mình từng ngỡ ngàng khi thấy ngay cả một webcomic khá nổi tiếng cũng không thể có bài wiki
  • Tôi nghĩ một trong những tính năng hay nhất nhưng ít được biết đến trên Wikipedia là các hộp điều hướng được thu gọn ở cuối mỗi bài
    Chúng rất hữu ích để nhìn bao quát một chủ đề phức tạp và xem một mục nằm ở đâu trong một cấu trúc phân cấp rắc rối
    Một số cái giống như những tác phẩm nghệ thuật nhỏ đến mức một ngày nào đó tôi muốn treo lên tường
    https://imgur.com/gallery/ILp6TtA
    Tôi hiểu vì sao mặc định chúng phải được thu gọn, nhưng tôi dùng userjs để chuyển chúng lên đầu trang, mở sẵn và dùng cho việc điều hướng
    Để chúng không chiếm quá nhiều không gian, tôi đặt CSS zoom là 0.3

    • Thật thú vị khi bạn thấy thứ này hấp dẫn như “nghệ thuật”, nhưng tôi thì hoàn toàn không thấy vậy
  • Cách chọn bài viết ngẫu nhiên thật gây sốc
    Việc ngẫu nhiên hóa sẽ sinh ra thiên lệch lâu dài, và xác suất từng bài viết được chọn thay đổi theo thời gian chắc chắn sẽ mang tính phụ thuộc đường đi rất nhiều
    Chọn một số nguyên ngẫu nhiên từ 1 đến N đâu phải khoa học tên lửa
    Cũng khiến tôi tự hỏi liệu có khi nào họ cố tình gán trọng số bằng cách để trống khoảng phía trước một số bài viết được ưu tiên để chúng xuất hiện thường xuyên hơn không

    • Đúng là gây sốc, nhưng điều còn gây sốc hơn là làm cho đúng thì khá gần với khoa học tên lửa
      MySQL thật sự không được thiết kế để chọn một hàng ngẫu nhiên với hiệu năng tốt
      Cách ngây thơ như ORDER BY RAND() LIMIT 1 có hiệu năng thảm hại, và LIMIT 0 OFFSET RAND() * row_count cũng tệ tương tự
      Nếu dùng cách hiệu năng tốt như WHERE id >= RAND() * max_id ORDER BY id LIMIT 1 thì các lỗ ID do bài viết bị xóa sẽ gây ra cùng một vấn đề: một số bài viết bị chọn thường xuyên hơn
      Chỉ có hai lời giải đúng: chọn ID ngẫu nhiên rồi thử lại nếu không hợp lệ, hoặc duy trì một cột/bảng riêng chứa toàn bộ bài viết hợp lệ dưới dạng dãy số nguyên liên tiếp
      Cách trước đôi khi có thể phải thử lại 20 lần tùy ID thưa đến mức nào, nên khó dự đoán hiệu năng; cách sau thì mỗi lần xóa bài viết, trung bình phải tính toán lại và ghi lại một nửa cột số nguyên
      Rốt cuộc, với một tính năng gần như đồ chơi, cách của Wikipedia là “đủ ổn”; có thể giảm nhược điểm bằng cách tính lại số ngẫu nhiên qua tác vụ batch hằng ngày/hằng tuần hoặc mỗi lần chỉnh sửa bài viết
      Cũng có thể cải thiện đáng kể bằng cách không chỉ chọn một bài viết gần nhất theo cách hiện tại, mà chọn khoảng 50 bài trước và 50 bài sau, rồi chọn ngẫu nhiên lại trong 100 bài đó
      Hoàn toàn là một mẹo hack, nhưng trên thực tế có lẽ vẫn rất nhanh
    • Nếu không thể biết trước bài viết nào đã bị xóa thì sẽ làm gì?
      Nếu chọn một số nguyên ngẫu nhiên từ 1 đến N, sẽ có xác suất nhận kết quả xấu
      Nghĩ đến spam thì khả năng trang xấu nhiều hơn trang tốt cũng không hề thấp, và khi đó phải bốc lại nhiều lần
      Tôi cho rằng bốc lại là một chiến lược ổn, nhưng khó nói mọi người sẽ cứ tin vào xác suất đó
      Thực tế, nếu tạo một wiki có 99 trang xấu và 1 trang tốt, nút bài viết ngẫu nhiên phần lớn sẽ không hoạt động
      Cũng có thể chọn từ 1 đến M dựa trên số bài viết hợp lệ M, nhưng vấn đề làm sao ánh xạ con số đó sang ID bài viết thực tế vẫn còn nguyên
      Cách này có thể có thiên lệch, nhưng có hiệu năng thời gian hằng số
      Cá nhân tôi thích giữ toàn bộ bài viết hợp lệ trong bộ nhớ và chọn một cái trong đó hơn
      Tính đến tháng 10 chỉ có 7 triệu bài, và kể cả tính bài đã xóa thì có lẽ cũng khoảng 70 triệu, quy mô tương tự tổng số mục trên HN
      Thậm chí tạo một file trên đĩa cho mỗi bài viết hợp lệ rồi tìm ngẫu nhiên bằng find . -type f | shuf -n 1, sau đó cache kết quả mỗi vài giây, có lẽ cũng không quá tệ, dù cách đó cũng có thiên lệch riêng
    • Việc họ làm đến mức này có lẽ là vì chọn hàng ngẫu nhiên trong cơ sở dữ liệu thực sự là thao tác chậm
      Dù sao cũng là tính năng thuần giải trí, nên trọng số không bằng nhau cũng chẳng quá quan trọng; nghe nói MariaDB thực hiện quét toàn bảng với ORDER BY RAND() LIMIT 1
    • Nếu có cơ sở dữ liệu các bài viết có ID bất kể đã xóa hay chưa, mỗi máy chủ ứng dụng biết phạm vi ID, và muốn chọn ngẫu nhiên một bài chưa bị xóa, tôi nghĩ sẽ làm thế này
      1. đặt một cache từ xa cho bài viết đã xóa và 2) mỗi khi máy chủ ứng dụng bốc trúng bài đã xóa thì thêm nó vào cache từ xa
        Cache từ xa nằm cục bộ trong trung tâm dữ liệu, được chống lưng bằng lưu trữ bền vững và có thể đặt TTL dài
        Trong thời gian TTL của cache, có thể không bốc được bài viết đã được khôi phục, nhưng không sao
        Tính cục bộ theo trung tâm dữ liệu đảm bảo một mức chịu lỗi và độ trễ thấp nhất định, còn lưu trữ bền vững giúp giảm vấn đề cache lạnh khi khởi động lại
        Mốc nước cao nhất của phạm vi ID có thể cập nhật bất đồng bộ, và việc bài mới tạm thời chưa hiện ra cũng không sao
    • Tôi từng nghĩ có thể họ cố ý dùng các trọng số khác nhau, vì nó khiến tôi liên tưởng đến mã hóa số học
      Hóa ra chỉ là tình cờ
      Cách triển khai hiện tại khi số bài viết tăng lên thì trọng số sẽ xấp xỉ nhau hơn, và từng người dùng dù sao cũng chỉ nhận một bài viết ngẫu nhiên nên có khả năng họ chẳng mấy quan tâm đến tính công bằng, nghe cũng hợp lý
  • Việc có thể tìm thấy ở một nơi những thông tin như một loài bướm đêm bình thường ở Peru, một ngôi làng nhỏ nào đó ở Iran, hay loại bài đọc ngày Chủ nhật thời Victoria ở Anh thật sự đáng kinh ngạc
    Trước Internet, những nội dung này có lẽ còn không đáng tiền giấy để in ra, nhưng giờ chi phí lưu trữ đám mây gần như bằng 0, nên ta có được thông tin đuôi dài cực kỳ giá trị
    Xin cảm ơn những người đóng góp và duy trì các nội dung như vậy
    Nói thêm, sẽ rất tuyệt nếu có thể để lại ghi chú trên một trang kiểu “tôi đã ghé trang này và muốn kết nối với người khác cũng quan tâm đến loài bướm đêm Peru Foovius Barivius”

    • Tôi cũng rất thích Wikipedia hiện nay, nhưng vẫn khao khát nó quay lại chính sách bao hàm ngày trước
      https://gwern.net/inclusionism
    • Liên quan đến phần nói thêm cuối cùng, tôi luôn nghĩ sẽ là một dự án cá nhân thú vị nếu áp dụng cho Wikipedia các cách thúc đẩy mức độ tương tác cực cao mà các ứng dụng mạng xã hội dùng
      Ví dụ có thể có một feed dọc kiểu TikTok tìm ra những bài mà người dùng có khả năng xem lâu nhất, và WikiScroll cũng đã phần nào đi theo hướng đó
      Cũng có thể gắn phòng chat vào từng bài viết để mọi người trò chuyện, hoặc có tính năng DM nhưng chỉ cho gửi liên kết Wikipedia
      Ý tưởng Wikipedia như một chất xúc tác xã hội rất thú vị
      https://wikiscroll.blankenship.io/
    • Đây là quảng bá rất trơ trẽn liên quan đến phần “Edit” cuối cùng, nhưng tiện ích mở rộng web tôi làm có đúng chức năng đó: https://webcursors.click/
      Nếu bạn để lại ghi chú trên trang, người khác cài cùng tiện ích có thể thấy, và nếu may mắn bạn có thể được liên hệ
    • Tôi thật sự biết ơn Wikipedia
      Theo tôi, đó là phần hay nhất của Internet
  • Có thể chứng minh bằng toán học rằng trên Wikipedia không có bài nào là không thú vị
    Chỉ cần chứng minh bằng phản chứng
    Sau khi xếp hạng tất cả bài viết theo mức độ thú vị rồi sắp xếp, nếu nhìn vào giá trị thấp nhất thì chắc chắn sẽ tồn tại bài viết kém thú vị nhất
    Nhưng chính việc bài đó là bài kém thú vị nhất trên toàn Wikipedia lại khiến nó trở nên thú vị
    Tương tự, có lẽ những bài có lượt xem thấp nhất được nêu trong bài blog này đến giờ cũng đã mất vị trí đó rồi

    • Tất nhiên cũng có bài Wikipedia về điều đó: https://en.wikipedia.org/wiki/Interesting_number_paradox
    • Tôi nghi ngờ tính hợp lệ của chứng minh đó
      Có vẻ nó giả định rằng chỉ có đúng một bài kém thú vị nhất
      Nhưng cũng có thể có hàng trăm bài cùng mức độ thú vị thấp nhất, và khi đó phải xem hàng trăm bài ấy là những bài không thú vị
    • Nếu xét cho kỹ, bài viết thực ra đang nhìn vào những trang được xem ít nhất trong năm 2021
    • Mức độ thú vị do việc là bài kém thú vị nhất mang lại phải đủ lớn để lấp khoảng cách giữa bài kém thú vị nhất và bài kém thú vị thứ hai
      Còn phải tính cả sự thú vị của việc là bài kém thú vị thứ hai nữa
      Có lẽ điều đó đúng, nên QED
    • Thực sự phải tìm ra nó đã
      Cho đến khi có ai đó tìm được bài kém thú vị nhất và nghĩ về nó, bài đó chưa trở nên thú vị
      Tính chất toán học thì vĩnh viễn, tồn tại bất kể có ai nhìn thấy hay không
  • Tôi nhớ đến loạt video của Geoff Marshall về Least Used Stations của Network Rail ở Anh
    https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
    https://www.youtube.com/@geofftech2

    • Kênh và các video thật sự rất vui, cảm ơn vì liên kết
  • Các quản trị viên Wikipedia khá tích cực xóa những bài mà họ cho là không quan trọng, nên có lẽ bài có lượt xem thấp nhất sẽ thay đổi khá thường xuyên

    • Bài Carrier_IQ tôi viết từng bị xóa với lý do không đủ nổi bật vì những lý do chính trị hiển nhiên, rồi vài năm sau được tạo lại khi cuộc chiến dư luận về công ty đó đã lắng xuống
      Cũng có thể có trò nghịch ngợm nào đó từ phía cơ quan tình báo
      Đây là một cách rất hay để xóa đi những sự thật lịch sử gây khó chịu
      Giờ thì nó chỉ còn là một câu chuyện nhỏ buồn cười về rootkit, hoàn toàn không có âm mưu chính trị cụ thể nào nữa
    • Đúng, nhưng theo kinh nghiệm của tôi, điều này áp dụng với nhân vật nhiều hơn là với một số chủ đề được đề cập trong bài
      Chẳng hạn, tôi nghĩ sẽ khó tìm được một thành phố, thị trấn, làng hay khu dân cư nhỏ nào ở Mỹ mà không có bài trên Wikipedia
      Nhìn Jack Wade, Alaska trên Google Maps thì chỉ thấy chừng 8 căn nhà, vậy mà vẫn có trên Wikipedia
      Tôi cũng không nghĩ bài về một loài bướm đêm hiếm sẽ bị gỡ
      Tuy vậy, vẫn cần có chính sách nào đó để không phải mọi cá nhân trên Trái Đất đều có bài Wikipedia
      Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
      Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
    • Tác giả thực ra cũng đề cập đến điểm đó, và những bài như vậy có vẻ ít khả năng bị xóa
      Tuy nhiên, việc bị phá hoại do vị thế độc đáo này bị lộ ra có thể là ngoại lệ
      Nói nhỏ với những ai quan tâm: có thể đây chỉ là sản phẩm phụ của bộ dữ liệu tác giả dùng, nhưng một điểm chung của các bài có lượt xem thấp nhất là chủ đề của chúng thuộc những nhóm thường không phải đối tượng bị xóa theo nguyên tắc nội dung của Wikipedia
  • Tác giả nói các bài về bướm đêm ít có khả năng tạo cơ hội để thúc đẩy quan điểm gây tranh cãi, nhưng nhìn lịch sử chỉnh sửa thì hồi đầu năm nay đã có bất đồng về sải cánh của Scrobipalpula crustaria
    11–13mm hay 10–13mm?
    Người ta có cảm xúc mạnh mẽ về những chuyện như thế này

  • Nếu tìm ra và công bố tên bài Wikipedia có lượt xem thấp nhất, lượt xem của bài đó sẽ tăng lên, khiến lý do tìm nó ban đầu biến mất

    • Giống hiệu ứng quan sát viên
      https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
    • Vậy tôi không rõ lý do ban đầu là gì
      Có vấn đề gì sao?
      Công bằng mà nói, đây là phân tích bộ dữ liệu năm 2021 nên tất nhiên không bị ảnh hưởng
    • Việc đi tìm từ chỉ xuất hiện một lần (hapax legomenon) trên Internet cũng gặp vấn đề tương tự, thậm chí còn tệ hơn
      Dù tìm được một từ, khoảnh khắc bạn thông báo sự tồn tại của nó thì nó bị phá hủy
      Cứ xem quizzaciously là thấy
  • Dù có hơn 6 triệu bài viết, 6.0e6 đã là con số có thể brute force được từ nhiều thập kỷ trước
    Tìm kiếm tuyến tính có thể còn mất ít thời gian hơn đọc một bài, và gần như chắc chắn ít thời gian hơn viết bài này
    Dĩ nhiên nếu làm vậy thì đã không thú vị hay thông minh bằng, nhưng kỹ thuật tốt hầu như lúc nào cũng như thế này