Đi tìm bài viết có ít lượt xem nhất trên Wikipedia (2022)
(colinmorris.github.io)- Wikipedia vừa có các bài viết phổ biến đạt hàng triệu lượt xem mỗi tuần, vừa có những bài viết cực kỳ không phổ biến trong hơn 6 triệu bài viết, mỗi năm chỉ được đọc ở mức một chữ số
- Trong một mẫu khoảng 32.000 bài viết năm 2021, nhóm ở đáy có nhiều trang định hướng; nếu loại chúng ra, các bài sơ khai ngắn như loài bướm đêm, loài ruồi, làng ở Iran, họ người chỉ dừng ở 7–9 lượt xem mỗi năm
- Nút “Random article” có xác suất chọn khác nhau tùy theo random gap giữa giá trị
page_randomcủa mỗi bài và giá trị liền trước, nên một số bài được hiển thị ít hơn nhiều so với mức trung bình - Khi thu hẹp phạm vi còn 600.000 bài có gap bằng khoảng 1/10 mức trung bình trở xuống, các bài có lượt xem thấp nhất năm 2021 là Trichromia phaeocrota và Opharus corticea, mỗi bài ghi nhận 3 lượt xem được cho là từ con người
- Trong 500 bài cuối bảng có nhiều taxon côn trùng, một số loài chân bụng và nấm, địa hình địa lý, bài set index; các bài về loài và khu dân cư thường vẫn tồn tại chỉ với nguồn yếu do tiêu chí độ nổi bật thấp
Đặc điểm của các bài viết không phổ biến lộ ra từ mẫu
- Wikipedia có hơn 6 triệu bài viết, và các bài phổ biến nhận hàng triệu lượt xem mỗi tuần
- Ngược lại, cũng có những bài khó đạt vài lượt xem mỗi ngày; ví dụ như sau
- Trong số các bài do tác giả tạo, bài kém phổ biến nhất là Sunday reading periodical, một bài về thể loại tạp chí thời Victoria, với trung bình khoảng 12 lượt xem mỗi tháng
- Dữ liệu lượt xem Wikipedia được công khai qua dump thô và API, nhưng không có cách dễ dàng để sắp xếp trực tiếp các bài viết có ít lượt xem nhất
Phân tích mẫu ngẫu nhiên 32.000 bài
- Dữ liệu lượt xem năm 2021 được thu thập từ một mẫu khoảng 32.000 bài viết Wikipedia
- Trung vị lượt xem hằng năm của mẫu thấp hơn 1.000 một chút, còn trung bình vào khoảng 13.000 do phần đuôi dài
- Trong mẫu có gần 100 bài có tổng lượt xem năm 2021 chỉ ở mức một chữ số
- Weimer Township: 3 lượt
- Goleh-ye Cheshmeh: 4 lượt
- Governor Terry: 4 lượt
- Tuy nhiên, 50 bài thấp nhất đều là trang định hướng, và trong phân tích không được xem là “bài viết thực sự”
- Nếu loại các trang định hướng, các bài có lượt xem hằng năm ở mức một chữ số thu hẹp lại thành một số ít bài sơ khai trong khoảng 7–9 lượt
- Erygia sigillata: loài bướm đêm
- Hilarigona obscurata: loài ruồi
- Loxocrambus hospition: bướm đêm
- Makhoshin: làng ở Iran
- Bojerud: họ người
- Scrobipalpula crustaria: bướm đêm
Nút “Random article” và random gap
- Lượt xem cực thấp có thể là kết quả từ việc người dùng nhấn nút Random article rồi được dẫn tới
- Từ năm 2015, nút Random article được triển khai để bỏ qua các trang định hướng, điều này có thể giải thích hiện tượng các trang định hướng tập trung ở nhóm lượt xem thấp nhất trong mẫu
- Khi được tạo, mỗi bài viết Wikipedia nhận một giá trị ngẫu nhiên giữa 0 và 1 là
page_random - Khi có yêu cầu Random article, máy chủ tạo một số ngẫu nhiên giữa 0 và 1, rồi trả về bài có
page_randomlớn hơn giá trị đó và gần nhất - Cách này không hoàn toàn công bằng
- Xác suất một bài được chọn bằng độ lớn random gap, tức chênh lệch giữa giá trị
page_randomcủa bài đó và giá trịpage_randomcủa bài ngay trước nó - Bài có gap nhỏ cũng có xác suất được chọn trong Random article thấp hơn
- Xác suất một bài được chọn bằng độ lớn random gap, tức chênh lệch giữa giá trị
Quan hệ giữa đáy lượt xem và random gap
- Nếu Wikipedia có khoảng 6 triệu bài, random gap trung bình là khoảng
1/6,000,000, tức1.67e-7 - Trong mẫu, Erygia sigillata, bài có ít lượt xem nhất, có giá trị
page_randomlà0.500764585777, còn bài ngay trước đó Katherine Hanley là0.500764582314 - Chênh lệch giữa hai giá trị là khoảng
3e-9, nhỏ hơn 98% so với random gap trung bình và có xác suất được chọn trong Random article thấp hơn 50 lần so với bài trung bình - Random gap của 5 bài khác có lượt xem hằng năm một chữ số cũng là
3e-9,9e-9,8e-9,4e-9,8e-9,2e-8, tất cả đều nhỏ hơn mức trung bình khoảng một bậc độ lớn - Trong toàn bộ mẫu 32.000 bài, quan hệ giữa random gap và lượt xem không rõ ràng
- Nhưng trong các tập hợp có vẻ vốn đã ít được quan tâm, như các bài dưới 200 lượt xem/năm hoặc khoảng 1.500 bài trong Category:Phaegopterina stubs, mối quan hệ này trở nên rõ hơn
Bài viết có lượt xem thấp nhất năm 2021
- Bài có lượt xem thấp nhất không chỉ phải là chủ đề ít được công chúng quan tâm, mà còn phải là bài có random gap rất nhỏ
- Phân tích giới hạn phạm vi vào các bài có gap từ
1.7e-8trở xuống, khoảng 1/10 gap trung bình, để xem xét 600.000 bài “kém may mắn nhất” - Ngay cả 600.000 bài này cũng đều có ít nhất vài lượt xem trong năm 2021
- Vị trí bài có lượt xem thấp nhất năm 2021 thuộc về hai bài đồng hạng, mỗi bài ghi nhận 3 lượt xem được cho là từ con người
- Trichromia phaeocrota: random gap
4e-9 - Opharus corticea: random gap
1e-9
- Trichromia phaeocrota: random gap
- Cả hai đều là bài về loài bướm đêm
Các mẫu lặp lại trong 500 bài cuối bảng
- Danh sách 500 bài cuối bảng có thể xem tại Least viewed articles in 2021
- Phân bố chủ đề rất nhất quán
- Một số lượng đáng kể là bài về loài côn trùng hoặc các taxon côn trùng khác
- Cũng có 17 loài chân bụng và 1 loài nấm tên Harknessiella
- Nhóm phổ biến tiếp theo là địa hình địa lý, đặc biệt các làng ở Iran và Sri Lanka xuất hiện thường xuyên
- Cũng có các bài địa lý ngắn như Kälberbuckel
- Một nhóm lặp lại khác là các bài set index
- Set index article trông giống và hoạt động tương tự trang định hướng, nhưng theo phân loại của Wikipedia thì không phải là trang định hướng
- Một số ít bài cũng gợi nhớ tới các tiêu chí đưa vào lỏng lẻo của Wikipedia trước đây, như DMZ//38 hoặc EuroNanoForum 2009
Vì sao có nhiều bướm đêm?
- Wikipedia áp dụng yêu cầu nguồn nghiêm ngặt đối với các chủ đề như người còn sống, công ty, ban nhạc
- Các chủ đề này có thể bị lạm dụng để chỉnh sửa nhằm mục đích quảng bá, lợi ích hoặc tranh chấp, nên khó được đưa vào chỉ bằng việc xác minh từ nguồn sơ cấp đơn giản; chúng cần các bài viết đáng kể từ nhiều nguồn thứ cấp độc lập
- Vì vậy, các chủ đề đáp ứng yêu cầu này nhiều khả năng sẽ có người quan tâm ngoài người dùng Random article, nên hầu như không xuất hiện trong 500 bài cuối bảng
- Ngược lại, bài về loài và bài về khu dân cư thường không bị xóa
- Chúng thường vẫn tồn tại ngay cả khi chủ đề chỉ có nguồn yếu
- Nhiều bài ở nhóm cuối bảng thường dựa vào một nguồn duy nhất như cơ sở dữ liệu, từ điển địa danh, hoặc nhắc đến ngắn trong sách hay tạp chí học thuật
- Do tiêu chí thấp, một số bài trông như bài sơ khai được tạo theo kiểu máy móc
- Pottallinda là một bài sơ khai 12 từ và có 5 lượt xem trong năm 2021
- Bài được User:Ser Amantio di Nicolao tạo vào ngày 18 tháng 1 năm 2011, và trong vòng 60 giây đã tạo nhiều bài tương tự như Polmalagama, Polommana, Polpitiya, Polwatta
- Những bài siêu nhỏ và không phổ biến này có thể khiến người dùng Random article thất vọng, nhưng cũng có thể trở thành nền móng để các biên tập viên khác mở rộng về sau
Dữ liệu và mã nguồn
- Dữ liệu lượt xem cùng mã scraping và phân tích được công khai trong kho GitHub wiki-pageview-floor
1 bình luận
Ý kiến trên Hacker News
Lý do những chuyện như thế này xảy ra trên Wikipedia không phải vì kiếm tiền hay quan điểm gây tranh cãi, mà vì tiêu chí độ nổi bật xuất phát từ tính chất và chất lượng của các nguồn được trích dẫn là căn cứ thường được dùng nhất khi quyết định xóa bài
Trước đây từng có hướng dẫn rằng những người thi đấu thể thao ở cấp quốc tế nhìn chung được xem là nổi bật, nên ngay cả một cầu thủ bóng đá chỉ chơi một trận cho đội tuyển quốc gia cũng có thể tránh bị xóa chỉ với các nguồn yếu
Nhưng khi hướng dẫn đó bị bỏ và quay lại hướng dẫn chung về độ nổi bật (GNG), với nhân vật thì cần có các bài viết tiểu sử đáng kể từ những cơ quan truyền thông chính thống, đáng tin cậy ở cấp toàn quốc; các báo cáo trận đấu, phỏng vấn địa phương và truyền thông của người hâm mộ nhìn chung bị loại trừ
Kết quả là hàng trăm bài sơ khai và hàng chục bài đầy đủ về cầu thủ bóng đá nữ quốc tế, dù là người vô địch World Cup, vẫn không đáp ứng được GNG vì tương đối thiếu đưa tin từ truyền thông chính thống; và khi một biên tập viên đưa hàng loạt bài như vậy ra đề nghị xóa sau khi World Cup nữ khai mạc mùa hè này, gần như tất cả đều bị xóa
Vì vậy, lý do các bài về bướm đêm hay địa điểm vẫn tồn tại không phải vì kiếm tiền hay tính tranh cãi, mà vì với sự vật và địa điểm—những thứ không thể kiện biên tập viên Wikipedia vì phỉ báng—người ta áp dụng một bộ tiêu chí độ nổi bật hoàn toàn khác
https://en.wikipedia.org/wiki/Wikipedia:WikiProject.U.S._Roads/Newsletter/Issues/Volume10/Issue01
Tôi cho rằng có bài của Polygon và Kotaku là đủ, nhưng ban đầu đó là một việc khó
Một người bấm nút cực nhanh liệu có thật sự là nhân vật nổi bật không?
Tôi nghĩ có vô số bài Wikipedia về những người có nhiều vai trò và chức vụ trong công nghệ, học thuật, chính trị địa phương, v.v. sẽ không đáp ứng nổi tiêu chí đó
Tôi vẫn nhớ mình từng ngỡ ngàng khi thấy ngay cả một webcomic khá nổi tiếng cũng không thể có bài wiki
Tôi nghĩ một trong những tính năng hay nhất nhưng ít được biết đến trên Wikipedia là các hộp điều hướng được thu gọn ở cuối mỗi bài
Chúng rất hữu ích để nhìn bao quát một chủ đề phức tạp và xem một mục nằm ở đâu trong một cấu trúc phân cấp rắc rối
Một số cái giống như những tác phẩm nghệ thuật nhỏ đến mức một ngày nào đó tôi muốn treo lên tường
https://imgur.com/gallery/ILp6TtA
Tôi hiểu vì sao mặc định chúng phải được thu gọn, nhưng tôi dùng userjs để chuyển chúng lên đầu trang, mở sẵn và dùng cho việc điều hướng
Để chúng không chiếm quá nhiều không gian, tôi đặt CSS
zoomlà 0.3Cách chọn bài viết ngẫu nhiên thật gây sốc
Việc ngẫu nhiên hóa sẽ sinh ra thiên lệch lâu dài, và xác suất từng bài viết được chọn thay đổi theo thời gian chắc chắn sẽ mang tính phụ thuộc đường đi rất nhiều
Chọn một số nguyên ngẫu nhiên từ 1 đến N đâu phải khoa học tên lửa
Cũng khiến tôi tự hỏi liệu có khi nào họ cố tình gán trọng số bằng cách để trống khoảng phía trước một số bài viết được ưu tiên để chúng xuất hiện thường xuyên hơn không
MySQL thật sự không được thiết kế để chọn một hàng ngẫu nhiên với hiệu năng tốt
Cách ngây thơ như
ORDER BY RAND() LIMIT 1có hiệu năng thảm hại, vàLIMIT 0 OFFSET RAND() * row_countcũng tệ tương tựNếu dùng cách hiệu năng tốt như
WHERE id >= RAND() * max_id ORDER BY id LIMIT 1thì các lỗ ID do bài viết bị xóa sẽ gây ra cùng một vấn đề: một số bài viết bị chọn thường xuyên hơnChỉ có hai lời giải đúng: chọn ID ngẫu nhiên rồi thử lại nếu không hợp lệ, hoặc duy trì một cột/bảng riêng chứa toàn bộ bài viết hợp lệ dưới dạng dãy số nguyên liên tiếp
Cách trước đôi khi có thể phải thử lại 20 lần tùy ID thưa đến mức nào, nên khó dự đoán hiệu năng; cách sau thì mỗi lần xóa bài viết, trung bình phải tính toán lại và ghi lại một nửa cột số nguyên
Rốt cuộc, với một tính năng gần như đồ chơi, cách của Wikipedia là “đủ ổn”; có thể giảm nhược điểm bằng cách tính lại số ngẫu nhiên qua tác vụ batch hằng ngày/hằng tuần hoặc mỗi lần chỉnh sửa bài viết
Cũng có thể cải thiện đáng kể bằng cách không chỉ chọn một bài viết gần nhất theo cách hiện tại, mà chọn khoảng 50 bài trước và 50 bài sau, rồi chọn ngẫu nhiên lại trong 100 bài đó
Hoàn toàn là một mẹo hack, nhưng trên thực tế có lẽ vẫn rất nhanh
Nếu chọn một số nguyên ngẫu nhiên từ 1 đến N, sẽ có xác suất nhận kết quả xấu
Nghĩ đến spam thì khả năng trang xấu nhiều hơn trang tốt cũng không hề thấp, và khi đó phải bốc lại nhiều lần
Tôi cho rằng bốc lại là một chiến lược ổn, nhưng khó nói mọi người sẽ cứ tin vào xác suất đó
Thực tế, nếu tạo một wiki có 99 trang xấu và 1 trang tốt, nút bài viết ngẫu nhiên phần lớn sẽ không hoạt động
Cũng có thể chọn từ 1 đến M dựa trên số bài viết hợp lệ M, nhưng vấn đề làm sao ánh xạ con số đó sang ID bài viết thực tế vẫn còn nguyên
Cách này có thể có thiên lệch, nhưng có hiệu năng thời gian hằng số
Cá nhân tôi thích giữ toàn bộ bài viết hợp lệ trong bộ nhớ và chọn một cái trong đó hơn
Tính đến tháng 10 chỉ có 7 triệu bài, và kể cả tính bài đã xóa thì có lẽ cũng khoảng 70 triệu, quy mô tương tự tổng số mục trên HN
Thậm chí tạo một file trên đĩa cho mỗi bài viết hợp lệ rồi tìm ngẫu nhiên bằng
find . -type f | shuf -n 1, sau đó cache kết quả mỗi vài giây, có lẽ cũng không quá tệ, dù cách đó cũng có thiên lệch riêngDù sao cũng là tính năng thuần giải trí, nên trọng số không bằng nhau cũng chẳng quá quan trọng; nghe nói MariaDB thực hiện quét toàn bảng với
ORDER BY RAND() LIMIT 1Cache từ xa nằm cục bộ trong trung tâm dữ liệu, được chống lưng bằng lưu trữ bền vững và có thể đặt TTL dài
Trong thời gian TTL của cache, có thể không bốc được bài viết đã được khôi phục, nhưng không sao
Tính cục bộ theo trung tâm dữ liệu đảm bảo một mức chịu lỗi và độ trễ thấp nhất định, còn lưu trữ bền vững giúp giảm vấn đề cache lạnh khi khởi động lại
Mốc nước cao nhất của phạm vi ID có thể cập nhật bất đồng bộ, và việc bài mới tạm thời chưa hiện ra cũng không sao
Hóa ra chỉ là tình cờ
Cách triển khai hiện tại khi số bài viết tăng lên thì trọng số sẽ xấp xỉ nhau hơn, và từng người dùng dù sao cũng chỉ nhận một bài viết ngẫu nhiên nên có khả năng họ chẳng mấy quan tâm đến tính công bằng, nghe cũng hợp lý
Việc có thể tìm thấy ở một nơi những thông tin như một loài bướm đêm bình thường ở Peru, một ngôi làng nhỏ nào đó ở Iran, hay loại bài đọc ngày Chủ nhật thời Victoria ở Anh thật sự đáng kinh ngạc
Trước Internet, những nội dung này có lẽ còn không đáng tiền giấy để in ra, nhưng giờ chi phí lưu trữ đám mây gần như bằng 0, nên ta có được thông tin đuôi dài cực kỳ giá trị
Xin cảm ơn những người đóng góp và duy trì các nội dung như vậy
Nói thêm, sẽ rất tuyệt nếu có thể để lại ghi chú trên một trang kiểu “tôi đã ghé trang này và muốn kết nối với người khác cũng quan tâm đến loài bướm đêm Peru Foovius Barivius”
https://gwern.net/inclusionism
Ví dụ có thể có một feed dọc kiểu TikTok tìm ra những bài mà người dùng có khả năng xem lâu nhất, và WikiScroll cũng đã phần nào đi theo hướng đó
Cũng có thể gắn phòng chat vào từng bài viết để mọi người trò chuyện, hoặc có tính năng DM nhưng chỉ cho gửi liên kết Wikipedia
Ý tưởng Wikipedia như một chất xúc tác xã hội rất thú vị
https://wikiscroll.blankenship.io/
Nếu bạn để lại ghi chú trên trang, người khác cài cùng tiện ích có thể thấy, và nếu may mắn bạn có thể được liên hệ
Theo tôi, đó là phần hay nhất của Internet
Có thể chứng minh bằng toán học rằng trên Wikipedia không có bài nào là không thú vị
Chỉ cần chứng minh bằng phản chứng
Sau khi xếp hạng tất cả bài viết theo mức độ thú vị rồi sắp xếp, nếu nhìn vào giá trị thấp nhất thì chắc chắn sẽ tồn tại bài viết kém thú vị nhất
Nhưng chính việc bài đó là bài kém thú vị nhất trên toàn Wikipedia lại khiến nó trở nên thú vị
Tương tự, có lẽ những bài có lượt xem thấp nhất được nêu trong bài blog này đến giờ cũng đã mất vị trí đó rồi
Có vẻ nó giả định rằng chỉ có đúng một bài kém thú vị nhất
Nhưng cũng có thể có hàng trăm bài cùng mức độ thú vị thấp nhất, và khi đó phải xem hàng trăm bài ấy là những bài không thú vị
Còn phải tính cả sự thú vị của việc là bài kém thú vị thứ hai nữa
Có lẽ điều đó đúng, nên QED
Cho đến khi có ai đó tìm được bài kém thú vị nhất và nghĩ về nó, bài đó chưa trở nên thú vị
Tính chất toán học thì vĩnh viễn, tồn tại bất kể có ai nhìn thấy hay không
Tôi nhớ đến loạt video của Geoff Marshall về Least Used Stations của Network Rail ở Anh
https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
https://www.youtube.com/@geofftech2
Các quản trị viên Wikipedia khá tích cực xóa những bài mà họ cho là không quan trọng, nên có lẽ bài có lượt xem thấp nhất sẽ thay đổi khá thường xuyên
Cũng có thể có trò nghịch ngợm nào đó từ phía cơ quan tình báo
Đây là một cách rất hay để xóa đi những sự thật lịch sử gây khó chịu
Giờ thì nó chỉ còn là một câu chuyện nhỏ buồn cười về rootkit, hoàn toàn không có âm mưu chính trị cụ thể nào nữa
Chẳng hạn, tôi nghĩ sẽ khó tìm được một thành phố, thị trấn, làng hay khu dân cư nhỏ nào ở Mỹ mà không có bài trên Wikipedia
Nhìn Jack Wade, Alaska trên Google Maps thì chỉ thấy chừng 8 căn nhà, vậy mà vẫn có trên Wikipedia
Tôi cũng không nghĩ bài về một loài bướm đêm hiếm sẽ bị gỡ
Tuy vậy, vẫn cần có chính sách nào đó để không phải mọi cá nhân trên Trái Đất đều có bài Wikipedia
Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
Tuy nhiên, việc bị phá hoại do vị thế độc đáo này bị lộ ra có thể là ngoại lệ
Nói nhỏ với những ai quan tâm: có thể đây chỉ là sản phẩm phụ của bộ dữ liệu tác giả dùng, nhưng một điểm chung của các bài có lượt xem thấp nhất là chủ đề của chúng thuộc những nhóm thường không phải đối tượng bị xóa theo nguyên tắc nội dung của Wikipedia
Tác giả nói các bài về bướm đêm ít có khả năng tạo cơ hội để thúc đẩy quan điểm gây tranh cãi, nhưng nhìn lịch sử chỉnh sửa thì hồi đầu năm nay đã có bất đồng về sải cánh của Scrobipalpula crustaria
11–13mm hay 10–13mm?
Người ta có cảm xúc mạnh mẽ về những chuyện như thế này
Nếu tìm ra và công bố tên bài Wikipedia có lượt xem thấp nhất, lượt xem của bài đó sẽ tăng lên, khiến lý do tìm nó ban đầu biến mất
https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
Có vấn đề gì sao?
Công bằng mà nói, đây là phân tích bộ dữ liệu năm 2021 nên tất nhiên không bị ảnh hưởng
Dù tìm được một từ, khoảnh khắc bạn thông báo sự tồn tại của nó thì nó bị phá hủy
Cứ xem
quizzaciouslylà thấyDù có hơn 6 triệu bài viết, 6.0e6 đã là con số có thể brute force được từ nhiều thập kỷ trước
Tìm kiếm tuyến tính có thể còn mất ít thời gian hơn đọc một bài, và gần như chắc chắn ít thời gian hơn viết bài này
Dĩ nhiên nếu làm vậy thì đã không thú vị hay thông minh bằng, nhưng kỹ thuật tốt hầu như lúc nào cũng như thế này