- Chỉ với 6 từ khóa tìm kiếm đơn giản cũng cho thấy các kết quả hàng đầu của những công cụ tìm kiếm lớn như Google, Bing thường lẫn spam SEO, quảng cáo lừa đảo và câu trả lời không chính xác
- Đối tượng so sánh gồm Google, Bing, Marginalia, Kagi, Mwmbl và ChatGPT 3.5; thử nghiệm được thực hiện khi tắt trình chặn quảng cáo, bao gồm cả kết quả bản địa hóa theo Vancouver, BC
- Marginalia thường không đưa ra được câu trả lời hoàn chỉnh, nhưng tương đối ít kết quả lừa đảo hơn; ChatGPT hoạt động tốt ở một số lượt tìm kiếm, nhưng cũng có trường hợp từ chối trả lời và ảo giác
- Google và Bing đưa website lừa đảo cùng kết quả mang tính quảng cáo lên cao trong các truy vấn phổ biến với người dùng thông thường, như tải video YouTube, trình chặn quảng cáo hay dự báo tuyết mùa đông
- Để có kết quả tốt, người dùng giờ cần các mẹo của người thành thạo như giới hạn theo site, kết hợp từ khóa, tìm kiếm tiếp nối; điều này ngày càng xa với trải nghiệm tìm kiếm trước đây kiểu “chỉ cần tìm là được”
Cách so sánh và tiêu chí đánh giá
- Đối tượng so sánh là Google, Bing, Marginalia, Kagi, Mwmbl và ChatGPT 3.5
- Từ khóa tìm kiếm được chọn từ ba nhóm
- Những truy vấn mà người dùng không chuyên có thể dùng khi thiết lập máy tính mới
- Câu hỏi kỹ thuật/khoa học mà học sinh trung học có thể hiểu nhưng khó tìm câu trả lời
- Tìm kiếm thông tin địa phương thực sự cần trong lúc viết bài
- 6 truy vấn được dùng như sau
download youtube videosad blockerdownload firefoxWhy do wider tires have better grip?Why do they keep making cpu transistors smaller?vancouver snow forecast winter 2023
- Đánh giá được chia thành
Terrible,Very Bad,Bad,Ok,Good,Great, và kết quả lừa đảo được xem là yếu tố trừ điểm lớn - Phần lớn lượt tìm kiếm được thực hiện vào tháng 11/2023, một số vào giữa tháng 12
- Các truy vấn trên công cụ tìm kiếm được chạy trong cửa sổ ẩn danh mới đã xóa cookie; Kagi không cho phép tìm kiếm khi đăng xuất nên dùng tài khoản mới
- Vị trí là Vancouver, BC, và có vẻ một số công cụ tìm kiếm đã áp dụng xếp hạng bản địa hóa
Kết quả tổng thể
- Marginalia đôi khi đưa ra câu trả lời khá ổn nhưng không hoàn hảo; với các câu hỏi không trả lời được, nó thường không có kết quả hoặc trả về kết quả rõ ràng không liên quan
- Tỷ lệ kết quả lừa đảo thấp hơn các công cụ tìm kiếm khác, nhưng ngay trong thử nghiệm này vẫn có một số kết quả lừa đảo
- Mwmbl cho phép người dùng trực tiếp chỉnh sửa thứ hạng kết quả tìm kiếm
- Một truy vấn sau khi chỉnh sửa đã có kết quả có thể xem là
Great, nhưng vì đó là kết quả được tối ưu thủ công theo benchmark nên không tính vào điểm
- Một truy vấn sau khi chỉnh sửa đã có kết quả có thể xem là
- Google có xu hướng ưu tiên mạnh các kết quả mới và video YouTube gần đây
- Với tìm kiếm
ad blocker, một video YouTube có nội dung nghèo nàn xuất hiện; video đó còn nói sai rằng kết quả đầu tiên là “chính thức của Google”
- Với tìm kiếm
- ChatGPT trong một trường hợp tốt hơn hẳn các công cụ tìm kiếm truyền thống; ở các trường hợp khác thì tạm ổn hoặc né tránh trả lời, và tạo ra ảo giác ở nhiều truy vấn
- Google và Bing được đánh giá là trả về nhiều kết quả mang tính ảo giác/bị thao túng hơn ChatGPT trong một số truy vấn
- Với tìm kiếm dự báo tuyết, kết quả gồm các website dự báo giả để kiếm doanh thu quảng cáo và kết quả từ doanh nghiệp địa phương dụ đăng ký dịch vụ dọn tuyết không cần thiết
Kết quả theo từng truy vấn
-
download youtube videos- Kết quả lý tưởng là
yt-dlphoặc một GUI wrapper miễn phí, mỏng choyt-dlp; các dự án ít được cập nhật hơn nhưyoutube-dlcũng được xem là chấp nhận được - Google không có kết quả tốt; phần lớn kết quả tự nhiên hàng đầu là dụ cài badware, quảng cáo lừa đảo, lựa chọn thay thế trả phí, bài listicle mang tính quảng cáo và video blogspam trên YouTube
- Bing cũng không có kết quả tốt; có nhiều lời dụ cài tiện ích mở rộng trông như badware, nút tải giả và quảng cáo trình tải xuống trả phí
- Kết quả đầu tiên của Marginalia là một câu trả lời cũ liên quan đến
youtube-dl, và cũng có bài blog về cách cài đặt/sử dụngyt-dlp, nên được đánh giá là kết quả tốt nhất - Kagi chứa đầy các site tải xuống nêu Norton SafeWeb, pop-up scam, liên kết archive.org cũ của
youtube-dl, v.v. - Mwmbl lẫn lộn một số phần mềm trả phí, bài viết cài đặt
youtube-dl, video liên quan đến GUI wrapper, cùng các site lừa đảo hoặc chất lượng thấp - ChatGPT trả lời rằng không nên tải xuống nếu không có YouTube Premium, và từ chối đề xuất ứng dụng/website bên thứ ba cụ thể
- Kết quả lý tưởng là
-
ad blocker- Kết quả lý tưởng là uBlock Origin, và tối thiểu là một trình chặn quảng cáo không lừa đảo, mặc định chặn quảng cáo
- Google không có liên kết uBlock Origin; kết quả lẫn các trình chặn quảng cáo tham gia chương trình Acceptable Ads, mặc định cho phép một số quảng cáo, cùng quảng cáo trông có vẻ lừa đảo
- Quảng cáo đầu trang của Bing dẫn tới Avast Secure Browser, TOTAL Adblock, các site đánh giá giả, v.v.; cách hiển thị quảng cáo rất tinh vi nên có thể bị nhầm là kết quả tìm kiếm thông thường
- Kết quả thứ 3 và 4 của Marginalia khuyên dùng uBlock Origin, kết quả thứ 8 là chính uBlock Origin; ít kết quả lừa đảo trực tiếp nên khá tốt
- Mwmbl lẫn Ghostery, trình chặn quảng cáo trả phí, site đầy quảng cáo và bình luận Hacker News đề xuất uBlock Origin
- Kagi đưa Adblock Plus và các kết quả thuộc họ AdBlock lên đầu, đồng thời có cả bài viết với pop-up dụ cài TOTAL Adblock
- Với câu hỏi
How do I install the best ad blocker?, ChatGPT đề xuất uBlock Origin ở khuyến nghị đầu tiên, nên được đánh giá là tốt nhất cho truy vấn này
-
download firefox- Kết quả lý tưởng là liên kết tải Firefox, và không có liên kết giả/lừa đảo
- Bing, Mwmbl và Kagi cung cấp liên kết liên quan đến tải Firefox nên được đánh giá
Great - ChatGPT đưa hướng dẫn cài đặt không chính xác về mặt kỹ thuật, nhưng chỉ người dùng tới đúng site, nên được cho là có khả năng giúp người dùng tải được Firefox
- Marginalia không có liên kết tải Firefox trực tiếp, chỉ có các liên kết gián tiếp liên quan đến Firefox, nên được đánh giá
Ok - Phần lớn liên kết hàng đầu của Google là liên kết tải bình thường, nhưng kết quả thứ 7 và thứ 10 có liên kết lừa đảo dẫn tới cài badware hoặc yêu cầu thông tin thẻ tín dụng, nên được đánh giá
Bad
-
Why do wider tires have better grip?- Câu trả lời đúng được cho là phải giải thích tác động của lốp rộng lên phanh trên mặt đường khô và thời gian vòng chạy, phanh và hiện tượng trượt nước trên mặt đường ướt, khác biệt khi thay riêng độ rộng mâm và độ rộng lốp, cũng như thay đổi áp suất lốp
- Google, Bing và Kagi trả về nhiều giải thích không đầy đủ hoặc sai về diện tích bề mặt, vệt tiếp xúc, tải động, cùng các trang mang tính quảng cáo
- ChatGPT có ngữ pháp tốt nhưng đưa ra câu trả lời ảo giác nghe hợp lý kiểu bình luận Internet
- Marginalia không có kết quả cho câu hỏi gốc; khi bỏ dấu hỏi thì chỉ trả về một kết quả sai
- Mwmbl trả về bài NYT không liên quan hoặc bài về lốp xe đạp
- Không công cụ tìm kiếm nào đưa ra được giải thích đúng; Marginalia được đánh giá tương đối tốt hơn vì có ít kết quả sai và liên kết lừa đảo hơn
-
Why do they keep making cpu transistors smaller?- Câu trả lời kỳ vọng là tài liệu giải thích trực quan vì sao transistor nhỏ hơn thì nhanh hơn, và liên hệ thế nào với công suất/điện dung
- Google trả về knowledge card cùng kết quả Stack Exchange, Quora, nhưng phần lớn chỉ là câu trả lời một phần như “nhỏ hơn thì nhanh hơn” hoặc trả lời cho câu hỏi khác
- Bing được đánh giá
Okvì một phần knowledge card ở đầu có câu trả lời một phần, có thể dẫn tới tìm kiếm tiếp theo - Kagi trả về kết quả Reddit, Stack Exchange, Quora, Metafilter; liên kết thứ 10 có thể dẫn tới Dennard Scaling, v.v., nhưng câu trả lời trực tiếp còn yếu
- Marginalia không có kết quả, còn Mwmbl chỉ trả về một bài Vox không liên quan có tiêu đề “Why do artists keep making holiday albums?”
- ChatGPT đưa ra câu trả lời không thực sự trả lời, kiểu hiệu năng tăng; khi yêu cầu giải thích thêm thì đưa ra câu trả lời dễ gây hiểu nhầm về truyền lan mạch và liên kết nội bộ
-
vancouver snow forecast winter 2023- Kết quả tốt là dự báo tuyết nhiều tháng cho mùa đông 2023 của Environment Canada, cho biết Vancouver sẽ có tuyết ít hơn đáng kể so với trung bình và nhiệt độ cao hơn
- Google hiển thị một dự báo có vẻ giả từ doanh nghiệp dọn tuyết địa phương dưới dạng knowledge card; trang này dự báo nhiều tuyết và lạnh để thúc đẩy mua dịch vụ dọn tuyết
- Trang có vẻ là kết quả liên quan hàng đầu của Bing là một site dự báo giả SEO dường như đã bịa xác suất “bão mùa đông” theo từng ngày
- Kagi đưa site dự báo giả của Bing vào 4 kết quả đầu, đồng thời có cả tin không liên quan và spam SEO
- Marginalia không có kết quả; Mwmbl trả về các kết quả không liên quan như bài về mất điện năm 2022, dự báo tuyết Philadelphia, sông Ohio đóng băng, tin địa phương Oregon
- ChatGPT không trả lời trực tiếp mà bảo xem website hoặc ứng dụng thời tiết; có một lần, trong prompt bị gắn nhầm
User\n, nó đề xuất Environment Canada
Cách quảng cáo, SEO và ảo giác bị trộn vào
- Kết quả công cụ tìm kiếm lẫn cả kết quả bị thao túng có chủ ý và các trang trại quảng cáo SEO thông thường
- Với tìm kiếm dự báo tuyết, có các site dự báo giả để kiếm doanh thu quảng cáo và dự báo giả dụ mua dịch vụ dọn tuyết
- Với tìm kiếm trình chặn quảng cáo, có các site đánh giá giả trông như đánh giá khách quan nhưng dẫn người dùng tới việc cài một trình chặn quảng cáo cụ thể
- Với tìm kiếm tải video YouTube, phần mềm trả phí, tiện ích đáng nghi là badware và nút tải giả liên tục xuất hiện thay vì công cụ mã nguồn mở miễn phí
- Hệ sinh thái tìm kiếm truyền thống được cho là có động lực mạnh để đưa lên đầu những kết quả có lợi nhất cho chuỗi cung ứng phần mềm, hơn là kết quả tốt nhất cho người dùng
- Các tín hiệu xếp hạng như lượt nhấp và tương tác chỉ có thể củng cố kết quả tốt khi người dùng đủ thành thạo để nhận ra kết quả tốt
Vấn đề động lực của tìm kiếm dựa trên quảng cáo
- Bài báo PageRank ban đầu của Sergey Brin và Larry Page cho rằng tìm kiếm dựa trên quảng cáo có sự lệch pha về động lực với việc cung cấp kết quả tìm kiếm tốt
- Bài báo giải thích rằng doanh thu quảng cáo có thể làm công cụ tìm kiếm thiên về phía nhà quảng cáo và rời xa nhu cầu của người tiêu dùng
- Google và Bing hiện đã thay đổi theo hướng khiến quảng cáo trông như kết quả tìm kiếm thật; người dùng thường không phân biệt được quảng cáo và kết quả tìm kiếm tự nhiên
- Đánh giá thứ hạng dựa trên thứ tự hiển thị trên trang
- Nếu có 4 quảng cáo phía trên kết quả tự nhiên, quảng cáo được tính là hạng 1–4, còn kết quả tự nhiên là hạng 5
- Trong ví dụ tìm kiếm
cellular phone, kết quả đầu của Google đầy Google Store Pixel 7, điện thoại Android trên Amazon, Wikipedia, kết quả thương mại và spam SEO - “The Effect of Cellular Phone Use Upon Driver Attention”, từng được bài PageRank nêu là kết quả hàng đầu tốt, bị chôn dưới đống kết quả thương mại và không còn thấy được
Công cụ tìm kiếm nhỏ và khả năng metasearch
- Việc Marginalia, dù là công cụ tìm kiếm do một người phát triển, vẫn cho kết quả tương đối tốt ở một số truy vấn là một trường hợp thú vị
- Việc tạo một công cụ tìm kiếm phổ biến thay thế Google vẫn rất khó
- Lập chỉ mục các nguồn thay đổi theo thời gian thực như Twitter, tin tức
- NLP vượt mức cơ bản
- Số tính năng người dùng kỳ vọng ở công cụ tìm kiếm tăng lên
- Ngược lại, việc tạo một công cụ tìm kiếm hữu ích cho một nhóm nhỏ người dùng được cho là đã dễ hơn
- Vì kết quả của Google đã tệ hơn trước ở nhiều truy vấn
- Google được cho là ngày càng thường không trả về được trang mong muốn, ngay cả khi tìm các trang ít phổ biến hơn hoặc tìm chuỗi ký tự được nhớ chính xác
- Việc gần như không xảy ra trong quá khứ đã hiếm khi xuất hiện vào năm 2015, và nay xảy ra với tỷ lệ đáng kể
- Khả năng kết hợp nhiều công cụ tìm kiếm nhỏ để cho nhiều người dùng kết quả tốt hơn Google được cho là từ nhiều năm nay đã gần như “có”
- Cách tiếp cận tuyển chọn bởi người dùng của Mwmbl được cho là khó nếu không có điều chỉnh thêm
- Có trường hợp người dùng chỉnh sửa thêm blogspam lên đầu kết quả tìm kiếm
RSS, và không có cách báo cáo dễ tìm
- Có trường hợp người dùng chỉnh sửa thêm blogspam lên đầu kết quả tìm kiếm
- Cách tổng hợp nhiều công cụ tìm kiếm, ChatGPT, Bard, v.v. giống Metacrawler kiểu năm 1996, nếu bỏ qua vấn đề pháp lý/chi phí giấy phép, có thể khá tốt về mặt kỹ thuật
Phụ lục: Các công cụ tìm kiếm khác
- DuckDuckGo trong quá khứ rất giống Bing, và lần này nếu bỏ quảng cáo của Bing thì vẫn tương tự dù không còn giống như trước, nên không đáng đưa vào bảng riêng
- Nếu người thành thạo viết truy vấn tốt thì nó ổn như Google, nhưng không tốt với các truy vấn ngây thơ trong so sánh này
- wiby.me là công cụ tìm kiếm để tìm các kết quả tương đối mơ hồ, tương tự Marginalia
- Với 4 truy vấn, nó đưa ra các kết quả thú vị và rất khác biệt, nhưng không trả về kết quả liên quan
- searchmysite.net đưa ra kết quả phần nào liên quan ở một số truy vấn, nhưng mức độ liên quan không bằng Marginalia
- Nó có ít trang lừa đảo và quảng cáo hơn nhiều so với Google, Bing, Kagi
- indieweb-search.jamesg.blog không xử lý được truy vấn nào do lỗi máy chủ
- Teclis vẫn còn ô tìm kiếm nhưng đã đóng vì bot abuse; trang chủ có thông báo rằng 99,9% lưu lượng là bot
- Có thông báo rằng kết quả Teclis có thể dùng qua lens
Non-commercial Webcủa Kagi và API
- Có thông báo rằng kết quả Teclis có thể dùng qua lens
Phụ lục: Quá trình đi vòng để tìm câu trả lời tốt
- Với câu hỏi về độ bám của lốp rộng, các công cụ tìm kiếm thông thường không đưa ra câu trả lời tốt; quá trình tìm kiếm chuyển sang tìm trên YouTube, đọc bình luận, sách về ô tô, khám phá sách tương tự, rồi tìm theo tên model cụ thể
Tune To Wincủa Carroll Smith nói rằng vệt tiếp xúc rộng làm giảm tích tụ nhiệt và cho phép thiết kế loại cao su mềm hơn, hoạt động trong dải nhiệt hẹp hơn, nhưng được cho là chưa giải thích đầy đủ hiện tượng quan sát đượcThe Unified Theory of Tire and Rubber Frictioncủa Kummer,The Physics of Tire Tractioncủa Hays và Browne,Race Car Vehicle Dynamicscủa Milliken và Milliken cũng chưa đạt tới lời giải thích đầy đủThe Science of Vehicle Dynamicscủa Guiggiani gần hơn với việc suy nghĩ và mô hình hóa các yếu tố liên quan- Từ gợi ý
brush modelở chương cuối, tác giả tìmbrush model tire width, dẫn tớiTire and Vehicle Dynamicscủa Pacejka; cuốn sách này được cho là bắt đầu giải thích độ bám của lốp rộng và mô hình hóa động lực học lốp/xe cần thiết - Để có kết quả tìm kiếm tốt cần mẹo của người thành thạo trong việc kết hợp từ khóa, site và tìm kiếm tiếp nối; không phải người dùng nào cũng có các mẹo này
Ví dụ về knowledge card của Google
- Kết quả knowledge card của Google được cho là thường không chính xác, ngay cả với câu trả lời dễ tìm hoặc câu hỏi buồn cười
oc2 gemini lengthtrả về20″, là chiều dài em bé trong một bài báo, thay vì chiều dài thuyềnbusy beaver numbertrả về số điện thoại(604) 375-2754Feedly revenuetrả về$5.2M/yrdựa trên một site dường như thao túng ước tính doanh thu/lợi nhuận của công ty tư nhânboston up118s dimensionstrả về kích thước đàn piano là5826298 x 5826899 x 582697 inIntel number of engineerstrả về số điện thoại thay vì số kỹ sưfraser river current speedtrả về con số không chính xác97 to 129 kilometers per hourfutura c-4 surfski weighttrả về39 pounds, là trọng lượng của một surfski khác
Trả lời các phê bình
- So sánh này không phải peer-reviewed study, và có đánh giá chủ quan trên một vài truy vấn
- Dựa trên kinh nghiệm với các bài báo trong lĩnh vực truy xuất thông tin và best paper award, tác giả cho rằng không phải cứ là bài báo học thuật thì tự động nghiêm ngặt hơn
- Một số phản bác từ người dùng Kagi là các trường hợp ghim kết quả GitHub hoặc chỉ chạy những truy vấn mà GitHub sẽ cho kết quả tốt
- Chưa có phản bác nào nói rằng họ thực sự lấy được kết quả tốt cho các truy vấn về lốp, transistor và dự báo tuyết
- Trọng tâm của tranh luận về chất lượng tìm kiếm không phải là mẹo tìm kiếm của người thành thạo, mà là người dùng thông thường với truy vấn đơn giản dễ gặp quảng cáo lừa đảo và spam SEO đến mức nào
1 bình luận
Ý kiến trên Hacker News
Gần đây thuật toán tìm kiếm đã được cải thiện đáng kể, nhưng tôi nghĩ Marginalia Search hơi may mắn với các truy vấn mẫu
Kết quả vẫn còn thất thường hơn các lựa chọn thay thế khác, và điều đó cũng cho thấy đánh giá chất lượng tìm kiếm khó đến mức nào
Hiệu quả cũng phụ thuộc rất nhiều vào việc người dùng có hiểu rằng đây là một công cụ tìm kiếm theo từ khóa không có khả năng hiểu ngữ nghĩa hay không
“Hiểu ngữ nghĩa” đôi khi có thể thiên lệch và hoạt động một cách đáng ngờ
Tôi đang theo dõi ở mức nào đó mảng tìm kiếm DIY/phi doanh nghiệp như YaCY, và muốn biết thêm bối cảnh các quyết định kỹ thuật khi xây dựng công cụ tìm kiếm
Nhìn chung Marginalia là một công trình rất ấn tượng, và tôi chỉ nghe người dùng ở đây đánh giá tích cực về nó
Tôi tìm marginalia trên DDG nhưng không thấy ở trang đầu; trên Google thì nó xuất hiện sau một loạt kết quả linh tinh
Vào marginalia.nu thì gặp lỗi SSL, còn search.marginalia.nu thì hoạt động
Khi tìm duckduckgo trên Marginalia, liên kết đầu tiên liên quan đến ứng dụng nên phần nào có liên quan, nhưng các kết quả còn lại dù có dính đến DDG thì mức độ liên quan vẫn khá mơ hồ
Tìm uBlacklist được nhắc ở trên cũng không thấy kết quả nào liên quan trực tiếp
Đúng là tìm kiếm đã tệ hơn nhiều, nhưng khả năng biết những từ khóa ma thuật như “ublock origin” thay vì “Adblock”, “yt-dlp” thay vì “download YouTube” và cấu trúc câu truy vấn cũng đã tốt hơn
Về cơ bản, tất cả chúng ta đã và đang làm prompt engineering trước một mô hình ngôn ngữ khổng lồ ở quy mô toàn Internet, nơi mọi bên đều là công ty spam
Tìm kiếm ngày nay khá khó, và ai cũng biết cách thao túng kết quả
Tôi khuyên dùng các công cụ tìm kiếm cho phép thay đổi hiệu quả những trang nào sẽ xuất hiện, như Kagi hoặc Programmable Search Engines của Google
Riêng YouTube thì tôi chặn vì ghét việc nó làm ô nhiễm kết quả thông thường bằng video, dù thỉnh thoảng có kết quả đúng. Lấy thông tin từ video mất quá nhiều thời gian
Tính năng cho phép đề xuất kết quả cho một truy vấn cụ thể thì hấp dẫn, nhưng nó cũng rất dễ bị thao túng, và rốt cuộc có vẻ chỉ cách tiếp cận DIY mới còn kiểm soát được
Trường hợp của tôi là chỉ cho phép kết quả từ những tên miền mà tôi tin là đúng. Cách dùng danh sách trắng có nhược điểm, và thường thì tôi xác minh tên miền mới qua các kênh xã hội như Reddit hoặc nơi này, chứ không phải qua kết quả tìm kiếm
Tôi cho rằng có một sự đánh đổi mang tính bản chất giữa khả năng khám phá và khả năng kết quả bị thao túng
Tôi hiểu cảm giác nhớ kết quả tìm kiếm Google năm 2008, nhưng khi đó lượng nội dung ít hơn bây giờ vài bậc độ lớn, và doanh nghiệp cũng chưa biết thứ hạng tìm kiếm có giá trị đến mức nào, nên có lẽ SEO hầu như chưa tồn tại
Ngoài ra, tôi không đồng ý rằng khi người dùng trung bình tìm “Youtube Download” thì yt-dlp là “đáp án đúng”. Rất có thể người dùng trung bình không biết, cũng không muốn dùng dòng lệnh
Nhiều website chỉ là các trại SEO chất lượng thấp tái chế cùng một nội dung, vì chúng dễ làm và chi phí lưu trữ rẻ
Ngược lại, làm video cần thời gian và công sức, nên rào cản để dùng làm click farm cao hơn
Đã nhiều lần khi tìm kiếm truyền thống thất bại, một video đăng khoảng năm 2009 trên YouTube lại giải thích rõ ràng, bình tĩnh và chi tiết đúng thứ tôi đang tìm
Khi tìm thông tin mua sản phẩm, đây cũng thường là nguồn tốt hơn. Ví dụ khi tìm nên mua quạt nào, có những kênh chuyên thử nghiệm công dụng của nhiều loại quạt và trình bày phương pháp cùng kết quả bằng video
Các kênh đại chúng thì không giúp ích mấy, nhưng những video nhiệt huyết kiểu “web cũ” tồn tại ở hầu như mọi chủ đề và giống như một kho báu
Chẳng hạn bài Wikipedia về “link farming” giải thích rằng việc đó đã có từ năm 1999 và nhắm vào SEO cho Inktomi
https://en.wikipedia.org/wiki/Link_farm
Tôi nhớ khoảng năm 2004, trong một bài thuyết trình nội bộ của Amazon cũng có nội dung rằng tăng cường Google SEO cho các trang web của Amazon sẽ làm tăng lưu lượng truy cập và doanh thu. Amazon thậm chí còn hơi đi sau vì một lý do nào đó giống hội chứng NIH
Nếu con người phân biệt được thì về nguyên tắc máy tính cũng có thể làm được
Chỉ cần thêm một dropdown nhỏ vào UI liên kết công khai của từng PSE để chọn cái muốn dùng là được, tiếc là không có
Giggle[1] cung cấp tính năng này, và tôi chạy nó cục bộ cùng với Kagi để tìm kiếm cụ thể hơn trên danh sách tên miền đã thu thập trong vài năm
Nếu click không tạo ra doanh thu thì phần lớn cuộc chơi sẽ biến mất
Không có nghĩa là họ không có quyền kiếm tiền, nhưng mô hình đó rõ ràng khuyến khích hành vi thù địch với người dùng
Ngay cả các trang hợp pháp như báo chí cũng dùng mô hình này, nên có thể nên để nó thành một tùy chọn
Tôi biết đến Kagi trên HN, và sau khi thử tìm kiếm 100 lần thì đã đăng ký thuê bao
Khi tìm kiếm nội dung bất kỳ liên quan đến JS hoặc CSS, MDN hiện ra là kết quả đầu tiên; nếu không thì cũng có thể hạ thứ hạng các trang spam ở phía trên
Sẽ thật tốt nếu các mô hình ngôn ngữ lớn chạy cục bộ được huấn luyện để phát hiện clickbait hoặc nội dung đầu tư ít công sức
Hãy tưởng tượng trong tìm kiếm YouTube, mọi nội dung clickbait đều bị gập lại giống như cách Kagi gom các bài dạng danh sách, và chỉ phần còn lại là nội dung có khả năng chất lượng cao. Không biết hiện giờ có làm được không
Đúng là một mẹo tối ưu cuộc sống tuyệt vời
Thật ngạc nhiên khi một công cụ tìm kiếm không ngập quảng cáo có thể tốt đến mức nào
Tôi vốn khá ghét các gói thuê bao, nên với một lĩnh vực dịch vụ vốn miễn phí thì đây là một đánh giá khá có ý nghĩa
Thỉnh thoảng tìm kiếm địa phương thì phải chuyển sang Google, nhưng ngoài chuyện đó thì hài lòng
Chia sẻ kết quả Kagi hiện tại để những người không có tài khoản có thể so sánh
youtube downloader
https://kagi.com/search?q=youtube+downloader&r=us&sh=_szITdy...
ad blocker
https://kagi.com/search?q=Ad+blocker&r=us&sh=-BHzV2ZoCDpmgOu...
download Firefox
https://kagi.com/search?q=Download+Firefox&r=us&sh=zkkmc_EQX...
why do wider tires have better grip?
https://kagi.com/search?q=Why+do+wider+tires+have+better+gri...
why do they keep making cpu transistors smaller?
https://kagi.com/search?q=Why+do+they+keep+making+cpu+transi...
vancouver snow forecast winter 2023
https://kagi.com/search?q=Vancouver+snow+forecast+winter+202...
Tôi đồng ý với tác giả rằng web có quá nhiều spam. Tôi cho rằng Kagi thường hạ thứ hạng spam khá tốt, và số lượng quảng cáo/tracker là tín hiệu xếp hạng tiêu cực của Kagi
Dù vậy vẫn có thể làm tốt hơn, và các chế độ tìm kiếm chuyên biệt như “Small Web” về cơ bản loại bỏ spam
Hoan nghênh kiểu kiểm chứng như thế này từ cộng đồng, và mong mọi người tiếp tục buộc chúng tôi phải giữ sự trung thực
Trong các ví dụ cũng không thấy spam
Với “why do wider tires have better grip?”, câu trả lời là lốp rộng phân bổ trọng lượng đều hơn nhờ diện tích tiếp xúc lớn hơn, đồng thời tăng độ bám khi vào cua, cải thiện khả năng điều khiển và độ ổn định
Với “why do they keep making cpu transistors smaller?”, câu trả lời là transistor nhỏ hơn thực hiện được nhiều phép tính hơn mà không quá nhiệt, có hiệu suất năng lượng tốt hơn, đồng thời giảm kích thước die để hạ chi phí và tăng mật độ, giúp tăng số lõi trên mỗi chip
Với “vancouver snow forecast winter 2023”, câu trả lời là trong mùa 2023/2024 dự kiến sẽ có lượng tuyết rơi đáng kể và nhiệt độ dao động quanh mức đóng băng, nên cần chuẩn bị
Thật sự khó hiểu vì sao trong các bài viết liên quan đến ChatGPT lại dùng 3.5
Đây là cách khá dễ gây hiểu lầm về kết quả có thể thu được từ phiên bản ChatGPT tốt nhất hiện có
Để so sánh, đây là kết quả khi đưa tất cả câu hỏi của tác giả cho GPT-4
https://chat.openai.com/share/ed8695cf-132e-45f3-ad27-600da7...
Nói về một thứ mà phần lớn độc giả sẽ không trả tiền để dùng gần như chẳng có ích gì, và một bên thứ ba bất kỳ cũng không có nghĩa vụ khuyến khích người khác gửi tiền cho OpenAI
Nếu không hài lòng việc mọi người dùng 3.5, thì nên phàn nàn với OpenAI, chứ không phải với những người đang dùng dịch vụ được cung cấp miễn phí
Cá nhân tôi không cảm thấy những lời ca ngợi quá mức về khác biệt giữa 4 và 3.5 là có cơ sở
https://news.ycombinator.com/item?id=38304184
Hoặc phải trả cố định 20 USD/tháng với giới hạn số tin nhắn, hoặc phải hiểu cách lấy API key, hoặc phải dùng một dịch vụ bên thứ ba có chi phí và giới hạn tương tự
Nên thử dùng uBlacklist. Đây là một công cụ kiểu như uBlock dành cho kết quả tìm kiếm
https://addons.mozilla.org/en-US/firefox/addon/ublacklist/
https://chromewebstore.google.com/detail/ublacklist/pncfbmia...
Có thể đồng bộ thiết lập và danh sách chặn cá nhân qua Dropbox hoặc Google Drive, và cũng có thể đăng ký theo dõi danh sách chặn
Tuy nhiên bạn phải tự bật công cụ tìm kiếm và đăng ký danh sách. Phần thiết lập đăng ký của uBlacklist hiện chưa có feed tích hợp sẵn
Trang của uBlacklist có một số feed
https://iorate.github.io/ublacklist/subscriptions
Tôi cũng tìm được một danh sách feed tốt hơn
https://github.com/quenhus/uBlock-Origin-dev-filter#other-fi...
Có thể nâng hạng tên miền hoặc đưa vào blacklist ngay từ kết quả tìm kiếm
Tôi dùng mấy năm rồi mà chưa gặp vấn đề gì
Mẹo nhanh: bật “Skip the "Block this site" dialog” và tắt “Hide the "Block this site" links” thì có thể chặn website spam nhanh hơn nhiều
Tôi thuộc phe vẫn cho rằng kết quả của Google còn rất tốt
Tuy nhiên tôi đang dùng uBlock Origin, và sẽ không thử tắt nó đi
Tôi hiểu ý tác giả tắt trình chặn quảng cáo để có được “trải nghiệm duyệt web của người không chuyên”, nhưng lẽ ra cũng có thể làm thêm một bài kiểm thử riêng với uBlock bật cho mọi truy vấn
Hơn nữa, vừa mô phỏng trải nghiệm của người không chuyên vừa kỳ vọng yt-dlp xuất hiện trong kết quả tải video thì hơi thiếu nhất quán
yt-dlp là một tiện ích Python chạy dòng lệnh. Nó còn xa mới là thứ dành cho người không chuyên
Phần lớn mọi người còn không biết video là tệp có thể tải xuống, và ngay cả trong số những người biết thì đa số cũng không biết dòng lệnh hay Python
Khi tìm “how to download youtube videos” trên Google, kết quả đầu tiên là một dịch vụ tên savefrom.net, hoạt động tốt và trông không giống lừa đảo. Theo tiêu chí của tôi thì đó là “rất tốt”
Nếu tìm “how to download youtube videos from the command line”, vài kết quả đầu là về youtube-dl, gồm cả liên kết GitHub và Super User. Không nhắc đến yt-dlp, nhưng youtube-dl là điểm khởi đầu tốt
https://msunduziassociation.online/perfect-online-videos/
https://gssaction.org/program-all-in-one-media-solutions/
Tôi chắc chắn sẽ xếp chúng vào nhóm “khủng khiếp” như tác giả
Nhập “https://www.youtube.com/watch?v=IkYVmtgxebU” rồi bấm “Download” thì một tab mới mở ra, cố cài phần mềm độc hại
Nếu từ chối cài đặt, tab mới đó chuyển đến trang chủ của phần mềm độc hại
Đóng tab đó và quay lại tab ban đầu thì savefrom.net hiển thị lỗi “The download link not found.” và không giúp tải video
Tôi có cảm giác mơ hồ rằng tìm kiếm đã tệ đi theo thời gian, nhưng đó không phải vấn đề lớn. Thường thì website tốt nằm trong một hai trang đầu, chỉ cần vào kiểm tra là được
Nhưng nếu điều đó có nghĩa là bạn bị tấn công ngay khi nhấp vào một trang, mức độ nghiêm trọng tăng vọt. Không chỉ quan trọng việc có website tốt hay không, mà còn quan trọng việc có vắng website xấu hay không
Ngoài ra, mọi người nói chung cần được rèn thói quen không tải chương trình từ website. Theo thời gian, có vẻ chuyện này đã khá hơn một chút
Google có thể hạ hạng các trang có liên kết đến tệp thực thi, và có lẽ họ đang làm vậy
Các tìm kiếm đời thường hơn biến thành việc lục lọi trong đống rác thậm chí không có cả cụm từ cần tìm
Tìm kiếm “verbatim” cũng phải cầu may. Hoặc bị phớt lờ, hoặc trả về 0 kết quả
Mô phỏng trải nghiệm của người không chuyên mà không có cách né tránh không phải là mẫu sử dụng phổ biến. Vì ai cũng có cách riêng để khai thác thêm giá trị từ công cụ mình thích
Nhưng bài viết này cho thấy cách thiết kế thí nghiệm, như “vì sao chọn truy vấn này, đánh giá lừa đảo ra sao”
Sẽ tốt nếu mọi người đánh giá, với cùng tinh thần đó, xem lựa chọn công cụ hiện tại của mình có đang mắc kẹt ở một tối ưu cục bộ hay không
Tôi hiểu vì sao mọi người cảm thấy kết quả tìm kiếm tệ
Với “Download youtube videos”, một kết quả tuyệt vời lại là “lý tưởng thì kết quả hàng đầu phải là yt-dlp hoặc một wrapper đồ họa mỏng”
Tôi chỉ cần một website nơi tôi có thể dán link tải xuống và lưu vào ổ cứng. Nó dùng gói nào thì tôi không quan tâm
Tôi cũng không lo phần mềm độc hại như thập niên 90, và 99,999% người dùng không đụng đến lập trình
Điều này khiến tôi nhận ra kết quả tìm kiếm chủ quan đến mức nào. Những kết quả “tuyệt vời” của họ đối với tôi toàn là “kinh khủng”
Đặc biệt vì máy tính khi đó là những thứ cô lập. Máy tính có kết nối mới là ngoại lệ
Nó xử lý video rất nhanh và cho tải xuống
Người hợp lý nào lại thích youtube-dl hơn chứ
Điều luôn khiến tôi bối rối ở thái độ “tìm kiếm đã trở nên quá tệ” là phần lớn nó dựa trên bằng chứng giai thoại là còn may, tệ hơn thì là ký ức giai thoại
Tôi cũng có ấn tượng rằng tìm kiếm đã tệ đi trong vài năm qua, nhưng làm sao biết thật sự có phải vậy không
Nó phải là một tuyên bố có thể kiểm chứng. Chỉ cần thử N truy vấn hàng đầu từ những nơi như Google Trends rồi xem hiệu năng
Có vẻ dễ tạo benchmark, nhưng không ai trong số những người phàn nàn về vấn đề này chịu làm vậy
Dan đã bắt đầu đưa ra bằng chứng thực tế và tiêu chí để chấm điểm kết quả, nhưng ngay cả vậy ông ấy cũng chỉ xem 5 ví dụ. Đó là mẫu thật sự nhỏ để đưa ra một tuyên bố tổng quát
Vì thế tôi vẫn thắc mắc tại sao có nhiều bài viết về cảm giác rằng tìm kiếm đã tệ đi như vậy, nhưng lại không có ai kiểm chứng tuyên bố đó
Nếu vấn đề chỉ là độ liên quan thì phê bình về cỡ mẫu nhỏ là hợp lý, nhưng nếu trọng tâm là thiệt hại thì mẫu nhỏ cũng có ý nghĩa
Nếu nói “tìm thấy kim tiêm đã qua sử dụng ở 3 trong 5 sân chơi”, thường người ta sẽ không đòi p-value và thanh sai số
Đặc biệt trong trường hợp này, tác giả đang trả lời câu hỏi “theo gu của tôi thì kết quả nào là tốt nhất?”
Tôi không định tạo công cụ tìm kiếm cạnh tranh với Google hay viết luận văn
Vấn đề này đã được nêu ở đây nhiều lần trong nhiều năm, nhưng câu trả lời luôn là lời giải thích chứ không phải giải pháp
Suy giảm chất lượng không xảy ra chỉ sau một đêm mà diễn ra qua nhiều năm
Google bắt đầu đưa ra “did you mean...?” vì một số truy vấn ít phổ biến hơn, buộc phải nhấp thêm lần nữa để thực hiện tìm kiếm ban đầu, rồi còn tệ hơn khi ngay cả các modifier để bỏ qua điều đó cũng bị phớt lờ
Khi tôi nhận ra một truy vấn đơn giản gồm ba từ được chọn cẩn thận cho ra hàng nghìn kết quả mà không có cái nào liên quan, tôi thấy như vậy là đủ rồi. Mỗi người có thể khác
Nếu nhiều người làm theo cách này hơn thay vì chủ nghĩa tối đa hóa định lượng, có lẽ chúng ta đã có ít sản phẩm khiến mình phát điên hơn
Điều quan trọng là cảm nhận áp đảo rằng tìm kiếm đã tệ đi, chứ không phải thêm một bảng tính nữa đã đưa chúng ta tới tình trạng này
Cũng khó đưa sự thiếu sót vào định nghĩa chất lượng, và việc nên thiếu gì cũng chủ quan
Ví dụ khi tìm “Gaza”, một công cụ có thể chỉ tập trung vào các sự kiện gần đây, còn công cụ khác có thể bỏ qua sự kiện gần đây và chỉ đưa thông tin chung
Bên nào có chất lượng cao hơn? Thực ra còn tùy bạn đang tìm gì
Cuối cùng chỉ có thể lập một danh sách chủ quan về những điều bạn cho là quan trọng rồi chấm điểm theo đó, và việc này gần như giống đánh giá giai thoại có thêm vài bước
Nếu muốn biết vì sao Google hay bất kỳ công cụ tìm kiếm nào không tốt lắm, hãy xem họ đo kết quả tìm kiếm của mình như thế nào
Hầu hết công ty tìm kiếm đều làm những việc rất giống tác giả đã làm, ở quy mô lớn và theo hướng dẫn rất cụ thể
Ví dụ có bộ hướng dẫn dài 168 trang dành cho người đánh giá chất lượng tìm kiếm của Google
https://static.googleusercontent.com/media/guidelines.raterh...
Trong đó có nội dung như nắm bắt ý nghĩa truy vấn, phán đoán ý định người dùng, đánh giá “chất lượng” của website, và chấm điểm mức độ hữu ích của trang so với ý nghĩa và ý định của truy vấn
Nói cách khác, không phải các công ty tìm kiếm không làm việc tác giả đã làm; chỉ là tiêu chuẩn của họ khác với tác giả
Tiêu chuẩn đó có thể khớp với người dùng hơn tác giả, cũng có thể không, và cũng không thể mãi như vậy
Trang 29 của tài liệu bạn liên kết mô tả “Lowest Quality Content”
Phần lớn kết quả tìm kiếm mà tác giả đánh giá là spam hoặc lừa đảo đều rõ ràng khớp với hướng dẫn này
Vậy thì hoặc là các đánh giá viên không hiểu đủ về chủ đề để phân biệt các trang gây hại hoặc gây hiểu lầm, hoặc họ đã đánh giá đúng nhưng vẫn không tạo ra hiệu quả mong muốn
Google đã được nhìn nhận như một công cụ tìm kiếm sản phẩm kiêm trang so sánh giá, và trong lĩnh vực đó nó rất tốt
Với bất kỳ sản phẩm nào đáng cân nhắc mua, nó đều tìm được sản phẩm liên quan cao, nên có thể Google đã tối ưu theo hướng đó
Phần lớn tìm kiếm của tôi liên quan đến IT, lập trình, phần mềm và máy tính nói chung, nhưng người bình thường tìm sản phẩm, tin tức, giờ mở cửa cửa hàng
Google khá ổn với những thứ đó, và tiền nằm ở việc “đi mua thứ gì đó”
Quảng cáo tìm kiếm sản phẩm của Google luôn chính xác hơn nhiều so với kết quả tìm kiếm thực tế
Tôi nghĩ Google đã tối ưu cho bán sản phẩm
Hy vọng khi các mô hình ngôn ngữ lớn được cải thiện, chúng có thể lọc kết quả trả về tốt hơn