Kết quả tìm kiếm “sản phẩm X vs Y” giờ gần như toàn là rác nhảm AI
Nhìn Internet chết ngày càng phình to khiến tôi muốn đăng ký Kagi. Có lẽ rồi một ngày nào đó sẽ cần chứng nhận nội dung do con người tạo ra
Đáng tiếc là Kagi cũng không phải thuốc chữa bách bệnh. Tôi trả tiền và dùng hằng ngày để ủng hộ một lựa chọn thay thế Google, nhưng vấn đề cả tìm kiếm hình ảnh lẫn văn bản đều ngập rác AI vẫn rất nghiêm trọng
So sánh sản phẩm là ví dụ tiêu biểu, nhưng điều đáng lo hơn là các tìm kiếm liên quan đến y tế. Tuần này tôi cố tìm nghiên cứu về một loại thuốc mình đang dùng; những kết quả vốn đã bị ô nhiễm bởi SEO từ 5 năm trước nay còn tệ hơn nhiều, với hàng trăm trang spam do GPT tạo ra nhằm dụ nhấp chuột
Cuối cùng tôi bỏ hẳn công cụ tìm kiếm, tìm được một bài báo tạm liên quan trên nih.gov, rồi phải lần thủ công theo danh sách trích dẫn để tìm thông tin
Khi nhớ lại Internet mình từng dùng hồi nhỏ và ở tuổi đôi mươi, cảm giác biết rằng Internet đó sẽ không bao giờ quay lại thật sự rất kỳ lạ
Nhìn Internet chết ngày càng lớn lên khá là siêu thực
Tôi nghĩ quảng cáo đã thương mại hóa Internet, và việc tập trung hóa vào các nền tảng thù địch với người dùng chắc chắn đã châm ngòi. Internet ngày xưa đến giờ nhìn vẫn tốt hơn nhiều, nhưng trong 15 năm qua đã mất phần lớn người dùng
Thêm “Reddit” vào cuối mọi từ khóa tìm kiếm thì có ích, nhưng có lẽ chỉ là vấn đề thời gian trước khi phần lớn nội dung Reddit cũng trở thành thứ do AI tạo ra
Tìm “baby peacock” trên Kagi cũng cho kết quả gần như giống Google, và phần lớn là ảnh AI
Phát điên mất. Internet chết rồi
Gần đây tôi mua nhà, và đã tìm những thứ như công việc sửa chữa nhà cửa: cần chuẩn bị thế nào trước khi sơn phào chỉ. Gần như mọi kết quả đều là trại nội dung do AI tạo, quảng cáo chen vào từng đoạn, video tự phát chẳng liên quan gì bám theo trang, hộp thoại đồng ý cookie bật lên, rồi ngay lập tức là modal đăng ký newsletter kiểu “hãy làm bạn với chúng tôi”
Dù thích hay không, giờ có vẻ Reddit là nơi duy nhất còn tìm được thông tin thật
Với những tìm kiếm kiểu này thì YouTube và TikTok là tốt nhất. Video vẫn chưa bị AI nhấn chìm hoàn toàn, và gần như việc thủ công nào cũng có thể tìm được
Tôi thích nội dung văn bản hơn video rất nhiều, nhưng nội dung văn bản thật do con người trực tiếp viết gần như đã chết. Reddit hiện tại có thể là ngoại lệ hiếm hoi. Một số diễn đàn cũ còn sống cũng vẫn tồn tại theo từng lĩnh vực, nhưng thường cực kỳ khó tìm
Mua một cuốn sách bảo trì nhà cửa tổng quát thì tốt hơn
Ví dụ https://archive.org/details/stanleyhomerepai0000fine/page/14... dẫn tới chương “Painting Trim the Right Way” trong cuốn Stanley Home Repairs xuất bản năm 2014
Nhà sách cũ cũng đáng xem. Việc sửa nhà không thay đổi nhiều
Bạn cũng có thể bật Wine và thử CD-ROM “Black & Decker Everyday Home Repairs” do Broderbund phát hành: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Theo https://www.goodreads.com/book/show/3424503-everyday-home-re..., nó hướng dẫn từng bước hơn 100 vấn đề gia đình thường gặp, từ sửa vòi nước bị rò đến phục hồi sàn gỗ nguyên khối, có cả hoạt họa và thuyết minh, đồng thời bao gồm thời gian, chi phí dự kiến, danh sách vật liệu và công cụ cần thiết
Thực sự trông khá ổn
Với tư cách là người sở hữu và tự sửa một căn nhà xây năm 1939, tôi chỉ lập được thư viện sách tham khảo về nhà cửa sau khi đã làm được một phần các công việc sửa chữa, trong khi lẽ ra nên làm điều đó trước khi cầm tua vít lên
Renovations của Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...) là tài liệu tôi xem đầu tiên khi bắt đầu một dự án sửa nhà. Chương 18 hoàn toàn nói về sơn. Các sách khác của Taunton cũng rất tuyệt, nhưng phạm vi bao quát của Renovations thì không gì sánh được
Loại phào MDF trắng phẳng mua ngày nay đã được sơn lót sẵn nên có thể sơn ngay
Tôi có một chiếc xe cũ và một chiếc xe mới; với xe cũ, vì nó đã tồn tại từ thời Internet ngày xưa, nên sửa gì cũng có thể tìm được cách làm. Hồi đó mọi người để lại đủ loại nhật ký làm việc
Thông tin thao tác về xe mới gần như không có, phần lớn chỉ là video YouTube của những người chẳng biết gì quay lại cảnh tự sửa rất tệ
Tôi nghĩ YouTube là nguồn tốt nhất cho sửa chữa nhà cửa. Tất nhiên nếu bạn muốn văn bản và ảnh thì tôi hiểu
Trong nền kinh tế Internet xoay quanh việc sản xuất và kiếm tiền từ “nội dung”, có lẽ khả năng mọi chuyện thành ra thế này đã rất cao ngay từ đầu
Nó bắt đầu bằng việc gắn quảng cáo vào nội dung có sẵn, rồi sau đó chuyển sang mạng xã hội và truyền thông xã hội; rốt cuộc đó là một cỗ máy crowdsourcing việc sản xuất thêm nội dung để hiển thị quảng cáo bên cạnh. Vì có tiền trong đó nên sản xuất nội dung trở thành một ngành kinh doanh quan trọng, và công nghệ đang đáp ứng nhu cầu ấy bằng cách tạo ra nội dung với chi phí rẻ hơn số tiền có thể kiếm được
Vốn dĩ vấn đề kiểm soát những nội dung không mong muốn do con người tạo ra đã bắt đầu bào mòn mô hình kinh doanh này, còn giờ đây các công cụ sinh tạo lại tạo ra nội dung không mong muốn nhanh hơn tốc độ kiểm duyệt. Khi bão hòa đến một mức nào đó, mọi người sẽ mất hứng thú, và những công cụ trước đây dùng heuristic thuật toán để phân biệt nội dung tốt với nội dung xấu cũng sẽ trở nên vô dụng. Lối thoát duy nhất thấy được là để con người tuyển chọn nội dung do con người tạo ra, nhưng tôi không biết liệu có mô hình kinh doanh nào như vậy ở quy mô mà ngành này đòi hỏi hay không
Nhiều người nhìn blog bằng con mắt hoài niệm, nhưng blog là một trong những ví dụ ban đầu cho việc Internet chuyển từ nội dung sống lâu sang sản xuất hàng loạt bài viết kiểu content farm
Internet thuở đầu giống cảm giác đi dạo trong thư viện hơn. Phần lớn website không được kỳ vọng là cập nhật hằng ngày, thậm chí hằng tháng; bài viết hầu như luôn được sắp xếp theo nội dung chứ không phải theo thứ tự mới nhất
Việc blog tập trung quá mức vào cái mới đã làm thay đổi nhiều thứ, và nhiều trang đã tệ đi thấy rõ khi chuyển từ việc xây dựng thư viện tư liệu lâu bền sang vắt ra lượt xem mới. Thảo luận trực tuyến cũng trải qua quá trình tương tự khi chuyển từ diễn đàn sang cấu trúc đề xuất kiểu Reddit/HN. Trên các diễn đàn cũ, vẫn còn những cuộc thảo luận kéo dài hơn 10 năm, còn trên Reddit hay HN thì chỉ sau vài giờ bài viết đã bị đẩy khỏi trang và cuộc thảo luận chết hẳn
Niềm tin của con người gần như khó vượt quá 100 người, huống chi ở quy mô toàn bộ Internet, nên tôi cho rằng không có mô hình kinh doanh nào như vậy. Con người có lẽ sẽ quay lại quy mô bộ lạc mà họ vốn được tạo ra để hiểu và thuộc về
Chat nhóm riêng tư phổ biến và thông dụng hơn rất nhiều so với mức chúng ta thừa nhận, và trong môi trường như thế này, xu hướng đó sẽ còn tăng tốc
Trong các hệ thống mở, tuyển chọn bởi con người là khả thi, nhưng nếu có vài silo khổng lồ thì hiệu quả thuật toán sẽ vận hành bên trong đó và tạo ra kết quả như hiện nay
Tôi hy vọng mọi người mất hứng thú và ngừng tiêu thụ nội dung rác, nhưng canh bạc ở phía bên kia là mọi người ngày càng quen với nội dung do thuật toán cung cấp có chất lượng ngày càng thấp, còn ngành này thì bằng mọi cách vắt kiệt lợi nhuận vô tận. Nhìn vào lịch sử truyền hình cáp thì có vẻ vẫn có một giới hạn
Nội dung do con người tạo ra và được con người tuyển chọn thực chất chính là retweet
Những nhóm đơn văn hóa nhỏ, chẳng hạn một số ít sinh viên đại học đang chán, lúc nào cũng sẽ tìm ra thuật toán, chiếm lĩnh nền tảng bằng porn và spam, rồi gặm nhấm tài nguyên. Việc gắn kết các công cụ tốt hơn được tạo ra để giúp các nhóm yếu thế với các khuyến khích tài chính lại càng làm khoảng cách lớn hơn. Điều này trở thành vấn đề vì các influencer tài chính không trả tiền để bị một nhóm nhỏ influencer trên thị trường nội dung làm nhục, mà trả tiền để được công chúng công nhận
Nhưng vì sao đó lại là vấn đề? Những người sản xuất “nội dung không mong muốn” chỉ tối ưu cho thứ mà thị trường đánh giá là có giá trị nhất. Nếu đó là vấn đề thì chính sự tồn tại của thị trường mới là vấn đề. Vậy phải làm gì? Chỉ cần phá hủy nó cũng có thể là hợp lý
Sau Gutenberg, có lẽ xuất bản đã liên tục đi theo hướng kiếm tiền từ nội dung. Nhìn vào lịch sử Giáo hội Công giáo thì có khả năng điều đó đã diễn ra từ trước nữa
Không chỉ là hình ảnh. Khi tìm trên Google những thứ có thể xem là câu hỏi phổ biến, trong 3–5 kết quả hàng đầu thường xuất hiện mớ chữ hỗn độn của AI sinh tạo
Khi bắt đầu đọc, ta không nhận ra ngay. Rồi sau đó ta bắt đầu nghi ngờ cả những thứ rõ ràng không phải AI sinh tạo. Con người có cảm giác về việc con người có thể sai theo cách nào, khi sai thì sai ra sao, khi sai thì giọng điệu sẽ thế nào, khả năng sai cao đến đâu, lỗi tồn tại ở những định dạng và nền tảng nào, sai thường xuyên ra sao, và người khác phản ứng thế nào. AI là một tồn tại hoàn toàn khác. Không có trực giác hay kinh nghiệm nào cho ta biết khi nào một AI nghe có vẻ hợp lý lại đang sai
Việc toàn bộ các heuristic mà ta dùng trong vô thức để đánh giá chất lượng thông tin được truyền đạt bị vô hiệu hóa chỉ sau một đêm có thể là công thức dẫn đến điên rồ và bất hạnh. Trong đời tôi hiếm khi nào thật sự buồn vì công nghệ đến thế
Thành thật mà nói, tôi nghĩ đây là dấu chấm hết của Internet công khai. Thứ thất bại không phải Google, mà là chính thực thể Internet công khai
Khi cần giúp đỡ hay có câu hỏi, tôi không dùng Google, cũng không đăng lên diễn đàn công khai. Tôi hỏi trong các chat nhóm riêng tư, nơi mọi người đều là người thật, không ai kiếm tiền, và không ai copy-paste ChatGPT để tích điểm Internet rồi sau này bán tài khoản
Chỉ có một con đường có thể thay đổi điều này, nhưng mọi người sẽ không thích. Đó là mọi nội dung trên Internet đều được liên kết với giấy tờ định danh pháp lý. Mọi bài đăng và mọi bình luận trên Facebook phải có thể được quy về một con người thật
Tôi không nghĩ các heuristic khác nhau đến vậy. Spam tối ưu công cụ tìm kiếm và nội dung nhảm nhí đã tồn tại từ trước, và cả Google lẫn YouTube đều đầy những “nhà sáng tạo nội dung” là con người tối ưu cho lượt nhấp và thao túng hệ thống đề xuất của YouTube
Nội dung AI cũng không khác biệt quá lớn. Chỉ là giờ việc tạo ra loại nội dung đó dễ hơn 100 lần nên ta thấy nó nhiều hơn rất nhiều. Về căn bản, đây không phải vấn đề AI mà là vấn đề khuyến khích và mô hình kinh doanh dựa trên quảng cáo. AI khiến vấn đề dịch vụ xuống cấp trở nên dễ thấy hơn rất nhiều, nhưng vấn đề đó vốn đã tồn tại
Tôi không biết giải pháp là gì. Tôi đoán rằng khi nội dung chất lượng thấp tràn ngập, Internet công khai sẽ ngày càng kém quan trọng theo thời gian, và nhiều giao tiếp sẽ chuyển sang các cộng đồng nhỏ phụ thuộc nhiều vào việc xác minh danh tính và tư cách của con người
Tôi không định dội gáo nước lạnh, nhưng dù vậy thì mất quyền riêng tư còn khiến tôi buồn hơn nhiều
Khó giải thích vì sao, nhưng có lẽ vì tôi không biết chim công con trông như thế nào, ví dụ này khiến tôi cảm nhận rất mạnh mặt tối của AI
Tôi đã quen với việc tin tưởng kết quả tìm kiếm ở một mức độ nào đó. Cũng từng có những kết quả kỳ lạ hoặc gần như vô nghĩa, nhưng chúng chỉ lác đác giữa một biển hình ảnh liên quan. Giờ đây tôi có thể hoàn toàn mù mờ về những thứ mình không biết. Với tư cách một người lớn lên cùng Google như một thứ “cứ thế mà tồn tại”, điều này thật sự đáng sợ
Nếu Google muốn tiếp tục giữ được tính liên quan, chẳng phải họ phải giải quyết vấn đề này bằng cách nào đó sao? Nếu tìm kiếm hình ảnh và tạo hình ảnh cho ra cùng một kết quả, thì tìm kiếm hình ảnh còn có ý nghĩa gì nữa?
Điều tương tự cũng có thể nói với tìm kiếm thông thường. Tìm bất cứ thứ gì cũng ra một trang quảng cáo, rồi vài trang content farm, sau đó là những trang “nghe như chuyên gia nhưng rốt cuộc vẫn là content farm”
Vì đã tài trợ Internet bằng quảng cáo nên việc tìm nội dung chất lượng tốt trở nên thật sự khó khăn. Nếu bạn không phải là nhà sáng tạo nội dung hay Google, các động lực khuyến khích đã hoàn toàn lệch lạc
Có vẻ mục tiêu là watermarking, nhưng chắc không ai có thể nghĩ web đang ở trạng thái nào khác ngoài suy thoái có quản lý. Cấu trúc AI nuôi AI rốt cuộc sẽ chấm dứt mọi thứ. Tôi nghĩ Platformer đã giải thích rõ nhất: https://www.platformer.news/google-io-ai-search-sundar-picha...
Vấn đề là điều gì sẽ đến tiếp theo, và có vẻ không ai có câu trả lời
Tôi không biết “giải quyết” nghĩa là gì. Chuyện này đã đang giải quyết vấn đề rồi. Nếu mọi người thấy nó đủ ổn, thế là xong
Bằng chứng là mọi tin tức và mạng xã hội khác trên Trái Đất
Google nhiều khả năng sẽ giải quyết theo hướng khiến mọi người không nhận ra công non là do AI tạo ra
Tôi nghĩ đây là một trong những lý do các công ty công nghệ lớn vận động hành lang để có quy định AI nghiêm ngặt hơn. Họ không sợ AI thống trị, mà sợ AI phá hủy hoạt động kinh doanh của họ
Tệ nhất là kết quả sao chép tiêu đề “Video Genuinely Shows White ‘Baby Peacock’?” của Snopes nhưng cắt mất mỗi dấu hỏi. Trang đó nói rằng bức ảnh ấy không phải là công non thật
Nếu tìm bằng thuật ngữ chính xác hơn là peachick thì có vẻ 100% là ảnh thật. Tuy vậy, một nửa số trang vẫn gọi là “baby peacocks”
Kết quả đầu tiên là Adobe Stock. Đây là nơi người ta có thể nghĩ sẽ có tiêu chuẩn cao hơn Pinterest hay TikTok, nhưng thực tế là vậy
Trong tương lai gần, rất có khả năng một phần đáng kể video YouTube và podcast sẽ được AI tạo ra, chẳng hạn thông qua các công cụ như Notebook LM.
Tuy nhiên, tôi không chắc khán giả có thật sự thích những nội dung do AI tạo như vậy hay không. Cá nhân tôi thích nội dung do con người làm hơn. Tôi thấy nó chân thật hơn và cuốn hút hơn.
Các công cụ AI nhất thiết cần những cơ chế phát hiện mạnh mẽ, như watermark đáng tin cậy, để các nền tảng khác có thể nhận diện nội dung do AI tạo. Đáng tiếc là các công cụ phát hiện âm thanh do AI tạo hiện vẫn còn thiếu: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
Tôi cũng vừa tổng hợp danh sách “podcast” do Notebook LM tạo ra: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Cần suy nghĩ xem liệu mình có muốn nghe podcast do AI tạo hay không. Tôi nghĩ mọi người có thể chấp nhận ổn các chương trình do chính họ tạo ra, nhưng sẽ ít thích các “podcast” do người khác dùng AI tạo hơn.
Tôi muốn tin rằng nội dung do con người làm chân thật hơn và cuốn hút hơn, nhưng không biết điều đó còn đúng được bao lâu.
Tôi “muốn” thích nội dung do con người sản xuất hơn, nhưng có vẻ AI có thể tối ưu hóa mức độ cuốn hút con người tốt hơn. Đặc biệt với những nội dung kích thích dopamine đơn giản như video TikTok thì càng có thể như vậy. Chúng ta ít phức tạp hơn mình tưởng.
Đáng tiếc là cơ chế phát hiện của các công cụ AI sẽ không bao giờ hoạt động đúng nghĩa. Không có cách nào loại trừ các tác nhân độc hại, và có rất nhiều tiền đặt cược vào việc khiến AI giả làm con người. Có lẽ ngược lại, nội dung do con người tạo ra mới cần được gắn watermark hoặc chữ ký.
Việc chia thành nhị nguyên ở đây không mấy hữu ích.
Ví dụ, ngay cả 10 năm trước tôi đã xem các video YouTube mà phần thuyết minh hoàn toàn là TTS. Người làm video không muốn dùng giọng của mình nên viết kịch bản rồi đưa vào hệ thống TTS. Với trình độ công nghệ lúc đó, âm thanh rất tệ, nhưng mọi người vẫn thích video và lượt xem cũng cao. Có gọi đó là do AI tạo không?
Giờ đây, ngay cả không dùng AI tạo sinh cũng đã có TTS tốt hơn nhiều. Những video như vậy hẳn giờ xem sẽ ổn hơn. Có thể do ít biến đổi ngữ điệu nên vẫn nhận ra không phải người thật, nhưng có lẽ phải nghe hơn 1 phút mới phân biệt được. Đây có phải do AI tạo không?
Bây giờ với AI tạo sinh, có thể tạo giọng nói mà bạn có thể không nhận ra là AI. Nhưng nếu con người viết kịch bản thì có ổn không? Đây có phải do AI tạo không?
Cuối cùng, hãy giả sử trong cùng video đó, người làm video tự viết kịch bản nhưng cảm thấy mình viết không tốt, hoặc tiếng Anh không phải tiếng mẹ đẻ nên có nhiều lỗi ngữ pháp. Vì vậy họ đưa kịch bản cho GPT, không chỉ để sửa ngữ pháp mà còn giao mục tiêu kiểu “trở thành kịch bản của một video phổ biến” và yêu cầu cải thiện. Sau đó họ xem lại để kiểm tra liệu ý chính mình muốn truyền đạt đã được truyền tải chưa rồi tiến hành tạo giọng nói. Đây có phải do AI tạo không?
Với tôi, tất cả các trường hợp này đều ổn, và không hề thấp kém hơn so với một quy trình hoàn toàn do con người thực hiện. Chỉ cần người sáng tạo là con người và cảm thấy mình đã truyền đạt điều cần truyền đạt là đủ.
Tôi muốn gửi bản nháp bài blog cho GPT và nhờ nó viết thay. Lý do tôi chưa làm là vì kết quả không có “giọng văn” của tôi. Nó có thể chứa nội dung tôi muốn nói, nhưng văn phong hoàn toàn khác. Nếu GPT/Claude có thể bắt chước phong cách của tôi tốt hơn, tôi sẽ dùng ngay. Rất ít người thích chỉnh sửa bất tận, đặc biệt là các nhà văn cũng vậy.
Vấn đề là mất bao lâu cho đến khi không thể phân biệt được sự khác nhau.
Chỉ riêng cuối tuần vừa rồi, Listen Notes đã xóa hơn 500 podcast giả được tạo bằng Notebook LM.
Thật đáng thất vọng khi thấy những kẻ lừa đảo và dân SEO mũ đen đã tận dụng Notebook LM để sản xuất hàng loạt podcast giả và phân phối lên nhiều nền tảng.
Cá nhân tôi phản đối những cỗ máy tạo nội dung rác không giới hạn.
Khi Google ngày càng khiến việc đi tới hoặc tải xuống ảnh thật từ tìm kiếm hình ảnh trở nên khó khăn hơn, tôi đã làm một công cụ tìm kiếm hình ảnh cho phép tìm trong kho Google Images bằng phím tắt hệ điều hành và nhanh chóng sao chép vào clipboard. Nó dùng Google Search Engine ID tùy chỉnh.
Khoảng một năm trước, tôi nhận ra 90% kết quả là do AI tạo, nên đã thêm cờ “No AI”. Về cơ bản đó là một bộ lọc nhanh và thô, giới hạn kết quả trước năm 2022. Không hoàn hảo, nhưng dùng tạm thì hiệu quả. https://github.com/scpedicini/truman-show
1 bình luận
Ý kiến trên Hacker News
Kết quả tìm kiếm “sản phẩm X vs Y” giờ gần như toàn là rác nhảm AI
Nhìn Internet chết ngày càng phình to khiến tôi muốn đăng ký Kagi. Có lẽ rồi một ngày nào đó sẽ cần chứng nhận nội dung do con người tạo ra
So sánh sản phẩm là ví dụ tiêu biểu, nhưng điều đáng lo hơn là các tìm kiếm liên quan đến y tế. Tuần này tôi cố tìm nghiên cứu về một loại thuốc mình đang dùng; những kết quả vốn đã bị ô nhiễm bởi SEO từ 5 năm trước nay còn tệ hơn nhiều, với hàng trăm trang spam do GPT tạo ra nhằm dụ nhấp chuột
Cuối cùng tôi bỏ hẳn công cụ tìm kiếm, tìm được một bài báo tạm liên quan trên nih.gov, rồi phải lần thủ công theo danh sách trích dẫn để tìm thông tin
Tôi nghĩ quảng cáo đã thương mại hóa Internet, và việc tập trung hóa vào các nền tảng thù địch với người dùng chắc chắn đã châm ngòi. Internet ngày xưa đến giờ nhìn vẫn tốt hơn nhiều, nhưng trong 15 năm qua đã mất phần lớn người dùng
Phát điên mất. Internet chết rồi
Gần đây tôi mua nhà, và đã tìm những thứ như công việc sửa chữa nhà cửa: cần chuẩn bị thế nào trước khi sơn phào chỉ. Gần như mọi kết quả đều là trại nội dung do AI tạo, quảng cáo chen vào từng đoạn, video tự phát chẳng liên quan gì bám theo trang, hộp thoại đồng ý cookie bật lên, rồi ngay lập tức là modal đăng ký newsletter kiểu “hãy làm bạn với chúng tôi”
Dù thích hay không, giờ có vẻ Reddit là nơi duy nhất còn tìm được thông tin thật
Tôi thích nội dung văn bản hơn video rất nhiều, nhưng nội dung văn bản thật do con người trực tiếp viết gần như đã chết. Reddit hiện tại có thể là ngoại lệ hiếm hoi. Một số diễn đàn cũ còn sống cũng vẫn tồn tại theo từng lĩnh vực, nhưng thường cực kỳ khó tìm
Ví dụ https://archive.org/details/stanleyhomerepai0000fine/page/14... dẫn tới chương “Painting Trim the Right Way” trong cuốn Stanley Home Repairs xuất bản năm 2014
Nhà sách cũ cũng đáng xem. Việc sửa nhà không thay đổi nhiều
Bạn cũng có thể bật Wine và thử CD-ROM “Black & Decker Everyday Home Repairs” do Broderbund phát hành: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Theo https://www.goodreads.com/book/show/3424503-everyday-home-re..., nó hướng dẫn từng bước hơn 100 vấn đề gia đình thường gặp, từ sửa vòi nước bị rò đến phục hồi sàn gỗ nguyên khối, có cả hoạt họa và thuyết minh, đồng thời bao gồm thời gian, chi phí dự kiến, danh sách vật liệu và công cụ cần thiết
Thực sự trông khá ổn
Renovations của Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...) là tài liệu tôi xem đầu tiên khi bắt đầu một dự án sửa nhà. Chương 18 hoàn toàn nói về sơn. Các sách khác của Taunton cũng rất tuyệt, nhưng phạm vi bao quát của Renovations thì không gì sánh được
Loại phào MDF trắng phẳng mua ngày nay đã được sơn lót sẵn nên có thể sơn ngay
Thông tin thao tác về xe mới gần như không có, phần lớn chỉ là video YouTube của những người chẳng biết gì quay lại cảnh tự sửa rất tệ
Trong nền kinh tế Internet xoay quanh việc sản xuất và kiếm tiền từ “nội dung”, có lẽ khả năng mọi chuyện thành ra thế này đã rất cao ngay từ đầu
Nó bắt đầu bằng việc gắn quảng cáo vào nội dung có sẵn, rồi sau đó chuyển sang mạng xã hội và truyền thông xã hội; rốt cuộc đó là một cỗ máy crowdsourcing việc sản xuất thêm nội dung để hiển thị quảng cáo bên cạnh. Vì có tiền trong đó nên sản xuất nội dung trở thành một ngành kinh doanh quan trọng, và công nghệ đang đáp ứng nhu cầu ấy bằng cách tạo ra nội dung với chi phí rẻ hơn số tiền có thể kiếm được
Vốn dĩ vấn đề kiểm soát những nội dung không mong muốn do con người tạo ra đã bắt đầu bào mòn mô hình kinh doanh này, còn giờ đây các công cụ sinh tạo lại tạo ra nội dung không mong muốn nhanh hơn tốc độ kiểm duyệt. Khi bão hòa đến một mức nào đó, mọi người sẽ mất hứng thú, và những công cụ trước đây dùng heuristic thuật toán để phân biệt nội dung tốt với nội dung xấu cũng sẽ trở nên vô dụng. Lối thoát duy nhất thấy được là để con người tuyển chọn nội dung do con người tạo ra, nhưng tôi không biết liệu có mô hình kinh doanh nào như vậy ở quy mô mà ngành này đòi hỏi hay không
Internet thuở đầu giống cảm giác đi dạo trong thư viện hơn. Phần lớn website không được kỳ vọng là cập nhật hằng ngày, thậm chí hằng tháng; bài viết hầu như luôn được sắp xếp theo nội dung chứ không phải theo thứ tự mới nhất
Việc blog tập trung quá mức vào cái mới đã làm thay đổi nhiều thứ, và nhiều trang đã tệ đi thấy rõ khi chuyển từ việc xây dựng thư viện tư liệu lâu bền sang vắt ra lượt xem mới. Thảo luận trực tuyến cũng trải qua quá trình tương tự khi chuyển từ diễn đàn sang cấu trúc đề xuất kiểu Reddit/HN. Trên các diễn đàn cũ, vẫn còn những cuộc thảo luận kéo dài hơn 10 năm, còn trên Reddit hay HN thì chỉ sau vài giờ bài viết đã bị đẩy khỏi trang và cuộc thảo luận chết hẳn
Chat nhóm riêng tư phổ biến và thông dụng hơn rất nhiều so với mức chúng ta thừa nhận, và trong môi trường như thế này, xu hướng đó sẽ còn tăng tốc
Tôi hy vọng mọi người mất hứng thú và ngừng tiêu thụ nội dung rác, nhưng canh bạc ở phía bên kia là mọi người ngày càng quen với nội dung do thuật toán cung cấp có chất lượng ngày càng thấp, còn ngành này thì bằng mọi cách vắt kiệt lợi nhuận vô tận. Nhìn vào lịch sử truyền hình cáp thì có vẻ vẫn có một giới hạn
Những nhóm đơn văn hóa nhỏ, chẳng hạn một số ít sinh viên đại học đang chán, lúc nào cũng sẽ tìm ra thuật toán, chiếm lĩnh nền tảng bằng porn và spam, rồi gặm nhấm tài nguyên. Việc gắn kết các công cụ tốt hơn được tạo ra để giúp các nhóm yếu thế với các khuyến khích tài chính lại càng làm khoảng cách lớn hơn. Điều này trở thành vấn đề vì các influencer tài chính không trả tiền để bị một nhóm nhỏ influencer trên thị trường nội dung làm nhục, mà trả tiền để được công chúng công nhận
Nhưng vì sao đó lại là vấn đề? Những người sản xuất “nội dung không mong muốn” chỉ tối ưu cho thứ mà thị trường đánh giá là có giá trị nhất. Nếu đó là vấn đề thì chính sự tồn tại của thị trường mới là vấn đề. Vậy phải làm gì? Chỉ cần phá hủy nó cũng có thể là hợp lý
Không chỉ là hình ảnh. Khi tìm trên Google những thứ có thể xem là câu hỏi phổ biến, trong 3–5 kết quả hàng đầu thường xuất hiện mớ chữ hỗn độn của AI sinh tạo
Khi bắt đầu đọc, ta không nhận ra ngay. Rồi sau đó ta bắt đầu nghi ngờ cả những thứ rõ ràng không phải AI sinh tạo. Con người có cảm giác về việc con người có thể sai theo cách nào, khi sai thì sai ra sao, khi sai thì giọng điệu sẽ thế nào, khả năng sai cao đến đâu, lỗi tồn tại ở những định dạng và nền tảng nào, sai thường xuyên ra sao, và người khác phản ứng thế nào. AI là một tồn tại hoàn toàn khác. Không có trực giác hay kinh nghiệm nào cho ta biết khi nào một AI nghe có vẻ hợp lý lại đang sai
Việc toàn bộ các heuristic mà ta dùng trong vô thức để đánh giá chất lượng thông tin được truyền đạt bị vô hiệu hóa chỉ sau một đêm có thể là công thức dẫn đến điên rồ và bất hạnh. Trong đời tôi hiếm khi nào thật sự buồn vì công nghệ đến thế
Khi cần giúp đỡ hay có câu hỏi, tôi không dùng Google, cũng không đăng lên diễn đàn công khai. Tôi hỏi trong các chat nhóm riêng tư, nơi mọi người đều là người thật, không ai kiếm tiền, và không ai copy-paste ChatGPT để tích điểm Internet rồi sau này bán tài khoản
Chỉ có một con đường có thể thay đổi điều này, nhưng mọi người sẽ không thích. Đó là mọi nội dung trên Internet đều được liên kết với giấy tờ định danh pháp lý. Mọi bài đăng và mọi bình luận trên Facebook phải có thể được quy về một con người thật
Nội dung AI cũng không khác biệt quá lớn. Chỉ là giờ việc tạo ra loại nội dung đó dễ hơn 100 lần nên ta thấy nó nhiều hơn rất nhiều. Về căn bản, đây không phải vấn đề AI mà là vấn đề khuyến khích và mô hình kinh doanh dựa trên quảng cáo. AI khiến vấn đề dịch vụ xuống cấp trở nên dễ thấy hơn rất nhiều, nhưng vấn đề đó vốn đã tồn tại
Tôi không biết giải pháp là gì. Tôi đoán rằng khi nội dung chất lượng thấp tràn ngập, Internet công khai sẽ ngày càng kém quan trọng theo thời gian, và nhiều giao tiếp sẽ chuyển sang các cộng đồng nhỏ phụ thuộc nhiều vào việc xác minh danh tính và tư cách của con người
Khó giải thích vì sao, nhưng có lẽ vì tôi không biết chim công con trông như thế nào, ví dụ này khiến tôi cảm nhận rất mạnh mặt tối của AI
Tôi đã quen với việc tin tưởng kết quả tìm kiếm ở một mức độ nào đó. Cũng từng có những kết quả kỳ lạ hoặc gần như vô nghĩa, nhưng chúng chỉ lác đác giữa một biển hình ảnh liên quan. Giờ đây tôi có thể hoàn toàn mù mờ về những thứ mình không biết. Với tư cách một người lớn lên cùng Google như một thứ “cứ thế mà tồn tại”, điều này thật sự đáng sợ
Nếu không có tài khoản Twitter và muốn xem thêm ngoài một bài đăng đơn lẻ, có thể xem ở đây: https://xcancel.com/notengoprisa/status/1842550658102079556
Nếu Google muốn tiếp tục giữ được tính liên quan, chẳng phải họ phải giải quyết vấn đề này bằng cách nào đó sao? Nếu tìm kiếm hình ảnh và tạo hình ảnh cho ra cùng một kết quả, thì tìm kiếm hình ảnh còn có ý nghĩa gì nữa?
Vì đã tài trợ Internet bằng quảng cáo nên việc tìm nội dung chất lượng tốt trở nên thật sự khó khăn. Nếu bạn không phải là nhà sáng tạo nội dung hay Google, các động lực khuyến khích đã hoàn toàn lệch lạc
Vấn đề là điều gì sẽ đến tiếp theo, và có vẻ không ai có câu trả lời
Bằng chứng là mọi tin tức và mạng xã hội khác trên Trái Đất
Tệ nhất là kết quả sao chép tiêu đề “Video Genuinely Shows White ‘Baby Peacock’?” của Snopes nhưng cắt mất mỗi dấu hỏi. Trang đó nói rằng bức ảnh ấy không phải là công non thật
Nếu tìm bằng thuật ngữ chính xác hơn là peachick thì có vẻ 100% là ảnh thật. Tuy vậy, một nửa số trang vẫn gọi là “baby peacocks”
Trong tương lai gần, rất có khả năng một phần đáng kể video YouTube và podcast sẽ được AI tạo ra, chẳng hạn thông qua các công cụ như Notebook LM.
Tuy nhiên, tôi không chắc khán giả có thật sự thích những nội dung do AI tạo như vậy hay không. Cá nhân tôi thích nội dung do con người làm hơn. Tôi thấy nó chân thật hơn và cuốn hút hơn.
Các công cụ AI nhất thiết cần những cơ chế phát hiện mạnh mẽ, như watermark đáng tin cậy, để các nền tảng khác có thể nhận diện nội dung do AI tạo. Đáng tiếc là các công cụ phát hiện âm thanh do AI tạo hiện vẫn còn thiếu: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
Tôi cũng vừa tổng hợp danh sách “podcast” do Notebook LM tạo ra: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Cần suy nghĩ xem liệu mình có muốn nghe podcast do AI tạo hay không. Tôi nghĩ mọi người có thể chấp nhận ổn các chương trình do chính họ tạo ra, nhưng sẽ ít thích các “podcast” do người khác dùng AI tạo hơn.
Tôi “muốn” thích nội dung do con người sản xuất hơn, nhưng có vẻ AI có thể tối ưu hóa mức độ cuốn hút con người tốt hơn. Đặc biệt với những nội dung kích thích dopamine đơn giản như video TikTok thì càng có thể như vậy. Chúng ta ít phức tạp hơn mình tưởng.
Đáng tiếc là cơ chế phát hiện của các công cụ AI sẽ không bao giờ hoạt động đúng nghĩa. Không có cách nào loại trừ các tác nhân độc hại, và có rất nhiều tiền đặt cược vào việc khiến AI giả làm con người. Có lẽ ngược lại, nội dung do con người tạo ra mới cần được gắn watermark hoặc chữ ký.
Ví dụ, ngay cả 10 năm trước tôi đã xem các video YouTube mà phần thuyết minh hoàn toàn là TTS. Người làm video không muốn dùng giọng của mình nên viết kịch bản rồi đưa vào hệ thống TTS. Với trình độ công nghệ lúc đó, âm thanh rất tệ, nhưng mọi người vẫn thích video và lượt xem cũng cao. Có gọi đó là do AI tạo không?
Giờ đây, ngay cả không dùng AI tạo sinh cũng đã có TTS tốt hơn nhiều. Những video như vậy hẳn giờ xem sẽ ổn hơn. Có thể do ít biến đổi ngữ điệu nên vẫn nhận ra không phải người thật, nhưng có lẽ phải nghe hơn 1 phút mới phân biệt được. Đây có phải do AI tạo không?
Bây giờ với AI tạo sinh, có thể tạo giọng nói mà bạn có thể không nhận ra là AI. Nhưng nếu con người viết kịch bản thì có ổn không? Đây có phải do AI tạo không?
Cuối cùng, hãy giả sử trong cùng video đó, người làm video tự viết kịch bản nhưng cảm thấy mình viết không tốt, hoặc tiếng Anh không phải tiếng mẹ đẻ nên có nhiều lỗi ngữ pháp. Vì vậy họ đưa kịch bản cho GPT, không chỉ để sửa ngữ pháp mà còn giao mục tiêu kiểu “trở thành kịch bản của một video phổ biến” và yêu cầu cải thiện. Sau đó họ xem lại để kiểm tra liệu ý chính mình muốn truyền đạt đã được truyền tải chưa rồi tiến hành tạo giọng nói. Đây có phải do AI tạo không?
Với tôi, tất cả các trường hợp này đều ổn, và không hề thấp kém hơn so với một quy trình hoàn toàn do con người thực hiện. Chỉ cần người sáng tạo là con người và cảm thấy mình đã truyền đạt điều cần truyền đạt là đủ.
Tôi muốn gửi bản nháp bài blog cho GPT và nhờ nó viết thay. Lý do tôi chưa làm là vì kết quả không có “giọng văn” của tôi. Nó có thể chứa nội dung tôi muốn nói, nhưng văn phong hoàn toàn khác. Nếu GPT/Claude có thể bắt chước phong cách của tôi tốt hơn, tôi sẽ dùng ngay. Rất ít người thích chỉnh sửa bất tận, đặc biệt là các nhà văn cũng vậy.
Thật đáng thất vọng khi thấy những kẻ lừa đảo và dân SEO mũ đen đã tận dụng Notebook LM để sản xuất hàng loạt podcast giả và phân phối lên nhiều nền tảng.
Khi Google ngày càng khiến việc đi tới hoặc tải xuống ảnh thật từ tìm kiếm hình ảnh trở nên khó khăn hơn, tôi đã làm một công cụ tìm kiếm hình ảnh cho phép tìm trong kho Google Images bằng phím tắt hệ điều hành và nhanh chóng sao chép vào clipboard. Nó dùng Google Search Engine ID tùy chỉnh.
Khoảng một năm trước, tôi nhận ra 90% kết quả là do AI tạo, nên đã thêm cờ “No AI”. Về cơ bản đó là một bộ lọc nhanh và thô, giới hạn kết quả trước năm 2022. Không hoàn hảo, nhưng dùng tạm thì hiệu quả.
https://github.com/scpedicini/truman-show