1 điểm bởi GN⁺ 2024-11-15 | 1 bình luận | Chia sẻ qua WhatsApp
  • Nhà nghiên cứu kiêm tác giả ẩn danh trên Internet Gwern Branwen được giới thiệu là người đã sớm đón nhận xu hướng scaling của LLM mà nhiều nhà bình luận AI quanh năm 2020 đã bỏ lỡ
  • Ông cho rằng ẩn danh không chỉ giúp tránh bị trả đũa, mà còn tạo ra cơ hội để ít nhất được đọc, vì độc giả khó lập tức phớt lờ bằng cách đóng khung người viết vào một danh tính hay niche cụ thể
  • Tự động hóa doanh nghiệp có áp lực bottom-up mạnh hơn, đi từ các công việc cấp dưới lên trên thay vì từ CEO đi xuống; và cấu trúc trong đó lãnh đạo con người đảm nhiệm các lựa chọn dài hạn của tổ chức AI là thực tế hơn
  • Gwern nhìn nhận trí tuệ như việc tìm kiếm Turing machine, và nhấn mạnh sức mạnh của compute, data, trial and error thông qua GPT-1, GPT-2, GPT-3, bài báo về scaling laws của Baidu năm 2017, AlphaZero và BigGAN
  • Nếu giả định AGI sẽ xuất hiện trong vài năm tới, thay vì tự mình hoàn tất mọi dự án, việc ghi lại những thứ AI không thể quyết định thay mình — như sở thích, mong muốn, đánh giá, phán đoán — để làm nguyên liệu cho việc thực thi trong tương lai trở nên quan trọng

Ẩn danh, avatar và tổ chức tự động hóa

  • Cuộc phỏng vấn được ghi hình trực tiếp, nhưng đã sử dụng avatar để bảo vệ tính ẩn danh của Gwern
    • Khuôn mặt và giọng nói trong video không phải thật; chỉ lời nói là của Gwern
  • Lợi ích bị đánh giá thấp của ẩn danh là khiến độc giả khó đặt người viết vào một danh tính hay niche cụ thể rồi phớt lờ từ trước
    • Nó cũng có tác dụng tránh bị trả đũa, nhưng Gwern xem trọng hơn việc không bị loại bỏ ngay vì bối cảnh và có được ít nhất một cơ hội để được đọc
    • Ông cũng xem việc tránh được những chuyện như bị gửi heroin đến nhà hoặc bị báo SWAT là một lợi ích
  • Ông cho rằng tự động hóa doanh nghiệp chịu áp lực bottom-up mạnh hơn, bắt đầu từ người lao động và các công việc cấp thấp, hơn là cách top-down thay thế CEO trước
    • Trong các tổ chức hiện hữu, hướng thay thế các vị trí ở tầng dưới rồi dần đi lên sẽ dễ được chấp nhận hơn
    • Cuối cùng, ông hình dung một hình thức trong đó lãnh đạo con người giám sát công ty gồm các AI
  • Từ góc nhìn học tăng cường, phần con người có thể làm tốt hơn AI có thể là tầm nhìn dài hạn, các chiến lược dài hạn mới và nắm bắt cơ hội
    • Có thể có cấu trúc trong đó CEO con người đưa ra tầm nhìn, tổ chức AI phụ trách đề xuất và thực thi, còn CEO con người chọn trong số đó
    • Ông cho rằng những doanh nghiệp do con người dẫn dắt như vậy về dài hạn có thể đưa ra lựa chọn tốt hơn các doanh nghiệp hoàn toàn chỉ gồm AI
  • Gwern cho rằng vai trò con người còn lại đến cuối cùng trong công việc của mình cũng gần với kiểu lựa chọn như Steve Jobs
    • Ông tưởng tượng khi các AI minion mang bài luận đến, mình sẽ chọn bài nào hay hơn và phán đoán nên thúc đẩy theo hướng nào hơn nữa

Tổ chức AI và đơn vị lựa chọn

  • Trong một công ty gồm AI, đơn vị lựa chọn có thể là “gói các tâm trí” hoặc cấp phòng ban, lớn hơn từng mô hình riêng lẻ
    • Nếu có thể sao chép hoàn hảo từng mô hình, đơn vị lựa chọn sẽ dịch chuyển lên cấp cao hơn
    • Một mind riêng lẻ có thể được huấn luyện theo cách khả vi, nhưng tương tác giữa các mind thì khó huấn luyện trực tiếp
  • Có thể tồn tại các nhóm mô hình phối hợp tốt về tổng thể, dù không thể quy giản về một yếu tố tương tác cụ thể
    • Ví dụ là một department unit gồm programmer, manager type, secretary type, financial type, legal type, v.v.
    • Khi cần unit mới, có thể tiến hóa bằng cách sao chép gói cơ bản, tạo biến dị ngẫu nhiên cho từng thành phần, rồi giữ lại những gói có hiệu năng tốt

Phả hệ Singularity và lý thuyết trí tuệ

  • Về việc từ khi nào có thể dự đoán Singularity, Gwern cho rằng ít nhất phải truy ngược đến Erewhon năm 1872 của Samuel Butler hoặc bài luận “Darwin among the Machines” năm 1863
    • Năm 1863, Butler đã viết rõ ràng viễn cảnh sự sống máy móc ngày càng phát triển, giành được tính tự chủ và cuối cùng trở thành mối đe dọa với nhân loại
    • Butler kết luận về máy móc rằng “war to the death should be instantly proclaimed against them”
    • Gwern nói ông không chắc có kịch bản Singularity nào rõ ràng hơn trước năm 1863 hay không
  • Isaac Newton được cho là đã giải thích các phát minh và tiến bộ thời mình không phải bằng sự tăng tốc công nghệ thực sự, mà là hiện tượng văn minh bị hủy diệt sau mỗi vài nghìn năm rồi tái khám phá tri thức quá khứ
    • Dwarkesh xem điều này giống Fermi paradox về các nền văn minh khác nhau theo thời gian, chứ không phải về các nền văn minh ngoài hành tinh trong không gian
    • Gwern nói Lucretius cũng đã dùng lập luận tương tự khoảng 1.700 năm trước, khi chứng kiến đổi mới và học thuật của La Mã
  • Lý thuyết trí tuệ của Gwern là “tìm kiếm các Turing machine
    • Mọi thứ xảy ra đều có thể được mô tả bằng các Turing machine có độ dài khác nhau
    • Học tập hay scaling là quá trình tìm kiếm nhiều Turing machine hơn và dài hơn để áp dụng cho các trường hợp cụ thể
    • Ông cho rằng không có master algorithm phổ quát hay intelligence fluid đặc biệt; thay vào đó là học một số lượng khổng lồ các trường hợp đặc thù và encode chúng vào não
  • Khác biệt về trí tuệ con người cũng được xem là khác biệt ở việc dùng nhiều compute hơn để tìm kiếm nhiều Turing machine hơn trong thời gian dài hơn
    • Ông nói có lẽ trong não không có bộ phận nào như “IQ gland” phụ trách fluid intelligence
    • Ông cho rằng não học rất nhiều vấn đề đặc thù riêng lẻ, rồi sau đó chúng được tái tổ hợp và trông giống fluid intelligence
    • Một neural network model lớn có thể được xem như một ensemble khổng lồ của các small model được điều chỉnh cho nhiều vấn đề nhỏ
  • Lý do trí tuệ tổng quát cấp con người mất nhiều thời gian để tiến hóa là vì, với nhiều sinh vật, các cơ chế được điều chỉnh cho vấn đề cụ thể có thể thích nghi tốt hơn general-purpose intelligence
    • Nếu có đủ tiến hóa, các Turing machine nhỏ có thể được gen encode trực tiếp hơn
    • Ở các niche tĩnh, niche nơi trí tuệ cực kỳ đắt đỏ, hoặc các sinh vật có tuổi thọ ngắn nên thiếu thời gian học, cơ chế chuyên cho vấn đề cụ thể có thể tốt hơn kiểu học của con người

Quá trình sớm chấp nhận scaling

  • Góc nhìn của Gwern về scaling bắt đầu từ việc đọc MoravecRay Kurzweil vào giữa thập niên 2000
    • Ông nói rằng cả hai đã đưa ra lập luận theo trường phái connectionism rằng nếu có đủ compute, điều đó có thể dẫn tới việc tìm ra neural network architecture phù hợp với bộ não con người
    • Gwern lúc đó xem điều này giống như “magical thinking”, và hoài nghi vì cho rằng thuật toán rất phức tạp, cần trực giác sâu sắc hoặc toán học khó
  • Khi quan tâm đến LessWrong, transhumanism và AI risk, ông theo dõi các bài viết của Shane Legg và biết đến các dự đoán của Legg
    • Theo Gwern, Legg dự đoán rằng nếu Moore’s Law tiếp tục, sẽ có generalist system đầu tiên vào khoảng năm 2019, các humanish agents có generalist capabilities vào khoảng năm 2025, và AGI vào khoảng năm 2030
  • Sau DanNet và AlexNet, Gwern chứng kiến những trường hợp thành công ấn tượng của connectionism
    • Ông bắt đầu chú ý xem đây là thành công đơn lẻ, hay là dòng chảy theo Kurzweil·Moravec·Legg rằng khi có GPU thì các thuật toán tốt hơn sẽ xuất hiện
    • Khi tiếp tục đọc tài liệu về deep learning, ông thấy dataset size, model size và lượng sử dụng GPU đều tăng lên, còn phạm vi áp dụng neural network thì mở rộng dần từ các use case hẹp sang rộng hơn
    • Nhìn thấy trên arXiv xu hướng CNN mỗi ngày được áp dụng cho một bài toán khác, ông chuyển dần sang quan điểm rằng “trí thông minh có thể là việc áp dụng nhiều compute, data và parameters”
  • Dòng GPT là bước ngoặt quan trọng làm thay đổi đánh giá của ông
    • Unsupervised sentiment neuron của GPT-1 gây ngạc nhiên vì nó tự học
    • Prompting và summarization của GPT-2 khiến ông có cảm giác mạnh mẽ rằng mình đang sống trong một thế giới scaling
    • GPT-3 được xem là một scale-up quy mô lớn từ GPT-2, đồng thời là một test quan trọng để đánh giá tính đúng đắn của scaling, không phải một task hẹp như Go
    • Khi nhìn vào few-shot learning chart ở phần đầu paper GPT-3, ông kết luận rằng “we are living in the scaling world”
  • Ông cho rằng có hai lý do khiến nhiều nhà bình luận AI vào khoảng năm 2020 bỏ lỡ LLM, GPT-3 và scaling laws
    • Họ không theo dõi đủ các kết quả scaling trước đó, và không đánh giá được tầm quan trọng của các kết quả này theo góc nhìn retrospective
    • Họ cùng chia sẻ niềm tin rằng thuật toán quan trọng hơn compute
  • Gwern cho rằng compute phải đi trước, vì nó cho phép trial and error và serendipity
    • Những khác biệt nhỏ về hyperparameter hoặc lựa chọn architecture có thể làm kết quả thay đổi lớn, nhưng nếu chỉ thử được vài lần thì rất dễ kết luận rằng nó không hoạt động và bỏ cuộc
    • Nếu có nhiều compute, có thể tiếp tục thử cho đến khi tìm được lời giải hoạt động tốt, rồi sau đó đơn giản hóa, cải thiện và tìm nguyên nhân để biến nó thành robust solution
  • Ông cho rằng trong các tài liệu deep learning cũ đã có những ý tưởng hiện đại, nhưng thiếu compute nên khó dùng trong thực tế
    • Ông giải thích rằng ResNet đã được công bố và hoạt động từ năm 1988, nhưng vì quy mô quá nhỏ nên không hữu dụng về thực chất và bị lãng quên, mãi đến năm 2015 mới xuất hiện như một cuộc cách mạng của deep learning
    • Ông cũng xem trường hợp BigGAN scaling lên tới 300 million images là một kết quả mà mọi người chưa quan sát đủ

Dự án và viết lách trong kỷ nguyên AGI

  • AGI timeline của Gwern vào giai đoạn 2005~2010 vẫn còn rất xa, như sau năm 2050
    • Sau AlexNet và DanNet, ông mô tả timeline rút ngắn với tốc độ mỗi năm kéo gần lại 2 năm
    • Ông cho rằng deep learning liên tục vượt qua các rào cản; trong khi các paradigm thay thế không làm tốt, paradigm này lại làm rất tốt
  • Sau AlphaGo, ông cho rằng một số người đã cập nhật quá mức theo AI hype
    • Khi các nỗ lực reinforcement learning lớn sau Dota không hoạt động tốt với những bài toán khó ngoài simulated game universe, Gwern cũng nghĩ rằng mình đã đi quá xa
    • Sau khi GPT xuất hiện, ông xóa bỏ đánh giá đó, và cho rằng RL sẽ là cherry trên chiếc cake mang tên generative model
  • Nếu nghiêm túc chấp nhận rằng AGI sẽ đến trong vài năm nữa, không cần tự mình triển khai mọi dự án
    • Những việc muốn làm hoặc yêu thích thì vẫn làm ngay bây giờ, dù AI có thể làm được sau 3 năm nữa
    • Với một số dự án, có thể sketch rõ mình muốn gì, vì sao nó tốt và làm thế nào, rồi để AGI tốt hơn thực thi
  • Gwern cho rằng những thứ ông sẽ ghi lại nhiều hơn trong tương lai là preferences, desires, evaluations, judgments
    • AI “không thể ăn kem thay bạn”, và cũng không thể quyết định thay bạn thích loại kem nào
    • Tiêu chí phán đoán công việc gồm ba điểm
      • Có phải việc làm vì bản thân thích, bất kể AI tương lai ra sao hay không
      • Có phải chỉ làm phần con người cần làm, còn phần AGI có thể làm sau này hay không
      • Có phải viết ra những điều hôm nay chưa được ghi lại để giúp phiên bản AI tương lai của chính mình hay không
    • Về cơ bản, ông cố gắng không làm những việc không thuộc ba nhóm này
  • Về thời điểm AI có thể viết được một essay đạt chất lượng Gwern, ông nói rằng nếu kết hợp toàn bộ corpus, có những ý tưởng có thể khiến việc đó khả thi ngay cả khi chưa có AGI
    • Nhiều essay idea tiềm năng phần lớn đã gần hoàn chỉnh trong corpus, nên có thể không cần super intelligence để kéo chúng ra
    • Theo tiêu chí lập kế hoạch AGI thông thường, ông nói timeline của Anthropic là 2028 có vẻ là điểm xuất phát tốt
  • Ông xem viết lách là hành động gây ảnh hưởng đến Shoggoth của tương lai
    • Các token mà LLM phải dự đoán là một trong số ít currency mà AI nhận biết, và viết lách gần giống như bỏ phiếu cho tương lai
    • Những giá trị, gu và mong muốn không được thể hiện trong văn bản online về cơ bản không tồn tại đối với AI
    • Theo kiểu “If it wasn’t written down, it wasn’t written down”, thông tin tự truyện không được ghi lại hoặc cảm xúc tại một thời điểm cụ thể rất khó khôi phục từ dấu vết về sau

Rabbit holes, khiếm thính, Wikipedia

  • Gwern nói thứ ông muốn tối đa hóa trong đời là rabbit holes
    • Ông mong chờ nhất việc chìm sâu vào những ý tưởng hoặc lĩnh vực mới mà trước đó hoàn toàn không biết
    • Từ trường hợp mèo không phản ứng với catnip, ông nói mình đã điều tra vì sao một số con mèo miễn nhiễm với catnip và cả các loại thuốc thay thế catnip
  • Đồng thời, ông cho rằng số rabbit hole có thể đào sâu cùng lúc tối đa chỉ là 2–3
    • Nhiều hơn thế thì không còn là bỏ công sức thật sự để đào sâu, mà gần với sự quan tâm thoáng qua
    • Rabbit hole phải mang tính ám ảnh; nếu nó không liên tục lôi kéo bạn thì đó không phải rabbit hole thật sự
  • Rabbit hole mà ông chìm đắm lâu nhất nhưng không tiếp tục một cách thỏa mãn là công việc ban đầu liên quan đến Neon Genesis Evangelion
    • Ông đã đọc gần như mọi tài liệu viết bằng tiếng Anh và cố hiểu quá trình phát triển cũng như lý do tác phẩm trở thành như vậy, nhưng khi đó không có được câu trả lời rõ ràng và bị kiệt sức
    • Nhiều năm sau ông tình cờ hiểu ra, nhưng nói rằng mình không còn đủ hứng thú để viết lại hoặc hoàn thiện nó
  • Gwern bị khiếm thính từ khi sinh ra, và trước mẫu giáo từng học ở trường giáo dục đặc biệt dành cho trẻ khiếm thính và trẻ có khuyết tật khác
    • Ở trường, mỗi tiết học ông phải mang theo máy trợ thính nối với giáo viên và một chiếc hộp lớn màu nâu, và cảm thấy bị sỉ nhục vì cảm giác mình khác biệt với những đứa trẻ khác
    • Máy trợ thính khi đó hoạt động không tốt, khiến ông luôn chậm một nhịp trong việc hiểu hội thoại, điều này ảnh hưởng rất xấu đến việc hòa nhập xã hội
    • Ông cho rằng đọc sách là hoạt động không bị ảnh hưởng bởi khiếm thính, nên điều đó đã góp phần biến ông thành một bookworm
  • Trước khi bắt đầu blog, ông biên tập Wikipedia
    • Gwern nói Wikipedia từng đóng vai trò như gwern.net trước khi có gwern.net, và những việc ông làm trên trang của mình hiện nay khi đó có lẽ đã được ông làm trên English Wikipedia
    • Ông vẫn tự hào về bài viết Fujiwara no Teika
    • Ông nói phần lớn những gì học được về viết lách đến từ việc biên tập Wikipedia, hơn là từ trường phổ thông hay đại học
  • Ông cho rằng hiện nay trên English Wikipedia khó rèn luyện theo kiểu rabbit hole như trước
    • So với năm 2004, các bài viết đã được lấp đầy hơn rất nhiều, và cộng đồng biên tập thù địch hơn với những đóng góp nghiên cứu chi tiết, mang tính ám ảnh
    • Những đóng góp như vậy có thể bị xóa hoặc bị từ chối vì original research hay vấn đề nguồn không được chấp nhận
  • Thành công lớn đầu tiên của ông là bài viết về Silk Road
    • Khi Adrian Chen viết trên Gawker về việc mua LSD trên Silk Road, Gwern thấy Bitcoin đã đủ thực tế đến mức có thể thật sự mua ma túy trên Internet, nên đã thay đổi thái độ
    • Gwern tự mình dùng Silk Road và ghi lại quy trình đặt hàng kèm ảnh chụp màn hình
    • Ông nói bài viết sau khi công bố đã đạt hàng trăm nghìn lượt xem, đến mức trên biểu đồ Google Analytics trông như một spike thẳng đứng

Cách làm việc, động lực viết, thiết kế website

  • Gwern cho rằng mọi người đánh giá quá cao trí thông minh của ông
    • Ông nói vì mình nhớ nhiều thứ và đã viết rất nhiều trong thời gian dài, ông trông như người có thể làm mọi thứ ngay tại chỗ
    • Trong các cuộc trò chuyện thực tế, ông thường trích dẫn những điều mình đã viết hoặc đã suy nghĩ từ lâu
    • So với những người có thể cập nhật nhanh ngay tại chỗ, ông không cho rằng mình đặc biệt thông minh, nhưng cuối cùng điều quan trọng là sản phẩm đầu ra
  • Quá trình làm việc của ông gần với việc tích lũy các ghi chú nhỏ trong thời gian dài hơn là một cú thiên tài
    • Những ghi chú như “lạ thật”, “đây là một ví dụ khác của mẫu hình này” nếu tích tụ trong 10 năm có thể khiến kết quả trông như phép màu
    • Ông nói mình thích câu của Penn & Teller rằng “ảo thuật là việc bỏ ra nhiều công sức hơn mức một người lý trí kỳ vọng”
  • Các tiểu luận như “Evolution as Backstop for RL” là sự tổng hợp hình thành từ việc liên tục thấy cùng một mẫu hình
    • Trọng tâm là cấu trúc trong đó ta học được thứ thông minh hơn bằng một cách học ngu ngốc và kém hiệu quả, nhưng không thể loại bỏ hoàn toàn cách ban đầu
    • Các ví dụ như doanh nghiệp, meta reinforcement learning, neural networks, pain được kết nối lại và tạo thành cấu trúc hiện tại
  • Một số tiểu luận xuất phát từ khoảnh khắc eureka, nhưng trước đó đã có nhiều ghi chú tồn tại lâu dài mà ông chưa biết là chúng liên quan với nhau
    • Khi một ngày đột nhiên có khoảnh khắc nhận ra tất cả đều được kết nối, ông viết liền một bài tiểu luận khổng lồ
    • “The Melancholy of Subculture Society” là ví dụ về kiểu tiểu luận eureka này
  • Luồng công việc trong ngày bắt đầu bằng việc dọn dẹp công việc trên website của hôm trước
    • Ông xử lý formatting, spelling errors, vấn đề bố cục, và thêm các suy nghĩ bổ sung hoặc bình luận quan trọng
    • Sau đó ông đọc nhiều qua Twitter hoặc RSS feed, và nếu bị thu hút bởi bình luận hay câu hỏi, ông sẽ viết
    • Buổi tối ông cố làm dự án thực tế hoặc đóng góp, rồi sau đó đi gym
  • Lý do ông đi gym là vì đó là hoạt động hoàn toàn trái ngược với việc ngồi trước máy tính để đọc
    • Không phải vì ông đặc biệt thích weightlifting, mà vì ông cho rằng để tránh burnout thì phải làm việc càng khác càng tốt
  • Tranh luận trực tuyến là động lực viết mạnh mẽ với Gwern
    • Ông cần động lực để viết và kết tinh suy nghĩ thành thứ có thể “thu hoạch”
    • Cơn giận và động lực tranh luận xuất phát từ việc thấy người trên mạng sai là rất dồi dào
    • Tuy nhiên, ông cho rằng spite chỉ nên được dùng trong thời gian cần thiết rồi sau đó phải buông bỏ; nếu cứ giữ mãi, nó sẽ đầu độc chính mình
  • Ông nói việc dành nhiều thời gian cho CSS và thiết kế website không thể được biện hộ hoàn toàn từ góc độ lợi ích xã hội
    • Đó là sở thích ông làm vì thích, và một website đẹp khiến việc đọc đi đọc lại bài viết của chính mình dễ chịu hơn
    • Ông cho rằng bảo trì website có thể trở thành một dạng spaced repetition đối với tác giả

Sinh kế, Patreon, sống dưới 12.000 USD/năm

  • Việc viết toàn thời gian được duy trì bằng Patreon và tiền tiết kiệm
    • Thu nhập từ Patreon ở mức khoảng 900–1.000 USD mỗi tháng
    • Nhờ may mắn nắm giữ Bitcoin từ sớm, ông kiếm được đủ để dùng trong thời gian dài, nhưng không đủ vĩnh viễn
    • Ông cố giảm chi tiêu tối đa để kéo dài runway cho việc viết
  • Thiết kế phần thưởng của Patreon và Substack khiến Gwern thấy gượng gạo
    • Ông cho rằng khó tạo phần thưởng tốt mà không dựng paywall
    • Patreon và Substack phù hợp với những người thích cập nhật kiểu bản tin định kỳ như Scott Alexander, nhưng bản thân ông không thích cách đó
  • Điều kiện sống dưới 12.000 USD/năm là cực kỳ tằn tiện
    • Ông sống ở nơi hẻo lánh, gần như không chi cho du lịch, ăn ngoài hay bảo hiểm y tế, tự nấu ăn và dùng phòng gym miễn phí
    • Ông nêu ví dụ khi sàn phòng ngủ bị ẩm làm mục và sập, ông chống đỡ bằng gỗ phế liệu và dầm sàn, đồng thời chấp nhận chuyện côn trùng chui vào
    • Ông mô tả cuộc sống của mình gần với “nghiên cứu sinh ăn loại mì ramen ngon hơn”
  • Lối sống này không phải là hình mẫu lý tưởng hay thứ các tác giả khác có thể làm theo y nguyên
    • Ông cho rằng việc đến nay sức khỏe vẫn rất tốt và chưa gặp tình huống khẩn cấp lớn cũng là may mắn
    • Ông nói đây là trường hợp đặc biệt khi Bitcoin, tính cách hài lòng với cuộc sống như tu sĩ, và sức khỏe đều khớp với nhau
    • Những người muốn trở thành tác giả hoặc blogger cần tìm mô hình sinh kế riêng, chẳng hạn dùng Substack hoặc làm JavaScript ở công ty công nghệ rồi viết như việc phụ
  • Lý do chính ông không chuyển đến San Francisco là tiền
    • Ông nói không muốn nghĩ mỗi tháng sống ở San Francisco đồng nghĩa với việc phải từ bỏ bao nhiêu tháng runway viết lách
    • Ông nói nếu ai đó trả 50.000–100.000 USD/năm để ông chuyển đến SF và tiếp tục viết toàn thời gian như hiện nay, ông sẽ nhận ngay

Đa dạng của mô hình AI, thuốc GLP, yếu tố môi trường, psychedelics

  • Gwern cho rằng, nếu bỏ qua “năng lực”, các mô hình AI đã đa dạng về mặt nhận thức hơn con người rất nhiều
    • Ông lập luận rằng chỉ nhìn mẫu đầu ra cũng thấy các LLM khác nhau suy nghĩ theo những cách distinct
    • Ông cho rằng LLM khác GAN, GAN cũng khác VAE; đặc biệt ở các mô hình nhỏ hoặc hiệu năng thấp, latent space, artifact và lỗi khác nhau đáng kể
  • Về những trường hợp khó phân biệt đầu ra theo từng mô hình trên Chatbot Arena, Gwern cho rằng đó là bối cảnh bị giới hạn trong các LLM gần đây và đã được heavily tuned
    • Ông ví chúng gần như “song sinh cùng trứng”, trong bối cảnh mọi người đều bắt chước cách làm của nhau và được huấn luyện trên dữ liệu gần như giống nhau
    • Nếu nhìn toàn bộ deep learning, ông cho rằng biên độ của mind và cách tư duy là rất rộng
  • Sự khác biệt giữa GAN và diffusion model thể hiện ở cách biểu diễn bàn tay
    • Ông cho rằng vì adversarial loss, GAN có động cơ che giấu thứ gì đó, thể hiện bằng việc đưa tay ra ngoài khung hình hoặc như thể không thể nghĩ về bàn tay
    • Ông nói diffusion model thì có nghĩ đến bàn tay, nhưng mắc lỗi biểu diễn chúng thành những hình dạng khổng lồ, quái dị
  • Một xu hướng mà hiện nay mọi người chưa hiểu hết hàm ý là các thuốc giảm cân nhóm GLP
    • Ông nói tác động của chúng lên sức khỏe, nghiện ngập và nhiều hành vi nói chung là đáng kinh ngạc
    • Kết quả vẫn còn preliminary, nhưng trông giống hiệu quả thực sự
    • Ông cho rằng chúng có thể cho ta biết điều quan trọng về ý chí con người và dysfunctionality
  • Ông cho rằng còn quá sớm để nói GLP drugs có phá vỡ Algernon argument hay không
    • Ông nói hiện chúng ta chưa hiểu GLP thực sự làm gì
    • Ông nói lợi ích có thể làm giảm fitness theo khía cạnh fertility, hoặc tác động lên cơ thể theo cách rất khó sao chép về mặt di truyền
    • Khủng hoảng béo phì là hiện tượng gần đây, chỉ trở nên rõ ràng khoảng thập niên 1990, nên ông cho rằng khó áp dụng Algernon argument ở quy mô 20–30 năm
  • Ông cho rằng gần như 100% có khả năng môi trường hiện đại có những yếu tố gây ảnh hưởng lớn, giống như nhiễm độc chì ở La Mã cổ đại
    • Các nhà hóa học liên tục tạo ra vật chất mới, cũng có các yếu tố liên quan đến microbiome; plastics là một ứng viên đang được chú ý, nhưng không nhất thiết phải là plastics
    • Ông không tin vào một nguyên nhân cụ thể nào, nhưng cho rằng có thể tồn tại những thứ gây hại tích lũy kiểu “1% ở đây, 1% ở kia”
    • Nhìn theo chuỗi thời gian, intelligence nhìn chung khá ổn định, nên yếu tố gây hại thực sự nhiều khả năng nằm ở obesity hơn là intelligence
  • Ông hoài nghi về các thử nghiệm psychedelics kiểu Bay Area
    • Tác dụng của psychedelics có thể acute và permanent
    • Ông cho rằng nootropics tương đối có effect dễ quản lý và kiểm soát hơn
    • Những thứ như LSD có thể vĩnh viễn thay đổi quan điểm của một người về việc dùng LSD hoặc psychiatric state của họ
    • Một vài lần sử dụng có thể tốt, và bản thân ông cũng thu được lợi ích, nhưng nếu vượt quá mức đó thì ông nói cần nghiêm túc kiểm tra xem mình đang nhận được lợi ích gì và bản thân đang thay đổi ra sao

Văn học, hư cấu, những câu hỏi còn lại

  • Gwern nói nếu không có Internet, có lẽ ông đã phải thu hẹp mối quan tâm và xuất bản đều đặn để tồn tại trong giới học thuật chính quy, hoặc rẽ sang làm thủ thư như Jorge Luis Borges
    • Ông nói mình luôn đồng tình với ý tưởng của Borges rằng “thiên đường được hình dung như một thư viện”, và bản thân ông cũng yêu thư viện
    • Hiện nay ông đọc chủ yếu trên máy tính nên tiếc rằng không thể dành nhiều thời gian ở thư viện vật lý
  • Borges là một nhà văn như anh hùng đối với Gwern
    • Từ Hyperion và The Fall of Hyperion của Dan Simmons, Out of Control của Kevin Kelly, “The Library of Babel”, ông đã đi đến việc đọc đi đọc lại tuyển tập truyện hư cấu và phi hư cấu của Borges
    • Ông choáng ngợp trước việc một người có thể viết các truyện ngắn và tiểu luận sáng tạo, thú vị, khiêu khích dựa trên vốn tri thức uyên bác, và nói rằng nếu có thể trở thành một nhà văn nào đó, ông muốn trở thành Borges
  • Những tác phẩm văn học ban đầu ông không hiểu nhưng về sau hiểu được gồm “Story of Your Life” của Ted Chiang và “Suzanne Delage” của Gene Wolfe
    • Ông diễn giải “Suzanne Delage” như một bản kể lại Dracula tinh tế, trong đó Dracula xâm nhập vào thị trấn, cướp đi một phụ nữ và tẩy não người kể chuyện theo kiểu Bram Stoker để khiến ông quên mọi chuyện
    • Ông hiểu “Story of Your Life” không phải là câu chuyện về du hành thời gian hay biết trước tương lai, mà là câu chuyện về một tâm trí khác lạ nhưng có giá trị ngang bằng, nhìn mọi thứ như một phần của câu chuyện đã được quyết định sẵn và cái kết đã được định trước
  • Ông khá hoài nghi về công dụng của hư cấu
    • Ông cho rằng ngay cả nếu dành cả đời chỉ đọc fiction, người ta có thể chẳng thu được lợi ích nào ngoài việc ghi nhớ nhiều kiến thức vụn vặt về những thứ do con người bịa ra
    • Ông nói 99% SF mà mình từng đọc hoàn toàn vô dụng, và những tác phẩm đủ sâu sắc để thực sự thay đổi góc nhìn của ông có thể rút gọn còn khoảng 20 tiểu thuyết và truyện ngắn
    • Điểm chung của các tác phẩm hàng đầu đó là chúng nghiêm túc xử lý trí tuệ phi nhân loại
  • Vai trò mà ông muốn đảm nhận trong đời sống của mọi người giống với vai trò khi nhân vật “Gwern” trong các LLM như Claude-3 xuất hiện như một mentor hoặc old wizard
    • Đó gần với một nhân vật cung cấp insight về tình huống và đưa ra call to adventure rằng “bạn cũng có thể viết, làm điều gì đó, và suy nghĩ”
    • Ông muốn độc giả không chỉ dừng ở việc nhận được giải trí hay thông tin, mà còn có aspiration rằng trang web và Internet có thể trở nên tốt hơn
  • Trên thực tế, ông lo ngại mình có thể trở thành một kiểu guru hoặc trickster devil đối với một số người
    • Với người thích ông, ông có thể bị xem như một tồn tại mà mọi thứ trên trang đều có thể được tiếp nhận như gospel, và bản thân ông ghét điều đó
    • Với người ghét ông, ông nói mình có thể bị xem như một vai phản diện bị phóng đại, kiểu covert, malicious, neo-Nazi, eugenicist, totalitarian, communist, anti-Chinese devil figure
  • Những open rabbit holes mà ông muốn có câu trả lời trước năm 2050 là các câu hỏi lớn về con người và văn minh
    • Vì sao ta ngủ và mơ
    • Vì sao con người lão hóa
    • Vì sao sinh sản hữu tính tồn tại
    • Vì sao con người khác nhau đến vậy, và còn thay đổi từng ngày
    • Vì sao con người mất nhiều thời gian đến vậy để phát triển văn minh kỹ thuật
    • Người ngoài hành tinh ở đâu
    • Vì sao Cách mạng Công nghiệp diễn ra ở nơi khác chứ không phải Trung Quốc
    • Đáng lẽ phải dự đoán deep learning revolution như thế nào
    • Vì sao bộ não con người lại oversized đến vậy so với artificial neural networks

1 bình luận

 
GN⁺ 2024-11-15
Ý kiến trên Hacker News
  • Viết lách là bỏ phiếu cho tương lai bằng một trong số ít loại tiền tệ mà Shoggoth công nhận, tức những token cần được dự đoán. Nếu không viết, coi như từ bỏ tương lai hoặc vai trò của mình trong đó; dù có nghĩ rằng sống như một công dân tốt, đi bầu, nhặt rác và tái chế là đủ, tương lai cũng chẳng quan tâm
    Các dự đoán về AI dường như hầu như không xét đến việc con người thật sẽ đánh giá thế nào rằng phương tiện do AI tạo ra đã thành công trong việc thay thế tác phẩm do con người sáng tạo, hay ngay từ đầu nó có thành công hay không. Hiện nay, việc một dự án bị biết là sản phẩm do AI tạo ra lại là điểm trừ; 2 năm trước, có ảnh AI ở header blog trông còn ngầu, nhưng giờ nó khiến người ta trông như kẻ lỗi thời
    Vì vậy tôi hoài nghi trước dự đoán rằng AI siêu trí tuệ sẽ thay thế mọi sáng tạo, tiểu luận, bài viết, video, v.v. của con người. Việc có thể làm được không có nghĩa là điều đó sẽ thực sự xảy ra, hay mọi người sẽ quan tâm. Trái lại, có vẻ khả năng cao hơn nhiều là các cách xác minh tính con người sẽ được thiết lập, nền kinh tế chú ý vẫn tập trung vào người thật, và sẽ hình thành những nghĩa địa rác AI mà không ai tương tác

    • Trong nhiều thập kỷ, tôi đã viết với niềm tin rằng mình đang huấn luyện AI tương lai, và thường nói rằng bài kiểm tra Turing không phải là một vấn đề huyền bí, mà là một vấn đề đã được giải như đường bàng quan trong kinh tế học, cho thấy những điểm mà con người quan tâm đến việc phân biệt người với máy
      Lập luận rằng AI sẽ không chiếm lĩnh được là: chúng ta được tổ chức quanh biểu tượng và tự sự, đồng thời rất nhạy với các meme yếu đi hoặc thấp kém, nên AI lần nào cũng phải tự tái phát minh thành “thứ không phải AI”. Tuy nhiên, nếu lấy âm nhạc làm ví dụ, những biến thể hạn chế cũng có thể thống trị suốt nhiều thập kỷ; và đã từng có tiền lệ là ngay cả từ loại rác như ngôi sao nhạc pop do máy móc công nghiệp tạo ra cũng sinh ra các meme thống trị, níu giữ tâm trí hàng triệu người suốt đời
      Ngày nay AI có thể bắt chước toàn bộ hệ thống ý nghĩa của những ngôi sao pop đó, còn TV Tropes thì đã liệt kê hết các yếu tố của thứ rác văn hóa mà lẽ ra con người phải miễn nhiễm, nhưng hàng triệu người vẫn sống với các nhân vật và tự sự mà họ nhận từ rác pop. Cũng như âm nhạc, TV và phim ảnh hiện nay định hình bản thể luận của con người, chắc chắn sẽ có một cái đuôi dài trong đó rác AI định hình bản thể luận; điều này khá gần với việc bị cuốn vào mô phỏng AI, và có thể còn tinh vi hơn. Hoặc cũng có thể ta chỉ đơn giản phủi bỏ nó
    • Khi nhìn vào AI, cần nghiền ngẫm thật lâu một khái niệm vay mượn từ mật mã học: đỉnh cao hôm nay sẽ là mức tệ nhất trong tương lai
      Nhân loại đang đặt cược tương lai vào ý tưởng rằng trước hard takeoff, ta sẽ đụng phải những giới hạn lý thuyết thông tin khó xử lý khiến cải thiện hiệu năng có lợi suất giảm dần; nhưng ở thời điểm hiện tại, khó có thể tin được lập luận rằng các phương pháp đã được chứng minh hiện nay đang ở đoạn cao của một đường cong chữ S nào đó. Các mô hình AI năm nay tốt hơn năm ngoái một cách ngoạn mục, năm ngoái cũng tốt hơn năm kia, và nhiều khả năng vài năm tới chúng sẽ tiếp tục tốt lên
      Chỉ riêng điều đó đã đủ để làm thay đổi đáng kể nhiều quá trình xã hội và kinh tế, theo hướng tốt lẫn xấu
    • Việc ảnh header của một bài blog rõ ràng là do AI tạo ra nay trông sến và lạc hậu là vì các mô hình công khai đã bị nerf nặng vì những lý do gần như hoảng loạn, khiến đầu ra trở nên dễ nhận ra ngay và sáo mòn
      Chẳng hạn, Dall-E 2 lúc mới ra mắt tốt hơn bây giờ rất nhiều; phiên bản hiện tại đã được chỉnh để không thể tạo ra thứ giống đầu ra của các họa sĩ hiện đại, và rõ ràng phần còn lại cũng đã bị thay đổi để render với tông cam-xanh chói mắt. Rốt cuộc, khi một mô hình tốt hơn xuất hiện hoặc bị rò rỉ, ta sẽ không thể phân biệt ảnh nào do AI tạo và ảnh nào không
    • O1-preview với prompt phù hợp đã không thể phân biệt được với mức trung vị của người bình luận trên HN, và đầu ra cũng không cần chỉnh sửa chút nào
    • Câu hỏi lớn hơn là: ngay cả nếu LLM nuốt Internet rồi diễn đạt lại bằng lời khác là tương lai của nhân loại, kho ngữ liệu AI đã có lượng tài liệu khổng lồ, nên vài blog được nghiên cứu kỹ lưỡng khó mà làm kim đồng hồ dịch chuyển nhiều
      Có lẽ spam nội dung hợp với quan điểm của mình bằng AI tạo sinh, hoặc sang Kenya làm công việc RLHF lương thấp, lại là cách thực thi quyền bỏ phiếu lớn hơn
  • Thật khó tin là Gwern sống tằn tiện đến mức bài viết này mô tả, và tôi cũng không chắc đó có thật là anh ta không. Gwern có một persona muốn thể hiện, và tôi gần như chắc chắn rằng việc trông có vẻ tằn tiện cũng là một phần trong đó
    Với câu hỏi “Gwern là ai?”, tôi nghĩ anh ta thuộc kiểu người gieo hạt giống vào tâm trí người khác rồi để mỗi người tự tạo phần còn lại của câu chuyện. Dù vậy, tôi vẫn thích nhiều bài viết của anh ấy, đặc biệt là những chủ đề kỳ quặc và hẹp mà đa số người thậm chí còn không nghĩ tới
    Nhờ bài luận về ngụy biện chi phí chìm của Gwern mà cuối cùng tôi đã không xăm hình sau khi đổi ý. Tôi gần như đã đi xăm chỉ vì đã đặt cọc, nhưng một tuần trước lịch hẹn, tôi đọc bài đó và kết luận rằng “nếu cả trẻ nhỏ và động vật cũng không bị chi phí chìm đánh lừa, thì mình cũng không nên như vậy”. Nói đúng nghĩa đen, bài viết của Gwern đã cứu phần da lưng của tôi

    • Khoảng 12 năm trước, tôi từng gặp Gwern một lần khi anh ấy đến buổi gặp mặt NYC Less Wrong. Hình như khi đó anh ấy chưa phải người nổi tiếng trên Internet, nhưng theo trí nhớ của tôi, việc nói rằng anh ấy sống rất tằn tiện là hoàn toàn đáng tin. Nhân tiện, ngoại hình của anh ấy thuộc kiểu đứng ở hội anime cũng chẳng nổi bật chút nào
    • Có bằng chứng thực tế nào ủng hộ đoạn đầu không?
    • Ngoại trừ đôi khi có thêm vài khoản chi tiêu, tôi nghĩ nhìn chung khá gần với sự thật. Ý tôi là, trừ khi anh ấy cứ duy trì hình ảnh đó ở những nơi không ngờ tới
      Tôi không thích việc mọi người giờ chỉ nhìn vào sự tằn tiện hiệu quả của anh ấy rồi đóng khung anh ấy, nhưng hy vọng anh ấy nhận được nhiều ủng hộ đủ để bù lại, dù trực tiếp hay qua patreon.com/gwern
    • Tôi thấy một bình luận trên subreddit r/slatestarcodex nói rằng có supposedly true information about him, tìm thấy khi search ‘who is gwern’, nhưng rốt cuộc nó chỉ khiến tôi có thêm nhiều câu hỏi hơn
    • Tôi thấy đáng tin
  • Đây là một cuộc phỏng vấn khó nghe, vì hai lý do hơi giống nhau một cách tinh tế
    Giọng nói như rơi vào thung lũng kỳ quái, chân thực nhưng khó nghe. Nói chính xác hơn, việc ghép nối ý nghĩa từ giọng nói đó đòi hỏi nhiều nỗ lực nhận thức, và âm sắc với ý nghĩa không hỗ trợ lẫn nhau. Nếu trẻ em lớn lên trong những giọng nói có tông ngẫu nhiên như vậy thì có thể mọi chuyện sẽ khác
    Cuộc trò chuyện cũng quá dài dòng. Vốn từ rộng thường che lấp sự nghèo nàn trong suy luận, và với một số khán giả, nỗ lực hiểu từng từ lại cản trở việc hiểu quan hệ giữa các từ, tức là hiểu ý nghĩa, khiến nó nghe như một mớ từ ngữ có vẻ thông minh trộn lẫn với nhau. Nếu bỏ đi lớp từ vựng, những cái nhếch mép tinh vi và phong cách “tôi biết nhiều hơn những gì tôi đang nói”, sẽ lộ ra rất nhiều chuyện phiếm vừa không đúng vừa chưa suy luận đến nơi đến chốn. Bản thân kiểu đối thoại ít được suy luận kỹ như vậy thì không sao, nhưng gói nó trong từ vựng lạ và phong cách như thế sẽ gây hiểu lầm và thiếu thân thiện. Một số mảnh “có vẻ thông minh” thực ra chỉ là những mảnh ngu ngốc được ăn mặc đẹp đẽ mà thôi

    • Đó là giọng thật. Có thể đã có một số đoạn được ghép nối, nhưng không rõ nhiều đến mức nào. Gwern thừa nhận mình không giỏi nói, và tôi tin điều đó. Anh ấy cũng nói mình không thông minh lắm, nhưng có lẽ đó là theo một chuẩn rất tương đối
    • Theo phần mô tả của video được liên kết, để bảo vệ tính ẩn danh của Gwern, sau khi phỏng vấn trực tiếp, bạn anh là Chris Painter đề xuất lồng tiếng lại lời của Gwern sau đó, và Gwern thấy thú vị nên đồng ý
      Tôi không nắm rõ mức mới nhất của giọng nói do AI tạo nên có thể sai, nhưng nó không nghe giống giả, và nguồn được liên kết cũng nói đó là con người. Có lẽ cảm giác kỳ lạ là vì một người thật đọc bản ghi cuộc trò chuyện và cố làm cho nó nghe như đối thoại
  • Đây là một tuần có nhiều cuộc phỏng vấn podcast thú vị về chủ đề AI
    Ngoài cái này còn có loạt phỏng vấn của Lex Fridman với các nhân vật chủ chốt của Anthropic https://youtu.be/ugvHCXCOmm4, và cuộc trò chuyện dài giữa Stephen Wolfram và Eliezer Yudkowsky về rủi ro AI https://youtu.be/xjH2B_sE_RQ

    • Cuộc trò chuyện giữa Wolfram và Yudkowsky khó nghe, và thực ra tôi còn chưa nghe nổi một nửa. Lập luận của cả hai phía hơi yếu và không thú vị
    • Altman + Tan cũng hay https://youtu.be/xXCBz_8hM9w
  • Trực giác của Gwern mà tôi thích nhất là Bitcoin is Worse is Better. Sau khi tóm tắt một danh sách dài các phản biện về Bitcoin, anh hỏi liệu chúng có điểm chung không, và câu trả lời là “không, vấn đề của Bitcoin là nó xấu xí”
    Việc khiến an ninh mạng chỉ dựa vào nhiều sức mạnh tính toán thô hơn đối thủ là xấu xí; việc để tránh chi tiêu hai lần mà hiện tại lẫn tương lai đều cần hơn một nửa năng lực xử lý cũng xấu xí; cây băm cứ phình to mãi cũng xấu xí; một hệ thống không thể dùng ngoại tuyến nếu không có proxy và cách đi vòng cũng xấu xí; việc phải theo dõi công khai mọi giao dịch cũng xấu xí. Ngay cả nếu phải cố định cung tiền, anh cũng hỏi vì sao lại là giới hạn tùy ý 21 triệu, tại sao phải là con số đó, sao không phải số tròn hơn hoặc một lũy thừa của 2. Khai thác cũng là món quà quá lớn cho những người tham gia sớm, và nếu gửi nhầm địa chỉ thì Bitcoin có thể đơn giản biến mất; nhìn chung đây là phê phán rằng toàn bộ thứ đó xấu xí và thiếu tao nhã
    https://gwern.net/bitcoin-is-worse-is-better

  • Thật khó hiểu vì sao người ta lại đặt nhiều niềm tin đến vậy vào tưởng tượng đầy hy vọng về một công ty AI chỉ có một người có tầm nhìn ở trên đỉnh
    Thứ nhất, CEO kiểu có tầm nhìn thật sự là một ngách cực hẹp. Thứ hai, hầu hết công ty không vận hành như vậy, và sự tồn tại của nhân lực cũng quan trọng không kém những gì công ty sản xuất. Thứ ba, trong một xã hội nơi động lực kinh tế phổ biến nhất là lao động làm công đột nhiên biến mất, ai sẽ mua hoặc thuê những dịch vụ hay sản phẩm đó?
    Kiểu tư duy hệ thống giả định rằng có thể tùy ý thay đổi và biến dạng hệ thống như thể hoàn toàn bỏ qua được các hàm ý xã hội khiến tôi rất khó chịu. Xung quanh thực chất là những kỹ sư silo được tô hồng, say sưa với niềm tin của chính mình, đang đóng vai “nhà tư tưởng”

    • Tôi không hiểu vì sao cần một CEO con người có tầm nhìn. Ngay cả những người chỉ trích AI mạnh mẽ nhất cũng đồng ý rằng LLM rất giỏi tạo ra tầm nhìn táo bạo
    • Khi những chiếc ô tô đầu tiên xuất hiện, hẳn cũng đã có người nói y hệt như vậy. Dữ liệu cho thấy biến động công nghệ phá hủy nhiều việc làm hơn số việc làm nó tạo ra ở đâu?
  • Liên kết ở đoạn trích dẫn liên quan đến Newton dẫn tới một bài trên website của Gwern; trong bài đó có nhiều liên kết nội bộ và bên ngoài, nhưng tôi không tìm thấy liên kết nào củng cố quan điểm “tiến bộ” của Newton.
    Khái niệm “tiến bộ nhanh” mang tính tương đối. Thời đó cũng có tiến bộ nhanh, còn bây giờ chỉ là có tiến bộ nhanh hơn, nên không có mâu thuẫn. Tôi cũng không đồng ý với ý rằng chúng ta chẳng mấy ấn tượng trước những cải tiến về tàu thuyền qua nhiều thế kỷ, các trường thi triết học bằng tiếng Latin, kim khâu hay máy in. Chúng ta vẫn đủ ấn tượng.
    Tôi không hiểu vì sao cuộc phỏng vấn này lại nhận được nhiều lượt đề xuất đến vậy, và có cảm giác như đã lãng phí thời gian.

    • Điều ngược lại cũng đúng. Tôi thấy kính sợ trước những gì nhân loại đã đạt được, nhưng khi đọc niên biểu của các thế giới hư cấu như Middle-Earth hay Westeros/Essos, tôi lại tự hỏi làm sao họ có thể bị đóng băng trong một thời đại na ná trung cổ như vậy. Rốt cuộc họ đang làm gì?
    • Bạn có thể giải thích thêm phần nào trong https://gwern.net/newton mà bạn cho là không củng cố mô tả của tôi về quan điểm của Newton không?
      Trích dẫn lớn thứ hai ở https://gwern.net/newton#excerpts liên kết rất nổi bật tới https://www.newtonproject.ox.ac.uk/view/texts/normalized/THEM00173, và tôi thấy nó đủ để biện minh cho lập luận của tôi, vốn lấy từ lời Newton nói trực tiếp với con rể. Nó cũng song song rất sát với các phát biểu lịch sử khác như của Lucretius, và những phát biểu đó cũng được đưa ra với tài liệu tham khảo rõ ràng cùng trích dẫn cụ thể.
      Tôi hơi khó hiểu khi bạn nói điều này hoàn toàn không được củng cố, và tự hỏi liệu có phải bạn đang xem một trang khác không.
    • Bất kể độ chính xác lịch sử của trích dẫn đó ra sao, bản thân tôi, khi trực tiếp trải qua quá trình chuyển từ một thế giới dường như không cần phải có ý kiến về mọi thứ sang một thế giới nơi Internet hiện diện khắp nơi, phần nào luôn cảm thấy như vậy.
      Không hẳn vì tôi tin rằng trong dòng thời gian hiện tại nền văn minh nhân loại tiên tiến đã tự hủy diệt, mà vì việc có quá nhiều đột phá làm thay đổi cuộc sống xuất hiện trong một thời gian ngắn trông giống như một cuộc hành quân không ngừng hướng tới bộ lọc vĩ đại.
    • Có vẻ mọi người đọc một tiêu đề thú vị hoặc vài dòng đầu rồi bấm đề xuất. Sau đó dù nội dung lộ ra là không hay thì cũng không có tùy chọn phản đối.
  • Nghe có vẻ hơi công kích, và thực tế cũng hơi như vậy, nhưng tôi từng tương tác với Gwern trên diễn đàn này, và điều tôi nhớ là luồng này, nơi Gwern nhầm a^nb^n là một ngôn ngữ chính quy và gọi bình luận của tôi là “not even wrong”.
    https://news.ycombinator.com/item?id=21559620
    Xin lỗi vì nói tiêu cực, nhưng ngay lúc đó Gwern đã được một bộ phận khá lớn trong cộng đồng tôn lên như một nhân vật có ảnh hưởng quan trọng trong lĩnh vực AI. Với tôi, đó là một ví dụ hay cho thấy phần lớn các AI influencer đang tranh giành ảnh hưởng trên mạng xã hội thay vì làm nghiên cứu thực ra không hiểu rõ AI và khoa học máy tính, mà chỉ giỏi tổng hợp và phổ biến kiến thức thứ cấp. Làm đội cổ vũ cho quan điểm chính thống của AI thì dễ. Cái khó là tìm ra và theo đuổi một hướng đi độc lập.

    • Cách nói “phần lớn AI influencer không biết AI và khoa học máy tính” hơi quá. Ngay cả trong số những kỹ sư và nhà khoa học giỏi, có kiến thức, cũng có nhiều người không nắm được luận điểm a^nb^n. Không thể biết 100% một lĩnh vực rộng như AI và khoa học máy tính.
    • Kết luận của tôi về bình luận được liên kết là: bài toán rất lý thuyết về việc có thể nhận diện một ngôn ngữ vô hạn hay không không liên quan nhiều đến khái niệm trí thông minh phi hình thức và trực giác.
      Transformer có thể hiểu a^nb^n một cách dễ dàng về mặt trí tuệ, nhưng không thể xác định một chuỗi dài tùy ý có phải là phần tử của ngôn ngữ đó hay không. Tuy nhiên, con người cũng chia sẻ giới hạn này. Nếu chuỗi đủ dài thì cuối cùng con người cũng sẽ đếm nhầm.
    • Tôi từng gặp chuyện rất giống với một AI influencer nổi tiếng khác. Đó là người đã giảng cho tôi một thứ lý thuyết automata giả mà sinh viên đại học ngành khoa học máy tính sẽ nhận ra ngay; người đó có hơn 140 nghìn người theo dõi và từng xuất hiện trên các podcast lớn như Lex hay MLST. Tôi không sửa, nhưng trong lòng ghi nhớ rằng không nên tin người đó.
    • Phản luận của ông ấy có vẻ là “phân tích cú pháp văn phạm hình thức” không phải cốt lõi của LLM, và điều đó hợp lý. Ông ấy sai ở chỗ phân biệt văn phạm chính quy với văn phạm phi ngữ cảnh, nhưng tôi nghĩ đa số lập trình viên cũng không quen với khác biệt đó. Lý do việc học cách phân loại a^nb^n là một bài toán kinh điển của lý thuyết automata cũng là vì thật đáng ngạc nhiên khi một văn phạm đơn giản như vậy lại là phi ngữ cảnh.
    • Ở đây tôi chọn góc nhìn kiểu Feynman. Những trò biểu diễn trí nhớ pha chút phù phiếm tự thân không tạo ra sản phẩm ròng mới; thứ đã biết thì cứ tra trong sách là được.
      Tôi tôn trọng nhiều nỗ lực khác nhau, nhưng kỹ thuật là việc tạo ra thứ mọi người có thể dùng mà không cần biết mọi thứ. Đó là một nhiệm vụ thú vị hơn nhiều so với việc trở thành một công cụ tìm kiếm Google dạng người.
  • Ý tưởng avatar thì thú vị, nhưng tôi nghĩ thà chỉ có giọng nói và dạng sóng âm thanh còn hơn là tạo một avatar biết nói. Có thể đó chỉ là sở thích cá nhân vì tôi không muốn có hình ảnh tinh thần về một người mình không biết. Nó giống như đọc sách sau khi đã xem bản chuyển thể điện ảnh.

    • Tôi cũng thấy kỳ lạ. Ở nước tôi, khi các series truyền hình thực hiện phỏng vấn ẩn danh, họ dùng một ngôn ngữ hình ảnh nhất định như khuôn mặt bị làm mờ pixel, cảnh người được quay nhìn về phía đối diện máy quay, hoặc khuôn mặt chìm trong bóng tối.
      Việc diễn viên lồng tiếng là bình thường, nhưng để diễn viên cho thấy khuôn mặt của nhân vật ẩn danh thì là một lựa chọn khá khác thường.
    • Chỉ nghe cuộc phỏng vấn thôi không được sao?
  • Lợi ích của ẩn danh: “Tôi được lợi rất nhiều vì người ta không thể gửi heroin đến nhà tôi hoặc báo cảnh sát giả để điều đội SWAT đến.”
    Bất lợi của ẩn danh: không có heroin miễn phí.