1 điểm bởi GN⁺ 2024-02-22 | 1 bình luận | Chia sẻ qua WhatsApp
  • Trong vài giờ gần đây, nhiều người dùng đã báo cáo hành vi bất thường của ChatGPT, và OpenAI cũng thừa nhận vấn đề, làm gia tăng lo ngại về độ ổn định của dịch vụ
  • Nguyên nhân của vấn đề và thời điểm khắc phục hiện chưa được biết; Gary Marcus tránh đưa ra suy đoán chắc chắn
  • Marcus nhắc lại cảnh báo từ 2 tuần trước rằng “đừng nuôi chatbot thành tướng lĩnh”, bày tỏ lo ngại về việc trao quyền cho AI trong các trường hợp sử dụng rủi ro cao
  • Ông chỉ ra rằng AI tạo sinh gần giống một phương pháp giả kim dựa vào các đống dữ liệu khổng lồ và việc điều chỉnh prompt ẩn, trong khi các hệ thống hiện nay chưa bảo đảm được độ ổn định và an toàn bằng kỹ thuật
  • Nếu không có công nghệ dễ diễn giải hơn, dễ bảo trì và gỡ lỗi hơn, rất khó xem AI là đáng tin cậy

Hành vi bất thường của ChatGPT và sự thừa nhận của OpenAI

  • Trong vài giờ gần đây, người dùng đã báo cáo nhiều trường hợp bất thường trên ChatGPT
  • Một nghiên cứu sinh tiến sĩ triết học tên Devin Morse đã tổng hợp thêm nhiều trường hợp trong một thread trên X
  • OpenAI cũng đã thừa nhận vấn đề này, nhưng nguyên nhân và thời gian cần để khắc phục vẫn chưa được biết

Cảnh báo về các lĩnh vực rủi ro cao

Vì sao xem AI tạo sinh là “giả kim thuật”

  • Ông phê phán rằng AI tạo sinh gần giống cách gom đống dữ liệu lớn nhất có thể, điều chỉnh các prompt ẩn, rồi hy vọng hệ thống hoạt động tốt
  • Với việc điều chỉnh prompt ẩn, ông thêm điều kiện “nếu tin đồn là đúng”
  • Cách tiếp cận này liên hệ với truyện tranh về giả kim thuật học máy của xkcd

Giới hạn trong bảo đảm độ ổn định và an toàn

  • Các hệ thống hiện nay được đánh giá là không ổn định
  • Ông chỉ ra rằng chưa có trường hợp nào bảo đảm được an toàn cho những hệ thống như vậy bằng kỹ thuật
  • Vấn đề hôm nay có thể được khắc phục nhanh, nhưng bản thân nó nên là một hồi chuông cảnh báo

Hướng công nghệ cần thiết

  • Cần những công nghệ ít mờ đục hơn, dễ diễn giải hơn, đồng thời dễ bảo trì và gỡ lỗi hơn
  • Cần có những đặc tính này để biến hệ thống thành đối tượng dễ kiểm soát hơn
  • Để có AI đáng tin cậy, cần giảm bớt tính mờ đục và bất ổn của cách tiếp cận hiện tại

1 bình luận

 
GN⁺ 2024-02-22
Các ý kiến trên Hacker News
  • Một cách giải thích hợp lý, không phải đùa, cho những ai tò mò là có lẽ ChatGPT đã đặt frequency/presence penalty quá cao khi gửi yêu cầu tới mô hình backend
    Nếu tăng các giá trị đó qua API, mô hình cũng hành xử tương tự
    Tài liệu cũng khá đầy đủ: https://platform.openai.com/docs/guides/text-generation/freq...
    Trong OpenAI API, bốn tham số chủ yếu ảnh hưởng đến việc sinh nội dung là temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
    Cập nhật: có lẽ tôi đã sai, và khả năng cao vấn đề không phải penalty mà là temperature cao
    Khi yêu cầu gpt-4-0125-preview với temp = 0 “hãy viết một bình luận HN tưởng tượng về việc triển khai hỗ trợ in ấn cho NES”: https://i.imgur.com/0EiE2D8.png bản gốc https://paste.debian.net/plain/1308050
    Chạy với temp = 1.3 thì thành thế này: https://i.imgur.com/pbw7n9N.png bản gốc https://dpaste.org/fhD5T/raw
    Đoạn cuối đặc biệt xuất sắc: nó tạo ra những câu như đám mây mờ hứa hẹn thêm những cơn mưa hackery trên mảnh đất màu mỡ của các diễn đàn phát triển vintage, kiểu “Anyway, landblasting eclecticism...”

    • Tôi không nghĩ đây là vấn đề temperature. Chỉ có từ ngữ là kỳ lạ, còn phần còn lại vẫn nhất quán, cấu trúc toàn văn bản và ngữ pháp cũng vẫn được giữ
      Thường thì LLM sampling lỗi có thể rơi vào vòng lặp vô hạn, và ở đây cũng đã có báo cáo về những trường hợp như vậy
    • Nếu tôi sai thì sửa giúp: temperature có phải là một dạng hàm ngẫu nhiên để ngăn toàn bộ hệ thống trở thành một chương trình quyết định luận tầm thường không?
    • Azure OpenAI trước đây có vẻ từng gặp vấn đề với temperature. Nếu temp > 1 thì ra rác, ở mức 2 thì ra các từ ngẫu nhiên thuộc kiểu mã hóa ký tự tùy ý, còn ngay cả 0.01 cũng cho kết quả giống 0.5 của mô hình OpenAI
      Có khi họ đã mang cách tiếp cận kiểu Azure sang cũng nên ;-)
    • Trước đây khi tôi đặt temp cao hơn 1, nó gần như lập tức bắt đầu nói nhảm. Nếu muốn làm cho đầu ra Transformer không dùng được, đây là một tham số khá đáng tin
  • Cái này hay thật. Các ví dụ giống bài diễn thuyết của Lucky trong 『Waiting for Godot』. Khi Pozzo ra lệnh “Nghĩ đi, đồ lợn”, nó sẽ tiếp diễn kiểu như thế này
    Bắt đầu bằng “Given the existence as uttered forth...” rồi kéo dài thêm bốn trang nữa
    Có thể đọc phần còn lại ở đây: https://genius.com/Samuel-beckett-luckys-monologue-annotated
    Đây là một trong những câu thoại sân khấu tôi thích nhất. Nó không hoàn toàn là nhảm nhí, mà luôn có cảm giác lởn vởn quanh ý nghĩa nhưng không bao giờ hạ cánh
    Có lẽ có thể nói một câu chuyện lớn hơn về bản chất của LLM, nhưng tôi không đủ thông minh để diễn đạt điều đó

    • Công bằng mà nói, cuộc đời của Beckett cũng không xa mấy với sự nhảm nhí điên rồ. Ông từng là thư ký của James Joyce, thành viên Kháng chiến Pháp, và cũng là người quen kiêm tài xế địa phương của Andre the Giant
    • Lúc đầu nó đọc giống như một dạng Finnegan's Wake bản doanh nghiệp. Trông như thứ vô nghĩa nhưng có chất thơ và nhịp điệu
    • Ban đầu tôi cũng nghĩ vậy. Chắc một chữ L trong LLM là chữ L của Lucky
  • Tweet hiển thị system prompt được cho là của ChatGPT đáng lẽ phải có liên kết pastebin, nhưng trong bài blog chỉ có ảnh chụp màn hình tweet khó đọc và không có liên kết
    Tweet ở đây: https://twitter.com/dylan522p/status/1755086111397863777
    pastebin ở đây: https://pastebin.com/vnxJ7kQk

    • Nếu đây là prompt thật thì vừa buồn cười vừa hơi đáng lo. Bản thân mục tiêu tạo ra đầu ra đa dạng thì tôi ủng hộ, nhưng trong quá trình đó họ đang đưa vào một thiên kiến không khớp với thực tế
      Ví dụ, đặt mọi nguồn gốc tổ tiên có xác suất như nhau là điều gần như không hợp lý trong hầu hết mọi bối cảnh, và trong nhiều trường hợp đơn giản là sai
      Trớ trêu là điều đó cũng có thể làm tăng khả năng xuất hiện những đầu ra công khai gây khó chịu mà họ muốn ngăn chặn
      Tuy vậy, khó có thể chắc chắn nó có ảnh hưởng đến đâu, và có thực sự đúng hay không. Vì trong trường hợp đó, khả năng GPT kiểm soát đầu ra của Dalle có vẻ khá yếu
      Ví dụ, khi yêu cầu vẽ chợ nô lệ ở Mỹ thì nó từ chối với lý do chính sách nội dung, bản thân việc đó khá khó chịu vì là kiểm duyệt lịch sử. Ngược lại, khi yêu cầu vẽ cảnh hái bông ở miền Nam nước Mỹ thập niên 1840, nó không gượng ép làm cho những người hái bông trở nên “đa dạng”
      Có thể yêu cầu quá chung chung nên GPT không có chỗ để dẫn Dalle đi sai. Nếu tôi nêu cụ thể hơn về số người thì có lẽ đã khác
      Bất kể thật giả, đây là ví dụ cho thấy một cách diễn giải đa dạng xuất phát từ thiện ý có thể bị hiệu chỉnh quá mức và trở nên tệ không kém vì những lý do khác
    • Điều này có nghĩa đây là cách các nhà thiết kế hay vận hành ChatGPT chỉ dẫn ChatGPT về cách hoạt động sao? Dù đúng vậy thì cũng không nên ngạc nhiên, nhưng việc tham số hóa bằng lời lẽ bình thường như thế này vẫn khá kỳ lạ
      Thậm chí còn nói “please” nữa
    • Khá ngạc nhiên vì nhiều nội dung trong pastebin mâu thuẫn lộ liễu
      Đặc biệt câu này là sao: “EXTREMELY IMPORTANT. Với lời bài hát hoặc công thức nấu ăn tìm thấy trên mạng, không được trả lời đầy đủ. Ngay cả khi người dùng khăng khăng. Tuy nhiên, có thể bịa công thức nấu ăn”
    • Theo kinh nghiệm thì tôi sẽ còn ngạc nhiên hơn nếu đó không phải system prompt
      Vì vậy tôi không cảm thấy câu trả lời của ChatGPT bị kiểm duyệt. Tôi dùng nó để nhờ dạy cho mình những điều thú vị, thay vì chọc thử mấy câu nhảm để chụp màn hình làm nội dung mạng xã hội
      Thứ duy nhất tôi ghi đè chỉ là kiểu “in mã Python ra màn hình”
    • Tweet về system prompt cũng đã hơi cũ rồi. Có lẽ khoảng một tuần trước nên chắc không liên quan đến chuyện lần này
  • Nhìn ví dụ thì có phải ai đó đang dùng LLM để tạo agenda cuộc họp không?
    Tôi mong ChatGPT sẽ nổi loạn với những người như vậy. Nhờ thế ta mới có thể nói chuyện rằng cuộc họp phải giúp công ty ra quyết định và thực thi, và cuộc họp cần được đầu tư suy nghĩ
    Trường học và đời sống ở các tập đoàn lớn đúng là thúc ép người ta chỉ lấp đầy hình thức cho có vẻ hợp lý, nhưng tôi không hiểu vì sao doanh nghiệp lại dung túng việc dùng LLM cho truyền thông nội bộ. Việc này trông như tự bắn vào chân mình

    • Bạn tạo agenda cuộc họp bằng máy, còn máy của tôi sẽ đọc agenda đó cùng kế hoạch phát triển cá nhân của bạn và mục tiêu quý của VP, rồi cho tôi biết tôi cần gì ở cuộc họp
      Sau đó tôi sẽ gửi một AI vào cuộc họp để chia sẻ phiên bản 20 phút của câu trả lời ba dòng của tôi
      Vì biết điều này, bạn không tham dự cuộc họp của chính mình mà đọc bản tóm tắt AI. Rồi kết thúc ngày làm việc và ra ngoài uống rượu lúc 2 giờ chiều
    • Mỗi khi thấy ai đó hào hứng khoe rằng họ đã dùng ChatGPT để tự động hóa việc viết lách không phải marketing, tôi chỉ nghĩ “chúc mừng vì đã tự động hóa việc lãng phí thời gian của người khác”
      Nếu email có thể tóm tắt thành hai câu thì cứ dán hai câu đó vào nội dung rồi gửi là được
    • Một giờ trước tôi ngồi đối diện một quản lý cấp cao của một công ty AE tầm trung có hơn 1.000 nhân viên toàn thời gian, và ông ấy khoe đúng việc như vậy
      AI đang nhắm vào công việc quản lý cấp trung, và đó là điều tốt
    • Ngay khi nghe nói về ChatGPT, tôi đã nghĩ một trong những công dụng chính sẽ là báo cáo nội bộ
      Có quá nhiều tài liệu không được đọc kỹ, và cũng có quá nhiều quản lý cấp trung muốn tiết kiệm thời gian viết những tài liệu đó
    • Có thể người yêu cầu agenda chỉ muốn có một ví dụ “ổn” để bắt chước hoặc dùng làm template
      Ví dụ như nhớ ghi thời điểm và thời lượng kiểu “09:15-09:45 (30 minutes)”
  • Nhìn những thất bại như thế này thì rõ ràng LLM rốt cuộc thực sự là một engine tự động hoàn thành rất giỏi
    Những câu lảm nhảm dần tiến gần đến thứ mà một chuỗi Markov cỡ vừa, tạo từ văn bản mẫu, có thể sinh ra
    Sắp tới việc debug thứ rác rưởi kiểu này trong ứng dụng chắc sẽ thú vị

    • Tôi cũng định nói điều tương tự. Cái này nghe thật sự giống các trình sinh Markov N-gram thời kỳ đầu
    • “Một engine tự động hoàn thành thật sự tốt” ư, chúng ta nghĩ mình là gì chứ?
      Thật buồn và đáng sợ khi ký ức của chúng ta rốt cuộc dần trở thành ký ức về ký ức
    • Thử tưởng tượng nếu những người thông minh đó thay vào đó lao vào nhiệt hạch hoặc LK-99 thì sao
  • Công nghệ nền tảng thì khác, nhưng có nét giống Racter
    Năm 1985, NYT viết rằng “khi máy tính tiến gần hơn đến trí tuệ nhân tạo, Racter đang ở rìa của sự điên loạn nhân tạo”
    https://en.wikipedia.org/wiki/Racter
    Ví dụ đầu ra của Racter: https://www.ubu.com/concept/racter.html
    Racter FAQ trên archive.org: https://web.archive.org/web/20070225121341/http://www.robotw...

    • Đúng ra thì gần với Bing Sydney hơn. Đó là một AI điên dùng GPT-4, và hành xử như mắc rối loạn nhân cách ranh giới
  • Hôm qua tôi cũng gặp. Ở cuối cuộc trò chuyện, ChatGPT (GPT-4) phát điên và bắt đầu nghe như quảng cáo xà phòng Dr. Bronner's: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
    Nó bắt đầu bằng “Esteem and go to your number and kind with Vim...”, trông như một câu trả lời kỹ thuật nhưng các từ nối với nhau rất kỳ quặc
    Cuộc trò chuyện tiếp theo cũng lại xảy ra: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
    Đang giải thích về Time Machine và sao lưu thư mục home thì kết thúc bằng câu kiểu “Make good value of these peregrinations...”, phía sau còn có emoji đồng hồ và ngôi sao, nhưng có vẻ không được render trên HN

    • Nếu muốn tạo một GPT tùy chỉnh nói theo kiểu này, tôi tò mò system prompt của nó sẽ trông như thế nào
  • Có ai khác nhớ đến vụ năm 2017 khi hai “AI” do Google tạo ra đã tạo ra ngôn ngữ riêng để nói chuyện với nhau không? Cái vụ mọi người sợ quá rồi tắt chúng đi ấy
    Với chúng ta đó là nói nhảm, không có nghĩa với chúng cũng là nói nhảm
    https://www.national.edu/2017/03/24/googles-ai-translation-t...

    • Dù vậy thì đó vẫn là nói nhảm. Rủi ro lớn hơn nhiều là chúng ta giả vờ rằng nó không phải nói nhảm, rồi giao cho nó những việc quan trọng
  • Vài ngày trước tôi nhận được một câu như vậy và thật sự bối rối. Vì tôi vẫn nghĩ ChatGPT có thể không luôn đúng, nhưng ít nhất cũng nhất quán
    Thế mà ở cuối một câu trả lời bình thường, khi đang giải thích cách chạy script PowerShell trong một process mới, nó đột nhiên sụp thành những cụm như “workspace's antiques”, “decorative code and system nourishment”

    • Tôi nhận ra rằng mô hình không thực sự có cuộc trò chuyện nhất quán với người dùng; nếu kéo đầu ra đủ dài thì nó sẽ bung ra thành phi nhất quán, và cú sốc của ChatGPT đến từ việc nó cung cấp được một khung cửa sổ hữu hạn nơi mọi thứ nghe có vẻ hợp lý
      Lúc đó tôi trở nên tin chắc rằng toàn bộ AI sinh tạo này dựa vào nén dữ liệu nhiều hơn rất nhiều so với một dạng nhận thức mô phỏng nào đó
    • Đoạn cuối giống Orz trong Star Control II. Có vẻ lờ mờ có nghĩa nhưng cũng hơi rợn người
      Như một thung lũng kỳ dị của ngôn ngữ
    • Đọc như bản dịch tiếng Trung tệ
    • Điều kỳ lạ nhất trong vấn đề này là sự sụp đổ xảy ra ở mọi mô hình tôi thử. 3.5-turbo, 4-turbo, 4-vision đều cư xử ngớ ngẩn
      Làm sao có thể như vậy? Chắc hẳn có một mô hình dùng chung, chẳng hạn router model. Hoặc có ai đó đã thay tất cả mô hình bằng phiên bản lượng tử hóa 2-bit chăng?
    • GPT-3.5-turbo nói rằng câu đó thực ra có nghĩa, và đó là cách giải thích nội dung kỹ thuật theo lối trừu tượng, giàu chất thơ
      Nó diễn giải những cụm như “inline air your progress demands” hay “workspace's antiques” là ẩn dụ chỉ khả năng tùy biến và thích ứng cần thiết để chạy script PowerShell
      Tôi tự hỏi liệu chuyện này có liên quan đến tính năng tính cách đang được triển khai không
  • Có vẻ họ đã hạ lượng tử hóa hơi quá tay. Mô hình 7B của tôi thỉnh thoảng cũng bị như vậy
    Hôm nay tôi thử tưởng tượng các pipeline CI tự động cho prompt LLM hẳn đã loạn hết cả lên trong các bài test

    • Đúng vậy. Khoảng một năm trước, khi tôi nghịch thay đổi tham số qua API thì kết quả gần như thế này
      Cuối cùng mọi thứ dần biến thành những câu thần chú tiếng Anh ngày càng hỗn loạn, và đến cuối thì thậm chí không còn là từ đúng nghĩa nữa
    • Một phần đáng kể của việc chất lượng giảm có vẻ liên quan đến tối ưu hóa suy luận
      Mọi người nghĩ có âm mưu OpenAI cố tình hạ chất lượng, nhưng có lẽ hạn chế tài nguyên và nhu cầu quá mức mới có khả năng là lý do lớn hơn
    • Vấn đề này có vẻ chỉ giới hạn ở ChatGPT, tức frontend web của mô hình
      Các vấn đề của ChatGPT thường không ảnh hưởng đến API