2 điểm bởi GN⁺ 2024-11-04 | 1 bình luận | Chia sẻ qua WhatsApp
  • Project Sid là kho lưu trữ báo cáo kỹ thuật cho thấy 10 đến hơn 1000 tác nhân AI hành xử và phát triển như thế nào trong một xã hội tác nhân
  • Nhóm tác giả cho rằng việc đánh giá tác nhân AI trước đây chủ yếu dừng ở mức đơn lẻ hoặc nhóm nhỏ, nên phạm vi và độ phức tạp của tương tác còn bị giới hạn
  • PIANO là kiến trúc Parallel Information Aggregation via Neural Orchestration, cho phép tác nhân tương tác thời gian thực với con người và các tác nhân khác, đồng thời duy trì tính nhất quán giữa nhiều luồng đầu ra
  • Trong môi trường Minecraft, nhóm sử dụng bộ benchmark nền văn minh lấy cảm hứng từ lịch sử loài người để đánh giá hiệu năng tác nhân trong mô phỏng quy mô lớn
  • Ở các kết quả ban đầu, tác nhân đã đạt được những cột mốc quan trọng hướng tới nền văn minh AI như tự chủ tạo ra vai trò chuyên biệt, tuân theo hoặc thay đổi quy tắc tập thể, và tham gia vào sự lan truyền văn hóa và tôn giáo

Vấn đề mà Project Sid xử lý

  • Cho đến nay, các tác nhân AI chủ yếu được đánh giá trong trạng thái cô lập hoặc trong các nhóm nhỏ
  • Trong những thiết lập như vậy, phạm vi và độ phức tạp của tương tác giữa các tác nhân bị hạn chế
  • Dự án bắt đầu từ nhận thức rằng mô phỏng tác nhân tự trị quy mô lớn phản ánh toàn bộ phổ của quá trình hình thành văn minh vẫn chưa được khám phá

Kiến trúc PIANO

  • Project Sid đề xuất kiến trúc PIANO
    • Tên đầy đủ là Parallel Information Aggregation via Neural Orchestration
    • Cho phép tác nhân tương tác thời gian thực với con người và các tác nhân khác
    • Mục tiêu là duy trì tính nhất quán trên nhiều luồng đầu ra

Cách mô phỏng và đánh giá

  • Việc đánh giá được thực hiện trong môi trường Minecraft
  • Để đánh giá hiệu năng tác nhân trong mô phỏng quy mô lớn, nhóm sử dụng bộ benchmark nền văn minh lấy cảm hứng từ lịch sử loài người
  • Quy mô thí nghiệm bao gồm 10 đến hơn 1000 tác nhân AI

Hành vi tác nhân được quan sát

  • Mô phỏng cho thấy các tác nhân có thể tạo ra những tiến triển có ý nghĩa
  • Các hành vi được quan sát bao gồm:
    • Tự chủ phát triển vai trò chuyên biệt
    • Tuân theo các quy tắc tập thể và thay đổi chúng khi cần
    • Tham gia vào sự lan truyền văn hóa và tôn giáo

Tài liệu và thông tin trích dẫn

  • Bài báo được cung cấp tại hai địa điểm
  • Thông tin trích dẫn được cung cấp là Altera.AL, năm 2024, arXiv preprint arXiv:2411.00114
  • Kết quả ban đầu của Project Sid được tổng kết là mở ra hướng khám phá mới cho mô phỏng xã hội quy mô lớn, trí tuệ tổ chức của tác nhân, và việc tích hợp AI vào nền văn minh nhân loại

1 bình luận

 
GN⁺ 2024-11-04
Các ý kiến trên Hacker News
  • Có vẻ tồn tại một số ràng buộc theo lý thuyết thông tin trong việc khơi gợi hành vi bậc cao từ nhiều instance của cùng một LLM
    Năm ngoái tôi đã làm một mô phỏng đa tác nhân trong một thời gian khá dài, và ngày nào cũng đi đến cùng một kết luận. Rốt cuộc, đây gần như là prompt engineering theo đường vòng; tuy có thể hữu ích như một mô hình tư duy, nhưng toàn bộ có thể được làm phẳng thành vài bảng SQL và hàm. Mỗi “tác nhân” về bản chất gần giống một SQL view được ánh xạ vào một template chuỗi để tạo prompt
    Tôi không nghĩ cần đến một thế giới 3D thực sự hay thứ gì như đồng hồ treo tường. Dù đặt một biểu diễn có vẻ hợp lý bên dưới quá trình tạo prompt, tôi không thấy LLM trở nên phong phú hơn một cách có ý nghĩa. Rõ ràng bên trong LLM không có “thế giới nội tại”, nên nỗ lực làm nó “vui” bằng một môi trường bên ngoài phong phú có vẻ không mấy ý nghĩa

    • Tôi vẫn chưa thấy trường hợp nào trong game mà LLM được dùng tốt hơn các thuật toán truyền thống, ngoại trừ có lẽ các tương tác NPC bớt lặp lại
      Có thể một ngày nào đó, nếu mesh có rig và texture có thể điều khiển được đạt đến mức dùng được trong game thì chưa biết, nhưng hiện tại nó chưa thể tạo ra những câu chuyện ứng biến đủ đáng tin cậy để hỗ trợ cốt truyện game nhất quán. Việc tạo bản đồ cũng không có vẻ cần gì hơn các thuật toán sinh thủ tục hiện có, và các ví dụ này vẫn dựa vào tài sản dựng sẵn. Các triển khai này dường như còn chưa thể đặt mesh tĩnh lên mặt đất cho hợp lý một cách ổn định
      Tôi cũng nghi ngờ NPC thực sự có giá trị đến đâu. Có thể chỉ là sự mới lạ thuần túy, thậm chí không đáng một giờ trải nghiệm. Dù LLM có tạo được diễn tiến cốt truyện kiểu hướng dẫn bằng câu chữ ứng biến, tôi vẫn nghi ngờ liệu nó có tốt bằng hoặc tốt hơn cây hội thoại do nhà văn chuyên nghiệp tạo ra không
      Ý tưởng kiểu Civ này ở mức nào đó có vẻ là một cách tiếp cận mới, nhưng về mặt khái niệm dường như không bổ sung được nhiều. Dù vậy, bản thân việc học được rằng nó không hiệu quả cũng có giá trị. Chỉ là nhìn chung những ý tưởng này thường là lời giải theo kiểu buzzword đi tìm bài toán, hoặc là nguồn cung sáng tạo rẻ hơn con người nhưng phải đánh đổi chất lượng lớn, và nhà phát triển phải điều chỉnh quá nhiều nên mức tiết kiệm chi phí thực tế cũng mơ hồ
      Là một technical artist, tôi có thiên kiến đánh giá cao giá trị của sáng tạo con người, nhưng đồng thời lẽ ra tôi cũng là nhóm đối tượng cốt lõi của các công cụ LLM cho phát triển game, vậy mà đến giờ vẫn chưa bị thuyết phục
    • Tôi nghĩ điểm này được chỉ ra rất chính xác. Để đạt tiến bộ trong một vấn đề khó như vậy, cần thành thật về khoảng cách giữa mục tiêu được marketing và thực tế
      Tôi hoàn toàn ủng hộ việc lợi ích thương mại tự nó thu hút sự chú ý và tham gia. Rõ ràng đây là một công việc rất hay, nhưng sẽ hợp lý hơn nếu trình bày tình hình một cách trung thực hơn nhiều và thu hút những người có chuyên môn cùng mức nhận thức thực sự có thể đẩy quả bóng tiến lên
      Việc công khai mười nghìn điều sai trong thí nghiệm và tổng hợp các kết luận thường thức rút ra từ đó sẽ thú vị hơn nhiều. Cần những nội dung sâu sắc và đúng như kết luận đã nói ở trên
      Ngành này và những người hỗ trợ nó cần vượt qua xu hướng cố thắng bằng phương pháp luận sai, đồng thời đẩy ra ngoài những người sáng tạo đã sẵn sàng tạo ra chuyển đổi mô hình trong lĩnh vực AI và trong công nghiệp
    • Tôi không hiểu họ kỳ vọng các tác nhân sẽ tự tổ chức cấu trúc xã hội như thế nào nếu không có một thực tại chung
      Dĩ nhiên bạn có thể tự viết mọi prompt, nhưng khi đó thực tại chung ấy chỉ là tưởng tượng của người viết, và người viết đang đóng vai dungeon master
      Mục đích của môi trường Minecraft không phải là làm phong phú “thế giới nội tại” của tác nhân hay khiến nó “vui”. Mục đích là tạo các nhiệm vụ mà con người có thể hiểu trong một môi trường chung, để đo lường hành vi tập thể và hiệu năng của các nhóm tác nhân có cấu hình khác nhau
      Tôi biết đây là kiểu nói không được khuyến khích trong bầu không khí hiện nay, nhưng tôi tự hỏi liệu người bình luận có đọc bài không. Bình luận này hầu như không bàn đến các phát hiện của nghiên cứu hay kỹ thuật được sử dụng
    • Khi tự làm và chơi với một hệ thống tác nhân đơn giản, tôi cũng có suy nghĩ tương tự về hành vi bậc cao, nhưng cũng có phản biện
      Không nhất thiết tất cả phải là cùng một mô hình; việc quản lý ngữ cảnh để giữ “chuỗi suy nghĩ” của từng tác nhân hẹp và tập trung có thể quan trọng
      Vế trước về cơ bản là thứ mixture of experts (MoE) xử lý, và tôi đã thấy ở các mô hình nhỏ rằng khi giới hạn phạm vi và ngữ cảnh thì chúng hoạt động tốt hơn nhiều. Nếu kết quả là nó làm được việc mà một mô hình lớn đơn lẻ không làm được, thì chẳng phải đó là hành vi bậc cao sao
      Nói rằng không có “thế giới nội tại” là đúng, nhưng có lẽ chính vì vậy mà việc trao cho nó một thế giới lại có lợi thế. Giống như khi cung cấp cho LLM công cụ chạy mã, nó có thể tự chạy thử và viết mã tốt hơn; một thế giới 3D cũng có thể trở thành sân chơi để khám phá các vấn đề thực tế theo cách khác. Nếu vậy thì có thể xem đó là hành vi bậc cao
    • Để tạo ra hành vi mới, cần có sự khám phá từ phía mô hình, và khám phá cần một mức ngẫu nhiên nhất định, nên rốt cuộc đây là vấn đề entropy
      LLM chỉ nhận được một lượng entropy rất nhỏ thông qua temperature của sampler
  • Cái này trông thực sự gần với tác nhân trí tuệ nhân tạo
    Nó có trí nhớ, ý chí, tính tự chủ, cấu trúc giống vòng lặp OODA và một môi trường liên tục. Đây là một khái niệm rất hay, và tôi nghĩ những gì học được ở đây cũng có thể áp dụng cho các vấn đề kinh doanh bình thường hơn
    Chỉ mong ban lãnh đạo hiểu rằng vài prompt đổ kết quả vào nhau không phải là “AI tác nhân tối tân”
    Nhưng công việc của họ có thể phụ thuộc vào việc bán cho các lãnh đạo cấp cao một thứ trông như đổi mới thực sự

    • Tôi không rõ dự án được liên kết khác gì với “vài prompt đổ kết quả vào nhau”
      Nhiều tác nhân hiện có vốn đã có trí nhớ và các yếu tố đã nói ở trên
    • Ngay cả với AI hẹp cũng không nên làm theo kiểu đó. Cần một khung quản trị để đo lường đầu ra và phát hiện các rủi ro tiềm tàng, chẳng hạn như ảo giác, dữ liệu hoặc liên kết sai, tóm tắt sai, v.v.
  • Tôi đã xem qua bài báo và tin chắc rằng bài này được dựng lên trên một tập hợp các tuyên bố sai sự thật
    Các tuyên bố trông không có tính chân thực, và không nên được chấp nhận nguyên xi nếu chưa qua bình duyệt. Các biểu đồ và đồ họa được cung cấp, khi xem xét mức độ áp dụng được với các tuyên bố, trong nhiều trường hợp cũng trông như những sản phẩm giả mạo tinh vi
    Hiện tại không có loại LLM nào có thể làm được việc được đề xuất. Xét về lợi ích thương mại thì ý định có thể là tốt, nhưng nói rõ ra, bài báo này được đọc như thể một nhóm tác tử AI trong mô phỏng đã điều phối các hoạt động liên quan đến bầu cử. Những tuyên bố như vậy cần bằng chứng đáng kể, nhưng không hề được cung cấp
    Các prompt được đưa ra hoàn toàn không liên hệ gì với cách áp dụng LLM được mô tả

    • Có vẻ bạn chưa hiểu đúng bài báo
      Thí nghiệm “bầu cử” là một kịch bản được định nghĩa sẵn, chứ không hề có sự “điều phối” hoạt động bầu cử. Các “influencer” được phân công trước đã dùng hệ thống hội thoại tích hợp trong PIANO, cảm xúc được mô phỏng tự động thu thập, và “Election Manager” cũng là một tác tử được định nghĩa sẵn khác
      Đặc biệt, phần thí nghiệm này được thiết kế để xem việc có hay không có các mô-đun cụ thể của framework PIANO ảnh hưởng thế nào đến hành vi
    • Các hoạt động liên quan đến bầu cử hiển nhiên có khả năng nằm trong dữ liệu huấn luyện của LLM
      Hiệu quả của hoạt động bầu cử rất có thể là rất thấp, nhưng tôi không cho rằng việc các tác tử prompt lẫn nhau để khiến LLM đi vào không gian tiềm ẩn liên quan đến bầu cử là chuyện ngoài khả năng
    • Nhân tiện, cũng đáng lưu ý rằng tài khoản này mới được tạo khoảng một ngày, và cũng không để lại thông tin liên hệ để các tác giả bài báo có thể xác minh tiếp
      Nếu nói với cùng mức độ nghiêm ngặt và chân thành, thì đây có vẻ là lời nhảm nhí xuất phát từ ghen tị và là sự hiểu sai rõ ràng một phần lớn của bài báo
    • Tôi chưa xem sâu, nhưng rất hoài nghi với các tuyên bố được nêu ở đây
      Nếu việc một tác tử trở thành người thu thuế và một tác tử khác thách thức chế độ thuế xuất hiện mà không được hard-code, thì đó thật sự là điều ấn tượng
  • Tôi đã nghĩ rất nhiều về vấn đề này. Tôi không phải triết gia cũng không phải nhà nghiên cứu AI nên đây gần như chỉ là suy đoán, nhưng nếu tự làm, tôi muốn bắt đầu từ các nguyên tắc, rồi để hệ thống tiến hóa hoặc được khám phá theo thời gian
    Các nguyên tắc sẽ là tự bảo toàn, thức ăn, chỗ ở, sinh sản, giao tiếp, ký ức, và nhìn chúng qua lăng kính tính toán rủi ro-phần thưởng. Việc xác định cái gì là “đã biết” và cái gì là “chưa biết” cũng có thể là cốt lõi, nhưng không nên theo kiểu nhị phân
    “Ký ức” có thể mang nhiều nghĩa, nhưng nếu mã hóa nó thành một hàm trong đó một chủ thể thực hiện một hành động tạo ra một kết quả, rồi hồ sơ rủi ro-phần thưởng gán cho kết quả đó được so sánh với các giá trị kiểm thử kinh nghiệm trải từ rất tiêu cực đến rất tích cực, thì điều này có vẻ rộng rãi và hữu ích cho cả cá nhân lẫn tập thể
    Từ đó sẽ phát sinh nhu cầu kết nối với người khác, xung đột tài nguyên, chấp nhận rủi ro, khám phá điều chưa biết, chia sẻ những gì đã học, tinh chỉnh rủi ro-phần thưởng, v.v. Với tư cách một dungeon master như thần, bạn cũng có thể dẫn dắt nền văn minh khám phá các công nghệ, phát minh, địa điểm đã định nghĩa trước. Hơi gian lận và giống như đặt sự phát triển lên đường ray, nhưng cũng khiến nó hữu ích, thú vị và dễ đồng cảm hơn
    Lượng tính toán có vẻ khổng lồ, nhưng trò chơi không nhất thiết phải diễn ra theo thời gian thực
    Tôi nghĩ phần lớn thân phận con người có thể được giải thích bằng “sự sống”, “tự do”, “tình yêu/kết nối”, “lòng tham”
    Nhìn video trong kho lưu trữ, tôi không thích cách họ trộn “văn hóa”, “meme”, “tôn giáo” vào ngay từ đầu. Tôi nghĩ tốt hơn là để chúng nổi lên từ nhu cầu giao tiếp và quá trình chia sẻ các hệ thống niềm tin sinh ra từ ký ức tập thể. Với mục đích phân tích này, đó có vẻ là một khác biệt không tạo ra khác biệt. Ngoài ra, nếu câu “thuế cao quá!” xuất hiện mà không có lớp bên dưới là “tài nguyên không đủ để sống”, thì trông quá giống việc bắt chước con người một cách máy móc

    • “Tiến hóa” là một con quái vật khác, nhưng phần bắt đầu từ các nguyên tắc rồi để hệ thống tiến hóa hoặc được khám phá theo thời gian thì bạn nên tìm đọc The Society of Mind của Marvin Minsky
      https://en.wikipedia.org/wiki/Society_of_Mind
      Cuốn sách này lần đầu ra mắt năm 1986, và là cuốn đầu tiên trình bày một cách tổng hợp lý thuyết “xã hội của tâm trí” mà Minsky đã phát triển từ đầu thập niên 1970. Sách gồm 270 tiểu luận độc lập, chia thành 30 chương, và từng có cả phiên bản CD-ROM
      Khi giải thích xã hội của tâm trí, Minsky đưa ra các lý thuyết về cách những quá trình như ngôn ngữ, ký ức, học tập vận hành, đồng thời cũng bàn đến các khái niệm như ý thức, cảm giác về cái tôi, và ý chí tự do. Vì vậy nhiều người cũng xem The Society of Mind là một tác phẩm triết học
      Đây không phải cuốn sách viết ra để chứng minh một tuyên bố AI hay khoa học nhận thức cụ thể nào, và cũng không bàn về cấu trúc vật lý của bộ não. Thay vào đó, nó là một tập hợp ý tưởng về cách tâm trí và tư duy vận hành ở cấp độ khái niệm
      Với người không chuyên tiếp cận AI trong lĩnh vực này, sách cũng khá dễ đọc
    • Nhiều dự án kiểu này đào khá nông vào trí tuệ, nhưng lại đào rất sâu vào công nghệ hiện tại
      Một số lĩnh vực sẽ được lợi lớn, nhưng xét riêng trí tuệ nhân tạo thì tôi nghĩ vẫn chưa tới mức đó. Game có vẻ sẽ hưởng lợi rất nhiều
    • Ký ức thật sự rất thú vị. Ví dụ nếu đã chơi 100.000 ván tic-tac-toe 5x5, có nhất thiết phải nhớ ván thứ 51.247 không, hay chỉ cần nhận ra và ghi nhớ các mẫu hình chiến thắng là đủ
      Trong học tăng cường, mỗi chiến thắng sẽ điều chỉnh chính sách, nhưng tôi tò mò trong AI tạo sinh thì chuyện đó sẽ hoạt động thế nào
    • Nghe giống một phiên bản Spore được hiện đại hóa
    • Có vẻ video thật sự phát được à? Ở đây tôi chỉ thấy hiện “không có video nào có định dạng và MIME type được hỗ trợ”
      Meme và gene đều là ký ức, nhưng ở các thang thời gian khác nhau
  • Trông như một món đồ chơi rất thú vị
    Tuy nhiên, xét từ góc độ nghiên cứu khoa học thì có vẻ không đặc biệt hữu ích. Có vẻ họ không suy nghĩ nhiều về thiết kế thí nghiệm, và cũng không có mục tiêu rõ ràng. Tôi tự hỏi liệu tiêu chuẩn nghiên cứu học thuật ngày nay có thật sự thấp đến mức này không

    • Cần lưu ý rằng ai cũng có thể đăng lên Arxiv, và việc nó lên đầu HN cũng không phải vì giá trị đóng góp nghiên cứu
    • Một nhóm có nhiều người từng làm trong giới học thuật đang dùng một phần hình thức học thuật, nhưng có vẻ họ không gọi đây hẳn là một bài báo nghiên cứu chính thức
      Họ tự gọi nó là báo cáo kỹ thuật, và trong dạng này thì việc viết “chúng tôi đã làm thứ này” cùng báo cáo chi tiết mà không có câu hỏi nghiên cứu rõ ràng thường được chấp nhận hơn. Dù vậy, báo cáo này vẫn có vẻ khá rời rạc
      Cả phần chuyên môn hóa và lan truyền văn hóa đều thú vị, nhưng vì thiếu chi tiết chính xác về thiết kế thí nghiệm, tôi nghĩ sẽ tốt hơn nếu họ tập trung vào một trong hai
      Việc không tập trung vào các chỉ số bên ngoài trong trường hợp đa tác tử cũng đáng tiếc. Benchmark đơn tác tử nhìn vào một chỉ số bên ngoài là “thời gian đến khi có loại khối”, nhưng phân tích đa tác tử dường như chỉ dừng ở các đo lường nội bộ như chuyên môn hóa vai trò và sự lan truyền meme. Không thấy hệ thống đa tác tử tập thể có đạt được nhiều hơn đơn tác tử ở các chỉ số như năng suất kinh tế hay độ phức tạp hay không
      Điều này rõ ràng liên quan đến phần chuyên môn hóa, nhưng nếu không xem xét liệu sự phân công vai trò nổi lên như vậy có kết quả kinh tế hay các tiền điều kiện hay không, thì tôi tự hỏi toàn bộ việc này ở mức nào đó có phải là kịch câm không
    • Phương pháp khoa học hữu ích, nhưng không phải là điều kiện tiên quyết của tính hữu ích
      Một số người thích tốc độ và sự bất định đi kèm với nó
  • Tôi tự hỏi liệu một “nền văn minh” AI giống như Altera đề xuất, nếu có được một hệ thống phần thưởng vận hành được cho toàn bộ nền văn minh, có thể là một mô thức tốt hơn cho AGI so với một LLM đơn lẻ hay không
    Chẳng hạn, nếu nền văn minh AI này cố tối đa hóa [scientific_output] hoặc [code_quality] hay một thước đo đánh giá khác, giống như các quốc gia hiện đại cố tối đa hóa GDP, liệu nó có thể cho kết quả tốt hơn một tác tử AI đơn lẻ cùng làm việc hướng tới mục tiêu đó không

    • Hướng đó rất phù hợp với tiến bộ. Đây đã là một yếu tố thiết kế trung tâm trong các công trình AI nghiêm túc từ khoảng thập niên 1990, và đặc biệt được biết đến rộng rãi qua The Society of Mind của Marvin Minsky
      Rất khuyến nghị cho những ai quan tâm đến tâm trí và AI. Cuốn sách bàn về nhiều khía cạnh của luận điểm bằng các bài tiểu luận một trang, một hình thức thú vị đến mức có thể gọi là kiểu Martin Luther
      Dĩ nhiên nó hơi bị lấn át trong làn sóng đổ xô sang cách tiếp cận LLM thuần túy hào nhoáng, nhưng tôi nghĩ đó gần với hệ quả của việc tệp người dùng tăng vọt hơn là tri thức bị biến mất. Các chuyên gia vẫn luôn ghi nhớ góc nhìn này, và đôi khi bàn đến nó bằng từ “ensemble”
      Một ví dụ hay là GPT-4; theo tôi hiểu, bước nhảy lớn về hiệu năng chủ yếu đến từ việc dùng mixture of experts, điều này gần như đồng nghĩa với xã hội tác tử hoặc ensemble mô hình
    • Sản xuất kẹp giấy?
  • Trông rất tuyệt. Tôi hoài nghi về lợi ích đối với “nền văn minh”, nhưng ít nhất có vẻ có thể tạo ra một trò chơi mô phỏng thú vị
    Vì vậy có lẽ nó hợp với Civilization hơn là civilization

    • Tôi nghĩ Civilization của Firaxis cần một AI kiểu AlphaZero rẻ hơn LLM
      Civ có nhiều cái bẫy ngớ ngẩn đến mức khó hard-code một AI chiến lược tốt một cách kinh tế, còn cách giải quyết bằng cách cho kẻ địch cheat thì chỉ gây bực mình. Sẽ thú vị nếu huấn luyện một mạng nơ-ron nhân tạo liên tục đấu với AI “cổ điển” cho đến khi nó đều đặn thắng từng mức độ khó, rồi tạo thành các tầng. Tôi đoán ai đó đã làm rồi, nhưng không tìm thấy tài liệu
      Tuy nhiên, tôi hoài nghi ngay cả một mạng nơ-ron nhân tạo rất tệ cho Civ cũng sẽ tốn bao nhiêu chi phí tính toán lúc suy luận. Tôi không biết thực tế nó scale thế nào, nhưng dù không cần trình độ grandmaster, phân bố của những sai lầm ngớ ngẩn vẫn có đuôi dài
      AI Starcraft 2 của DeepMind khác AlphaZero vì Starcraft không phải trò chơi thông tin hoàn hảo. AI này cần cơ sở dữ liệu ván đấu của con người để không liên tục bị nghiền nát ở giai đoạn đầu. Với một trò chơi mới, dữ liệu huấn luyện như vậy rất khó có được. Civ cũng luôn thiên về biểu đạt nghệ thuật hơn các game chiến thuật 4X khác, và nếu mỗi khi có kỳ quan mới lại phải huấn luyện lại AI thì có thể là gánh nặng quá lớn
    • Đúng là trông hợp với Civilization hơn là civilization. Ở mảng game thì có thể khá thú vị
    • Tôi thích việc tên dự án gợi nhớ đến Sid Meier
      Tôi hoài nghi liệu dự án này có thực sự hoạt động như cách họ trình bày hay không, nhưng ý tưởng xây một game Civilization trên engine Minecraft thì rất thú vị
    • Tôi hơi ngạc nhiên là các công ty làm game chiến thuật không dùng AI để kiểm thử trước khi phát hành nhằm tìm những thứ như lá bài bị lỗi cân bằng
      Hearthstone là ví dụ đặc biệt hiện lên trong đầu
    • Vừa tiếc vừa nhẹ nhõm từ góc nhìn p(doom) khi nó không được triển khai trong Civilization VI, Humankind, hoặc các game đại chiến lược lớn của Paradox, đặc biệt là Stellaris, Victoria, Crusader Kings, Europa Universalis, thay vì Minecraft
      Tiền cược vừa lớn hơn vừa thực tế hơn so với “hãy lên kế hoạch cho bữa tiệc”, “được, tôi sẽ đi nhặt gỗ”
      Công bằng mà nói, có thể bài báo có đề cập. Dù sao thì thứ này không hiểu sao trông như preprint của preprint
  • Tôi nghĩ đến Dwarf Fortress. Một trò chơi mô phỏng hàng nghìn năm thời gian của thế giới người lùn, địa hình thay đổi, sự hưng vong của các vương quốc người lùn, rồi thả bảy người lùn do người chơi điều khiển xuống bản đồ và nói “chơi vui nhé!”
    Nó có thể là một mô hình đồ chơi hữu ích để tìm các lĩnh vực cần khảo sát xem có thể dự đoán hành vi của các nền văn minh thật hay không, nhưng tôi không thấy đột phá AI nào ở đây
    Có lẽ phải chờ Project Sid 6.7

  • Cũng có bài blog công bố: https://digitalhumanity.substack.com/p/project-sid-many-agen...

  • Đọc bài báo thì có cảm giác đảo lộn đầu đuôi
    Các agent không thực sự có thể tự chơi Minecraft một cách riêng lẻ, cũng không thực hiện thành công các nhiệm vụ được giao hoặc tự nguyện nhận. Theo một nghĩa nào đó, giống như mặc quần áo người cho chó rồi tuyên bố đó là một nền văn minh giống con người
    Hơn nữa, các yếu tố cốt lõi về cơ bản đã được hard-code. Có lẽ là các kiểu xã hội khả dĩ và tên vai trò. Tôi cũng không rõ tổ chức xã hội ở đây được hiểu là gì. Nói mạnh nhất thì cũng chỉ đến mức framework agent này có thể dùng cho NPC trong game, tức là tuyên bố rằng các agent duy trì vai trò và phe phái
    Tuyên bố rằng agent “có thể sử dụng cấu trúc pháp lý” đặc biệt không thuyết phục. Vì “hãy sử dụng cấu trúc pháp lý” đã được nhúng vào nhiều hành vi của agent. Việc cố mở rộng điều này sang xã hội loài người thực tế là lố bịch, và chuyện các tác giả thản nhiên bỏ qua xã hội học và nhân học cũng chẳng giúp gì
    Cũng có những tuyên bố đáng ngờ khác. Tôi nói “tin rằng” tên vai trò đã được hard-code, nhưng nếu tôi không bỏ sót gì thì thông tin mơ hồ đến mức khó chấp nhận. Tôi không thấy trong prompt của agent có yếu tố nào cho phép tạo vai trò mới hoặc tự phân vai. Có thể tôi đã bỏ sót, nhưng càng đọc càng thấy rối
    Họ tuyên bố các agent đã hình thành quan hệ xã hội dài hạn trong 12 ngày Minecraft, nhưng ngoài đời thực đó chỉ là bốn giờ, và agent trải nghiệm thời gian thực. Độ dài một ngày trong Minecraft không quan trọng. “Hình thành quan hệ xã hội dài hạn” và “sử dụng cấu trúc pháp lý” không chỉ là phóng đại mà còn có vẻ thiếu trung thực
    Phần lan truyền meme và tôn giáo hoàn toàn phớt lờ ô nhiễm dữ liệu huấn luyện của GPT-4. Meme được tóm tắt rõ ràng cho thấy nó biết đến meme Pastafarian ngoài đời, nên kết luận rằng meme này đã “lan truyền” là sai. Khả năng lớn hơn nhiều là nó được gợi lại bên trong các agent vốn đã biết meme đó. Không rõ vì sao họ không thử nghiệm bằng một tôn giáo giả mới thật sự
    Một số ví dụ meme như “oak log crafting syndrome” có vẻ mới, nhưng những thứ như “meditation circle” hay “vintage fashion and retro projects” thì chẳng liên quan gì đến Minecraft và gần như chắc chắn là hallucination của GPT-4
    Nhìn chung, nếu muốn làm nghiên cứu trung thực thì việc dùng GPT-4 có vẻ là một sai lầm khủng khiếp

    • Tôi nghĩ hướng đi là đúng. Điểm cốt lõi là làm tốt mã hóa giao diện giữa game và agent để agent có thể đưa ra các lựa chọn đơn giản
      Ví dụ, nếu đưa trạng thái bàn cờ n×n làm world model và cung cấp một số lựa chọn hữu hạn, agent có thể chơi game một cách ổn định và giải thích quyết định với game master. Điều này tạo ảo giác rằng agent đang suy luận
      Cuối cùng, tôi cho rằng đây là bài toán mã hóa: chia world model thành các bài toán lựa chọn đơn giản
      [1] https://jdsemrau.substack.com/p/evaluating-consciousness-and...