1 bình luận

 
GN⁺ 2024-03-04
Ý kiến trên Hacker News
  • Khi nhắc đến định lý không có bữa trưa miễn phí, cũng nên kèm theo lưu ý rằng trên thực tế nó không phải là trở ngại lớn đến vậy
    Chỉ cần giả định dữ liệu đến từ thế giới thực cũng đã đủ để định lý này không còn gây cản trở
    Cuốn sách hoàn toàn không đề cập đến điểm đó; sẽ tốt hơn nếu giải thích rằng “mọi phân phối” ở đây gần giống việc tổng quát hóa mọi chuỗi bit có thể được sinh ra bằng tung đồng xu thành một không gian nhiều chiều của các hàm rời rạc, còn các hàm liên tục chỉ là một tập con cực nhỏ trong đó
    Rốt cuộc, ý nghĩa gần đúng là nếu dữ liệu đến từ một phân phối ngẫu nhiên đều của “mọi khả năng” thì những thứ như kết quả lần tung đồng xu tiếp theo là không thể học để dự đoán được

    • Đúng. Những loại định lý không có bữa trưa miễn phí như thế này, hoặc các kết quả dựa trên những giả định quá tổng quát, nhìn chung thường có vẻ quá bi quan
      Ví dụ, nhiều người ngây thơ nghĩ rằng vì bài toán dừng hoặc định lý Rice nên phân tích chương trình tĩnh là bất khả thi
    • Nó giống bài toán quy nạp của Hume. Không có giả định thì không thể nối các quan sát trong quá khứ với dự đoán tương lai
      Việc mặt trời đã mọc vào buổi sáng một nghìn lần không tự động làm tăng hay giảm khả năng nó sẽ mọc vào ngày mai; ta phải giả định kiểu như các sự kiện nhìn chung tiếp diễn tương tự theo thời gian
      Những giả định như vậy không thể rút ra từ dữ liệu. Dù trong quá khứ mọi thứ đã tiếp diễn tương tự, điều đó cũng không nói gì về tương lai
      Dẫu vậy, khoa học vẫn vận hành tốt bất chấp vấn đề này, và học máy cũng tiếp tục hoạt động tốt vì con người dùng kinh nghiệm và tri thức tiên nghiệm khi thiết kế thuật toán
      Những giả định này được gọi là thiên kiến quy nạp, và khiến việc học nghiêng về các mẫu nhất định như “những thứ gần nhau nhìn chung thì giống nhau”
    • Tôi không rõ lưu ý đó được áp dụng như thế nào. Tôi hiểu định lý không có bữa trưa miễn phí không có nghĩa là một số bài toán là không học được, mà là không có một thuật toán duy nhất hoạt động tốt cho mọi lớp bài toán
      Ví dụ trong chứng minh có thể mang tính nhân tạo, nhưng trong thực tế chẳng phải ta sẽ chọn thuật toán khác nhau tùy theo các giả định bổ sung sao?
  • Lý thuyết học là một nỗ lực hình thức hóa khoa học tự nhiên cho đến cả việc ra quyết định. Giả định ngầm của khoa học tự nhiên là có thể dự đoán các quan sát tương lai từ các quan sát quá khứ bằng một mô hình thế giới mang tính thuật toán đủ tinh vi
    Điều này giống với giả định Solomonoff đưa ra khi chứng minh suy luận quy nạp, nên phải bắt đầu từ mã hóa Turing-complete, chứ không phải cái gọi là mã hóa “phổ quát” của Rissanen
    Khi xây dựng các lý thuyết con thì việc rời khỏi điểm xuất phát đó là ổn, nhưng nếu không bắt đầu từ đó thì sẽ dẫn đến những kết quả rác rưởi như sự lẫn lộn suốt 50 năm qua quanh việc “nguyên lý độ dài mô tả tối thiểu” chính xác có nghĩa là gì
    Tuy nhiên, nếu muốn xây dựng mô hình nhân quả thì điều đó không ổn. Để mô hình hóa hệ động lực, không thể rời khỏi mã Turing-complete
    Có thể xem hệ động lực như một máy trạng thái hữu hạn với rất nhiều trạng thái, nhưng để tạo mã được nén tối ưu, cần ngữ nghĩa Turing-complete chạy trên một đồ thị có chu trình có hướng gồm một số rất lớn nhưng hữu hạn các flip-flop hoặc các cổng vạn năng như NOR, NAND

  • Giờ đã biết nguyên nhân của double descent là gì chưa?

    • Tôi không biết đây có phải là kết quả đã được khái quát hóa hay không, nhưng nhóm Circuits của Anthropic đã đưa ra một giả thuyết khá thuyết phục. Giai đoạn đi xuống đầu tiên là lúc mô hình ghi nhớ các điểm dữ liệu, còn giai đoạn đi xuống thứ hai là lúc nó chuyển sang học đặc trưng theo nghĩa hình học
      Ở đây, đặc trưng có thể được xem như một không gian vector trừu tượng và có số chiều rất cao
      Nhóm này đang nghiên cứu sâu ý tưởng chồng lấp, trong đó một neuron mã hóa nhiều khái niệm
      Họ thử nghiệm với các mô hình đồ chơi và tập dữ liệu trong đó các đặc trưng tiềm ẩn được biểu diễn tường minh rồi nén vào một tập nhỏ các chiều dữ liệu, buộc tạo ra chồng lấp, và cho thấy chồng lấp đó trông như thế nào tùy theo kích thước dữ liệu huấn luyện
      Rõ ràng đây là mô hình đồ chơi, nhưng ít nhất đối với các mô hình gặp hiện tượng chồng lấp thì đó là một ý tưởng thuyết phục
      https://transformer-circuits.pub/2023/toy-double-descent/ind...
    • Gần đây có một bài blog cho rằng có thể giải thích double descent bằng cơ học thống kê https://calculatedcontent.com/2024/03/01/describing-double-d...
      Chi tiết hơn ở đây: https://calculatedcontent.com/2019/12/03/towards-a-new-theor...
    • Tôi không phải chuyên gia, nhưng bài báo này khảo sát double descent bằng một mô hình đơn giản
      Diễn giải là như sau. Khi mở rộng sang vùng quá tham số hóa, ta có thể tối ưu về phía các trọng số có chuẩn nhỏ, và các trọng số như vậy lại khái quát hóa tốt
      Việc điều này có giải thích double descent nói chung hay không, hoặc có áp dụng cho các mô hình khác như mạng nơ-ron sâu hay không, là những câu hỏi riêng
      https://arxiv.org/pdf/2303.14151.pdf
    • Vẫn chưa biết. Giả thuyết cá nhân tôi thích là stochastic gradient descent đúng theo nghĩa đen là có tính ngẫu nhiên
      Vì nó tối ưu trên một tập con rất nhỏ chứ không phải toàn bộ ngữ liệu huấn luyện, nên gradient không chính xác
      Ý tưởng là việc học quá mức sẽ đẩy qua các nghiệm tối ưu cục bộ, và thay vì né vòng quanh những hố quá khớp cục bộ, nó cho phép mô hình tiến đệ quy về phía phân phối thực
  • Trên Internet có thật sự rất nhiều PDF toán học tuyệt vời, miễn phí, do giới học thuật, nhà giáo dục và kỹ sư viết. Vấn đề là nội dung trùng lặp cũng cực kỳ nhiều
    Tôi tự hỏi liệu có thể tạo một mô hình AI tổng hợp tốt các cụm tài liệu chồng lặp thành một PDF thống nhất, nhất quán và không trùng lặp hay không

    • Có khi chỉ cần chọn cuốn sách được dùng trong khóa học tương ứng ở trường đại học đó là được
    • Không cần đến mô hình AI. Probabilistic Machine Learning của Murphy là một tài liệu và sách tham khảo rất hay
  • Bắt bẻ nhỏ thôi, nhưng tiêu đề gây nhầm lẫn. Từ đầu tiên nên được đổi thành Machine-Learning hoặc Statistical-Learning thì đúng hơn
    Nếu có thể, hy vọng tác giả một ngày nào đó sẽ sửa như vậy

  • Khá khó đọc. Ví dụ ngay trang đầu chương 1 đã nói về tối thiểu hóa dạng toàn phương và đưa ra thứ trông giống công thức của phương pháp bình phương tối thiểu tuyến tính, nhưng không giải thích gì xem nó có đúng không
    Có thêm chút diễn giải thì sẽ hữu ích hơn
    Điểm mình thích là có nhiều bài tập

    • Bài này có vẻ được viết cho những người đã có một mức nền tảng toán học nhất định và muốn hiểu lý thuyết học
      Hơn nữa, chương đó được ghi rõ là phần ôn tập, nên coi như giả định rằng nội dung ấy bạn đã học hoặc sẽ học ở nơi khác
    • Bắt đầu từ nguyên lý thứ nhất không có nghĩa là dễ đọc
    • Như bình luận cùng nhánh đã nói, tài liệu này rõ ràng không nhắm đến người mới học lần đầu
      Dù vậy trực giác của bạn đúng. Nếu viết hàm mục tiêu của phương pháp bình phương tối thiểu tổng quát thì nó trở thành một dạng toàn phương
      Việc chọn từ “toàn phương” ở đây không phải ngẫu nhiên; nó là sự tổng quát hóa hàm bậc hai bằng ma trận
      Phần đó bàn về phiên bản vector của việc tối thiểu hóa một hàm bậc hai
    • Chắc chắn trông không giống như bắt đầu từ nguyên lý thứ nhất
    • Bình phương tối thiểu là một biểu thức bậc hai
      Bậc hai nghĩa là có hạng tử bình phương
  • Thú vị đấy. Có cuốn sách hay nào về chủ đề này không?

  • Thú vị. Khi có thêm thời gian mình sẽ đọc lướt thử
    Nhìn qua thì có vẻ sách này [1] bao quát khá nhiều nội dung giống cuốn này. Mình tò mò không biết hai cuốn khác nhau thế nào
    [1]: https://www.cambridge.org/core/books/understanding-machine-l...

    • Một cuốn sách về machine learning xuất bản năm 2014, giờ nghe đã có cảm giác cổ điển và mang tính lịch sử rồi
  • Mình mong đến ngày có thể nói với GPT-5 rằng “tôi có một ý tưởng muốn thử, hãy đọc cuốn sách này và cho tôi biết có nội dung nào liên quan đến việc làm cho ý tưởng đó hoạt động tốt hơn không”

    • Mình chưa từng nghe chuyện LLM tạo ra ý tưởng mới. Chẳng phải chỉ khả thi khi đó là ý tưởng đã có ai đó từng thử rồi sao?
    • Mình đang nhận ra phần khó là truyền ngữ cảnh về $this
      Rất khó mô tả ngữ cảnh của mình với tư cách người dùng bằng vài biến số chiều thấp, và chính mình cũng không hiểu tình huống của bản thân trong vũ trụ đủ để giải thích cho AI
      Vốn từ vựng mình chia sẻ với AI cũng thiếu. Internet có vẻ đã thành công trong việc trao đổi trạng thái đã được thống nhất một cách nhất quán nhờ giao thức chung HTTP
      Ví dụ trong Uber, có thể truyền trạng thái trong một thế giới yêu cầu-phản hồi hẹp như số điện thoại, xe, GPS, thời điểm hiện tại, thanh toán
      Nhưng với tư cách một học viên muốn học thuật toán, mình không biết truyền những thông tin phức tạp như tuổi, môi trường dùng internet, nơi sống, sở thích giải thích bằng hình ảnh, lịch sử từng sợ sách dày, các cột mốc như CS50, mức độ thành thạo Python như thế nào
      Ý tưởng startup cũng không thể chỉ nói “traction thấp” là đủ; cần truyền trạng thái như mạng lưới VC, lập trình viên, bán hàng, bằng chứng về các quan hệ đối tác thành công, số người tham dự, doanh thu
      Ngay cả trong thế giới thực, ngữ cảnh của mỗi người cũng quá khác nhau nên những vốn từ như vậy chỉ tồn tại trong các nhóm nhỏ
      Việc giả định tri thức tồn tại như một biến toàn cục và vĩnh viễn cũng là vấn đề. Ở một số khu vực, nhiều người còn không có điện hay thậm chí điện thoại cơ bản, nên một PDF do AI gợi ý có hữu ích hay không cũng phụ thuộc vào cấu trúc quyền lực và quản trị địa phương
      Mình không biết tương lai sẽ tiến hóa ra sao, nhưng chỉ nghĩ về khả năng thôi đã thấy thú vị. Máy tính có thể trò chuyện với chúng ta dễ dàng và giống như một đứa trẻ thông minh ngay từ ngày đầu, nhưng rốt cuộc việc không đưa vào được dữ liệu đủ nhiều, phù hợp và rẻ có thể mới là nút thắt thực sự để khai thác thêm tính hữu ích
    • Nếu tự đọc cuốn sách đó thì ý tưởng của bạn sẽ tốt hơn. Trong quá trình ấy có thể bạn cũng học được điều mới