1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Từ 10 bài toán mở không có tiến triển cốt lõi trong ít nhất 10 năm, phiên bản nội bộ Astra của mô hình lớn kế tiếp của OpenAI đã tạo ra các kết quả mới, bao quát từ hình học nhiều chiều đến độ phức tạp lượng tử và mật mã dựa trên lưới
  • Quá trình tìm kiếm lời giải đã dùng lượng token trị giá khoảng 2.000 USD theo mức giá API Sol; sau khi con người dùng cùng mô hình để chuẩn bị bài báo, mô hình tiếp tục hình thức hóa từng lập luận thành chứng chỉ Lean
  • Các thành quả chính gồm chứng minh sự tồn tại của nhóm phi-sofic, phản ví dụ cho giả thuyết độ cứng Connes, cận dưới công thức số học n⁴/log n cho việc tính permanent, và định lý lặp song song theo hàm mũ cho trò chơi lượng tử 2 người tổng quát
  • Công trình cũng cải thiện các cận cho đóng gói cầu và mã nhị phân/cầu diện, giải quyết tính khó xấp xỉ theo bội đa thức của bài toán vector gần nhất và giả thuyết thể tích Ehrhart, đồng thời trả lời các bài toán Erdős 146, 180, 183
  • OpenAI cho biết con người chịu trách nhiệm cho việc chuẩn bị bài báo, hình thức hóa bằng Lean và tính chính xác, nhưng vì lập luận toán học do AI tạo ra nên không nên gán là tác phẩm của con người mà phải quy thuộc đóng góp của AI một cách trung thực

10 kết quả do Astra tạo ra

  • Để tăng tốc khám phá cho các nhà khoa học và toán học, OpenAI đang cung cấp miễn phí mô hình ChatGPT tốt nhất của mình cho 100.000 người thông qua ChatGPT for Academic Researchers, đồng thời tiếp tục đánh giá mô hình bằng các bài toán nghiên cứu công khai ngay trong quá trình phát triển
  • Vào tháng 5, hãng đã công bố phản ví dụ do AI tạo ra cho giả thuyết khoảng cách đơn vị của Erdős được phát hiện trong lúc đánh giá một mô hình chưa phát hành; sau đó kết quả này dẫn tới các nghiên cứu tiếp nối trong toán học và khoa học máy tính lý thuyết
  • Những bài toán được chọn đều không có tiến triển ở kết quả cốt lõi trong ít nhất 10 năm, đa số còn lâu hơn nhiều, và nhận được sự quan tâm đáng kể từ cộng đồng toán học ở từng lĩnh vực
  • Phiên bản nội bộ Astra đã tìm ra lời giải, với tổng chi phí tìm kiếm khoảng 2.000 USD theo mức giá API Sol
  • 10 kết quả gồm:
    1. Đóng gói cầu nhiều chiều: hạ cận trên mới của mật độ đóng gói cầu xuống tới điểm tới hạn Cohn–Elkies
    2. Mã nhị phân và mã cầu diện: cải thiện theo hàm mũ cận về kích thước tối đa của mã nhị phân ở khoảng cách tối thiểu cho trước, và đạt kết quả tương tự cho mã cầu diện nhiều chiều
    3. Nhóm phi-sofic: đưa ra một cấu trúc chứng minh sự tồn tại của nhóm phi-sofic, giải quyết một bài toán mở trung tâm trong lý thuyết nhóm
    4. Giả thuyết độ cứng Connes: đưa ra phản ví dụ cho giả thuyết lâu năm rằng một số nhóm nhất định được xác định duy nhất bởi đại số von Neumann của chúng
    5. Độ phức tạp mạch số học: thu được các cận dưới mới khi tính permanent bằng mạch số học và công thức số học; cận dưới cho công thức số học có bậc n⁴/log n
    6. Lặp song song lượng tử: chứng minh định lý lặp song song theo hàm mũ cho trò chơi lượng tử 2 người tổng quát, mở rộng một nguyên lý nền tảng của lý thuyết độ phức tạp cổ điển
    7. Bài toán vector gần nhất: xác lập tính khó xấp xỉ theo bội đa thức cho một bài toán lưới then chốt liên quan tới mật mã hậu lượng tử
    8. Giả thuyết thể tích Ehrhart: xác định thể tích cực đại khả dĩ trong mọi số chiều đối với vật thể lồi mà trọng tâm là điểm lưới nội bộ duy nhất
    9. Số Ramsey nhiều màu: thu được cận dưới siêu mũ cho số Ramsey tam giác nhiều màu, qua đó giải quyết bài toán Erdős 183
    10. Giả thuyết trong lý thuyết đồ thị cực trị: với các kết quả về giả thuyết compactness và degeneracy, giải quyết các bài toán Erdős 146 và 180
  • Các nghiên cứu tiếp theo sau phản ví dụ cho giả thuyết khoảng cách đơn vị gồm phản ví dụ cho giả thuyết tổng-tích trên số thực, ước số phân rã và bài toán Elekes–Rónyai, sự cần thiết của thời gian bậc hai cho cặp xa nhất trong số chiều siêu hằng dưới SETH, độ phức tạp truyền thông của giao điểm điểm-đường thẳng trên số thực, khoảng cách lặp trong lưới Minkowski

Quy thuộc nghiên cứu và vai trò của cộng đồng toán học

  • Sự xuất hiện của các hệ thống AI có thể đóng góp cho nghiên cứu toán học tạo ra những câu hỏi mà một công ty công nghệ đơn lẻ khó có thể tự trả lời; OpenAI cho biết họ tôn trọng các quan điểm lo ngại về tác động của AI, bao gồm cả những người ký Tuyên bố Leiden về AI và toán học
  • Cách các kết quả được tạo ra phải được phản ánh trung thực trong ghi nhận tác giả và quy thuộc đóng góp
    • Nếu gắn các chứng minh do AI tạo ra hoàn toàn là tác phẩm của con người thì sẽ làm sai lệch cả đóng góp của hệ thống lẫn công việc trí tuệ thực sự của con người
    • Con người hỗ trợ chuẩn bị bài báo và hình thức hóa bằng Lean, đồng thời chịu trách nhiệm về tính chính xác, nhưng bản thân lập luận toán học là do hệ thống AI tạo ra
  • OpenAI kỳ vọng cộng đồng toán học sẽ xem xét các kết quả, đặt chúng vào bối cảnh, rồi phát triển các ý tưởng này thành nghiên cứu và khám phá mới
  • Khi AI phát triển thành cộng tác viên nghiên cứu ngày càng tinh vi hơn, khả năng tiếp cận rộng rãi là điều thiết yếu để các nhà khoa học và toán học có thể khám phá và định hình tương lai của từng lĩnh vực

1 bình luận

 
Ý kiến trên Hacker News
  • Điều khiến tôi khó chịu nhất là sự thiếu minh bạch về toàn bộ thí nghiệm và cách thiết lập. Khó tin rằng họ chỉ cho mô hình giải đúng 10 bài này một lần mỗi bài, nên con số 2.000 USD được đưa ra mà không công bố thiết kế thí nghiệm tổng thể có thể dễ bị hiểu lầm như kiểu hack P-value
    Tôi muốn biết tổng số bài toán đã đưa cho mô hình, tỷ lệ và chi phí của những bài không giải được trước khi bỏ cuộc, số lần thử cho từng bài, và chi phí môi trường chạy bao gồm cả việc có được truy cập cụm tác vụ hay không

    • Tôi nhớ là ngay cả trước làn sóng AI, trong giáo dục toán học đã có bàn luận rằng không chỉ bản thân bài toán và lời giải mà cả giàn giáo hỗ trợ (scaffolding) giúp tìm ra chúng cũng rất quan trọng
    • Ngược lại, chi phí có vẻ không phải điểm phù hợp để chỉ trích ở đây. Dù có tiêu 1 triệu USD cho 10 bài toán này thì cũng chỉ tương đương chi phí một năm của 10–20 nhà nghiên cứu toán học, và vẫn khó biết liệu trả số tiền đó cho con người có đem lại cùng kết quả hay không
    • Tôi cũng tò mò liệu đã từng có nhà nghiên cứu nào không liên quan tới OpenAI hay các công ty phát triển LLM khác đạt được thành quả tương tự chưa
      Cũng cần kiểm tra khả năng OpenAI đã thuê một nhà nghiên cứu tổ hợp học giỏi để giải bài toán còn mô hình chỉ được dùng phụ trợ
    • Thái độ không thể chấp nhận bất cứ điều gì nếu không có thử nghiệm đối chứng ngẫu nhiên (RCT) bắt buộc cũng là quá đà. Không phải tôi mỉa mai, nhưng cần có khả năng hoài nghi bản thân một cách hợp lý mà không cần dàn dựng RCT
    • So sánh việc không công bố toàn bộ chi phí chạy với hack P-value là không công bằng. Việc bỏ sót báo cáo giá cả hoàn toàn khác với gian lận khoa học hay thao túng kết quả
  • Điều đáng ngạc nhiên hơn là bài này thậm chí còn không lên vị trí đầu trang cao nhất của HN. Dù đúng là kết quả này tiến bộ hơn trước, nó cho thấy giờ đây người ta không còn quá ngạc nhiên trước ý tưởng AI tạo ra các bước tiến lớn trong toán học và khoa học máy tính nữa

    • Những người không thể chấp nhận về mặt tâm lý sự tiến bộ của AI đã tích cực report để hạ thứ hạng. Hacker News không còn là sân chơi của giới tinh hoa nữa
    • Một số bạn tôi là nhà toán học trong học giới, đúng đối tượng độc giả, nói rằng họ lướt qua vì tiêu đề trông giống bài tổng hợp thành tựu của tháng trước chứ không phải 10 kết quả mới
    • Các phe đang chia rẽ rất dữ dội theo lợi ích từng công ty và chuyện có mã nguồn mở hay không
    • Vậy thì tôi cũng tò mò về bản thân nghiên cứu AI. Cũng nên hỏi liệu OpenAI đã gần tới mức tự động hóa nhân viên con người và xóa bỏ việc làm hay chưa
    • Thành thật mà nói tôi hơi mệt với kiểu bài này
  • Giờ đây rất khó phủ nhận ảnh hưởng của AI, và gần như không còn chỗ nào để dời cột mốc nữa. Lần tới chắc phải dời hẳn ra ngoài sân
    Mọi người càng sớm thoát khỏi giai đoạn phủ nhận và bắt đầu nhìn nhận nghiêm túc thì càng tốt

    • Tôi khó hiểu với lời chỉ trích về việc dời cột mốc. Khoa học là quá trình tiến bộ, học hỏi và điều chỉnh kỳ vọng; nếu hoàn toàn không thay đổi cột mốc thì chỉ lặp lại cùng một thành tựu
    • Vấn đề không phải phủ nhận mà là thờ ơ. Đa số chẳng quan tâm, nhưng lại có thể kể mọi thứ về Kim Kardashian
  • Tôi không phải chuyên gia trong lĩnh vực mà OpenAI nói là đã có tiến bộ, nên không muốn vội hạ thấp thành quả này, nhưng tôi lo cách diễn đạt trên blog có thể đã bị thổi phồng vì mục đích marketing
    Trước đây đúng là chưa có cách tiếp cận tính toán nào giải được ổn định những bài này, nhưng điều cốt lõi là liệu chứng minh lần này có bổ sung ý tưởng mới cho toán học hay chỉ là tìm kiếm quy mô lớn một tổ hợp công cụ phù hợp từ tài liệu sẵn có
    Tôi muốn biết đây vốn là những bài mà đáp án có vẻ trực quan, chứng minh cũng có thể làm được nhưng không đủ giá trị để chuyên gia bỏ thời gian, hay là những bài thực sự khó về bản chất và AI đã làm được nhiều hơn là chỉ nhét thêm vào một cỗ máy giải cực lớn

    • Trong hồ sơ trích dẫn, nghiên cứu đột phá có thể được định nghĩa là nghiên cứu vừa được trích dẫn nhiều vừa nối các dòng trích dẫn trước đó chưa từng xuất hiện cùng nhau. Ngược lại, nghiên cứu tăng tiến bình thường chỉ kết hợp các trích dẫn vốn đã ở gần nhau
      Nói cách khác, mức độ đổi mới có thể được đo khá cụ thể bằng mức độ nó nối các ý tưởng và lĩnh vực vốn chưa từng liên kết. Puja Ohlhaver đã trình bày về điều này, và tôi cũng từng làm một thí nghiệm được tài trợ: https://www.youtube.com/watch?v=guLDNMAOn24
    • Các bài toán CVP và độ phức tạp mạch trong khoa học máy tính là những chủ đề cực kỳ quan trọng mà các nhà nghiên cứu hàng đầu đã theo đuổi 30–40 năm, trong đó có cả người đoạt Turing Award. Nếu thật sự đã giải được thì xứng đáng giành giải bài báo xuất sắc nhất ở nhiều hội nghị danh giá hàng đầu
    • Chỉ vì họ dùng từ advanced mà lo là thổi phồng marketing thì hơi khó hiểu. Các nhà nghiên cứu trình độ tiến sĩ đã dành phần lớn sự nghiệp cho các bài toán này, nên cách diễn đạt đó là phù hợp
  • Một trong những dự đoán ban đầu về AI tăng tốc đột ngột là sẽ có hệ thống giải các bài toán chưa có lời giải trong toán học cao cấp, rồi thông qua những khám phá mới trong toán học và khoa học máy tính mà đẩy hiệu năng phần mềm tăng vọt
    Thành quả hiện tại ở mức toán học tuyến đầu mà nếu là con người thì sẽ thuộc top 100–1.000 thế giới, tức khoảng top 0,00001%, và trong phần mềm cũng đã có tiến bộ lớn như việc OpenAI sửa vấn đề kernel GPU để cải thiện hiệu năng khoảng 15%. Cả hai đều gắn với định luật mở rộng và tính khái quát của trí tuệ, ở chỗ mô hình lớn đồng thời đạt được năng lực toán học và kỹ thuật phần mềm mà quy mô nhỏ hơn không thể có
    Tuy vậy, tôi đánh giá thấp hơn trước khả năng các khám phá toán học/khoa học sẽ trực tiếp mở ra cải thiện hiệu năng phần mềm. Ngay cả các công ty công nghệ cũng giao cho tiến sĩ toán làm kỹ thuật phần mềm thay vì toán thuần túy, và lý do họ giỏi thường là nhờ trí tuệ tổng quát chứ không phải các khám phá học thuật mới nhất
    Vì thế đây vẫn là bằng chứng rằng mô hình đang tốt lên, nhưng khó xem là dấu hiệu ngay trước một cú tăng tốc bùng nổ (foom) do cách mạng toán học tuyến đầu kích hoạt

    • Muốn tin như vậy thì phải giả định rằng mô hình chỉ bị overfit rõ rệt vào toán học hàn lâm và năng lực đó hoàn toàn không chuyển sang kỹ thuật phần mềm thực tiễn. Tôi sẽ không đặt cược theo hướng đó
    • Việc đồng nhất các tiến bộ toán học mới với trình độ top 100–1.000 thế giới có vẻ là hiểu sai về việc các nhà toán học thực sự làm gì
  • Năng lực của AI nội bộ còn chưa được nêu tên này rất ấn tượng, nhưng không có lấy một tên người đóng góp nào xuất hiện ở đâu cả. Ít nhất cũng phải có ai đó pha cà phê cho mô hình này chứ

    • Có ghi rõ rằng kết quả đạt được bằng phiên bản nội bộ của Astra, tức mô hình lớn tiếp theo
  • Tôi tò mò tổng chi phí của nghiên cứu này sẽ là bao nhiêu nếu tính cả lương của nhà toán học và kỹ sư

    • Nếu không phải con người túc trực liên tục để chăm sóc thì không có lý do gì phải tính toàn bộ lương. Chỉ cần tính thời gian dùng cho môi trường chạy, thiết lập prompt và kiểm chứng kết quả; chi phí huấn luyện mô hình thì còn được phân bổ cho nhiều mục đích khác
    • Vì OpenAI trả thưởng cho nhân viên bằng cổ phần nên con số có thể rất lớn, nhưng trong bối cảnh hạ tầng và mô hình đã được huấn luyện sẵn thì đó không phải con số quá có ý nghĩa. Kể cả khi AI không tiến thêm, nó đã có sức phá hoại khổng lồ rồi
    • Có nói rằng chi phí để tạo ra chứng minh cho 10 đột phá này là dưới 2.000 USD theo giá API Sol
      https://x.com/polynoamial/status/2083470822258467194
  • Tôi tự hỏi sẽ ra sao nếu các công ty như OpenAI không công bố những kết quả này mà đơn giản bắt đầu đưa chúng vào dữ liệu huấn luyện

    • Giữ bí mật toán học thuần túy thì gần như không có giá trị công nghiệp, với công ty nó chỉ có tác dụng phô diễn năng lực mô hình. Thực tế hơn thì họ có thể sẽ ngừng tài trợ chi phí nghiên cứu
      Ngay cả nếu ý là dùng kín cho việc cải thiện mô hình, thì vài chứng minh đúng cũng chỉ đem lại lợi ích bổ sung rất nhỏ, và cuối cùng vẫn có khả năng bị trích xuất ra khỏi mô hình rồi lộ ra ngoài
    • Vì đây là những bài toán trước đó chưa được giải nên vốn không có lời giải sẵn, do đó nói “đưa vào huấn luyện” thực sự có nghĩa gì thì cũng không rõ
  • Những nơi như OpenAI trên thực tế có thể cho chuyên gia dùng lượng token trị giá hàng triệu USD. Họ đâu có bán toàn bộ tài nguyên tính toán 24/24 mỗi ngày, nên chi phí nội bộ phần lớn có lẽ gần với tiền điện
    Nhưng nếu tài nguyên tính toán vẫn không dùng hết như vậy thì cũng phải đặt câu hỏi liệu có thực sự cần xây thêm rất nhiều trung tâm dữ liệu trong tương lai không

    • Với OpenAI thì nghiên cứu cũng là marketing, nên chắc chắn họ đã phân bổ ngân sách đủ lớn
    • So với tổng sản lượng đầu ra thì rất có thể chỉ ở mức sai số do làm tròn. Họ đang hạn chế mức dùng của mô hình công khai để dành tài nguyên nghiên cứu, và càng nhiều trung tâm dữ liệu thì những giới hạn đó càng có thể giảm xuống
    • Huấn luyện học tăng cường có thể dùng hết toàn bộ tài nguyên tính toán, nên tôi không rõ dựa vào đâu để nói là không cần
    • Việc kết luận rằng không cần trung tâm dữ liệu chỉ vì có tài nguyên nhàn rỗi để thúc đẩy toán học là khá gượng ép. Ngược lại, kết luận hợp lý duy nhất rút ra từ tin này là cần nhiều trung tâm dữ liệu hơn