1 điểm bởi GN⁺ 14 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Kết quả phân tích toàn bộ phần thân bài của 12.750 bài báo arXiv cho thấy khoảng một phần ba các bài gần đây đọc giống như do máy viết, và tỷ lệ bị phân loại trong quý hoàn chỉnh gần nhất là khoảng 32%
  • Dùng các bài báo giai đoạn 2021~2022 làm nhóm đối chứng do con người viết để đặt ngưỡng ở mức tỷ lệ dương tính giả 0,4%, đồng thời sử dụng PDF phiên bản 1 và khoảng tin cậy 95% theo phương pháp bootstrap
  • Sau khi ChatGPT xuất hiện, tỷ lệ phân loại tăng hai đợt và đạt đỉnh khoảng 39% vào đầu năm 2026; tính đến tháng 7/2026, trong 12 tháng gần nhất, khoa học máy tính là 65,0% còn toán học là 0,7%
  • Các bài báo toán học có nhiều công thức và cấu trúc định lý·chứng minh có thể bị đo thấp vì khác với phân bố huấn luyện của bộ phát hiện, và cũng không thể đánh giá hiệu năng với tổ hợp mô hình·prompt riêng tư mà tác giả thực sự đã dùng
  • Kết quả phân loại không thể xác định tác giả hay tỷ lệ nội dung do AI tạo ra, cũng không phân biệt được chỉnh sửa nhẹ với tạo toàn bộ, nên cần được diễn giải như một cận dưới của tỷ trọng văn phong máy móc chứ không phải căn cứ để chỉ trích cá nhân

Thiết kế đo lường lấy tỷ lệ dương tính giả làm chuẩn

  • Con số kiểu “N% nội dung là AI” sẽ kém giá trị nếu không xem cùng tỷ lệ mà bộ phát hiện gán nhầm cả tài liệu thực sự do con người viết
    • Nếu 40% bài mới bị phân loại là do máy viết nhưng kết quả tương tự cũng xuất hiện ở 20% bài báo trước thời ChatGPT, thì con số cần được giải thích trước tiên là tỷ lệ dương tính giả 20%
  • Bộ phát hiện được hiệu chỉnh phù hợp với văn phong học thuật
    • Ở mức tỷ lệ dương tính giả 0,4%, nó cho qua bình thường 99,6% tài liệu khoa học thật từ trước thời LLM
    • Phát hiện được 85% tài liệu học thuật do AI viết
  • Xem các bài báo nộp trong giai đoạn 2021~2022 là dữ liệu đáp án do con người viết, rồi đặt ngưỡng sao cho đúng 0,4% bị phân loại
  • Tất cả kết quả đều là tỷ lệ bài báo vượt ngưỡng được thiết kế để tài liệu trước thời LLM giữ ở mức 0,4%
  • Các năm trước ChatGPT đóng vai trò nhóm đối chứng tích hợp sẵn
    • Nếu xu hướng tăng là kết quả giả tạo do chính bộ phát hiện sinh ra, thì các năm 2021~2022 cũng phải cao như năm 2026, nhưng thực tế không phải vậy

Mẫu và phương pháp phân tích

  • Lấy mẫu khoảng 25 bài theo từng lĩnh vực và từng tháng từ tháng 1/2023 đến tháng 7/2026 trong 10 nhóm lĩnh vực, cộng thêm 8 tháng đối chứng của giai đoạn 2021~2022, tổng cộng phân tích 12.750 bài
  • Sử dụng PDF phiên bản 1 của mỗi bài để tránh việc câu chữ được sửa vào năm 2026 lẫn vào mẫu năm 2023 của chính bài đó
  • Phân tích toàn bộ phần thân bài thay vì phần tóm tắt
    • Có trường hợp cùng một bài mà phần tóm tắt dưới 20%, còn phần thân vượt 70%, nên nếu chỉ phân tích tóm tắt thì tín hiệu có thể bị làm yếu đi
  • Áp dụng khoảng tin cậy 95% theo phương pháp bootstrap cho mọi số liệu

Xu hướng tổng thể và chênh lệch theo lĩnh vực

  • Tỷ lệ phân loại giữ ở mức 0,4% trong giai đoạn 2021~2022, rồi bắt đầu tăng trong vòng vài tháng sau khi ChatGPT xuất hiện
  • Sau đó tăng qua hai đợt, đạt khoảng 32% trong quý hoàn chỉnh gần nhất, và lên đỉnh khoảng 39% vào đầu năm 2026
  • Kết quả theo lĩnh vực trong 12 tháng gần nhất tính đến tháng 7/2026 như sau
Lĩnh vực Nhóm đối chứng trước LLM Tỷ lệ phân loại gần đây Khoảng tin cậy 95%
Khoa học máy tính 0,2% 65,0% 59,3~70,3%
Sinh học định lượng 3,5% 56,3% 51,0~61,7%
Kỹ thuật điện và hệ thống 1,7% 51,3% 46,0~57,0%
Kinh tế và tài chính 2,5% 47,0% 41,3~52,7%
Vật lý ứng dụng 1,3% 34,0% 29,0~39,7%
Thống kê 1,8% 31,3% 26,0~36,7%
Vật lý vật chất ngưng tụ 0,0% 24,0% 19,3~29,0%
Vật lý năng lượng cao 0,5% 14,0% 10,0~18,0%
Vật lý thiên văn 0,0% 10,7% 7,3~14,3%
Toán học 0,0% 0,7% 0,0~1,7%
  • Khoa học máy tính cao nhất với khoảng 65%, còn toán học thấp nhất với khoảng 0,7%, nhưng con số thấp của toán học lại khó diễn giải
  • Cột đối chứng là giá trị trung bình của tỷ lệ phân loại giai đoạn 2021~2022 của từng lĩnh vực qua ba thiết lập độ nhạy
  • Vì các lĩnh vực tăng mạnh không trùng với các lĩnh vực có mức đối chứng trước LLM cao, nên không thể giải thích mức tăng về sau chỉ bằng điểm xuất phát cao

Giới hạn thống kê của nhóm đối chứng theo lĩnh vực

  • Nhóm đối chứng trước ChatGPT của mỗi lĩnh vực gồm 200 bài
  • Với tỷ lệ dương tính giả 0,4%, trong 2.000 bài đối chứng của 10 lĩnh vực chỉ có 8 bài bị phân loại, nên tỷ lệ theo từng lĩnh vực dưới một ngưỡng duy nhất chỉ được đo khá thô
  • Cận dưới dương tính giả khi gộp toàn bộ đã được ước lượng đủ tốt và thiết kế nghiên cứu cũng dựa trên đó, nhưng số liệu đối chứng theo từng lĩnh vực chỉ là xấp xỉ
  • Muốn cố định chính xác tỷ lệ dưới 1% cho từng lĩnh vực thì cần hàng nghìn bài đối chứng ở mỗi lĩnh vực, nhưng arXiv trước năm 2023 không có đủ số bài để đáp ứng điều đó

Điểm thấp và các điểm mù của bộ phát hiện

  • Điểm thấp có thể có nghĩa là tỷ lệ áp dụng AI thấp, hoặc có thể phản ánh các điểm mù của bộ phát hiện
  • Bài báo toán học xoay quanh công thức và cấu trúc định lý·chứng minh; nếu bỏ công thức và tài liệu tham khảo đi thì phần văn xuôi còn lại rất ít, và cũng khác với tiếng Anh khoa học mà bộ phát hiện được huấn luyện
    • Ngay cả bài toán học được viết với nhiều trợ giúp từ mô hình cũng có thể nhận điểm thấp vì phần văn xuôi nằm ngoài phân bố của bộ phát hiện
    • Vì vậy, chỉ từ kết quả của toán học thì khó phân biệt giữa mức độ áp dụng thấp và độ nhạy phát hiện thấp
  • Các lĩnh vực có tỷ trọng văn xuôi cao và khớp nhất với phân bố huấn luyện của bộ phát hiện lại tăng mạnh nhất, nên riêng yếu tố gây nhiễu này không thể giải thích xu hướng tăng chung
  • Thứ hạng của các lĩnh vực có điểm thấp cần được đọc như cận dưới của mức độ áp dụng AI
  • Bộ phát hiện có độ nhạy khác nhau tùy mô hình sinh, và không thể đánh giá chính xác tổ hợp riêng tư giữa mô hình và prompt mà các tác giả thực tế đã dùng
  • Phạm vi phát hiện không hoàn hảo làm giảm tỷ lệ bị phân loại, nên tỷ lệ đo được là cận dưới của tỷ trọng văn phong máy móc thực tế; hiệu năng theo từng bộ sinh có thể xem trong phần giải thích bộ phát hiện

Những gì không thể biết từ kết quả phân loại

  • Bộ phát hiện ước tính liệu một tài liệu có đọc giống như do máy viết hay không dựa trên tỷ lệ lỗi đã biết và xác suất đã được hiệu chỉnh
  • Nó không thể phân biệt tài liệu chỉ được chỉnh sửa nhẹ với tài liệu được tạo hoàn toàn, và một điểm số đơn lẻ không thể là căn cứ để chỉ trích một cá nhân cụ thể
  • Đối tượng được đo không phải là danh tính tác giả hay tỷ lệ nội dung được tạo ra, mà là tỷ lệ văn phong máy móc, bao gồm cả các chỉnh sửa sử dụng nhiều AI
  • Có thể kiểm tra bài báo arXiv tại trang kiểm tra miễn phí, còn văn bản thông thường tại trang kiểm tra văn bản, và họ không kiếm lợi nhuận từ việc vận hành bộ phát hiện

1 bình luận

 
Các ý kiến trên Hacker News
  • Bài workshop PyHPC tôi viết năm 2011 bị đánh giá là 27% do máy viết, còn luận án tiến sĩ năm 2012 là 40%, ngay dưới ngưỡng chuẩn 42%
    Tôi không còn xuất bản bài báo nữa, nhưng không biết là tôi viết giống LLM hay LLM đã học từ văn của tôi. Bài IEEE CLUSTERS năm 2015 thậm chí ra tới 74%

    • Các bộ phát hiện thời kỳ đầu còn đánh giá Tuyên ngôn Độc lập của Hoa Kỳ có xác suất 100% là do AI viết, nên những công cụ kiểu này không hoạt động đúng
      Điều nguy hiểm hơn là những người không hiểu nguyên lý lại dựa vào đó để kết luận học sinh, sinh viên dùng AI và gây bất lợi nghiêm trọng cho họ; chuyện này đã xảy ra ở mọi cấp giáo dục
    • “Các nỗ lực phát hiện nội dung do AI tạo hoặc deepfake có khiếm khuyết căn bản. Vì có thể dùng kết quả phát hiện để huấn luyện các trình tạo dữ liệu giả tốt hơn. Cuối cùng, trong không gian số, chúng ta sẽ đạt tới trạng thái cân bằng của bất định số, nơi không thể khẳng định điều gì là thật. Việc một sản phẩm số đến từ con người hay AI không quan trọng; điều quan trọng là nó có hữu ích với tôi hay không. Nội dung hữu ích là nội dung đi đúng trọng tâm, phù hợp sự thật, và nếu có thể thì đủ bất ngờ để dạy tôi điều gì đó mới.” - https://seanpedersen.github.io/posts/digital-uncertainty/
    • Chẳng phải có khả năng những bài đó thực sự đã nằm trong tập dữ liệu huấn luyện sao?
    • Nếu đã học từ tác phẩm rồi còn chưng cất nữa thì nhiễu dương tính giả chắc chắn sẽ lớn đến mức phi lý
  • Họ đã phân tích toàn văn 12.750 bài báo arXiv giai đoạn 2021–2026 để khảo sát tỷ lệ bị đánh giá là do máy viết và mức tăng sau khi ChatGPT ra mắt
    Bộ phát hiện được cố ý tinh chỉnh để tránh dương tính giả, nên tỷ lệ phát hiện trước ChatGPT khoảng 0,4%. Đến tháng 1/2026, khoảng 39% tổng số bài, và cao nhất 65% trong khoa học máy tính, bị đánh giá là do AI viết; toán học hầu như không đổi, từ 0,7%, nhưng cũng có thể công cụ chưa nắm bắt tốt văn phong thiên về chứng minh. Đây chỉ là ước lượng tín hiệu thống kê, không phải bằng chứng rằng một tác giả cụ thể đã dùng AI; “do máy viết” cũng có thể bao gồm việc biên tập được AI hỗ trợ mạnh

    • Tôi tò mò họ đã dùng bộ phát hiện nào, và làm sao có thể chắc chắn về độ chính xác khi mọi công cụ phát hiện AI thương mại đều đã bị phản bác
    • Kết quả chuỗi thời gian trông khá thuyết phục, nhưng tôi tự hỏi cách huấn luyện bộ phát hiện có độc lập với phân tích này không
      Cũng có thể có rò rỉ kiểu tài liệu trước ChatGPT được đưa vào dữ liệu huấn luyện dương tính
    • Nếu công khai các trường hợp dương tính giả từ tài liệu trước thời LLM, có lẽ ta sẽ biết điều gì kích hoạt bộ phát hiện
      Tôi tò mò liệu trước khi LLM xuất hiện đã có một số rất ít tác giả viết giống LLM hay không
    • Nếu mở rộng sang cả các bài trước năm 2020, có thể nắm rõ hơn độ chính xác nền của hệ thống phát hiện
    • Tôi muốn biết có thể chạy mô hình cục bộ không, hoặc họ có thể cung cấp bảng kết quả cho mọi bản thảo arXiv không
      Tôi không muốn kiểm tra nhiều bài rồi làm quá tải máy chủ
  • Việc doanh nghiệp dùng LLM thực sự có động cơ theo lý thuyết trò chơi
    Các lập trình viên dùng Claude Code vô tội vạ để sản xuất hàng loạt code và tài liệu trông có vẻ tốt hơn, còn ban lãnh đạo khuyến khích vì trước mắt chưa thấy nhược điểm. Chất lượng cấu trúc thì chưa chắc, nhưng các chỉ số sai lệch chỉ cho thấy sản lượng, nên sẽ mất nhiều năm mới đánh giá được liệu có đáng chấp nhận sự suy giảm năng lực nhận thức hay không. Người không dùng LLM cả ngày chắc chắn sẽ thua về sản lượng, và rất có thể áp lực tương tự cũng sẽ tác động lên giới khoa học, nơi số lượng công bố được coi trọng

    • Trong nghiên cứu y sinh cơ bản, LLM phần lớn bị bỏ qua vì không thể diễn giải hầu hết dữ liệu thí nghiệm ướt thô
      Dù vậy, rất nhiều startup và trợ lý giáo sư mới vẫn quảng bá rằng họ đang khai phá lĩnh vực mới bằng “AI”, nhưng trên thực tế cách tiếp cận hiệu quả nhất dùng machine learning hơn là LLM
    • Tôi đang nhờ ChatGPT-5.6 Sol chuyển một mô hình Rhino3D dựa trên Python dài 2.800 dòng sang OCCT/FreeCAD dựa trên Python, và đến khoảng nửa chặng đường nó đã phình lên 36.000 dòng
      Tôi liên tục yêu cầu giảm trùng lặp và thu gọn code, nhưng kết quả gần với “tệ hại nhưng hữu ích với tôi”. Mức hữu ích này cũng không thể xem nhẹ, nhưng tôi sợ những nhà quản lý nhìn cái bồn cầu tràn mà tưởng giá trị đã được tối đa hóa
    • Code của LLM tốt hơn code của lập trình viên kém năng lực, kém hơn code của lập trình viên trung bình có động lực, nhưng nhìn chung vẫn đủ dùng
      Câu hỏi thật sự khó là chất lượng so với thời gian và chi phí bỏ vào, và hiện tại tôi cho rằng code do opus/fable tạo ra, xét theo phí thuê bao, là đủ có lợi
    • Trước khi giá tăng, tôi rất lo ban lãnh đạo sẽ ép dùng bằng mọi giá, nhưng giờ tôi lại hy vọng AI đã trở nên quá đắt để các doanh nghiệp lớn có thể biện minh cho việc triển khai thêm
      Bản thân công cụ mới thì tốt, nhưng tôi không thích bị ép dùng một công cụ cụ thể chỉ để đạt các chỉ số quản lý
    • Có thể chính sự suy giảm năng lực nhận thức mới là mục đích
      Khi con người phụ thuộc vào AI, doanh nghiệp sẽ có được ảnh hưởng để thay đổi luật theo hướng có lợi cho họ. Ngay cả khi người dân phản đối các trung tâm dữ liệu khổng lồ trong nội đô, doanh nghiệp vẫn có thể gây sức ép rằng nếu không có AI do các trung tâm dữ liệu đó cung cấp thì chẳng ai làm được gì; vì vậy, biến con người thành kém năng lực và phụ thuộc có thể mới là điểm cốt lõi
  • Cũng như mọi phương pháp phát hiện AI chỉ dùng văn bản, tôi lo ngại về độ chính xác
    Đặc biệt, tôi không hiểu làm sao có thể chắc chắn rằng bước kết hợp điểm của ba bộ phát hiện ở cuối không tạo ra thiên lệch; lại không có mã nguồn nên cũng khó xem xét cách hoạt động hoặc tái lập nghiên cứu. Một nghiên cứu không công khai do tôi tự viết trước thời LLM cũng nhận điểm cao, còn trong một bài khác, gần như mọi câu đều bị tô đỏ “machine-leaning” nhưng lại không ảnh hưởng đến điểm số. Cùng một văn bản mà điểm cũng thay đổi lớn tùy có hay không có định dạng LaTeX. Kết luận nên là “phát hiện văn bản sinh ra là việc khó, và không nên chấp nhận kết quả chỉ vì nó xác nhận giả thuyết”. Chính đoạn này tôi cũng vừa tự viết, nhưng điểm do máy viết lại cao

    • Cách dùng đáng lo nhất là các trường học dùng những công cụ như vậy để bắt học sinh, sinh viên gian lận
  • Sau khi xem xét cùng vấn đề trong môi trường học thuật, kết luận được đưa ra là không thể phát hiện một cách đáng tin cậy văn bản do AI viết chỉ dựa trên văn bản
    Nếu con người và LLM tình cờ viết ra đúng cùng một đoạn văn, thì không có cách nào phân biệt cùng một đầu vào đó là tổng hợp hay do con người viết. Trên thực tế có những dấu vết đặc trưng của LLM, nhưng chúng thay đổi theo thời gian và theo mô hình, nên không thể phân biệt bài viết của con người trông giống văn bản tổng hợp với văn bản tổng hợp trông giống con người. Cách tiếp cận thú vị hơn là phân tích xem từ vựng, đặc trưng ngôn ngữ, embedding văn phong, embedding tổng quát, lỗi chính tả, lỗi sai và tài liệu tham khảo trong kho ngữ liệu bài luận đã thay đổi ra sao sau khi LLM được đưa vào sử dụng. Rõ ràng văn phong học thuật đã thay đổi ở cấp độ tập thể, nhưng khó truy vết nguyên nhân

    • Nếu không phải là những cụm rất ngắn, các cách diễn đạt khả dĩ sẽ nhanh chóng gây ra bùng nổ tổ hợp, nên tôi không đồng ý với cách giải thích rằng việc phân loại hoàn hảo là bất khả thi vì số tổ hợp hữu hạn
      Như Chomsky nói, gần như mọi câu mà con người nói hoặc hiểu đều là tổ hợp từ xuất hiện lần đầu trong lịch sử vũ trụ. Khó khăn lớn hơn nằm ở chỗ LLM không chỉ tạo ra một cách diễn đạt cố định, và mật độ thông tin của văn bản thấp, nên để kiểm định thống kê với khoảng tin cậy hẹp cần một lượng văn bản đáng kể
  • Nếu 65% các bài báo mình đọc có đặc điểm do AI viết, thì dù không trực tiếp dùng AI, mình cũng sẽ chịu ảnh hưởng của văn phong AI
    Điều này đặc biệt có khả năng thể hiện mạnh hơn ở các nhà nghiên cứu mới vào nghề, những người vẫn đang hình thành văn phong

    • Ảnh hưởng của văn phong AI có thể xuất hiện cục bộ, như ở một số từ hoặc cách diễn đạt tu từ nhất định, nhưng văn bản do AI tạo thường nghe giống AI một cách nhất quán trên toàn bộ đầu ra
      Để con người duy trì các mẫu cú pháp của AI trong thời gian dài, họ phải nắm được những mẫu hiện chưa ai thật sự hiểu trọn vẹn và tinh chỉnh từng mệnh đề tỉ mỉ như làm giả tranh. Hơn nữa văn phong AI cũng thay đổi; delve, từng là dấu hiệu tiêu biểu, đã giảm mạnh sau giữa năm 2024 và nay gần như biến mất khỏi đầu ra của LLM. Văn bản của con người học theo đó lại trở nên ít giống văn phong AI hiện tại hơn
    • Con số 20% đó có thể có nghĩa là các công cụ phát hiện không đáng tin cậy như ta tưởng, hoặc AI đã học văn bản của con người khiến một phần văn phong con người vốn có nay trở thành đặc trưng của văn nhảm AI
      Ngay cả trước AI cũng đã có người tạo ra văn nhảm
  • Vì không phải người nói tiếng Anh bản ngữ, nên kết quả rằng phần lớn bài báo bị bộ phát hiện AI đánh dấu không có gì đáng ngạc nhiên
    Không phải vì nhờ LLM viết toàn bộ bài báo, mà vì họ không quen với văn phong khoa học trong khi các biên tập viên Mỹ lại yêu cầu điều đó. Có thể viết ý tưởng bằng câu cơ bản rồi dùng LLM làm cho trôi chảy. Nếu tự viết từng đoạn rồi nhờ chỉnh cho khoa học hơn, nội dung vẫn hoàn toàn là của mình nhưng vẫn bị phán định là do LLM tạo. Ngược lại, nếu trau chuốt tiếng Anh đủ tốt, một bài báo do LLM viết cũng có thể trông như văn của con người

    • Đó đúng là cách sử dụng đã dự đoán, và không có lý do gì để xem là sai
    • Tôi không có vấn đề gì với khả năng tiếng Anh và cũng tự viết luận văn thạc sĩ bằng tiếng Anh, nhưng viết theo văn phong khoa học là việc rất vất vả
      Nếu viết bài báo lần nữa, tôi sẽ không định tự tay viết toàn bộ; miễn là kiểm chứng nội dung có khớp với ý định và sửa những phần viết sai thì không có vấn đề gì. Trong các bài báo do người bản ngữ tiếng Anh viết cũng có nhiều bài sẽ tốt hơn hẳn nếu được LLM viết lại
    • Đây là hành vi sai trái
    • Việc biến nó thành “khoa học hơn” vốn không phải là chỉnh sửa văn phong đơn giản mà vẫn trung thành giữ nguyên ý nghĩa ban đầu
      Cách diễn đạt chi tiết trong từng đoạn ảnh hưởng lớn đến việc truyền đạt cái gì và như thế nào, nên khó có thể xem đó hoàn toàn là bài báo của chính mình. Ngay từ đầu, lý do phải theo đuổi một văn phong trông có vẻ khoa học cũng đáng nghi ngờ; những bài báo được viết tốt nhất đọc như một cuộc trò chuyện không màu mè. Tôi hiểu là có áp lực bên ngoài, nhưng có lẽ những câu cơ bản của tác giả vẫn tốt hơn câu của LLM
    • Có một ranh giới tinh tế giữa việc dùng LLM để sửa ngữ pháp, chính tả và việc tạo văn bản
  • Những bài báo kiểu này thường có nhiều phần dài dòng và sáo rỗng, nên có thể AI đã viết 90%, còn con người chỉ viết phần thật sự mới và phần giải thích về tầm quan trọng
    Có lẽ cách làm đó thực sự đang lan rộng

    • Nếu 90% bài báo là cụm từ sáo rỗng, thì trước hết cần hỏi liệu nội dung đó có đáng được xuất bản như một bài báo học thuật hay không
    • Trong hoạt động khoa học, viết lách phần lớn là thời gian bị lãng phí, và nếu máy có thể làm thành thạo thì nhà nghiên cứu ít có lý do để tự viết
      Một số người có thể là nghệ sĩ viết lách, nhưng đa số thì không
  • Có khả năng bộ phát hiện chỉ học rằng các từ và thuật ngữ chuyên môn tăng lên trong tài liệu sau năm 2022 là đặc điểm của AI
    Ví dụ, LLM và những người dùng chúng thường xuyên xử lý LLM, nên chính cụm “large language model” có thể bị phán là giống AI. Cụm này hiếm trước năm 2022 và xuất hiện nhiều hiện nay cũng như trong văn bản do AI tạo, nhưng không phải là đặc trưng tốt để phân biệt văn bản của con người hiện đại với văn bản AI. Ngay cả sau năm 2023, trong một nhóm đối chứng có thể hợp lý xem là hầu như không có văn bản do LLM tạo, tỷ lệ phát hiện phải thấp hơn nhiều so với arXiv. Nature và Science cũng không hoàn toàn miễn nhiễm, nhưng nếu kiểm tra đến năm 2026 thì đường cong tăng phải thấp hơn arXiv nhiều

    • Đây là một khả năng hợp lý, nhưng theo trực giác thì có lẽ chỉ giải thích được một phần nhỏ các bài báo thực tế về phát hiện
      Khi cập nhật bộ phát hiện, tôi sẽ xem xét cách giảm nhẹ điều này, nhưng khó có được bộ dữ liệu sạch sau năm 2023. Nếu tạo bằng một bộ phát hiện AI khác thì cuối cùng cũng không thể tốt hơn bộ phát hiện đó
  • Khi hỏi nhiều nhà nghiên cứu về các giao thức đồng thuận và lĩnh vực tương tự rằng họ thích viết bài báo hay làm nghiên cứu hơn, hầu như tất cả đều chọn bản thân việc nghiên cứu
    Nếu họ thích viết hơn, nhiều khả năng họ đã chọn nghề khác. Nếu LLM có thể biến biểu đồ nghiên cứu, mã nguồn, v.v. thành bài báo hoặc bản nháp, số bài báo nghiên cứu chất lượng cao thậm chí có thể tăng. Vì ma sát kiểu “muốn làm nghiên cứu nhưng viết bài báo phiền phức” sẽ giảm. Nếu đặt năng lực nghiên cứu và sự ghét viết lách trên hai trục, LLM có thể khơi ra kết quả từ những nhà nghiên cứu có cả hai giá trị đều cao. Bài báo kém cũng sẽ tăng, nhưng về dài hạn hiệu ứng ròng có khả năng là tích cực