- Kết quả phân tích toàn bộ phần thân bài của 12.750 bài báo arXiv cho thấy khoảng một phần ba các bài gần đây đọc giống như do máy viết, và tỷ lệ bị phân loại trong quý hoàn chỉnh gần nhất là khoảng 32%
- Dùng các bài báo giai đoạn 2021~2022 làm nhóm đối chứng do con người viết để đặt ngưỡng ở mức tỷ lệ dương tính giả 0,4%, đồng thời sử dụng PDF phiên bản 1 và khoảng tin cậy 95% theo phương pháp bootstrap
- Sau khi ChatGPT xuất hiện, tỷ lệ phân loại tăng hai đợt và đạt đỉnh khoảng 39% vào đầu năm 2026; tính đến tháng 7/2026, trong 12 tháng gần nhất, khoa học máy tính là 65,0% còn toán học là 0,7%
- Các bài báo toán học có nhiều công thức và cấu trúc định lý·chứng minh có thể bị đo thấp vì khác với phân bố huấn luyện của bộ phát hiện, và cũng không thể đánh giá hiệu năng với tổ hợp mô hình·prompt riêng tư mà tác giả thực sự đã dùng
- Kết quả phân loại không thể xác định tác giả hay tỷ lệ nội dung do AI tạo ra, cũng không phân biệt được chỉnh sửa nhẹ với tạo toàn bộ, nên cần được diễn giải như một cận dưới của tỷ trọng văn phong máy móc chứ không phải căn cứ để chỉ trích cá nhân
Thiết kế đo lường lấy tỷ lệ dương tính giả làm chuẩn
- Con số kiểu “N% nội dung là AI” sẽ kém giá trị nếu không xem cùng tỷ lệ mà bộ phát hiện gán nhầm cả tài liệu thực sự do con người viết
- Nếu 40% bài mới bị phân loại là do máy viết nhưng kết quả tương tự cũng xuất hiện ở 20% bài báo trước thời ChatGPT, thì con số cần được giải thích trước tiên là tỷ lệ dương tính giả 20%
- Bộ phát hiện được hiệu chỉnh phù hợp với văn phong học thuật
- Ở mức tỷ lệ dương tính giả 0,4%, nó cho qua bình thường 99,6% tài liệu khoa học thật từ trước thời LLM
- Phát hiện được 85% tài liệu học thuật do AI viết
- Xem các bài báo nộp trong giai đoạn 2021~2022 là dữ liệu đáp án do con người viết, rồi đặt ngưỡng sao cho đúng 0,4% bị phân loại
- Tất cả kết quả đều là tỷ lệ bài báo vượt ngưỡng được thiết kế để tài liệu trước thời LLM giữ ở mức 0,4%
- Các năm trước ChatGPT đóng vai trò nhóm đối chứng tích hợp sẵn
- Nếu xu hướng tăng là kết quả giả tạo do chính bộ phát hiện sinh ra, thì các năm 2021~2022 cũng phải cao như năm 2026, nhưng thực tế không phải vậy
Mẫu và phương pháp phân tích
- Lấy mẫu khoảng 25 bài theo từng lĩnh vực và từng tháng từ tháng 1/2023 đến tháng 7/2026 trong 10 nhóm lĩnh vực, cộng thêm 8 tháng đối chứng của giai đoạn 2021~2022, tổng cộng phân tích 12.750 bài
- Sử dụng PDF phiên bản 1 của mỗi bài để tránh việc câu chữ được sửa vào năm 2026 lẫn vào mẫu năm 2023 của chính bài đó
- Phân tích toàn bộ phần thân bài thay vì phần tóm tắt
- Có trường hợp cùng một bài mà phần tóm tắt dưới 20%, còn phần thân vượt 70%, nên nếu chỉ phân tích tóm tắt thì tín hiệu có thể bị làm yếu đi
- Áp dụng khoảng tin cậy 95% theo phương pháp bootstrap cho mọi số liệu
Xu hướng tổng thể và chênh lệch theo lĩnh vực
- Tỷ lệ phân loại giữ ở mức 0,4% trong giai đoạn 2021~2022, rồi bắt đầu tăng trong vòng vài tháng sau khi ChatGPT xuất hiện
- Sau đó tăng qua hai đợt, đạt khoảng 32% trong quý hoàn chỉnh gần nhất, và lên đỉnh khoảng 39% vào đầu năm 2026
- Kết quả theo lĩnh vực trong 12 tháng gần nhất tính đến tháng 7/2026 như sau
| Lĩnh vực | Nhóm đối chứng trước LLM | Tỷ lệ phân loại gần đây | Khoảng tin cậy 95% |
|---|---|---|---|
| Khoa học máy tính | 0,2% | 65,0% | 59,3~70,3% |
| Sinh học định lượng | 3,5% | 56,3% | 51,0~61,7% |
| Kỹ thuật điện và hệ thống | 1,7% | 51,3% | 46,0~57,0% |
| Kinh tế và tài chính | 2,5% | 47,0% | 41,3~52,7% |
| Vật lý ứng dụng | 1,3% | 34,0% | 29,0~39,7% |
| Thống kê | 1,8% | 31,3% | 26,0~36,7% |
| Vật lý vật chất ngưng tụ | 0,0% | 24,0% | 19,3~29,0% |
| Vật lý năng lượng cao | 0,5% | 14,0% | 10,0~18,0% |
| Vật lý thiên văn | 0,0% | 10,7% | 7,3~14,3% |
| Toán học | 0,0% | 0,7% | 0,0~1,7% |
- Khoa học máy tính cao nhất với khoảng 65%, còn toán học thấp nhất với khoảng 0,7%, nhưng con số thấp của toán học lại khó diễn giải
- Cột đối chứng là giá trị trung bình của tỷ lệ phân loại giai đoạn 2021~2022 của từng lĩnh vực qua ba thiết lập độ nhạy
- Vì các lĩnh vực tăng mạnh không trùng với các lĩnh vực có mức đối chứng trước LLM cao, nên không thể giải thích mức tăng về sau chỉ bằng điểm xuất phát cao
Giới hạn thống kê của nhóm đối chứng theo lĩnh vực
- Nhóm đối chứng trước ChatGPT của mỗi lĩnh vực gồm 200 bài
- Với tỷ lệ dương tính giả 0,4%, trong 2.000 bài đối chứng của 10 lĩnh vực chỉ có 8 bài bị phân loại, nên tỷ lệ theo từng lĩnh vực dưới một ngưỡng duy nhất chỉ được đo khá thô
- Cận dưới dương tính giả khi gộp toàn bộ đã được ước lượng đủ tốt và thiết kế nghiên cứu cũng dựa trên đó, nhưng số liệu đối chứng theo từng lĩnh vực chỉ là xấp xỉ
- Muốn cố định chính xác tỷ lệ dưới 1% cho từng lĩnh vực thì cần hàng nghìn bài đối chứng ở mỗi lĩnh vực, nhưng arXiv trước năm 2023 không có đủ số bài để đáp ứng điều đó
Điểm thấp và các điểm mù của bộ phát hiện
- Điểm thấp có thể có nghĩa là tỷ lệ áp dụng AI thấp, hoặc có thể phản ánh các điểm mù của bộ phát hiện
- Bài báo toán học xoay quanh công thức và cấu trúc định lý·chứng minh; nếu bỏ công thức và tài liệu tham khảo đi thì phần văn xuôi còn lại rất ít, và cũng khác với tiếng Anh khoa học mà bộ phát hiện được huấn luyện
- Ngay cả bài toán học được viết với nhiều trợ giúp từ mô hình cũng có thể nhận điểm thấp vì phần văn xuôi nằm ngoài phân bố của bộ phát hiện
- Vì vậy, chỉ từ kết quả của toán học thì khó phân biệt giữa mức độ áp dụng thấp và độ nhạy phát hiện thấp
- Các lĩnh vực có tỷ trọng văn xuôi cao và khớp nhất với phân bố huấn luyện của bộ phát hiện lại tăng mạnh nhất, nên riêng yếu tố gây nhiễu này không thể giải thích xu hướng tăng chung
- Thứ hạng của các lĩnh vực có điểm thấp cần được đọc như cận dưới của mức độ áp dụng AI
- Bộ phát hiện có độ nhạy khác nhau tùy mô hình sinh, và không thể đánh giá chính xác tổ hợp riêng tư giữa mô hình và prompt mà các tác giả thực tế đã dùng
- Phạm vi phát hiện không hoàn hảo làm giảm tỷ lệ bị phân loại, nên tỷ lệ đo được là cận dưới của tỷ trọng văn phong máy móc thực tế; hiệu năng theo từng bộ sinh có thể xem trong phần giải thích bộ phát hiện
Những gì không thể biết từ kết quả phân loại
- Bộ phát hiện ước tính liệu một tài liệu có đọc giống như do máy viết hay không dựa trên tỷ lệ lỗi đã biết và xác suất đã được hiệu chỉnh
- Nó không thể phân biệt tài liệu chỉ được chỉnh sửa nhẹ với tài liệu được tạo hoàn toàn, và một điểm số đơn lẻ không thể là căn cứ để chỉ trích một cá nhân cụ thể
- Đối tượng được đo không phải là danh tính tác giả hay tỷ lệ nội dung được tạo ra, mà là tỷ lệ văn phong máy móc, bao gồm cả các chỉnh sửa sử dụng nhiều AI
- Có thể kiểm tra bài báo arXiv tại trang kiểm tra miễn phí, còn văn bản thông thường tại trang kiểm tra văn bản, và họ không kiếm lợi nhuận từ việc vận hành bộ phát hiện
1 bình luận
Các ý kiến trên Hacker News
Bài workshop PyHPC tôi viết năm 2011 bị đánh giá là 27% do máy viết, còn luận án tiến sĩ năm 2012 là 40%, ngay dưới ngưỡng chuẩn 42%
Tôi không còn xuất bản bài báo nữa, nhưng không biết là tôi viết giống LLM hay LLM đã học từ văn của tôi. Bài IEEE CLUSTERS năm 2015 thậm chí ra tới 74%
Điều nguy hiểm hơn là những người không hiểu nguyên lý lại dựa vào đó để kết luận học sinh, sinh viên dùng AI và gây bất lợi nghiêm trọng cho họ; chuyện này đã xảy ra ở mọi cấp giáo dục
Họ đã phân tích toàn văn 12.750 bài báo arXiv giai đoạn 2021–2026 để khảo sát tỷ lệ bị đánh giá là do máy viết và mức tăng sau khi ChatGPT ra mắt
Bộ phát hiện được cố ý tinh chỉnh để tránh dương tính giả, nên tỷ lệ phát hiện trước ChatGPT khoảng 0,4%. Đến tháng 1/2026, khoảng 39% tổng số bài, và cao nhất 65% trong khoa học máy tính, bị đánh giá là do AI viết; toán học hầu như không đổi, từ 0,7%, nhưng cũng có thể công cụ chưa nắm bắt tốt văn phong thiên về chứng minh. Đây chỉ là ước lượng tín hiệu thống kê, không phải bằng chứng rằng một tác giả cụ thể đã dùng AI; “do máy viết” cũng có thể bao gồm việc biên tập được AI hỗ trợ mạnh
Cũng có thể có rò rỉ kiểu tài liệu trước ChatGPT được đưa vào dữ liệu huấn luyện dương tính
Tôi tò mò liệu trước khi LLM xuất hiện đã có một số rất ít tác giả viết giống LLM hay không
Tôi không muốn kiểm tra nhiều bài rồi làm quá tải máy chủ
Việc doanh nghiệp dùng LLM thực sự có động cơ theo lý thuyết trò chơi
Các lập trình viên dùng Claude Code vô tội vạ để sản xuất hàng loạt code và tài liệu trông có vẻ tốt hơn, còn ban lãnh đạo khuyến khích vì trước mắt chưa thấy nhược điểm. Chất lượng cấu trúc thì chưa chắc, nhưng các chỉ số sai lệch chỉ cho thấy sản lượng, nên sẽ mất nhiều năm mới đánh giá được liệu có đáng chấp nhận sự suy giảm năng lực nhận thức hay không. Người không dùng LLM cả ngày chắc chắn sẽ thua về sản lượng, và rất có thể áp lực tương tự cũng sẽ tác động lên giới khoa học, nơi số lượng công bố được coi trọng
Dù vậy, rất nhiều startup và trợ lý giáo sư mới vẫn quảng bá rằng họ đang khai phá lĩnh vực mới bằng “AI”, nhưng trên thực tế cách tiếp cận hiệu quả nhất dùng machine learning hơn là LLM
Tôi liên tục yêu cầu giảm trùng lặp và thu gọn code, nhưng kết quả gần với “tệ hại nhưng hữu ích với tôi”. Mức hữu ích này cũng không thể xem nhẹ, nhưng tôi sợ những nhà quản lý nhìn cái bồn cầu tràn mà tưởng giá trị đã được tối đa hóa
Câu hỏi thật sự khó là chất lượng so với thời gian và chi phí bỏ vào, và hiện tại tôi cho rằng code do opus/fable tạo ra, xét theo phí thuê bao, là đủ có lợi
Bản thân công cụ mới thì tốt, nhưng tôi không thích bị ép dùng một công cụ cụ thể chỉ để đạt các chỉ số quản lý
Khi con người phụ thuộc vào AI, doanh nghiệp sẽ có được ảnh hưởng để thay đổi luật theo hướng có lợi cho họ. Ngay cả khi người dân phản đối các trung tâm dữ liệu khổng lồ trong nội đô, doanh nghiệp vẫn có thể gây sức ép rằng nếu không có AI do các trung tâm dữ liệu đó cung cấp thì chẳng ai làm được gì; vì vậy, biến con người thành kém năng lực và phụ thuộc có thể mới là điểm cốt lõi
Cũng như mọi phương pháp phát hiện AI chỉ dùng văn bản, tôi lo ngại về độ chính xác
Đặc biệt, tôi không hiểu làm sao có thể chắc chắn rằng bước kết hợp điểm của ba bộ phát hiện ở cuối không tạo ra thiên lệch; lại không có mã nguồn nên cũng khó xem xét cách hoạt động hoặc tái lập nghiên cứu. Một nghiên cứu không công khai do tôi tự viết trước thời LLM cũng nhận điểm cao, còn trong một bài khác, gần như mọi câu đều bị tô đỏ “machine-leaning” nhưng lại không ảnh hưởng đến điểm số. Cùng một văn bản mà điểm cũng thay đổi lớn tùy có hay không có định dạng LaTeX. Kết luận nên là “phát hiện văn bản sinh ra là việc khó, và không nên chấp nhận kết quả chỉ vì nó xác nhận giả thuyết”. Chính đoạn này tôi cũng vừa tự viết, nhưng điểm do máy viết lại cao
Sau khi xem xét cùng vấn đề trong môi trường học thuật, kết luận được đưa ra là không thể phát hiện một cách đáng tin cậy văn bản do AI viết chỉ dựa trên văn bản
Nếu con người và LLM tình cờ viết ra đúng cùng một đoạn văn, thì không có cách nào phân biệt cùng một đầu vào đó là tổng hợp hay do con người viết. Trên thực tế có những dấu vết đặc trưng của LLM, nhưng chúng thay đổi theo thời gian và theo mô hình, nên không thể phân biệt bài viết của con người trông giống văn bản tổng hợp với văn bản tổng hợp trông giống con người. Cách tiếp cận thú vị hơn là phân tích xem từ vựng, đặc trưng ngôn ngữ, embedding văn phong, embedding tổng quát, lỗi chính tả, lỗi sai và tài liệu tham khảo trong kho ngữ liệu bài luận đã thay đổi ra sao sau khi LLM được đưa vào sử dụng. Rõ ràng văn phong học thuật đã thay đổi ở cấp độ tập thể, nhưng khó truy vết nguyên nhân
Như Chomsky nói, gần như mọi câu mà con người nói hoặc hiểu đều là tổ hợp từ xuất hiện lần đầu trong lịch sử vũ trụ. Khó khăn lớn hơn nằm ở chỗ LLM không chỉ tạo ra một cách diễn đạt cố định, và mật độ thông tin của văn bản thấp, nên để kiểm định thống kê với khoảng tin cậy hẹp cần một lượng văn bản đáng kể
Nếu 65% các bài báo mình đọc có đặc điểm do AI viết, thì dù không trực tiếp dùng AI, mình cũng sẽ chịu ảnh hưởng của văn phong AI
Điều này đặc biệt có khả năng thể hiện mạnh hơn ở các nhà nghiên cứu mới vào nghề, những người vẫn đang hình thành văn phong
Để con người duy trì các mẫu cú pháp của AI trong thời gian dài, họ phải nắm được những mẫu hiện chưa ai thật sự hiểu trọn vẹn và tinh chỉnh từng mệnh đề tỉ mỉ như làm giả tranh. Hơn nữa văn phong AI cũng thay đổi; delve, từng là dấu hiệu tiêu biểu, đã giảm mạnh sau giữa năm 2024 và nay gần như biến mất khỏi đầu ra của LLM. Văn bản của con người học theo đó lại trở nên ít giống văn phong AI hiện tại hơn
Ngay cả trước AI cũng đã có người tạo ra văn nhảm
Vì không phải người nói tiếng Anh bản ngữ, nên kết quả rằng phần lớn bài báo bị bộ phát hiện AI đánh dấu không có gì đáng ngạc nhiên
Không phải vì nhờ LLM viết toàn bộ bài báo, mà vì họ không quen với văn phong khoa học trong khi các biên tập viên Mỹ lại yêu cầu điều đó. Có thể viết ý tưởng bằng câu cơ bản rồi dùng LLM làm cho trôi chảy. Nếu tự viết từng đoạn rồi nhờ chỉnh cho khoa học hơn, nội dung vẫn hoàn toàn là của mình nhưng vẫn bị phán định là do LLM tạo. Ngược lại, nếu trau chuốt tiếng Anh đủ tốt, một bài báo do LLM viết cũng có thể trông như văn của con người
Nếu viết bài báo lần nữa, tôi sẽ không định tự tay viết toàn bộ; miễn là kiểm chứng nội dung có khớp với ý định và sửa những phần viết sai thì không có vấn đề gì. Trong các bài báo do người bản ngữ tiếng Anh viết cũng có nhiều bài sẽ tốt hơn hẳn nếu được LLM viết lại
Cách diễn đạt chi tiết trong từng đoạn ảnh hưởng lớn đến việc truyền đạt cái gì và như thế nào, nên khó có thể xem đó hoàn toàn là bài báo của chính mình. Ngay từ đầu, lý do phải theo đuổi một văn phong trông có vẻ khoa học cũng đáng nghi ngờ; những bài báo được viết tốt nhất đọc như một cuộc trò chuyện không màu mè. Tôi hiểu là có áp lực bên ngoài, nhưng có lẽ những câu cơ bản của tác giả vẫn tốt hơn câu của LLM
Những bài báo kiểu này thường có nhiều phần dài dòng và sáo rỗng, nên có thể AI đã viết 90%, còn con người chỉ viết phần thật sự mới và phần giải thích về tầm quan trọng
Có lẽ cách làm đó thực sự đang lan rộng
Một số người có thể là nghệ sĩ viết lách, nhưng đa số thì không
Có khả năng bộ phát hiện chỉ học rằng các từ và thuật ngữ chuyên môn tăng lên trong tài liệu sau năm 2022 là đặc điểm của AI
Ví dụ, LLM và những người dùng chúng thường xuyên xử lý LLM, nên chính cụm “large language model” có thể bị phán là giống AI. Cụm này hiếm trước năm 2022 và xuất hiện nhiều hiện nay cũng như trong văn bản do AI tạo, nhưng không phải là đặc trưng tốt để phân biệt văn bản của con người hiện đại với văn bản AI. Ngay cả sau năm 2023, trong một nhóm đối chứng có thể hợp lý xem là hầu như không có văn bản do LLM tạo, tỷ lệ phát hiện phải thấp hơn nhiều so với arXiv. Nature và Science cũng không hoàn toàn miễn nhiễm, nhưng nếu kiểm tra đến năm 2026 thì đường cong tăng phải thấp hơn arXiv nhiều
Khi cập nhật bộ phát hiện, tôi sẽ xem xét cách giảm nhẹ điều này, nhưng khó có được bộ dữ liệu sạch sau năm 2023. Nếu tạo bằng một bộ phát hiện AI khác thì cuối cùng cũng không thể tốt hơn bộ phát hiện đó
Khi hỏi nhiều nhà nghiên cứu về các giao thức đồng thuận và lĩnh vực tương tự rằng họ thích viết bài báo hay làm nghiên cứu hơn, hầu như tất cả đều chọn bản thân việc nghiên cứu
Nếu họ thích viết hơn, nhiều khả năng họ đã chọn nghề khác. Nếu LLM có thể biến biểu đồ nghiên cứu, mã nguồn, v.v. thành bài báo hoặc bản nháp, số bài báo nghiên cứu chất lượng cao thậm chí có thể tăng. Vì ma sát kiểu “muốn làm nghiên cứu nhưng viết bài báo phiền phức” sẽ giảm. Nếu đặt năng lực nghiên cứu và sự ghét viết lách trên hai trục, LLM có thể khơi ra kết quả từ những nhà nghiên cứu có cả hai giá trị đều cao. Bài báo kém cũng sẽ tăng, nhưng về dài hạn hiệu ứng ròng có khả năng là tích cực