1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Trong 22 bài được phản biện tại NeurIPS, WACV và TerraBytes của ECCV, 15 bài (68%) có trích dẫn hoặc danh sách tác giả bị thao túng, hoặc có các câu rõ ràng do LLM tạo; hai bài báo cáo tác giả giả cũng được nhận thuyết trình miệng với điều kiện sửa tài liệu tham khảo
  • Ước tính trong tài liệu học thuật năm 2025 có khoảng 146.900 trích dẫn ảo giác, và 85,3% các trích dẫn ảo giác được theo dõi từ bioRxiv đến bản xuất bản vẫn còn tồn tại sau khi qua phản biện
  • Vấn đề đã lan từ nộp bài sang phản biện: 21% đánh giá của ICLR 2026 bị xác định là hoàn toàn do AI tạo, và tại ICML 2026, việc dùng LLM bị phát hiện trong khoảng 795 đánh giá do các phản biện viên thuộc nhóm bị cấm dùng LLM viết
  • Vấn đề không phải bản thân việc dùng LLM mà là nộp kết quả chưa được kiểm chứng; lỗi tài liệu tham khảo, số liệu trong nội dung không khớp với bảng, quảng bá thành tích quá mức, và phần thảo luận chỉ lặp lại các chỉ số là dấu hiệu cho thấy bản thảo chưa được rà soát đầy đủ
  • bib-audit, công cụ đối chiếu tài liệu tham khảo với nhiều cơ quan đăng ký, đã được công bố; nhưng vì công cụ gửi một phần bản thảo nộp kín tới LLM được host, phản biện viên cần kiểm tra trước chính sách bảo mật và LLM của từng hội nghị

Quy mô phát hiện khi phản biện 22 bài

  • Hai phản biện viên trong mùa hè đã phản biện tổng cộng 22 bài tại NeurIPS, WACV và workshop không gian địa lý TerraBytes của ECCV
    • Trong 15 bài (68%), họ phát hiện dấu vết rõ ràng của nội dung do LLM tạo, như trích dẫn hoàn toàn bịa đặt, danh sách tác giả của bài thật bị sửa đổi, thuật ngữ chuyên môn ảo giác, câu vô nghĩa và trích dẫn không liên quan
    • Một phản biện viên phát hiện các vấn đề này ở 6/11 bài (55%), người còn lại ở 9/11 bài (82%)
  • Kết quả theo hội nghị như sau
    • Track NeurIPS Datasets and Benchmarks: 2/5 bài
    • Track NeurIPS Position Paper: 2/2 bài
    • TerraBytes: lần lượt 1/2 bài và 4/5 bài
    • WACV: cả hai phản biện viên đều là 3/4 bài
  • Số bài đáng bị desk reject chỉ vì vấn đề trích dẫn lần lượt là 5 và 9 bài
    • Hai bài WACV đã thay tác giả của bài thật bằng tên giả ngay từ mục đầu tiên trong tài liệu tham khảo
    • Một bài NeurIPS có thuật ngữ ảo giác hoặc vô nghĩa trải dài 53 trang, khiến việc kiểm tra tài liệu tham khảo trở nên vô nghĩa
    • Cả hai bài NeurIPS Position Paper đều được đánh giá là sản phẩm do LLM tạo, và 4/5 bài được phân cho TerraBytes cũng có trích dẫn hoặc tác giả giả

Trích dẫn ảo giác lan rộng trong toàn bộ tài liệu học thuật

  • Phân tích của Nature vào tháng 4/2026 xác nhận khả năng ít nhất hàng chục nghìn ấn phẩm năm 2025 chứa tài liệu tham khảo sai do AI tạo
  • Kiểm toán arXiv, bioRxiv, SSRN và PubMed Central của Zhao và cộng sự ước tính chỉ riêng năm 2025 đã có khoảng 146.900 trích dẫn ảo giác
    • Chúng không tập trung vào một số ít tác nhân ác ý, mà rải mỏng trên nhiều bài báo
    • Khả năng xuất hiện cao nhất ở các nhà nghiên cứu đầu sự nghiệp và các nhóm nhỏ
    • Khi theo dõi bản xuất bản của các preprint bioRxiv có trích dẫn ảo giác, 85,3% vẫn còn nguyên
  • Trong kiểm toán 2,5 triệu bài y sinh của The Lancet, tỷ lệ bài có ít nhất một tài liệu tham khảo giả đã tăng gấp 6 lần trong hai năm
    • Từ 1/2.828 bài vào năm 2023 lên 1/458 bài vào năm 2025
    • Đầu năm 2026 đạt 1/277 bài
  • Trong phân tích 100 trích dẫn ảo giác ở các bài NeurIPS 2025 đã xuất bản, tất cả các trích dẫn đều đã vượt qua 3–5 phản biện viên chuyên gia
    • Các bài chứa những trích dẫn này gồm 53 bài, chiếm khoảng 1% tổng số bài được nhận, và hiện vẫn còn trong proceedings

Bình duyệt do AI viết và khả năng thao túng

  • Phân tích ICLR 2026 của Pangram xác định 15.899 đánh giá, tức 21%, là hoàn toàn do AI tạo
    • Hơn một nửa tổng số đánh giá có AI tham gia dưới một hình thức nào đó
  • Organization Science ghi nhận số bài nộp tăng 42% sau khi ChatGPT xuất hiện, và đo được hiện hơn 30% bình duyệt có sử dụng AI ở một mức độ nhất định
  • Trong phát hiện prompt injection tại ICML 2026, việc dùng LLM được tìm thấy trong khoảng 795 đánh giá do 506 phản biện viên Policy A, nhóm bị cấm dùng LLM, viết
    • Con số này tương đương khoảng 1% tổng số đánh giá
    • Tại NeurIPS cũng quan sát thấy các đánh giá đạo đức rõ ràng do AI tạo và nhiều bản phản hồi do AI tạo
  • Đánh giá bằng AI có thể nâng điểm bằng cách viết lại phần tóm tắt theo hướng đối kháng mà không thay đổi nội dung khoa học của bài
    • Trong thí nghiệm của Li và cộng sự, đòn tấn công mạnh nhất đạt tỷ lệ thành công khoảng 38%
    • Trên thang 10 điểm, điểm chấp nhận của phản biện viên Gemini 3 Flash tăng 1,31 điểm, và của phản biện viên GPT 5.4 Mini tăng 0,88 điểm
    • Kẻ tấn công thậm chí không cần biết mô hình phản biện nào đang được dùng

Các thao túng và tín hiệu nhận biết trong phản biện thực tế

  • Trường hợp tệ nhất là hai bài nộp giữ nguyên hội nghị, tiêu đề và các tác giả khác của bài thật, nhưng thay riêng tác giả mà phản biện viên quen biết bằng tên giả tương tự
    • Phản biện viên khuyến nghị từ chối và báo trực tiếp cho ban tổ chức, nhưng cả hai bài đều được nhận thuyết trình miệng có điều kiện sửa tài liệu tham khảo
  • Một bài WACV trích dẫn SatMAE đã ghi tác giả là “Yuyang Cong, Saurabh Khanna, Chen Meng, et al.”
  • Các bài NeurIPS dài 53 trang và 40 trang có thuật ngữ ảo giác và tài liệu tham khảo bị thao túng; một bài còn để lại ghi chú nội bộ của LLM cạnh nhiều trích dẫn
  • Tác giả giả và tài liệu tham khảo hoàn toàn giả đều cho thấy bản thảo chưa được kiểm tra đầy đủ
    • Không rõ liệu nghiên cứu liên quan có thật sự được đọc, có được trích dẫn đúng ngữ cảnh, và các phần khác của bài, mã nguồn, tập dữ liệu có đáng tin hay không
    • Quan điểm được nêu là bài có tài liệu tham khảo ảo giác chưa sẵn sàng để được nhận và nên bị desk reject
  • Tín hiệu có khả năng cao do LLM viết

    • Các dấu hiệu văn phong phổ biến gồm cụm đối lập như “It’s not X, it’s Y”, “The real X is Y”, lạm dụng chữ đậm và em dash, câu đặc quánh khó diễn giải, và quảng bá kết quả quá mức
    • Tín hiệu tinh vi hơn là khi số liệu hoặc chỉ số trong thân bài không khớp với bảng
    • Sự không nhất quán này xảy ra nếu sau khi chạy lại thí nghiệm, không yêu cầu agent cập nhật hoặc kiểm chứng toàn bộ số liệu
    • Claude có xu hướng nén vào thân bài cả những số liệu lẽ ra nên đưa vào phụ lục hoặc mã, và trong phần thảo luận chỉ lặp lại nguyên các chỉ số trong bảng
    • Mô hình tùy biến gọi mức cải thiện dưới 1% là SOTA mà không có trung bình và độ lệch chuẩn, công thức phức tạp ở chỗ chỉ cần trích dẫn, và thí nghiệm ablation lẽ ra nên ở phụ lục cũng là tín hiệu cảnh báo

Thay đổi trong công việc phản biện

  • Quy trình phản biện đã đổi thành đọc tóm tắt xong thì lướt tài liệu tham khảo trước, rồi nhanh chóng kiểm tra xem toàn bài có phải đầu ra của LLM hay không
  • Thời gian tìm dấu vết LLM tăng lên, trong khi giả định bài được nộp với thiện chí cũng yếu đi
    • Có cảm giác số bài thú vị, đáng đọc và do con người viết đã giảm mạnh
    • Tuy nhiên, ngoài tài liệu tham khảo ảo giác, nhiều vấn đề vẫn giống khi phản biện các bài chất lượng thấp do con người viết trước đây
  • Việc dùng LLM tự thân không phải tiêu chí phản biện
    • Nếu LLM hỗ trợ viết nhưng nghiên cứu thú vị, thí nghiệm hợp lệ và có thể tái lập thì không có vấn đề
    • Vấn đề là nộp nguyên đầu ra LLM chưa kiểm tra rồi yêu cầu phản biện viên đưa phản hồi
  • Khi hội nghị buộc người nộp phải phản biện 4–5 bài, khối lượng phản biện không lương cũng tăng
    • Phản biện viên dành thời gian buổi tối hoặc cuối tuần để phản biện, và nếu về sau phát hiện trích dẫn ảo giác thì thời gian đó bị lãng phí
    • Để học từ đánh giá, trước hết nhà nghiên cứu phải tự đọc kỹ và suy ngẫm về công trình của mình

Cách dùng LLM trong nghiên cứu và viết lách

  • Dùng LLM như Claude hằng ngày, nhưng đầu ra luôn phải được xác minh, biên tập và viết lại
    • Dùng Claude cho bản nháp tổng quan tài liệu, rồi tự đọc bài gốc và bài viết liên quan
    • Tìm nghiên cứu gốc mà blog trích dẫn để thay thế, tái cấu trúc tài liệu và loại bỏ chi tiết không cần thiết
  • Trước khi nộp bài, đọc kỹ toàn bộ bản thảo và kiểm tra thủ công tài liệu tham khảo
    • Cho Claude tìm các phần mơ hồ, rồi phỏng vấn bằng câu hỏi trắc nghiệm để khớp với ý định
    • Ngay cả sau khi chạy bib-audit, vẫn kiểm tra từng mục trong các cơ sở dữ liệu như Google Scholar, IEEE, CVF
    • Tái sử dụng BibTeX thật trong Zotero đã tích lũy nhiều năm
  • Nhận phản hồi từ người khác từ sớm, và nếu cần thì tái cấu trúc toàn bộ bài ngay trong khi soạn nháp
    • Công việc gấp sát hạn được xem là nguyên nhân tạo ra các bài LLM chất lượng thấp
    • Cảm giác nghiên cứu được hình thành từ trước thời LLM là quan trọng, và có lo ngại về môi trường nơi nhà nghiên cứu trẻ tạo ra nghiên cứu mà không có định hướng
  • Cách kiểm soát văn phong của Claude

    • Câu do agent viết quá đặc và luồng đọc kém, nên hạn chế em dash và dấu chấm phẩy
    • Fable 5 có xu hướng lạm dụng dấu hai chấm thay cho em dash và tạo văn phong marketing B2B SaaS
    • Mục tiêu là câu văn không quá công kích hoặc nhạt nhẽo, đồng thời người ngoài lĩnh vực cũng đọc được
    • Một skill chứa các quy tắc nằm giữa viết khoa học và ASD-STE100 Simplified Technical English tỏ ra hiệu quả
    • Cần xác định trước mục đích và độc giả của bài viết, rồi điều chỉnh định dạng phù hợp với độc giả
    • Văn phong mặc định của Claude không phù hợp với độc giả khoa học
    • Nếu còn quá nhiều chữ đậm, danh sách liệt kê và câu marketing, người đọc có thể nghi ngờ cả nguồn gốc nội dung lẫn việc nội dung đã được kiểm chứng hay chưa

Vì sao cần lọc ở giai đoạn nộp bài hơn là chỉ công khai khai báo

  • Nghĩa vụ công khai việc dùng LLM có thể hữu ích cho nhà nghiên cứu thiện chí, nhưng được cho là sẽ không thay đổi hành vi thực tế nhiều
    • TorchGeo đã thêm chính sách AI theo các mức “không dùng LLM”, “LLM hỗ trợ”, “LLM viết toàn bộ”, nhưng khả năng người dùng tự nguyện chọn mục cuối là thấp
    • Ngay cả khi được viết bằng LLM, nếu kết quả đã được kiểm chứng, có thể tái lập và là bài tốt thì vẫn có thể chấp nhận
  • Cần một cơ chế desk reject hoặc công cụ gắn cờ để tìm các lỗi LLM phổ biến và xác định liệu bản thảo có ở trạng thái có thể phản biện hay không
    • Hiện nay phản biện viên thực chất đang chia nhau làm công việc desk reject, điều này không công bằng với các phản biện viên thiện chí
    • ICLR sẽ công khai tên tác giả trên OpenReview từ năm 2027
  • Trách nhiệm thuộc về tác giả, người hướng dẫn, area chair, ban tổ chức và hội nghị
    • Tác giả không nên nộp hàng loạt bài ít công sức chỉ để làm đẹp CV
    • Người hướng dẫn và mentor phải ngăn sinh viên nộp bài ít công sức
    • Ban tổ chức phải chuẩn bị cách lọc trong bối cảnh lượng bài nộp lớn
  • Vấn đề động lực xuất bản đã tồn tại từ trước LLM; Lipton và Steinhardt đã tổng kết vào năm 2018 về vỏ bọc toán học, lạm dụng ngôn ngữ và động lực lệch lạc
  • Dù LLM có thể biến dự án môn học hoặc kết quả nghiên cứu tự động thành bài theo định dạng NeurIPS, nếu đó không phải đóng góp nghiên cứu thật thì không nên nộp
    • Có thể dùng Opus 4.6 và kho autoresearch của Karpathy để tạo kết quả và bài trông như SOTA trên LandCoverAI, nhưng vì không phải đóng góp nghiên cứu nên không nộp
    • AAAI 2027 nhận 48.000 tóm tắt, khiến quy mô vấn đề lọc tự động còn lớn hơn

Tự động kiểm toán tài liệu tham khảo bằng bib-audit

  • bib-audit là một skill Claude Code theo giấy phép MIT, đối chiếu tiêu đề, năm và danh sách tác giả đầy đủ của tài liệu tham khảo với hồ sơ của các cơ quan đăng ký
  • Có thể nhập .bib, .bbl, PDF
    • Với .bbl và PDF, Claude khôi phục tài liệu tham khảo đã render thành các trường có cấu trúc
    • Sau đó script kiểm tra từng mục trên Crossref, arXiv, DataCite, Semantic Scholar
  • Kết quả được sắp xếp từ lỗi nghiêm trọng
    • Bài báo không tồn tại
    • Định danh bị thao túng và tác giả giả
    • Metadata sai của bài thật, danh sách tác giả bị cắt, chênh lệch năm giữa preprint và bản xuất bản
    • Lỗi định dạng như khoảng trang dùng một dấu gạch nối, DOI lưu dưới dạng URL, chữ viết tắt kiểu J.D.
  • Công cụ không chỉ kiểm tra tiêu đề có tồn tại hay không, mà so sánh danh sách tác giả đầy đủ, nên có thể tìm ra việc thay tác giả như trường hợp SatMAE
  • Các mục không có DOI hoặc arXiv ID, chỉ khớp bằng tìm kiếm tiêu đề, không bị kết luận chắc chắn mà được trả về như khuyến nghị cần kiểm tra thủ công
    • Trong đánh giá, không nên suy đoán động cơ, mà chỉ báo cáo sự thật quan sát được, chẳng hạn “tác giả đầu tiên trong hồ sơ arXiv là Yezhen Cong, không phải Yuyang Cong”
  • Kiểm tra .bib là chỉ đọc, không có phụ thuộc riêng, và có thể cấu hình để chỉ thất bại khi có bất nhất ở các mục được cố định bằng định danh, nên có thể dùng làm CI gate trước khi nộp
  • Ngoài Claude, có thể cài vào Codex, Copilot, Cursor và các agent khác thông qua npx skills add isaaccorley/skills

Chính sách bảo mật và hội nghị mà phản biện viên cần kiểm tra

  • Quá trình kiểm toán gửi một phần tài liệu tham khảo của bản thảo nộp kín tới LLM được host, nên ngay cả khi không dùng LLM để viết đánh giá, vẫn có thể vi phạm chính sách hội nghị
  • Chính sách ECCV 2026 cấm dùng LLM local hoặc API để viết đánh giá hoặc meta-review, và cũng cấm riêng việc chia sẻ phần đáng kể của bản nộp với LLM
  • Hướng dẫn phản biện viên WACV coi đánh giá do LLM tạo là hành vi rất vô trách nhiệm
    • Nếu vi phạm, bài của chính phản biện viên có thể bị desk reject
    • Cũng cấm cho đối tượng không phải phản biện viên xem tài liệu mật, và LLM được host không phải phản biện viên
  • Chính sách LLM của NeurIPS giới hạn nội dung mà phản biện viên có thể chia sẻ với dịch vụ LLM
  • Tác giả có thể tự chạy bib-audit trước khi nộp, nhưng phản biện viên bắt buộc phải kiểm tra chính sách LLM và bảo mật của hội nghị tương ứng trước khi dùng

1 bình luận

 
Ý kiến trên Hacker News
  • Hiện nay trong quy trình xuất bản nghiên cứu AI, AI đảm nhiệm từ viết bài, phản biện, cho đến đọc và tóm tắt bài báo
    NeurIPS cũng đang tiến hành thử nghiệm phản biện có AI hỗ trợ, và số lượng bài ở các hội nghị lớn quá nhiều nên con người không thể đọc hết
    Trong quy trình xuất bản học thuật, con người đang bị tự động hóa đẩy ra ngoài với tốc độ rất nhanh

    • Tôi cho rằng thay vì loại bỏ con người khỏi quy trình xuất bản, họ đang tự động hóa việc sản xuất hàng loạt các bài báo chất lượng thấp
      Gần đây tôi cũng gặp chuyện tương tự khi phản biện EMNLP; AI vẫn còn rất xa mới đạt mức có thể đánh giá chất lượng nghiên cứu
      Hàng hóa công là phản biện đồng cấp trung thực đang bị lạm dụng, nhưng ngoài việc hạn chế quyền tiếp cận hệ thống phản biện bằng một hệ thống điểm xã hội cực đoan, dường như chưa có giải pháp rõ ràng nào
    • Bước tiếp theo có lẽ sẽ là tạp chí do AI vận hành thu phí thuê bao từ những AI khác, và đại học do AI vận hành thăng chức cho AI có nhiều bài báo và trích dẫn nhất
    • Điểm quan trọng là ngay cả những bài bị phát hiện có dùng AI vẫn được chấp nhận
      Vì phần lớn nhà nghiên cứu tích cực sử dụng AI, họ không muốn trừng phạt điều đó hoặc tạo ra môi trường khiến chính họ cũng bất lợi; bầu không khí nói chung là đừng lo, cứ chấp nhận đi
      Cuối cùng, một thực tế phũ phàng lộ ra: ngay từ đầu hầu như chẳng có mấy người thật sự coi trọng bản thân khoa học một cách nghiêm túc
    • Điều này khiến tôi nghĩ đến sa mạc suy luận (reasoning deserts), tương tự như sa mạc thực phẩm
      Nó chỉ những không gian nơi, vì tính toán kinh tế, người ta cung cấp các sản phẩm thay thế trông bề ngoài tương tự nhưng thiếu những thành phần thực sự cần thiết cho sức khỏe và sự thịnh vượng của con người
    • Không phải là đẩy con người ra ngoài bằng tự động hóa, mà là đang khiến chính giới học thuật trở nên vô nghĩa
      Nếu đây là hình ảnh phổ biến của học thuật, tôi cũng thấy đồng cảm với phe kêu gọi cắt giảm ngân sách nghiên cứu
  • Đây là hệ quả logic của cơ chế không xuất bản thì bị đào thải
    Nếu loại bỏ cơ chế này thì phần lớn vấn đề cũng sẽ biến mất; dù các nhà quản lý muốn những chỉ số đơn giản, nghiên cứu không có loại chỉ số như vậy

    • Thành tích xuất bản trong khoa học giống như đo số dòng mã đã viết trong phát triển phần mềm
      Nợ kỹ thuật cũng y hệt: bài báo thì vô số, nhưng phần lớn có khả năng không tái lập được, và ta không biết bài nào thuộc loại đó
    • Vậy thì câu hỏi là liệu có chỉ số đánh giá nghiên cứu nào, dù phức tạp, nhưng dùng được hay không
      Thành tích xuất bản và trích dẫn có thể bị thao túng nhưng cụ thể; các bài được trích dẫn nhiều nhìn chung là hữu ích, nên tác giả được tưởng thưởng
      Nếu loại bỏ chúng mà không đưa ra được phương án tốt hơn, mọi thứ có thể còn phụ thuộc vào quan hệ và tài ăn nói hơn hiện nay
    • Giáo sư vốn đã phải đáp ứng nhiều yêu cầu ngoài bài báo, như giảng dạy, phục vụ cộng đồng, tham gia hội đồng, hướng dẫn và cho nghiên cứu sinh tốt nghiệp, và tất cả đều được tính vào xét duyệt biên chế lâu dài
  • Tôi cho rằng việc nộp nguyên những lỗi do AI tạo ra nên được xem là vi phạm tương đương đạo văn và bị xử phạt tương tự

    • Theo tôi biết, chính sách cấm gửi bài cho tạp chí ít nhất 1 năm nếu không trung thực công khai việc dùng AI đã được áp dụng, và arXiv dường như cũng đi theo hướng tương tự
      Việc công khai và việc sử dụng quá mức là hai chuyện khác nhau, nhưng nếu ngay cả ảo giác và lỗi cũng không kiểm tra, thì vấn đề cốt lõi không phải AI mà là sự kém năng lực và lười biếng
  • Có lẽ nên đổi thống kê số bài nộp hằng tháng của arXiv sang thang log
    Có vẻ giới học thuật năm 2027 có thể biến thành thứ giống Moltbook

    • Nếu xu hướng tăng theo log đã bắt đầu từ trước kỷ nguyên các bài báo về LLM, ta cũng có thể ngây thơ hy vọng rằng nó chỉ phản ánh mức độ phổ biến ngày càng tăng của việc công bố bản thảo trước trên arXiv
    • Hướng nhận định thì đúng, nhưng tình hình khác nhau rất lớn tùy lĩnh vực và tiểu lĩnh vực
      Bài báo chất lượng thấp tập trung vào các chủ đề hào nhoáng và lớn, đặc biệt nghiêm trọng trong lĩnh vực học máy; nhưng vẫn còn nhiều chủ đề quan trọng mà ngách, chưa bị kiểu tác giả này đụng đến
      Những lĩnh vực đó vẫn do các nhà nghiên cứu nghiêm túc dẫn dắt, nhưng nếu không tự học sâu thì khó biết chúng tồn tại
  • Đây là tác dụng phụ của việc giới học thuật đã không nghiêm túc xử lý vấn đề khả năng truy cập mở của bài báo và tạp chí
    Nếu bài báo không bị chặn sau tường truy cập của tạp chí, thì ít nhất việc kiểm chứng sự tồn tại của bài được trích dẫn và đoạn trích dẫn sẽ dễ dàng

    • Vấn đề là các nhà xuất bản, hơn là giới học thuật, dựa vào thương hiệu để vắt kiệt lợi nhuận
      Phản biện đồng cấp giống vai trò quản trị viên Reddit: không được trả công, chỉ nhận danh tiếng, còn nền tảng và nhà xuất bản hưởng lợi
      Đây là cấu trúc trong đó tác giả trả phí xuất bản, tác giả khác lại hiệu đính miễn phí; việc các học giả đưa bản thảo trước hoặc bài nổi tiếng lên website cá nhân là lựa chọn tự nhiên
    • Việc một bài báo có tồn tại hay không trong đa số trường hợp có thể xác nhận dễ dàng ngay cả với tạp chí đóng, chỉ bằng chỉ mục công khai của tạp chí, thông tin tác giả/tóm tắt và trích dẫn DOI
      Tuy nhiên, để kiểm chứng nội dung trích dẫn có khớp với lập luận thực tế hay không thì phải đọc và diễn giải bài báo, nên chỉ truy cập mở không làm việc này trở nên đơn giản; dù dùng AI để kiểm tra bước đầu thì đây vẫn là công việc rất nặng nhọc
    • Điều này cho thấy một thất bại kinh niên của con người lặp lại trong mọi nhóm người: không ai muốn dọn dẹp nhà mình
    • Việc kiểm tra sự tồn tại của bài báo được trích dẫn vốn đã dễ dàng
    • Ít nhất trong nghiên cứu y sinh, phần lớn bài báo được chuyển sang truy cập mở ngay khi xuất bản hoặc sau 1 năm
  • Tôi thắc mắc liệu có đúng là khi nộp bài cho hội nghị thì bắt buộc phải phản biện 4–5 bài hay không
    Như vậy ngay cả bài nghiêm túc cũng bị buộc phải nhận phản biện từ những người không rõ nguồn gốc và chuyên môn

    • Đúng vậy, và 4–5 bài còn là con số ước lượng thấp
      Tôi bị buộc phản biện 7 bài; tôi đã đăng ký 30 bài muốn phản biện trong số 30.000 bài, nhưng không được phân cho bài nào trong số đó mà phải nhận 7 bài mình không đủ chuyên môn
    • Ở các hội nghị thuộc họ ACL, họ không phải là người hoàn toàn ngẫu nhiên; họ phải là tác giả đã có ít nhất 2 bài ở sự kiện ACL chính hoặc Findings, và thêm ít nhất 1 bài trong ACL Anthology hoặc tại các hội nghị ML/AI lớn
      Nhưng số bài nộp tiếp tục tăng còn phản biện viên tình nguyện thì thiếu, nên việc phản biện bắt buộc đang được áp dụng thực tế: tiêu chí khuyến khích phản biện
  • Có thể tham khảo nghịch lý Chavda: https://zencapital.substack.com/p/chavdas-paradox

  • Ban đầu tôi tưởng Caleb và Isaac là tên của hai thuật toán phát hiện việc dùng AI trong bài đã xuất bản, nhưng thực ra đó là tên hai tác giả đã viết bài với sự trợ giúp của AI
    Nếu hai người đưa ra kết luận khác nhau, tôi tò mò không biết các bài mà mỗi người đánh dấu là có vấn đề trùng nhau đến mức nào

  • Dù vẫn đang ở giai đoạn alpha, tôi đang phát triển ứng dụng kiểm chứng trích dẫn https://veruscite-data.com/ với mục tiêu công bố trên Show HN sau vài tuần nữa
    Những ai quen với công cụ AI tạo sinh có thể tự dùng các chức năng mà Caleb và Isaac cung cấp trong bài, nhưng công cụ này hiệu quả token hơn và cung cấp GUI giúp dễ xem xét, chỉnh sửa các tài liệu tham khảo đã trích xuất