6 điểm bởi mssmss 1 ngày trước | 1 bình luận | Chia sẻ qua WhatsApp

Gần đây có một chủ đề từng gây sốt trên Hacker News.
Đó là một bài blog nói rằng việc phân biệt AI Slop Text bằng ML cổ điển hiệu quả hơn mong đợi.

https://news.ycombinator.com/item?id=48936880
https://blog.lyc8503.net/en/post/llm-classifier/

Đây cũng là một hướng tiếp cận đã được bàn luận khá nhiều, nhưng vì nó vẫn còn hiệu quả và hấp dẫn ở tính hiệu suất nên tôi đã thử làm một bản cho tiếng Hàn.

  • Chia theo từng câu, chấm điểm bằng tổ hợp char/word n-gram TF-IDF + linear SVM, rồi phân loại toàn bộ tài liệu dựa trên tỷ lệ câu đáng ngờ.
  • Toàn bộ suy luận đều là JavaScript, nên chạy chỉ với trang tĩnh mà không cần server, API hay GPU. Mô hình khoảng 1.4MB, và văn bản bạn dán vào sẽ không bị gửi đi đâu cả.

Tất nhiên, các giới hạn cũng rất rõ ràng. Vì sử dụng ML cổ điển như SVM, nó khá chắc trong việc phát hiện một số kiểu văn bản mang đậm dấu hiệu AI, nhưng với các bài viết mơ hồ hoặc mang tính học thuật thì đôi khi cũng cho kết quả không rõ ràng.

Việc công cụ này kết luận là AI không có nghĩa chắc chắn đó là AI, nhưng có lẽ nó sẽ hữu ích như một công cụ để kiểm tra lại những bài viết có thể do AI tạo ra.

1 bình luận

 

Tôi đã thử so sánh với bài mình viết: bài tôi tự viết thì 0%, bài viết bằng AI rồi chỉnh sửa một phần thì 51%, còn bài chỉ viết bằng AI thì 100%, phân biệt tốt hơn tôi nghĩ đấy hsh

Chỉ là một ý tưởng thôi, nhưng nếu làm thành tiện ích mở rộng cho trình duyệt Chrome, nhận diện nội dung theo tiêu chí giống như https://github.com/mozilla/readability rồi hiển thị kết quả phân biệt kiểu đèn giao thông thì có vẻ sẽ tiện hơn.
(Có thể chỉ tự động nhận diện với các domain trang đã đăng ký, còn lại thì hoạt động thủ công như tính năng dịch cũng được.)