1 điểm bởi GN⁺ 2023-12-18 | 1 bình luận | Chia sẻ qua WhatsApp
  • CAPTCHA vẫn là một biện pháp phòng vệ chống bot được dùng rộng rãi, nhưng khi xem xét cùng lúc các trường hợp triển khai thực tế và trải nghiệm người dùng, sự cân bằng giữa bảo mật và khả năng sử dụng đang bị lung lay đáng kể
  • Trong khảo sát 200 website phổ biến và nghiên cứu người dùng trên MTurk, reCAPTCHA dạng nhấp chọn là nhanh nhất với trung vị 3,7 giây, còn dạng game, dạng thanh trượt và hCAPTCHA khó có xu hướng mất nhiều thời gian hơn
  • CAPTCHA nhanh không phải lúc nào cũng được ưa thích nhất, nên có những loại như dạng game và dạng thanh trượt dù mất thời gian giải lâu hơn vẫn được đánh giá tương đối tốt
  • Trong thiết lập theo ngữ cảnh đưa CAPTCHA vào luồng tạo tài khoản, thời gian giải trung bình tăng tối đa 57,5% so với giải trực tiếp, và tỷ lệ bỏ cuộc cũng cao hơn
  • Tuổi càng cao thì thời gian giải của hầu hết CAPTCHA càng tăng, và khi so sánh với các nghiên cứu trước về hiệu năng bot, đã xác nhận có nhiều trường hợp bot nhanh và chính xác hơn con người

Lý do CAPTCHA lại trở thành đối tượng cần được đánh giá

  • CAPTCHA đã được dùng rộng rãi như một biện pháp chống bot trong khoảng 20 năm, nhưng các kỹ thuật vượt qua hoặc tự động giải nó cũng liên tục phát triển
  • CAPTCHA thời kỳ đầu hoạt động theo cách đọc văn bản bị làm méo trong ảnh rồi nhập lại, nhưng với sự phát triển của thị giác máy tính và machine learning, đã có trường hợp công cụ tự động đạt độ chính xác trên 99% vào năm 2014
  • Hiện nay CAPTCHA đã phân hóa thành nhiều dạng
    • Dạng nhận diện đối tượng: “chọn các ô có chứa vật thể đó”
    • Dạng văn bản bị biến dạng
    • Dạng câu đố: “đẩy khối”
    • Dạng dựa trên phân tích hành vi người dùng
  • Nghiên cứu này nhắm tới CAPTCHA nguyên bản đang được dùng trên web thực tế
    • Khảo sát thủ công 200 website phổ biến
    • Nghiên cứu người dùng chính với 1.000 người dựa trên MTurk
    • Nghiên cứu MTurk bổ sung để xem riêng tỷ lệ bỏ cuộc
    • Công bố toàn bộ bộ dữ liệu đã ẩn danh và mã phân tích: captcha-study

Phân bố CAPTCHA trên 200 website phổ biến

  • Đã khảo sát thủ công 200 website hàng đầu theo danh sách Alexa Top websites
    • 185 website có quy trình tạo tài khoản
    • 142 website thực sự cho phép tạo tài khoản
    • Mỗi website được truy cập bằng Chrome ở chế độ ẩn danh và bằng trình duyệt Tor
  • Loại CAPTCHA được quan sát cho thấy sự thiên lệch mạnh về reCAPTCHA là nổi bật nhất
    • reCAPTCHA: 68 website, 34% mẫu khảo sát
    • CAPTCHA dựa trên thanh trượt: 14 website, 7%
    • CAPTCHA văn bản bị biến dạng: 14 website, 7%
    • CAPTCHA dựa trên game: 9 website, 4,5%
    • hCAPTCHA: 1 website
    • CAPTCHA vô hình: 12 website, 6%
    • Khác: CAPTCHA kiểu vé cào, CAPTCHA tìm ký tự tiếng Trung trong ảnh, NuCaptcha, v.v.
  • Phạm vi khảo sát có những giới hạn rõ ràng
    • Vì là khảo sát thủ công nên chỉ bao gồm 200 website hàng đầu
    • Không thực thi mọi chức năng nên số trường hợp triển khai CAPTCHA thực tế có thể còn nhiều hơn
    • Phụ thuộc vào thứ hạng website và trạng thái CAPTCHA tại một thời điểm cụ thể
    • Không bao gồm CAPTCHA của các website mục đích đặc thù như dark web
  • Trong bộ dữ liệu 673 triệu website của BuiltWith, trong số 15,2 triệu website dùng CAPTCHA thì reCAPTCHA chiếm 97,3% và hCAPTCHA chiếm 1,4%
    • Các loại CAPTCHA dùng trong nghiên cứu này bao quát hơn 98% theo bộ dữ liệu quy mô lớn đó

Thiết kế nghiên cứu người dùng

  • Nghiên cứu người dùng chính được thực hiện trên MTurk với 1.000 người, mỗi người giải 10 CAPTCHA theo thứ tự ngẫu nhiên
  • Quy trình gồm bốn bước
    • Giới thiệu nghiên cứu
    • Câu hỏi trước nghiên cứu: thu thập thông tin nhân khẩu học
    • Nhiệm vụ giải CAPTCHA
    • Câu hỏi sau nghiên cứu: hỏi về mức độ ưa thích đối với CAPTCHA vừa giải, v.v.
  • Tổng cộng có 10 loại CAPTCHA được sử dụng
    • 2 loại reCAPTCHA v2: cấu hình dễ nhất cho người dùng, cấu hình bảo mật nhất
    • 2 loại dạng game của Arkose Labs: xoay vật thể, chọn vật thể đúng hướng
    • 2 loại hCAPTCHA: cấu hình dễ, cấu hình khó
    • 1 loại CAPTCHA thanh trượt Geetest
    • 3 loại CAPTCHA văn bản bị biến dạng: đơn giản, che khuất, văn bản chuyển động
  • Để so sánh bối cảnh thí nghiệm, nghiên cứu dùng hai thiết lập
    • Thiết lập trực tiếp: nói rõ với người tham gia đây là nghiên cứu giải CAPTCHA và đưa trực tiếp 10 CAPTCHA
    • Thiết lập theo ngữ cảnh: thông báo đây là nghiên cứu về tạo tài khoản, và CAPTCHA xuất hiện sau khi gửi từng biểu mẫu tạo tài khoản
  • Trong thiết lập theo ngữ cảnh, để tránh thu thập thông tin cá nhân, nghiên cứu cung cấp dữ liệu tổng hợp, và mục đích thực sự chỉ được công bố sau khi hoàn thành nhiệm vụ
    • Cách làm này đã được IRB phê duyệt, và các tài liệu liên quan đến công bố không đầy đủ cùng thay đổi đồng thuận cũng được phê duyệt
    • Sau khi công bố mục đích, dữ liệu của người tham gia nào không đồng ý cho sử dụng sẽ không được thu thập
  • Thù lao ban đầu là 0,30 USD cho thiết lập trực tiếp và 0,75 USD cho thiết lập theo ngữ cảnh
    • Sau khi xác nhận thời gian hoàn thành trung vị lần lượt là 4,4 phút và 11,5 phút, mức này được tăng hồi tố lên 0,60 USD và 1,50 USD

Khác biệt về thời gian giải và mức độ ưa thích

  • Thời gian giải theo từng loại CAPTCHA khác biệt lớn
    • reCAPTCHA dạng nhấp chọn là nhanh nhất với trung vị 3,7 giây
    • Khác biệt giữa cấu hình dễ và khó là không lớn
    • CAPTCHA văn bản bị biến dạng dạng đơn giản được giải nhanh nhất trong nhóm văn bản biến dạng
    • Thời gian giải của dạng che khuất và dạng văn bản chuyển động là tương tự nhau
    • hCAPTCHA cho thấy khác biệt rõ giữa cấu hình dễ và khó, trong đó cấu hình khó đưa ra bài toán ảnh khó hơn hoặc nhiều vòng hơn
    • CAPTCHA dạng game và dạng thanh trượt nhìn chung có thời gian giải trung vị cao, nhưng một số người tham gia vẫn giải trong dưới 10 giây
  • Mức độ ưa thích của người dùng không hoàn toàn đi cùng thời gian giải
    • reCAPTCHA dạng nhấp chọn vừa nhanh nhất vừa được ưa thích nhất
    • Dạng game và dạng thanh trượt mất nhiều thời gian hơn nhưng vẫn nhận điểm ưa thích cao
    • Ngay cả reCAPTCHA dạng nhấp chọn, loại được ưa thích nhất, cũng có 18,9% người tham gia chấm 1 hoặc 2 điểm
    • Ngay cả hCAPTCHA, loại có mức ưa thích thấp nhất toàn bộ, vẫn có hơn 31,0% người tham gia chấm 4 hoặc 5 điểm

Khác biệt do bối cảnh thí nghiệm tạo ra

  • Khi so sánh thiết lập trực tiếp và thiết lập theo ngữ cảnh, thời gian giải trung bình trong thiết lập theo ngữ cảnh cao hơn ở hầu hết các CAPTCHA
    • reCAPTCHA dạng nhấp chọn dễ tăng 1,8 giây, tức tăng 57,5%
    • Arkose dạng xoay tăng 10 giây, tức tăng 56,1%
    • Trung bình trên tất cả các loại CAPTCHA, thiết lập theo ngữ cảnh tăng 26,7% so với thiết lập trực tiếp
    • hCAPTCHA cấu hình khó có thời gian giải trung vị cao nhất toàn bộ, nhưng chênh lệch thời gian giải trung bình giữa hai thiết lập không có ý nghĩa đáng kể
  • Trong kiểm định Kruskal-Wallis, sự khác biệt về thời gian giải trung bình có ý nghĩa thống kê ở mọi loại CAPTCHA ngoại trừ Geetest, reCAPTCHA dạng ảnh và hCAPTCHA cấu hình khó
  • Giữa hai thiết lập vẫn còn nhiều yếu tố gây nhiễu tiềm ẩn
    • Người tham gia ở thiết lập theo ngữ cảnh phải làm nhiều việc hơn
    • Khác biệt về thù lao và nhận thức về việc hoàn thành nhiệm vụ có thể đã ảnh hưởng đến động lực hoặc khả năng bỏ cuộc

Nhân khẩu học, độ chính xác và tỷ lệ bỏ cuộc

  • Tuổi có liên quan đến thời gian giải CAPTCHA
    • Ở mọi loại trừ reCAPTCHA dạng ảnh dễ, người tham gia trẻ tuổi có xu hướng có thời gian giải trung bình thấp hơn
    • Nghiên cứu trước báo cáo CAPTCHA văn bản tăng 0,03 giây cho mỗi năm tuổi, nhưng nghiên cứu này cho thấy mức tăng 0,09 giây mỗi năm nếu lấy trung bình toàn bộ loại CAPTCHA
  • Không quan sát thấy khác biệt lớn về thời gian giải theo trình độ học vấn và giới tính
    • Nghiên cứu trước cho rằng người tham gia có bằng PhD giải nhanh hơn các nhóm học vấn khác, nhưng trong nghiên cứu này, trình độ học vấn tự khai không tương quan với thời gian giải
  • Ở thiết bị và phương thức nhập có một số khác biệt
    • Người dùng máy tính có thời gian giải trung bình thấp hơn người dùng điện thoại đối với CAPTCHA văn bản biến dạng và reCAPTCHA dạng nhấp chọn khó
    • Giữa bàn phím vật lý và nhập chạm có khác biệt có ý nghĩa thống kê ở văn bản biến dạng đơn giản, văn bản biến dạng che khuất, reCAPTCHA dạng nhấp chọn và Arkose dạng chọn
  • So sánh về độ chính xác cho thấy khác biệt lớn theo từng loại
    • Độ chính xác phân loại ảnh của reCAPTCHA là 81% ở cấu hình dễ và 81,7% ở cấu hình khó
    • Độ chính xác của hCAPTCHA là 81,4% ở cấu hình dễ và 70,6% ở cấu hình khó
    • Với văn bản biến dạng, nếu không phân biệt chữ hoa chữ thường thì mức độ nhất quán giữa người tham gia tăng trung bình 20%
      • Dạng đơn giản: từ 84% lên 93%
      • Dạng che khuất: từ 50% lên 73%
      • Dạng văn bản chuyển động: từ 62% lên 90%
  • Khi so sánh với hiệu năng bot trong tài liệu trước đây, ở nhiều loại CAPTCHA, bot cho kết quả nhanh và chính xác hơn con người
    • reCAPTCHA dạng nhấp chọn: con người 3,1~4,9 giây, bot 1,4 giây và có trường hợp đạt độ chính xác 100%
    • Geetest: con người 28~30 giây, bot 5,3 giây và có trường hợp đạt độ chính xác 96%
    • Văn bản biến dạng: con người 9~15,3 giây với độ chính xác 50~84%, bot dưới 1 giây và có trường hợp đạt độ chính xác 99,8%
    • reCAPTCHA dạng ảnh: con người 15~26 giây với độ chính xác 81%, bot 17,5 giây và có trường hợp đạt độ chính xác 85%
    • hCAPTCHA: con người 18~32 giây với độ chính xác 71~81%, bot 14,9 giây và có trường hợp đạt độ chính xác 98%
  • Trong nghiên cứu riêng về tỷ lệ bỏ cuộc, 18~45% người tham gia rời nghiên cứu sau khi CAPTCHA đầu tiên được đưa ra
    • Người tham gia ở thiết lập theo ngữ cảnh có khả năng bỏ cuộc cao hơn 120% so với người tham gia ở thiết lập trực tiếp
    • Nếu người dùng từ bỏ nhiệm vụ vì CAPTCHA, điều đó có thể dẫn đến mất các hoạt động trên website như mua hàng hoặc tạo tài khoản

1 bình luận

 
GN⁺ 2023-12-18
Ý kiến trên Hacker News
  • CAPTCHA của Google được cho là đã được thiết kế và triển khai như một cơ chế phục vụ huấn luyện AI, nên mới trở thành như bây giờ
    Phần diễn an ninh xung quanh chỉ gần như là yếu tố phụ, và việc AI giờ giải rất giỏi cũng không có gì đáng ngạc nhiên. Chúng ta đã huấn luyện nó như vậy suốt nhiều năm

    • Phần lớn là đúng, nhưng dù với người dùng nó trông như một biện pháp bảo mật gây khó chịu, trong nhiều trường hợp nó vẫn có mục đích thực sự là giới hạn tốc độ tấn công brute-force
      Ít nhất nó cũng tạo ra chi phí cho kẻ tấn công
    • Cách giải thích đó không khớp lắm. reCAPTCHA thực sự làm đúng chức năng như tên gọi, nhưng cách nó hoạt động hầu như không liên quan đến câu đố mà người dùng nhìn thấy
      Cốt lõi là phân tích hành vi, bao gồm cả việc Google dùng dữ liệu đã thu thập từ trước khi người dùng tải trang để đánh giá khả năng là bot
      Tôi không phủ nhận reCAPTCHA là nguồn dữ liệu huấn luyện cho Google. Không thể là ngẫu nhiên khi bài toán của reCAPTCHA V2 cứ xoay quanh nhận diện đối tượng giao thông, nhất là khi Google cũng không phải đang làm AI xe tự hành đâu
      Nhưng đó là mô hình kinh doanh chứ không phải chức năng cốt lõi, và dữ liệu huấn luyện đó cũng không được trao nguyên vẹn cho các nhà phát triển bot giải CAPTCHA
    • Tôi cứ nghĩ họ dùng thời gian và chuyển động chuột nhiều hơn là đúng/sai của đáp án để xác định có phải người hay không
    • Một khi đã được huấn luyện hoàn toàn, tôi không biết các website sẽ còn phân biệt được bot thông minh và người thật bằng cách nào
      Hiện tại họ giao việc lọc cho các dịch vụ như Cloudflare, nhưng nếu kiểu huấn luyện này tiếp tục thì đến Cloudflare rồi cũng sẽ khó biết đâu là bot đâu là người
    • Buồn cười là AI có khi còn giải CAPTCHA tốt hơn con người
      Tôi đã thấy nhiều lần CAPTCHA của Google từ chối đáp án đúng, nên có thể đây là hệ quả của việc huấn luyện bot chấp nhận cả đáp án sai
      Dù sao thì may là giờ không còn là biển báo dừng nữa. Nếu Google một mặt bán xe “tự lái”, mặt khác lại cho thấy robot không nhận ra biển báo dừng thì cũng khá ngượng thật
  • Nghiên cứu này có vẻ nói về nhiều khía cạnh trong cách con người giải CAPTCHA, còn phần AI vượt qua con người thì tôi không tìm thấy. Có ai biết đó là đoạn nào không?
    Việc giải reCAPTCHA v2/v3 đòi hỏi nhiều hơn là bấm vào ô checkbox và làm câu đố hình ảnh. Nếu chỉ có vậy thì chắc đã loạn lên từ lâu rồi
    Nói CAPTCHA là để huấn luyện AI thì hiểu theo nghĩa rộng là đúng, nhưng với cách CAPTCHA hiện đại hoạt động thì điều đó chỉ giống một tác dụng phụ hơn
    Những thứ như reCaptcha V2+ theo dõi phân tích hành vi như lịch sử duyệt web hay chuyển động chuột trên trang. Vì vậy đa số mọi người chỉ cần bấm ô checkbox là xong
    Tôi cũng không rõ có mô hình đa phương thức lớn nào đưa chuyển động chuột vào làm dạng đầu vào hay chưa
    Ngay cả AI được thiết kế để phá CAPTCHA cũng không thể dùng dữ liệu của Google v.v. cho huấn luyện. Nếu lo Google sẽ tự huấn luyện bot của họ để vượt CAPTCHA thì không phải là bất khả thi

    • Đúng vậy. Nghiên cứu này thực ra nói về việc con người giải CAPTCHA chứ không phải AI giải CAPTCHA
      Tiêu đề khá mang tính câu view, và đáng tiếc là trên HN kiểu tiêu đề đó lại rất hiệu quả
    • Nó nằm ở Table 3
  • Về sau có lẽ bước tiếp theo khi đăng ký thứ gì đó sẽ là xác minh thẻ thanh toán
    Có vẻ họ sẽ bắt đầu bằng cách chặn các BIN trả trước. Khá kinh khủng, nhưng hiện giờ tôi gần như thấy trả 0,01 USD còn dễ chịu hơn là đi giải CAPTCHA, nên chắc vẫn cần một thứ gì đó
    Đặc biệt là mấy trò “hãy chọn tất cả xe đạp” đúng là phí đời

    • Giờ những loại ma sát này đã quá nhiều đến mức nó đang đẩy người ta sang hướng không làm các hành vi đó ngay từ đầu
      Mua ít đồ hơn, dùng mạng xã hội ít hơn. Đi dạo ngoài thiên nhiên và đọc sách giấy thì không có CAPTCHA
    • Bước tiếp theo sẽ là chứng thực thiết bị (device attestation). Nếu tôi nhớ không nhầm thì Safari đã làm việc này rồi, nên ở những nơi hỗ trợ thì bạn sẽ không thấy CAPTCHA
      Để nó hoạt động trên mọi trình duyệt, có thể làm kiểu này: quét mã QR bằng iPhone hoặc Android hỗ trợ chứng thực, hỏi có chấp thuận đăng nhập hay không, rồi thiết bị đó sẽ chứng thực thay
      Nếu bị xác định là tác nhân xấu thì website có thể chặn thiết bị đó, vì vậy cũng khó dùng một thiết bị duy nhất để tung tấn công quy mô lớn
    • Bạn nên tìm hiểu UPI của Ấn Độ. Mấy thứ nghe có vẻ hay ho như “xác minh thẻ thanh toán” thì đầy lỗi, cũ kỹ, lạc hậu và còn rất tốn kém cho doanh nghiệp
      Với UPI, bạn nhận mã QR hoặc nhập UPI ID, rồi bấm thanh toán là xong
      Nếu lo về “chống gian lận” thì tôi nghĩ nên xử lý với ngân hàng, người bán và tòa án thay vì phụ thuộc vào trung gian như eBay hay công ty thẻ
    • Làm ơn đừng. Lần gần nhất tôi phải giải CAPTCHA, vì dùng VPN nên bị phạt bằng cách phải bấm xe đạp, xe máy, xe buýt, đèn giao thông không dứt, mất 15 phút. Không hề phóng đại
    • Nghĩ đến chuyện đó trở thành tiêu chuẩn thì thật kinh khủng
      Tôi vẫn nhớ hồi sống ở {Country}, tôi hoàn toàn không có cách nào tiếp cận loại thẻ được chấp nhận cho thanh toán quốc tế
  • HN đã bao giờ yêu cầu CAPTCHA chưa? Có vẻ họ vẫn trụ khá ổn chỉ với các công cụ vận hành/chống spam cơ bản nhưng đã được kiểm chứng, cộng thêm giới hạn tốc độ đủ để chặn các đợt tấn công trừ phi là DDoS cực kỳ dai dẳng
    Có vẻ họ cũng không áp các giới hạn vô lý với việc scraping hay client bên thứ ba
    Mà vẫn xử lý được 5 triệu khách truy cập duy nhất mỗi tháng và 10 triệu lượt xem mỗi ngày[0]
    [0] https://news.ycombinator.com/item?id=33454140

    • Thực ra HN không phải mục tiêu hấp dẫn đến thế
      Điều bạn có thể làm cùng lắm là đăng spam, mà với kẻ tấn công thì giá trị tiền bạc thực tế khá thấp, và như bạn nói, công cụ xử lý việc đó đã tồn tại từ vài chục năm nay rồi
      Rất khác với các website khác nơi khả năng kiếm tiền rõ ràng và trực tiếp hơn nhiều
    • Khi có bài viết nổi hơn bình thường thì họ cũng khá chật vật
    • Nếu tôi nhớ không nhầm thì trang đăng ký đôi khi có hiện reCAPTCHA
    • Từ một máy duy nhất thôi nhé :)
    • HN bị sập khá thường xuyên. Có lẽ độ sẵn sàng chỉ cỡ four nines
      Tôi cũng không rõ vì sao họ cứ muốn vận hành chỉ với vài máy như vậy. Chắc họ không thiếu tiền, và hiệu ứng quảng bá cho YC thôi cũng đủ bù khác biệt rồi
  • CAPTCHA quá đau khổ vì tính mơ hồ và vấn đề ảnh không tải đầy đủ
    Đợi 1 phút mà một số ảnh vẫn không hiện. Kể cả khi hiện rồi thì cũng có quá nhiều ảnh xe đạp, xe máy và vạch qua đường
    Nếu một mảnh rất nhỏ hơi lấn sang ô khác thì lúc nào cũng phân vân không biết có phải bấm hay không. Cũng không thể chỉ làm mới riêng một ảnh chưa tải; mà nếu làm mới thì có vẻ phần lớn là phải bắt đầu lại từ đầu
    Như người khác cũng đã nói, khi dùng Tor thì CAPTCHA thường xuyên không tải nổi. Nó không hiện ảnh mà chỉ đứng im. Các trang web thông thường trên Tor nhìn chung vẫn hoạt động ổn, nên có vẻ đây là vấn đề từ phía CAPTCHA

    • Mỗi lần lại phải tự hỏi liệu có cần bấm vào trường hợp một mảnh nhỏ hơi lấn sang ô khác hay không
  • Tôi đã dự đoán như thế này từ 7 năm trước: “Máy móc sẽ thống trị như thế nào? Khi CAPTCHA trở nên quá khó đến mức chỉ AI mới giải được, con người sẽ bị khóa hoàn toàn khỏi Internet.” https://twitter.com/lapcatsoftware/status/771857826130034688

    • Tôi nghĩ chuyện này thực ra đã bắt đầu xảy ra từ khoảng 7 năm trước rồi
      Loại CAPTCHA kiểu “chữ trong ảnh này là gì” đã giảm mạnh trong một thời gian, và có lẽ một phần lý do là vì điều này
  • Tiêu đề khi gửi lên là “AI bots are now outperforming humans in solving CAPTCHAs”, và điều này đã vi phạm quy tắc tiêu đề của HN là “nếu không gây hiểu nhầm hay câu view thì hãy dùng tiêu đề gốc, đừng chỉnh sửa”
    Nếu người đăng muốn nói điều họ cho là quan trọng trong bài, họ có thể viết ở phần bình luận của luồng. Khi đó quan điểm ấy sẽ được đặt trên cùng vạch xuất phát với mọi người khác: https://hn.algolia.com/?dateRange=all&page=0&prefix=false&sort=byDate&type=comment&query=%22level%20playing%20field%22%20by:dang

  • Tiêu đề đã bị biên tập theo hướng gây hiểu nhầm. Trong tiêu đề và phần tóm tắt thực tế không hề có nội dung nói rằng AI “giờ đây” vượt con người
    Tiêu đề thực tế là An Empirical Study & Evaluation of Modern CAPTCHAs
    Trong gần 20 năm, CAPTCHA đã được dùng rộng rãi như một biện pháp bảo vệ để chặn bot, và khi việc sử dụng tăng lên thì các kỹ thuật phá hoặc vượt qua nó cũng không ngừng phát triển
    Đồng thời, CAPTCHA cũng phát triển về độ tinh vi và tính đa dạng, khiến nó ngày càng khó giải không chỉ với bot mà cả với con người
    Vì cuộc chạy đua vũ trang kéo dài này vẫn tiếp diễn, việc khảo sát người dùng hợp lệ mất bao lâu để giải CAPTCHA hiện đại và họ cảm nhận chúng như thế nào là rất quan trọng
    Nghiên cứu này đã đánh giá CAPTCHA đang được triển khai thực tế mà không chỉnh sửa chúng, thông qua khảo sát thủ công trên các website phổ biến và nghiên cứu người dùng
    1.400 người tham gia đã giải tổng cộng 14.000 CAPTCHA, và xuất hiện khác biệt lớn giữa các loại phổ biến nhất
    Điều thú vị là thời gian giải và cảm nhận của người dùng không phải lúc nào cũng cho thấy tương quan
    Nghiên cứu cũng so sánh sự khác biệt giữa việc giải CAPTCHA một cách trực tiếp và giải nó như một phần của các tác vụ tự nhiên hơn như tạo tài khoản; dù có nhiều yếu tố gây nhiễu, bối cảnh thí nghiệm có thể ảnh hưởng nên cần được xem xét trong nghiên cứu tương lai
    Cuối cùng, họ còn phân tích những người tham gia đã bắt đầu tác vụ nhưng không hoàn thành để xem CAPTCHA khiến người dùng bỏ dở tác vụ như thế nào

  • Những bài nghiên cứu kiểu này đã bỏ qua chuyện CAPTCHA có nhiều mức độ khó
    Những người dùng tài khoản enterprise hoặc hợp tác chặt chẽ với nhà cung cấp CAPTCHA sẽ thấy kết quả rất khác
    Ngày nay, nhiều nhà cung cấp CAPTCHA khi quyết định sẽ đưa ra loại CAPTCHA nào ở chế độ khó đều lấy tiêu chí là thứ mà mô hình ngôn ngữ lớn không giải được
    Lý do CAPTCHA không bị cố tình làm khó quá mức là vì những nơi như pex.com cần phải có khả năng vượt qua nó để phục vụ thực thi bản quyền
    Xin nói rõ là tôi từng là nhà sáng lập hcaptcha nên tôi có thiên kiến

  • Những kiểu CAPTCHA gần đây như xoay vật thể để khớp câu đố, hoặc tìm cùng một mục, có vẻ tốt hơn
    Cách cũ là đọc chữ bị làm méo, đặc biệt kiểu phải đoán đó là i, 1 hay l, còn gây khó chịu hơn nhiều