- The Numbers, trang từng cung cấp dữ liệu về hơn 78.000 bộ phim, đã đột ngột ngừng hoạt động vào ngày 5/3/2026; do lưu lượng tự động quy mô lớn và các hoạt động dò quét bảo mật nhắm vào hệ thống 30 năm tuổi, trang cũ bị loại bỏ và chỉ khôi phục lại mức chức năng tối thiểu
- Con người chỉ chiếm khoảng 10% tổng lưu lượng; từ tháng 12/2025, lưu lượng thu thập dựa trên prompt và AI dạng tác tử tăng vọt, khiến khoảng 90% thời gian làm việc của đội ngũ vận hành bị dồn vào việc duy trì trang cũ
- Trong log không chỉ có các lượt thu thập bình thường mà còn phát hiện cả hoạt động dò tìm backdoor dường như nhằm truy cập sớm hoặc thao túng dữ liệu, nhưng nguyên nhân thực sự của sự cố và chủ thể tấn công vẫn chưa được xác định
- Dữ liệu của The Numbers được dùng làm chuẩn phân xử cho thị trường dự đoán doanh thu phim trên Polymarket, nên dữ liệu trước giờ công bố có thể mang lại lợi thế giao dịch; đồng thời các công cụ AI giúp việc dò tìm lỗ hổng trên các trang cũ trở nên rẻ hơn
- Các crawler AI gây chi phí khổng lồ và sự cố nhưng không đưa độc giả quay lại, làm sụp đổ quan hệ trao đổi của web mở; các kho lưu trữ độc lập, trang tin, diễn đàn và trang tham chiếu phụ thuộc vào mã cũ cùng đội ngũ nhỏ đặc biệt dễ tổn thương
Một tuần biến mất của nền tảng dữ liệu ngành điện ảnh
- The Numbers là trang dữ liệu phim có hơn 8 triệu lượt truy cập mỗi năm, tự nghiên cứu và cung cấp doanh thu phòng vé, kinh phí sản xuất, dữ liệu home video và streaming
- Đây là nguồn có thẩm quyền được báo chí, giới học thuật, nhà làm phim, thị trường dự đoán và Guinness World Records sử dụng
- Đầu năm 2026, cơ sở dữ liệu này có 78.396 bộ phim, 178.375 bản ghi phát hành rạp và 236.176 nhân vật
- Trang đã ngừng hoạt động vào ngày 5/3/2026, hơn một tuần không quay lại, rồi được khôi phục dưới dạng rút gọn trên hạ tầng mới vào ngày 13/3
- Các biểu đồ lịch sử, trang riêng cho từng phim, Report Builder đều biến mất, chỉ còn lại chức năng tối thiểu xoay quanh số liệu phòng vé mới nhất
- Do chỉ hiển thị thông báo đang tái xây dựng mà không có hướng dẫn cụ thể, người dùng đã nổi giận, thậm chí xuất hiện nghi ngờ đây là việc cố tình cắt giảm tính năng để chuyển sang sản phẩm trả phí
Hệ thống 30 năm tuổi bắt đầu từ năm 1997
- Bruce Nash, nhà toán học và cựu lập trình viên phần mềm IBM, đã khởi tạo một trang Geocities theo dõi 300 bộ phim vào ngày 17/10/1997
- Ban đầu, ông tạo HTML từ cơ sở dữ liệu Access rồi đưa lên Geocities, đồng thời thông báo các phân tích phòng vé phục vụ giao dịch cổ phiếu phim trên diễn đàn Hollywood Stock Exchange
- Bài viết nhìn lại dịp kỷ niệm 20 năm khi đó nay chỉ còn trong bản lưu trên Internet Archive
- Trang cũ được mở rộng suốt hàng chục năm đã cung cấp khoảng 2 triệu trang với khoảng 160.000 tệp nguồn
Hai làn sóng lưu lượng do crawler AI tạo ra
- Trong 25 năm đầu, khách truy cập chủ yếu là con người, các công cụ tìm kiếm tương đối tuân thủ quy tắc và các trình thu thập cho dự án cá nhân; những bên thu thập quá mức có thể bị phát hiện và chặn
- Biến động đầu tiên bắt đầu vào khoảng năm 2024, khi crawler phục vụ huấn luyện AI gia nhập cùng nhóm crawler của công cụ tìm kiếm
- Crawler AI có xu hướng kém tuân thủ quy tắc hơn công cụ tìm kiếm, làm tăng khối lượng công việc quản trị để giữ trang ổn định
- Năm 2024, lưu lượng tự động trên toàn web đã vượt lưu lượng của con người; sau đó, thống kê của Cloudflare cho thấy bot chiếm 57,5% số yêu cầu tới trang web
- Làn sóng thứ hai bắt đầu khoảng tháng 12/2025, khi các AI agent thu thập website để trả lời prompt và các agent do người dùng tự tạo tiếp tục đẩy lưu lượng lên cao hơn
- Trong lượng truy cập vào The Numbers, tỷ lệ con người tự trực tiếp duyệt chỉ khoảng 10%, còn lại là bot AI và lưu lượng tự động
- Từ tháng 12 đến đầu tháng 3, đội ngũ vận hành dành khoảng 90% thời gian làm việc để duy trì trang cũ và dùng phần thời gian còn lại để phát triển hệ thống mới
Phản ứng bằng cách chỉ đường cấp phép cho crawler
- Đội ngũ vận hành đã thêm hướng dẫn mà LLM có thể đọc được lên trang để chúng trả lời cách mua giấy phép thay vì trực tiếp thu thập dữ liệu
- Sau đó, số lượng yêu cầu hỏi về giấy phép dữ liệu tăng khoảng 10 lần
- Các biện pháp giảm tải lưu lượng có hiệu quả, nhưng không thể giải quyết gánh nặng mang tính cấu trúc là vừa phải bảo vệ 160.000 tệp vừa phải tiếp tục vận hành dịch vụ trên nền mã 30 năm tuổi
Máy chủ sập và dấu vết dò quét bảo mật
- Máy chủ sụp đổ vào rạng sáng 5/3, và lúc đầu đội ngũ vận hành nghi ngờ nguyên nhân chỉ là tải do lưu lượng AI
- Trong log, ngoài các truy cập dùng URL bình thường còn phát hiện những nỗ lực tìm backdoor
- Có khả năng ai đó đã cố truy cập dữ liệu của trang trước khi công khai hoặc thao túng dữ liệu được cung cấp cho người dùng
- Dù đã có nhiều tháng thu thập và dò quét tự động, vẫn chưa xác định được điều gì gây ra sự cố cuối cùng và ai là người thực hiện
- Theo lời khuyên của chuyên gia an ninh mạng, máy chủ cũ không được bật lại
- Nếu khôi phục bản sao lưu thì sẽ lại phơi bày 160.000 tệp legacy cho những kẻ tấn công vốn đã dò tìm lỗ hổng trong thời gian dài
- Họ đánh giá rằng máy chủ cũ có thể lại ngừng hoạt động chỉ sau vài phút nếu khởi động lại, nên đã dựng một phiên bản tối thiểu trên hạ tầng mới
Thị trường dự đoán đã gán giá trị tiền tệ cho dữ liệu phim
- Polymarket vận hành thị trường dự đoán doanh thu cuối tuần mở màn phim và chỉ định
Daily Box Office Performancecủa The Numbers làm chuẩn phân xử thị trường - Mỗi thị trường cuối tuần cho một phim thường có quy mô từ vài chục nghìn đến vài trăm nghìn USD, và tổng các thị trường doanh thu phim mở cùng lúc có thể lên tới hàng triệu USD
- Nếu có thể xem dữ liệu của The Numbers trước khi được công bố, người ta có thể biết kết quả sớm hơn các nhà giao dịch khác mỗi tuần để giao dịch đi trước
- Thị trường dự đoán có thể biến gần như mọi dữ liệu thành giá trị tiền tệ; các công cụ AI giá rẻ làm hạ thấp rào cản kỹ thuật cho việc xâm nhập website, còn bot tác tử quy mô lớn thì khuếch đại điểm yếu của hạ tầng web truyền thống
AI làm hạ thấp ngưỡng gia nhập của tấn công mạng
- Anthropic đã công bố vào tháng 11/2025 về chiến dịch gián điệp mạng đầu tiên được ghi nhận là có AI điều phối
- Một tổ chức được nhà nước hậu thuẫn đã tấn công khoảng 30 cơ quan và AI thực hiện 80~90% công việc
- Con người chỉ can thiệp tại 4~6 điểm ra quyết định trong mỗi chiến dịch
- Rào cản cho các cuộc tấn công mạng tinh vi đã giảm mạnh và có vẻ sẽ còn tiếp tục giảm
- Theo báo cáo đe dọa trước đó của Anthropic, ngay cả tội phạm thiếu năng lực kỹ thuật cũng có thể dùng AI để thực hiện những tác vụ phức tạp như phát triển ransomware vốn trước đây cần nhiều năm đào tạo
- Công cụ kiểm thử xâm nhập AI tự động XBOW đã đứng số 1 bảng xếp hạng HackerOne tại Mỹ khi gửi khoảng 1.060 lỗ hổng
- Một website 30 năm tuổi, nơi khả năng tồn tại lỗ hổng đã biết là rất cao, là bề mặt tấn công phù hợp để công cụ AI dò quét với chi phí thấp; rào cản chuyên môn từng bảo vệ các trang nhỏ trong quá khứ nay đã suy yếu đáng kể
The Numbers bắt tay vào tái xây dựng toàn diện
- Dù website công khai bị gián đoạn, nguồn doanh thu cốt lõi của The Numbers không bị ảnh hưởng nên bản thân hoạt động kinh doanh vẫn được duy trì
- Trong vài năm gần đây, trang miễn phí không phụ thuộc nhiều vào quảng cáo
- Các mảng kinh doanh chính là OpusData bán dữ liệu số lượng lớn, báo cáo phân tích so sánh cho nhà làm phim và nhà đầu tư, cùng Business Report
- Vì phải xây dựng lại từ đầu một website cung cấp 78.396 bộ phim, 178.375 bản ghi phát hành và 236.176 nhân vật, họ không thể khôi phục toàn bộ tính năng cùng lúc
- Đội ngũ vận hành phân loại người dùng mà website công khai năm 2026 phải đối mặt thành sáu nhóm
- Con người
- Công cụ tìm kiếm
- Tác vụ huấn luyện LLM
- Lưu lượng AI dựa trên prompt
- AI dạng tác tử
- Nhà giao dịch thị trường dự đoán
- Nếu trước đây chỉ tập trung vào ba yếu tố nội dung, quảng cáo và SEO, thì nay trong mọi quyết định thiết kế phải cân nhắc khoảng 8~10 yếu tố
- Trang mới hướng đến việc hỗ trợ cả sáu loại người dùng, bổ sung dịch vụ OpusData và tính năng cho người đăng ký Business Report, đồng thời trả lại dữ liệu cũ cho người dùng phổ thông dưới hình thức được cải thiện
Chi phí crawling và những lượt truy cập không quay trở lại
- Trong thống kê theo nền tảng của Cloudflare, quy mô crawling mà các website chấp nhận để đổi lấy một khách truy cập được giới thiệu khác nhau rất lớn
- Google thu thập khoảng 5 trang cho mỗi khách truy cập
- OpenAI thu thập hơn 1.000 trang
- Anthropic thu thập hơn 38.000 trang
- Quan hệ trao đổi của web mở, nơi công cụ tìm kiếm đọc nội dung rồi gửi độc giả trở lại, không còn vận hành với crawler AI
- Việc thu thập quy mô lớn làm tăng chi phí băng thông của các website nhỏ và có thể khiến toàn bộ dịch vụ ngừng hoạt động
Thiệt hại do thu thập quy mô lớn mà các website khác phải chịu
- Tại Read the Docs, một crawler đã tải xuống 73TB HTML nén trong một tháng, phát sinh chi phí băng thông hơn 5.000 USD
- iFixit ghi nhận 1 triệu request trong một ngày từ crawler của Anthropic
- Triplegangers, công ty bán ảnh quét 3D với 7 nhân viên, đã bị ngừng hoạt động trong giờ làm việc vì bot của OpenAI; CEO đánh giá đây thực chất là một cuộc tấn công DDoS
- Nhà vận hành SourceHut dành 20~100% thời gian làm việc mỗi tuần để đối phó crawler AI và phải chịu hàng chục đợt gián đoạn ngắn mỗi tuần
- Trang tin Linux LWN xem lưu lượng crawler đến từ hàng triệu IP là một cuộc tấn công từ chối dịch vụ phân tán
- Dự án mã nguồn mở GNOME đo được khoảng 97% lưu lượng là bot
- Một thư viện đại học đã chặn 16.000 địa chỉ IP trong 48 giờ để duy trì dịch vụ danh mục
Chi phí và sự suy giảm độc giả mà Wikipedia trải qua
- Wikimedia Foundation thống kê vào tháng 4/2025 rằng bot chiếm khoảng 35% lượt xem trang Wikipedia, nhưng trong nhóm lưu lượng có chi phí xử lý cao nhất thì chúng chiếm ít nhất 65%
- Do crawler lấy hàng loạt cả những trang mà con người hầu như không đọc, tỷ trọng chi phí còn cao hơn
- Sáu tháng sau, lượt xem trang từ con người trên Wikipedia giảm khoảng 8% so với cùng kỳ năm trước
- Ngày càng nhiều người lấy kiến thức từ phần tóm tắt AI thay vì trực tiếp truy cập Wikipedia
- Các hệ thống AI vừa lấy nội dung với quy mô lớn vừa làm giảm lượng độc giả lẽ ra website gốc sẽ nhận được
Khi các giả định của internet cũ sụp đổ
- Công cụ AI vừa mạnh mẽ vừa mang tính phá hủy, và đang được công chúng thử nghiệm theo thời gian thực trong môi trường thực tế
- Web mở truyền thống được xây trên những giả định sau, nhưng tất cả đều không còn phù hợp với tình hình hiện tại
- Phần lớn khách truy cập là con người
- Lưu lượng nhìn chung tỷ lệ thuận với số lượng độc giả
- Chi phí vận hành website gắn với giá trị mà nhà vận hành thu được
- Tách biệt khỏi câu chuyện có phủ nhận tính hữu ích của AI hay không, web hiện tại đơn giản là chưa được chuẩn bị cho sức mạnh và quy mô của các mô hình AI mà ai cũng có thể truy cập
Thử nghiệm tính phí crawling và chặn mặc định
- Cloudflare đã ra mắt pay-per-crawl, cho phép website thu phí crawler AI theo từng trang
- Sau đó, hãng còn công bố mô hình pay-per-use, theo đó nhà xuất bản được trả tiền khi nội dung thực sự được dùng trong câu trả lời của AI
- Từ ngày 15/9, các trang dựa vào quảng cáo của khách hàng Cloudflare sẽ mặc định chặn crawler
mixed-usekhông trả phí - Thành bại của các chính sách này phụ thuộc vào việc các công ty AI có tham gia hệ thống tính phí thay vì tìm cách vượt qua bằng kỹ thuật hay không
Lời cảnh báo cho toàn bộ website độc lập
- The Numbers đã mất toàn bộ website giữa lưu lượng máy móc quá mức và khả năng bị xâm nhập, nhưng vẫn có thể sống sót vì website công khai không phải toàn bộ hoạt động kinh doanh
- Công ty dệt may Đức ZEGO đã hoạt động 37 năm nhưng nộp đơn phá sản sau khi một cuộc tấn công mạng hồi tháng 3 làm sản xuất ngừng trong 6 tuần
- Các kho lưu trữ độc lập, cơ sở dữ liệu sở thích, tin tức địa phương, diễn đàn và website tham chiếu đang bảo tồn tri thức cộng đồng được tích lũy trong khi phụ thuộc vào mã cũ cùng đội ngũ nhỏ hoặc người vận hành cá nhân
- The Numbers đang phục hồi với cấu trúc tốt hơn, và việc tiếp tục sử dụng cũng như hỗ trợ các website nhỏ được tạo ra cho internet cũ có liên hệ trực tiếp tới khả năng sống còn của chúng
1 bình luận
Ý kiến trên Hacker News
Nói nghiêm túc thì, liệu thị trường dự đoán có thể trở thành nguồn doanh thu mới cho TheNumbers.com không? Có khả năng một số kẻ tấn công đã cố lấy các con số trước khi công bố để đặt cược trên thị trường dự đoán bằng thông tin chắc chắn
Đây rõ ràng là giao dịch nội gián nên rất phi đạo đức, nhưng CEO của PolyMarket từng nói giao dịch nội gián cũng là một phần chủ đích của dịch vụ: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566
Điểm cốt lõi không chỉ là agent đang đập vào trang web, mà còn là có lỗ hổng tiềm ẩn có thể bị khai thác. Đây cũng là lý do trang web bị ngừng rồi quay lại với dữ liệu và thiết kế bị cắt giảm đáng kể
Nếu kẻ xấu truy cập được dữ liệu chưa công bố của The Numbers, họ có thể biết đáp án trước các trader khác mỗi tuần và giao dịch đón đầu
Khi thấy suy đoán trên Reddit rằng đây là một cú rút thảm có chủ ý nhằm phá hỏng trang miễn phí để đẩy người dùng sang sản phẩm trả phí, tôi lại nghĩ liệu tài nguyên miễn phí có còn tiếp tục giảm đi không
Trước đây tôi từng open source các công cụ nhỏ với hy vọng ai đó sẽ dùng để giải quyết vấn đề tương tự, nhưng giờ thì ngại đóng góp cho web miễn phí vì biết rằng nó sẽ bị scrape làm dữ liệu huấn luyện rồi sau đó bị kiếm tiền. Chủ các trang miễn phí hữu ích tức giận cũng phải
Không chỉ dừng ở việc tác phẩm bị dùng theo cách khó chịu, mà còn làm tăng chi phí và thời gian bảo trì, gây ra thiệt hại thực tế
Vài năm trước, trong thời kỳ COVID-19, tôi vận hành một trang tra cứu khoản hỗ trợ cho doanh nghiệp nhỏ của chính phủ Mỹ và các khoản vay gian lận mà DOJ đã truy tố. Khoảng 10GB dữ liệu công khai đầy đủ có thể tải về miễn phí, và tổng tiền quyên góp chỉ khoảng 2.000 USD
Nhưng crawler AI không dùng liên kết tải toàn bộ ở trang đầu mà duyệt qua mọi tổ hợp điều kiện tìm kiếm và phân trang, lấy về hàng chục terabyte HTML. Dù có cache CloudFront và backend hiệu quả, chỉ riêng chi phí mạng mỗi tháng cũng lên khoảng 1.000 USD, nên tháng sau tôi đóng luôn trang web
Tuy nhiên nếu lỡ thanh toán, máy chủ có thể bị xóa trong vòng khoảng một tuần, nên tuyệt đối đừng để quá hạn
Có lẽ chúng ta cần các pattern kỹ thuật và thư viện mã nguồn mở để ứng phó với cấu trúc traffic đã thay đổi? Hàng triệu trang nhỏ và người sáng tạo không có khả năng tự mình phòng thủ trước truy cập tự động quy mô lớn, và nội dung càng hữu ích thì càng bị crawl hung hãn, làm tăng chi phí vận hành và độ bất ổn định
Cần các công cụ quản trị cộng đồng gồm nhận diện agent, giới hạn tốc độ, phân loại traffic, chính sách truy cập, cache, quy trình xác minh, logging, xác minh nguồn gốc và kiểm soát sử dụng. Thay vì mỗi bên vận hành tự làm lại từ đầu, nên có những quy tắc chung mạnh mẽ phù hợp với traffic tự động ngày nay
Vì cũng có công ty công khai bán quyền truy cập proxy của smart TV và điện thoại bị nhiễm, biết đâu có thể lập cơ sở dữ liệu IP đó để chặn? Nếu kèm thông báo chặn để khuyến khích kiểm tra thiết bị nhiễm trong gia đình thì có thể xử lý từ gốc: https://news.ycombinator.com/item?id=49000864
Cuối cùng lại quay về các biện pháp kiểm soát bùng nổ traffic vốn có. Những công cụ được đề xuất này đã được dùng hàng chục năm để chặn hiệu ứng Slashdot, DDoS và việc crawler công cụ tìm kiếm quét quá mức, và các công ty như Cloudflare từ lâu đã dẫn đầu lĩnh vực này
Các công ty AI đúng là đang xã hội hóa chi phí và tư hữu hóa lợi nhuận. Những trang như The Numbers phải gánh chi phí chống chọi làn sóng AI nhưng không nhận lại gì từ các công ty AI
Nếu crawler đã trả phí cấp phép cho dữ liệu đầy đủ chất lượng cao thì không vấn đề gì, nhưng điểm mấu chốt là chúng bắt đầu đi tìm cả lỗ hổng chỉ để truy cập dữ liệu chưa công bố
Phần công khai miễn phí có vẻ là một trang rất phù hợp để dựng lại bằng trình tạo trang tĩnh và kết hợp với CDN nhận diện bot. Như vậy có lẽ có thể vận hành lâu dài với chi phí hợp lý
Tôi cũng tò mò về kiến trúc cũ·mới, cũng như các chiến lược giảm tải và mở rộng đã áp dụng để duy trì trang
Ngay cả các trang PHP sơ sài của thập niên 2000 cũng xử lý được khoảng 200 request/giây, trang tĩnh thì hơn 1.000 request/giây, còn Node.js từng quảng bá 100.000 request/giây với mô hình luồng hợp tác. Trong khi đó, các trang ngày nay chạy hàng trăm tới hàng nghìn truy vấn cơ sở dữ liệu do ORM và vấn đề N+1, nên phản hồi mất hơn 500ms và thậm chí 1.000 người dùng đồng thời cũng đã thành gánh nặng
Bộ nhớ đệm búp bê Nga độc lập với ngôn ngữ và cơ sở dữ liệu, cùng với việc vô hiệu hóa cache chính xác cho dữ liệu phụ thuộc, đã không thể trở nên phổ biến. Tôi từng thử cả sự kiện touch của Laravel lẫn cache truy vấn Redis, nhưng vô hiệu hóa cache về thực chất vẫn là vấn đề chưa được giải quyết; không nên tự triển khai mà nên tính từ đầu tới các chiến lược như package và sharding
Web lẽ ra nên trở thành một hệ lưu trữ định địa chỉ nội dung P2P, nơi nội dung được lấy từ peer gần nhất như BitTorrent, nhưng HTTPS/SSL và mô hình bảo mật của trình duyệt đã là vật cản. Có thể còn cần cả mạng lưới tin cậy hay bằng chứng không kiến thức, nên trước mắt có vẻ chúng ta vẫn sẽ mắc kẹt với những màn hình xác minh con người lỗi thời
Năm 2015 tôi đã khởi động Applaudience, khi đó là nơi duy nhất cung cấp dữ liệu bán vé phim theo thời gian thực, và trong quá trình hiệu chỉnh tôi thường so sánh với các con số của TheNumbers.com
Giờ tôi làm việc khác rồi, nhưng đây vẫn là công nghệ tự tay làm ra mà tôi thích nhất, nên một ngày nào đó muốn hồi sinh nó
Có thể chặn crawler của các công ty AI lớn bằng cách đặt
Disallow: /trongrobots.txtcho từng botClaudeBot,Claude-SearchBot,Claude-User,GPTBot,OAI-SearchBot,PerplexityBot,Google-Extended,Google-Extended-Factual,Bingbotcrawl-delayđể điều chỉnh theo điều kiện máy chủ, nhưng họ không hỗ trợ: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntaxNếu chặn thì có vẻ lượng truy cập từ tìm kiếm cũng sẽ còn giảm thêm
Kết quả là hầu hết URL thư mục con đều bị thêm một request không cần thiết
Tôi vận hành một trang nhỏ lưu trữ các chương trình phát thanh tiếng Nga cũ http://radar.lv; trước đây lưu lượng từ Mỹ là 5%, nhưng gần đây 90% lại đến từ Mỹ
May là tôi chịu được tới 1TB mỗi tháng, và bản thân tôi không phản đối việc crawl, nhưng lo về độ ổn định cho khách truy cập thực. Tôi đang cân nhắc có nên bật tính năng trả phí truy cập mà Cloudflare mới tạo gần đây hay không
Blog cá nhân thì tôi dùng trình tạo tĩnh, nhưng kho lưu trữ này còn có vấn đề là đang dùng Drupal cũ đã nhiều năm không còn bản vá bảo mật