Nightshade: công cụ tấn công dành cho nghệ sĩ để chống lại các trình tạo nghệ thuật AI
(nightshade.cs.uchicago.edu)- Nightshade là một công cụ ứng phó với tình trạng hình ảnh trực tuyến bị dùng để huấn luyện AI tạo sinh mà không có sự đồng ý, bằng cách biến tác phẩm thành các mẫu poison không phù hợp cho việc huấn luyện mô hình
- Danh sách opt-out và do-not-scrape/robots.txt khó xác minh và cưỡng chế, đồng thời cũng khó xác định bên vi phạm với độ chắc chắn cao, nên người sáng tạo thiếu những phương tiện kiểm soát thực chất
- Hình ảnh sau khi biến đổi trông không khác quá nhiều với bản gốc đối với mắt người, nhưng khiến mô hình AI học những cấu hình khác, dẫn tới kết quả khó dự đoán
- Nếu Glaze là công cụ phòng thủ ngăn việc bắt chước phong cách của từng nghệ sĩ, thì Nightshade là công cụ tấn công có chọn lọc nhằm làm tăng chi phí huấn luyện của các mô hình cào dữ liệu không có sự đồng ý
- Hiện tại Nightshade v1.0 là công cụ chạy độc lập và không cung cấp khả năng bảo vệ trước việc bắt chước như Glaze, vì vậy không nên chỉ dùng riêng nó cho các tác phẩm mà bạn lo ngại về việc bị bắt chước phong cách
Ứng phó với việc thu thập dữ liệu huấn luyện không có sự đồng ý
- Các mô hình AI tạo sinh và các bên huấn luyện đã cho thấy khả năng tải xuống nội dung trực tuyến để dùng cho việc huấn luyện mô hình
- Chủ sở hữu nội dung và người sáng tạo hầu như không có công cụ nào để ngăn tác phẩm của mình bị đưa vào các mô hình AI tạo sinh trái với ý muốn
- Danh sách opt-out từng bị các bên huấn luyện mô hình trước đây phớt lờ, và có thể dễ dàng bị bỏ qua mà không phải chịu hậu quả đáng kể
- Chỉ thị do-not-scrape cũng khó xác minh và thực thi, và cũng khó nhận diện bên vi phạm với độ chắc chắn cao
Cách Nightshade hoạt động
- Nightshade biến hình ảnh thành các mẫu poison không phù hợp cho việc huấn luyện mô hình
- Các mô hình học từ những hình ảnh này mà không có sự đồng ý có thể học những hành vi khó lường, lệch khỏi cách hoạt động được kỳ vọng
- Ví dụ, khi yêu cầu hình ảnh “một con bò bay trong không gian”, mô hình có thể tạo ra hình một chiếc túi xách đang lơ lửng trong vũ trụ
- Mục tiêu không phải là đơn thuần phá hỏng mô hình, mà là làm tăng chi phí huấn luyện bằng dữ liệu không được cấp phép để việc cấp phép hình ảnh từ người sáng tạo trở thành một lựa chọn thay thế thực tế
Hình ảnh mà con người và mô hình nhìn thấy khác nhau
- Nightshade hoạt động tương tự Glaze, nhưng thay vì phòng thủ trước việc bắt chước phong cách, đây là công cụ tấn công làm bóp méo biểu diễn đặc trưng bên trong các mô hình tạo ảnh AI
- Phép biến đổi được tính toán bằng tối ưu hóa đa mục tiêu nhằm giảm thiểu các thay đổi nhìn thấy được trên ảnh gốc
- Với mắt người, hình ảnh đã được shade nhìn chung trông khá giống bản gốc, nhưng mô hình AI có thể nhìn thấy một cấu hình hoàn toàn khác trong ảnh
- Con người gần như vẫn nhìn thấy nguyên vẹn hình một con bò trên cánh đồng xanh
- Mô hình AI có thể nhìn đó là một chiếc ví da lớn đặt trên bãi cỏ
- Nếu học đủ nhiều hình ảnh đã được shade có chứa bò, mô hình có thể ngày càng tin rằng bò có tay cầm da màu nâu, túi hông trơn, khóa kéo và logo thương hiệu
Hiệu ứng vẫn tồn tại trước các biến đổi ảnh thông thường
- Hiệu ứng của Nightshade có độ bền vững trước những thay đổi thường được áp dụng lên hình ảnh
- Hiệu ứng poison vẫn còn sau khi cắt, resample, nén, làm mịn pixel và thêm nhiễu
- Hiệu ứng shade vẫn được giữ lại ngay cả khi chụp ảnh màn hình hoặc chụp lại hình ảnh đang hiển thị trên màn hình
- Điều này không phải watermark hay thông điệp ẩn kiểu steganography, nên không phải là một phương thức dễ bị phá vỡ
Khác biệt về vai trò giữa Nightshade và Glaze
- Glaze là công cụ phòng thủ giúp từng nghệ sĩ tự bảo vệ mình trước các cuộc tấn công bắt chước phong cách
- Nightshade là công cụ tấn công giúp các nghệ sĩ tập thể cản trở các mô hình cào hình ảnh không có sự đồng ý
- Bạn nên áp dụng Glaze cho mọi tác phẩm đăng lên mạng để tự bảo vệ mình
- Nightshade là tính năng có chọn lọc nhằm răn đe các bên huấn luyện mô hình thiếu lương tâm
- Lý tưởng nhất, nghệ sĩ đăng tác phẩm của mình lên mạng nên áp dụng cả Glaze lẫn Nightshade
- Bản phát hành tích hợp của hai công cụ hiện đang được phát triển
Những điểm cần lưu ý khi sử dụng
- Những thay đổi do Nightshade tạo ra có thể dễ thấy hơn trên các tác phẩm có màu phẳng và nền mượt
- Vì Nightshade nhằm mục đích gây nhiễu mô hình, nên cường độ thấp hoặc mức poison thấp không tạo ra kết quả tiêu cực cho chủ sở hữu hình ảnh
- Có kèm các thiết lập cường độ thấp cho người dùng muốn ưu tiên chất lượng thị giác của ảnh gốc
- Cũng như các cuộc tấn công hoặc phòng thủ bảo mật, không thể cho rằng Nightshade sẽ tiếp tục có hiệu quả lâu dài trong tương lai
- Là một công cụ tấn công, Nightshade có thể dễ dàng tiến hóa để thích ứng với các biện pháp đối phó hoặc phòng thủ tiềm năng
Cách phân phối và xử lý dữ liệu
- Mục tiêu của Nightshade là khám phá và học hỏi điều mới thông qua nghiên cứu, đồng thời tạo tác động tích cực cho thế giới
- Nightshade, giống như Glaze, được thiết kế để chạy mà không cần mạng
- Dữ liệu hay tác phẩm không được gửi tới nhóm Nightshade hay bất kỳ nơi nào khác
- Nightshade v1.0 được thiết kế là công cụ chạy độc lập
- Phiên bản hiện tại không cung cấp bảo vệ trước việc bắt chước như Glaze, nên cần cẩn trọng về cách sử dụng
- Nếu bạn dù chỉ hơi lo ngại về việc bị bắt chước phong cách, bạn không nên đăng các hình ảnh tác phẩm chỉ áp dụng Nightshade
- Cách Nightshade và Glaze hoạt động cùng nhau đang được thử nghiệm
- Khi sẵn sàng, Nightshade sẽ được phát hành dưới dạng tiện ích bổ sung cho WebGlaze để người dùng WebGlaze có thể áp dụng cả Nightshade và Glaze lên một ảnh trong một lần
Bài báo kỹ thuật và tài liệu tham khảo
- Cách cài đặt, chạy/cấu hình và gỡ bỏ Nightshade có thể xem trong User guide
- Tên bài báo kỹ thuật là Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
- Các tác giả là Shawn Shan, Wenxin Ding, Josephine Passananti, Haitao Zheng, Ben Y. Zhao
- Bài báo dự kiến được công bố tại 45th IEEE Symposium on Security and Privacy tổ chức ở San Francisco vào tháng 5 năm 2024
- Bản preprint được công bố vào tháng 2 năm 2024 là arxiv/2310.13828
1 bình luận
Ý kiến trên Hacker News
Bài báo ở đây: https://arxiv.org/abs/2310.13828
Cách này có vẻ tạo ra quá nhiều artifact đến mức nhiều nghệ sĩ khó có thể chấp nhận: https://twitter.com/sini4ka111/status/1748378223291912567
Theo những gì tôi nghe được thì a) nó chỉ tạm hoạt động với quy trình huấn luyện của thế hệ trước, b) hoàn toàn không hiệu quả với các quy trình mới hơn như GPT-4V, LLaVA, hay thậm chí gắn nhãn bằng BLIP2, và c) ngay cả khi tác động lớn hơn và được dùng rộng rãi thì cũng không quá khó để đối phó
Tác phẩm trước đó của các tác giả là Glaze cũng có vẻ không hiệu quả như những tuyên bố cường điệu, nên đây có thể là một ví dụ học thuật thú vị nhưng bị thổi phồng quá mức so với tính thực tiễn ngoài đời
[1]: do /u/b3sn0w trên Reddit cung cấp: https://imgur.com/cI7RLAq https://imgur.com/eqe3Dyn https://imgur.com/1BMASL4
Đưa ảnh vào GPT-4V, Stable Diffusion img2img, v.v. không phải là huấn luyện AI; mô hình hoàn toàn cố định và không thay đổi chút nào[0]
Tôi vẫn không rõ hiện nay còn nơi nào cào ảnh mới rồi đưa vào huấn luyện trình tạo hay không. Tôi từng nghe rằng OpenAI đã ngừng scraping vào khoảng năm 2021 vì lo mô hình sẽ học lại chính đầu ra của nó[1], còn Adobe Firefly thì tuyên bố được huấn luyện bằng ảnh Adobe Stock, nhưng không rõ mốc thời gian nội bộ của Adobe là khi nào[2]
Nếu muốn GPT-4V hay Stable Diffusion bị chặn ngay ở giai đoạn suy luận thì thứ cần có là ảnh đối kháng. Tôi không biết có thể huấn luyện đối kháng cho các mô hình không có trọng số truy cập được hay không, nhưng có nghe nói rằng nếu khái quát hóa được trên nhiều mô hình độc lập thì vẫn có thể phá hỏng chúng khá mạnh[3]
[0] Khả năng trông giống như đang học của trình tạo văn bản đến từ cửa sổ ngữ cảnh, nhưng đó chỉ là trí nhớ ngắn hạn cỡ 2048 token, ngoài ra không có năng lực ghi nhớ nào khác
[1] Kịch bản này đôi khi bị gọi đùa là Habsburg AI. Mô hình học từ chính thiên lệch của mình, rồi củng cố nó thành thiên lệch mạnh hơn nữa và quên hết phần còn lại
[2] Sẽ đặc biệt mỉa mai nếu AI generator duy nhất bị Nightshade gây hại lại là cái đã cố làm theo cách có đạo đức hơn đôi chút
[3] Ở cực đoan hơn, ảnh đối kháng còn có thể đánh lừa cả con người. Tuy nhiên, các nghiên cứu đó chỉ cho xem ảnh trong thời gian rất ngắn, với ý tưởng rằng phơi nhiễm ngắn giống với mạng thần kinh truyền thẳng không có đường tính toán hồi quy. Nếu nhìn lâu hơn thì sẽ rõ đó là một bức ảnh của vật này đã được chỉnh để trông như vật khác
Dù sao thì khử nhiễu cũng có thể là một bước tiền xử lý tốt
Có vẻ những người bên LLM thực ra không hề có ý định trả tiền một cách chính đáng, và bản tóm tắt kế hoạch kinh doanh của họ về cơ bản là “cứ trộm mọi thứ có thể với tới”
Thị trường sản phẩm bịp bợm ở đây là cực lớn. Chừng nào nghệ thuật còn phải hiển thị cho mắt người thì loại công cụ này không có cách nào thắng; và kể cả có hoạt động thì về nguyên lý cũng sẽ bị lách ngay lập tức
Với nghệ sĩ hay bất kỳ ai khác, cách thực tế duy nhất để ngăn mô hình học từ sản phẩm do con người tạo ra là dùng luật pháp, tức sức cưỡng chế do nhà nước hậu thuẫn, để ngăn điều mình không muốn. Ngay cả cách này cũng không hoàn hảo, và còn có thể làm tăng động lực phát triển các mạng huấn luyện phân tán để “rửa” hành vi vi phạm bản quyền có thể bị trừng phạt
Cuối cùng thì đây ít nhất cũng là một trận chiến thua cuộc, và tệ nhất là một trận chiến ngớ ngẩn. Không thể ngăn máy tính quan sát những hình ảnh đã được đưa lên cho con người xem tự do, nên các mô hình kiểu này có thể được tạo ra dễ dàng và rốt cuộc sẽ được tạo ra
Ngoài luật pháp vẫn còn cách khác. Chỉ cung cấp tác phẩm dưới dạng xem riêng tư, và không cho khán giả tại chỗ mang theo thiết bị ghi hình. Nghe có vẻ lố bịch, nhưng với những hoạt động như quan hệ tình dục thì đây lại là thông lệ phổ biến
Tệ nhất thì cũng chỉ là lãng phí thời gian, chứ không có chuyện ai bị lừa để mua nó
Giờ cách duy nhất để sống sót với tư cách nghệ sĩ là có một phong cách thật độc đáo của riêng mình, và tuyệt đối không bao giờ đưa nó lên mạng
Vài tháng trước, tôi đã tạo một proof of concept cho thấy nếu fine-tune Stable Diffusion XL bằng các hình ảnh sai lệch hoặc thiếu nhất quán, thì khi dùng chính các hình ảnh đó làm negative prompt, nó lại có thể xuất ra các hình ảnh “tốt hơn”: https://news.ycombinator.com/item?id=37211519
Tức là về bản chất, bạn đang chỉ định những vùng nhiều chiều trong latent space mà quá trình sinh của mô hình nên tránh. Việc khuyến khích tạo hàng loạt bộ dữ liệu bị thao túng nghịch lý là không phải không có khả năng sẽ cải thiện các mô hình nghệ thuật AI tạo sinh, vì mô hình có thể học cách nhận ra dữ liệu bị thao túng và để quá trình huấn luyện né tránh nó
Điều này có vẻ là một cuộc chạy đua vũ trang khá vô nghĩa, hoặc trò mèo vờn chuột. Nếu người muốn huấn luyện mô hình ảnh sinh không hề quan tâm đến suy nghĩ của nghệ sĩ, thì chỉ cần hậu xử lý cơ bản ở mức đủ để phá hỏng những thay đổi được tinh chỉnh rất tinh vi của thuật toán Nightshade
Ví dụ, chỉ cần lấy mẫu lại ở độ phân giải thấp hơn một chút rồi phóng lớn lại bằng một mô hình siêu phân giải khác, có vẻ cũng đủ làm hỏng kiểu tinh chỉnh vi mô này mà mắt người gần như không thấy khác biệt
Tôi nghĩ về sau, do áp lực xã hội, tòa án có khả năng phần lớn sẽ đứng về phía nghệ sĩ. Nghệ sĩ có thể nêu vấn đề với những hình ảnh bị phát hiện, và một mô hình machine learning khác có thể nhanh chóng phán định liệu ảnh được tạo ra có “quá giống” phong cách của nghệ sĩ đó hay không. Tất nhiên, phong cách ấy phải đủ khác biệt so với người khác thì mới có thể đưa ra yêu cầu pháp lý hợp lý
Hoặc cũng có thể các nghệ sĩ sẽ từ bỏ việc kiếm tiền trực tiếp từ chính hình ảnh và tập trung vào việc tạo ra các sản phẩm vật lý. Tương tự như cách các nhạc sĩ độc lập ngày nay kiếm phần lớn tiền từ lưu diễn, bán hàng lưu niệm tại địa điểm biểu diễn và Patreon. Khi một thay đổi nền tảng lớn như vậy xảy ra nhanh chóng, thật sự rất khó dự đoán tương lai
Trong một tương lai khá cay đắng, tôi nghĩ có thể sẽ có nhiều cái gọi là “furry artist” hơn. Cũng như nhiều lĩnh vực khác của Big Tech, mảng 18+ rất có thể sẽ bị nhiều thế lực mạnh tay ngăn chặn. Khi đó, các tác phẩm NSFW sẽ được bảo vệ phần nào khỏi làn sóng phát triển này, và mọi người sẽ либо phải tìm các mô hình huấn luyện ngầm, либо quay lại thuê nghệ sĩ
The Grateful Dead đã triển khai mô hình này một cách rất tinh vi, và đôi khi còn cố tình tránh khẳng định quyền sở hữu trí tuệ đối với tác phẩm của mình. Họ tin rằng những khẳng định như vậy cản trở thành công, và cuối cùng đã chính thức hóa sự ủng hộ đó bằng cái tên “The Electronic Frontier Foundation”. Việc EFF xuất phát từ văn hóa deadhead không phải là chuyện ngẫu nhiên
Việc không tồn tại một OpenArt tương ứng với OpenSource cũng vậy. Tất nhiên tôi hiểu khác biệt ở chỗ mã nguồn không dành cho khán giả phổ thông và có thể được che giấu nếu muốn, còn nghệ thuật thì không như vậy. Chỉ là sản phẩm phụ của lối suy nghĩ kiểu sinh tạo thôi
Tôi nghĩ việc huấn luyện bằng những hình ảnh này thực ra sẽ làm mô hình AI tốt hơn chứ không tệ đi. Về cơ bản, các nghệ sĩ đang miễn phí tạo ra dữ liệu huấn luyện cho biết loại nhiễu nào không làm thay đổi ý nghĩa hình ảnh mà họ định truyền tải
Trong tương lai gần, sẽ có số lượng người có thể tạo ra nghệ thuật chất lượng cao chỉ bằng các công cụ có sẵn nhiều đến mức khó tin
Đây là điều khá phấn khích. Trao cho hàng tỷ người sức mạnh trộn các phong cách họ thích, áp dụng chúng vào những chủ thể mới, và tạo ra các tác phẩm độc đáo, mang tính cá nhân của riêng mình là một khả năng cực kỳ tuyệt vời
Chỉ riêng việc các mô hình AI ăn nội dung do AI tạo ra cũng đủ khiến chúng tự sụp đổ. Cứ nhìn vào model collapse liên quan đến generative AI là thấy
Tôi muốn có phí lũy tiến cho việc sử dụng bản quyền, sở hữu trí tuệ và bằng sáng chế, đồng thời muốn có sự hợp tác và lập pháp của các chính phủ trên toàn thế giới. Có lẽ cũng có thể có một phương án cho phép dùng tác phẩm có bản quyền trên toàn cầu mà không cần xin phép trước, nhưng tôi nghĩ đừng đi xa đến mức nói chuyện kỳ quặc đó
Sẽ tốt nếu áp dụng một mức phí cấp phép có thể mở rộng, chẳng hạn gắn với doanh thu. Có vấn đề gián tiếp là biên lợi nhuận mỗi ngành khác nhau, nhưng dù vậy đây vẫn có vẻ là cách công bằng nhất
Tôi muốn bản quyền do cá nhân sở hữu được giảm dần xuống đến 0 năm sau khi tác giả qua đời, còn bản quyền do doanh nghiệp sở hữu thì tối đa 20–30 năm, bắt đầu chậm rãi trên toàn cầu hoặc ít nhất là từ EU
Hình phạt đối với các công ty không khai báo việc sử dụng hoặc không trả phí phải rất nặng. Cỡ như 50% lợi nhuận gộp hoặc 50% lợi nhuận ròng của năm đó, đủ để không chỉ là phạt cho có và không thể dễ dàng lách được, mà còn tạo động lực để ngay từ đầu đừng đi ăn cắp
[*] Hoặc trong khoảng thời gian mà xã hội cho là phù hợp
[**] Cho đến khi việc phát hiện tự động, dù tốt hay xấu, trở nên đủ tốt
Tôi nghĩ làm vậy sẽ cho phép sử dụng cá nhân, khuyến khích người mới tham gia, thúc đẩy đổi mới và buộc những nơi như OpenAI phải hành xử tốt hơn
Việc quyền hết hạn không lâu sau khi chết thì hơi khó chấp nhận, việc thời hạn bản quyền chênh lệch lớn tùy theo tuổi tác giả cũng không hay, và việc nhiều tác phẩm bị giữ bản quyền quá lâu lại càng không tốt
Bản quyền hết hạn ngay khi tác giả còn sống cũng hoàn toàn không sao. Cứ 20–30 năm cho mọi thứ là được
Nhìn “giải pháp” này, có cảm giác giới nghệ thuật cũng đang bước vào cùng một trò mèo vờn chuột mà trình chặn quảng cáo đã chơi suốt 10–20 năm qua
Tôi vẫn thấy việc lang thang trên Internet, cào ảnh không xin phép rồi dùng cho AI kiếm tiền của mình là sai rành rành. Mong sẽ có thêm nhiều cách bảo vệ tác phẩm nghệ thuật, gồm cả âm thanh và các định dạng khác, và chúng trở nên dễ tiếp cận hơn
Theo kiểu để một mô hình bổ sung cố lừa mô hình chính, từ đó tăng khả năng kháng lại các bộ lọc kiểu Nightshade
Bài viết không cho thấy cách này phá hỏng mô tả chi tiết của hình ảnh. Chỉ cần nhìn thumbnail của bài báo tham khảo cũng thấy vậy: https://arxiv.org/pdf/2310.13828.pdf
Và có thể tôi ngây thơ, nhưng có vẻ khá dễ để lách qua bằng một bộ lọc tiền xử lý nhanh. Tôi không chắc chỉ khử nhiễu truyền thống có đủ hay không, nhưng trong trường hợp xấu nhất thì cứ chạy khuếch tán img2img là được