Đừng sa thải họa sĩ minh họa của bạn
(sambleckley.com)- AI tạo ảnh dùng latent space, khử nhiễu và liên kết văn bản-hình ảnh để tạo ra kết quả có vẻ thuyết phục, nhưng có những giới hạn mang tính cấu trúc khi cần tạo chính xác một hình ảnh cụ thể như mong muốn
- Stable Diffusion được huấn luyện bằng cách thêm nhiễu vào hàng triệu hình ảnh rồi khôi phục chúng theo từng bước, từ đó tạo ra hình ảnh có vẻ hợp lý từ nhiễu thuần túy
- Prompt văn bản phải được chuyển đổi nhiều lần từ không gian từ ngữ sang không gian hình ảnh, và thường chỉ xử lý khoảng 75 từ mỗi lần nên khó kiểm soát chi tiết
- Những công việc mà đầu ra không quá quan trọng như ảnh header blog đơn giản hay bài viết phục vụ SEO có thể nhanh chóng bị AI tạo sinh thay thế, nhưng các ràng buộc tinh vi như bố cục, tư thế, phong cách, màu sắc vẫn cần đầu vào của họa sĩ minh họa
- Trong minh họa thương mại, quy trình cộng tác thực tế hơn là con người đảm nhiệm nét vẽ, bố cục và ý tưởng cốt lõi, AI điền các chi tiết ít quan trọng hơn như màu sắc, ánh sáng, nền, rồi con người chỉnh sửa lại
Latent space để hiểu Stable Diffusion
- Màu sắc, từ ngữ và hình ảnh đều có thể được biểu diễn thành danh sách số, và một cách biểu diễn tốt sẽ được tổ chức sao cho những đối tượng giống nhau có các con số gần nhau
- Không gian màu có nhiều cách như RGB, Lch, CMYK, và mỗi cách định nghĩa “sự giống nhau” khác nhau
- Các con số không hẳn là tệp lưu chính màu đó mà gần hơn với nhãn và chỉ thị trỏ tới màu ấy
- Từ ngữ cũng có thể được biểu diễn bằng hàng trăm con số; “mom” và “dad” có thể nằm gần nhau, còn “mom” và “prestidigitation” có thể nằm xa nhau hơn
- Hình ảnh phức tạp hơn từ ngữ và màu sắc, nhưng vẫn có thể tạo không gian hình ảnh bằng hàng nghìn con số
- Nếu liệt kê giá trị RGB của mọi pixel thì sẽ cần đến hàng triệu con số
- Những hình ảnh giống nhau về mặt ý nghĩa như mèo đen và mèo trắng vẫn có thể rất xa nhau nếu chỉ nhìn vào giá trị pixel
Image latent space vay mượn từ caption
- Nhiều hình ảnh có caption, nhãn hoặc văn bản xung quanh, nên có thể tạo không gian hình ảnh thông qua mối quan hệ giữa hình ảnh và văn bản
- Các ảnh được gắn nhãn “cat” có thể được đặt gần nhau, còn các ảnh gắn nhãn “car” cũng có thể được đặt gần nhau
- Nhãn như “Miyizaki cat-bus” có thể nằm đâu đó giữa mèo và ô tô
- Trong nghiên cứu AI tạo sinh, kiểu không gian này được gọi là image latent space
- Latent space có thể xấp xỉ không chỉ gần như mọi hình ảnh mà ta muốn xem, mà cả những hình ảnh ngẫu nhiên không thể diễn giải, dưới dạng danh sách số
- Không gian này được ví như Library of Babel dành cho tranh ảnh
Stable Diffusion hoạt động như thế nào
- Stable Diffusion không phải là cách duy nhất để tạo ảnh, nhưng là phương pháp được dùng rộng rãi
- Quá trình huấn luyện diễn ra bằng cách thêm một ít nhiễu vào hàng triệu hình ảnh rồi huấn luyện máy tính khôi phục chúng trở lại sạch sẽ
- Sau đó thêm nhiều nhiễu hơn nữa, rồi tiếp tục huấn luyện để đưa chúng trở lại trạng thái ít nhiễu hơn
- Nếu lặp lại quá trình này cho đến mức hình ảnh gần như biến mất, máy tính sẽ học được cách quay ngược từng bước về bất kỳ hình ảnh nào
- Việc học cách liên kết văn bản và hình ảnh cũng diễn ra song song
- Ảnh mèo có khả năng cao sẽ đi kèm caption như “my cute kitty mister french fry”
- Còn caption như “the engine from a 1959 Austin Healey” thì ít có khả năng hơn
- Cross attention là cách kết nối nhiều hệ AI để vừa giảm nhiễu trong hình ảnh vừa đẩy hình ảnh tiến gần hơn tới một caption văn bản cụ thể
- AI tạo sinh kết hợp các mục tiêu khác vào quá trình khử nhiễu để dẫn hình ảnh đi theo một hướng nhất định
Vì sao ngón tay và khuôn mặt bị lệch
- Latent space không phải là không gian chứa nguyên xi các ảnh huấn luyện, mà là không gian biểu diễn mọi hình ảnh có thể có
- Lực kéo ra xa khỏi nhiễu ưu tiên độ rõ nét của ảnh, còn lực kéo về phía nhãn văn bản tập trung vào việc làm hài lòng những hình ảnh có thể được gắn nhãn bằng đoạn văn bản đó
- Caption ảnh thường không đề cập nhiều đến độ chính xác của bàn tay người hay số lượng ngón tay
- Những nhãn phủ định như “no deformed hands” có hiệu quả hạn chế nếu có ít ảnh được gắn nhãn “deformed hands”
- “polydactyly” có thể tốt hơn vì là nhãn gắn mạnh với việc thừa ngón tay
- Khuôn mặt cũng gặp vấn đề tương tự, nên nhiều hệ tạo sinh có thành phần riêng để sửa mặt
- Hệ thống cốt lõi có thể cho rằng chỉ cần trông giống khuôn mặt là đủ
- Mắt người lại cực kỳ nhạy với độ chính xác của khuôn mặt, như hướng nhìn của hai mắt
- Đưa tên tác giả như James Gurney vào prompt có thể cải thiện tính nhất quán của toàn bộ hình ảnh
- Caption thông thường chủ yếu tập trung vào danh từ và đối tượng chính
- Phong cách của tác giả là một gestalt trải trên toàn bộ pixel chứ không chỉ một phần của ảnh, nên có thể dẫn đến kết quả nhất quán hơn
Những công việc AI tạo sinh dễ thay thế
- Nhu cầu của con người đối với chất liệu vật lý như hội họa thực, điêu khắc, tranh khắc gỗ hay thêu có lẽ sẽ không biến mất
- Thành phẩm từ chất liệu vật lý vẫn có thể tiếp tục bị dùng để huấn luyện AI tạo sinh
- Việc tác phẩm bị dùng để huấn luyện mà không được phép rồi được tận dụng để thay thế sinh kế có thể tạo cảm giác bị xâm phạm
- Nhưng không phải hình ảnh nằm trong latent space theo một cách cụ thể nào đó; cùng lắm là với prompt phù hợp và một chút may mắn, có thể truy hồi ra ảnh tương tự
- Không rõ có cách nào vừa cho phép hành vi sử dụng hợp lý của nghệ sĩ con người vừa chỉ hạn chế riêng việc dùng cho ML bằng pháp luật
- AI tạo sinh có thể thay thế một số minh họa và bài viết mà nội dung thực sự không quan trọng
- Ảnh header blog chỉ cần tương đối liên quan để lấp vào bố cục trang
- Bài blog hằng tuần dạng spam phục vụ SEO
- Những đầu ra này gần với nội dung kiểu đồ nội thất mà từ người làm đến người tiêu dùng cuối cùng đều không quá quan tâm
- Các công việc đó vốn đã không được trả cao, đang biến mất rất nhanh, và ngay cả khi có quy định pháp lý mạnh cũng khó thấy lối thoát
Vì sao khó tạo ra một hình ảnh cụ thể
- Tạo ra hình ảnh ấn tượng bằng AI tạo sinh là tương đối dễ, nhưng tạo ra một hình ảnh cụ thể đôi khi gần như bất khả thi
- Cứ khoảng 1 trong 10 ảnh có thể khiến ta thấy “đẹp đấy”, nhưng điều đó không có nghĩa ảnh đó thực sự khớp với yêu cầu ban đầu
- Trên các showcase ảnh tạo sinh như civitai, có thể so sánh prompt rất dài với ảnh kết quả
- Trang này có thể chứa NSFW
- Nhiều yếu tố trong prompt đôi khi hoàn toàn không xuất hiện trong ảnh
- Một ý niệm tổng thể như “a mystical dragon” có thể nổi bật trong prompt nhưng lại không có trong ảnh
- Cách sử dụng này gần với trò gacha hay máy đánh bạc để tạo tranh
- Bạn nhập vào một prompt có nhiều ý tưởng thú vị rồi lặp lại cho đến khi ra thứ gì đó đủ hài lòng
- Kết quả có thể hấp dẫn, nhưng có thể không phải chính hình ảnh bạn đã yêu cầu
- Văn bản phải được chuyển từ prompt thực tế sang text latent space, rồi tiếp tục thành một hàm trong image latent space, nên nó hoạt động khá kém như công cụ điều khiển hình ảnh
- Lượng văn bản có thể xử lý cùng lúc thường cũng chỉ vào khoảng 75 từ
- Nếu dài hơn thì phải tách ra bằng các hệ dẫn hướng riêng trong cross attention
Đầu vào bằng hình ảnh là công cụ kiểm soát mạnh hơn
- Hình ảnh được dịch sang image latent space tốt hơn nên trở thành điều kiện ràng buộc trực tiếp hơn so với văn bản
- Prompt dựa trên hình ảnh có thể kiểm soát rất chi tiết nội dung và bố cục của kết quả tạo sinh
- Tạo ảnh suy giảm về cùng line art như một ảnh khác
- Tạo ảnh có cùng depth map lấy từ ảnh khác
- Tạo ảnh khớp với tư thế lấy từ ảnh khác
- Tạo ảnh có nội dung khác nhưng khớp phong cách của ảnh khác
- Khớp các đường phối cảnh của ảnh khác
- Khớp bảng màu của ảnh khác
- Vấn đề là những ảnh hướng dẫn này đến từ đâu
- Vai trò hiểu ý tưởng minh họa mong muốn rồi chuyển nó thành line art, phác thảo tư thế và phong cách trùng lặp rất nhiều với vai trò của họa sĩ minh họa truyền thống
- Những công việc tạo ảnh có yêu cầu tinh vi rất khó hữu ích nếu không có họa sĩ minh họa
Quy trình AI khả dĩ cho minh họa thương mại
- Họa sĩ minh họa thương mại có khả năng vẫn giữ được việc, nhưng sẽ cần học cách đưa AI vào một phần quy trình để đáp ứng tốc độ làm việc nhanh hơn
- Điều đó không có nghĩa là phải bỏ vẽ để trở thành prompt engineer
- Làm vậy sẽ lãng phí quá nhiều quá trình rèn luyện mà thu lại chẳng bao nhiêu
- Một quy trình digital painting khả dĩ có thể là như sau
- Tạo line art theo cách truyền thống, tập trung vào bố cục và ý tưởng cốt lõi
- Để AI tạo sinh đề xuất khoảng 12 hướng tiếp cận về màu sắc và ánh sáng
- Chọn 1 đến 2 phương án trong số đó
- Tô đè lại gần như toàn bộ lên phần pixel do AI tạo ra, đồng thời điều chỉnh và sửa màu theo đúng ý đồ
- Cách này có thể không phù hợp với những tác giả đặt nhiều tâm huyết và cảm xúc vào việc chọn màu
- Không có một cách làm duy nhất phù hợp cho mọi tác giả; những người có deadline có thể dùng AI để lấp các bước ít quan trọng nhất và nhàm chán nhất
- Cảnh đông người
- Phong cảnh đô thị
- Thảm thực vật
- Nhiều hình ảnh cũng có phần đồ nội thất cần có nhưng không quan trọng như ảnh header của một trang, và đó đang là vùng đất của AI tạo sinh
Khoảng cách giữa sản phẩm và hướng nghiên cứu
- Nghiên cứu AI tạo sinh ngày càng đi theo hướng cung cấp nhiều cách hơn để dùng đầu vào bằng hình ảnh nhằm chỉ đạo việc tạo ảnh
- Các sản phẩm tung ra thị trường lại khó tích hợp trơn tru vào quy trình của họa sĩ minh họa
- Việc thử nghiệm để đạt mức kiểm soát đủ hữu ích đã được thực hiện theo cách chạy mô hình dữ liệu mở trên máy tính cá nhân
- Hình dung tương lai của minh họa thương mại gần với việc họa sĩ minh họa nắm phần cốt lõi, AI tạo sinh lấp các phần ít quan trọng hơn, rồi con người chỉnh sửa lại
- Các sản phẩm AI tạo sinh cũng cần phát triển theo hướng hỗ trợ kiểu quy trình này
1 bình luận
Ý kiến trên Hacker News
Một quan điểm nữa có lẽ chẳng ai thích, nhưng tác động của AI đối với nghệ sĩ có lẽ sẽ giống như tác động của Spotify đối với ngành âm nhạc. Tức là rất có khả năng nó sẽ bóp chết dòng doanh thu của tất cả mọi người, trừ các nhà xuất bản và những nghệ sĩ/người chơi lớn
Spotify về cơ bản đã xóa sổ số tiền đến từ phân phối vật lý, và còn tệ hơn cả nạn sao chép lậu vốn khi đó là không thể tránh khỏi. Ít nhất khi bị sao chép lậu, bạn không phải vừa không nhận được tiền vừa phải trả phí luật sư để đàm phán lại với hãng đĩa
Những nơi như Adobe, OpenAI có vẻ sẽ trả cho nghệ sĩ vài đồng lẻ để họ vẽ tranh dùng huấn luyện mô hình, rồi bắt họ ký giấy từ bỏ kiểu “tôi không sao nếu không nhận được tiền từ tác phẩm AI này”, sau đó bán lại thành phẩm với giá cao ở những nơi như Splice: https://splice.com/features/sounds
Cuối cùng, bản thân mô hình gần như không quan trọng; nó được huấn luyện bằng tác phẩm của ai mới là yếu tố khác biệt thật sự. Nhưng rồi sẽ thành “bức này do AI tạo nên không cần trả tiền cho anh/chị”
Máy móc trước kia chỉ thay thế ở mức 1–2 nhiệm vụ, nhưng nếu con người làm cho việc huấn luyện AI thật sự hiệu quả, nó sẽ thay thế hàng trăm nhiệm vụ cùng lúc. AI cũng có tác dụng làm tăng sự cô lập bằng cách giảm mức độ cần đến những người khác
Vì những lý do này, tôi cho rằng thế giới sẽ tốt hơn rất nhiều nếu không có AI, và các công ty công nghệ đang phá hỏng thế giới bằng những sản phẩm quái vật của họ
Spotify đã lấy cấu trúc kinh tế của sao chép lậu rồi phủ lên đó một lớp vỏ mỏng trông có vẻ hợp pháp
Thứ nhất, hình ảnh do AI tạo có tính ngẫu nhiên và gần như là đồ dùng một lần. Bạn có thể có một hình ảnh đẹp dùng được một lần, rồi sau đó thì sao? Rất khó xây dựng cả một chiến dịch bằng nó
Thứ hai, nghệ thuật do AI tạo không được bảo hộ bản quyền, nên đối thủ bắt chước có thể thoải mái dùng hình ảnh marketing do AI tạo ra
Ít nhất thì có thể đưa tác phẩm của một họa sĩ đồ họa được trả tiền vào AI làm seed, và hình ảnh AI dựa trên seed có thể được bảo hộ bản quyền. Nhưng họa sĩ đó sẽ làm tốt hơn một thực tập sinh không lương
Hồi nhỏ, chiều Chủ nhật cha tôi thường bật album lên và chỉ ngồi nghe. Thật sự chỉ nghe thôi. Bây giờ rất hiếm người làm như vậy
Giờ nhu cầu lớn là âm nhạc phụ trợ khi lái xe, đọc sách, lướt Internet, viết code, dọn dẹp. Từ khoảng lúc âm nhạc trở nên có thể mang theo, cách tiêu thụ đã thay đổi căn bản, và Spotify chỉ là bên thắng trong cuộc cạnh tranh đó
So với thời kỳ đầu của nhạc số, tôi có ấn tượng rằng phân phối phương tiện vật lý thực ra đang tăng. Điều này liên quan đến việc số hóa âm nhạc nói chung hơn là do Spotify
Xung quanh tôi, có vẻ nhiều người mua merch hoặc phương tiện vật lý để ủng hộ nghệ sĩ họ thích, hơn là để thực sự nghe nhạc trên định dạng vật lý
Những bài như thế này thường mặc định về tạo ảnh từ văn bản và prompt engineering, thường là vì người viết thiếu trải nghiệm trực tiếp với các mô hình đó. Nếu không phải làm cho vui thì cách đó về bản chất không phải câu trả lời đúng
Công việc cần tính dự đoán được và khả năng kiểm soát giống với “hãy vẽ phần còn lại của những con cú theo cách tương tự những con cú khác tôi đã tự vẽ” hơn, kèm với photobashing và chỉnh sửa/ghép thủ công. Để tạo ra kết quả không nhàm chán, đây là một lĩnh vực lai đòi hỏi cả năng lực nghệ thuật lẫn kỹ thuật, tương tự 3D CGI
Đây không phải vấn đề do mô hình hiểu ngôn ngữ tự nhiên kém; ngay cả khi xuất hiện thứ có thể hợp lý gọi là AGI, có lẽ khi đó cũng chưa chắc thay đổi nhiều. Prompt văn bản không có đủ dung lượng để chứa ý nghĩa
Một prompt chi tiết cùng vài ví dụ về phong cách mong muốn có vẻ là đủ. Tất nhiên điều đó không có nghĩa là không rất khó, nhưng tôi không thấy cần đột phá nền tảng cho việc này. Các thành phần cần thiết đã tồn tại
Nó giống như đưa AI đến trường, hoặc cho nó nhanh chóng học khái niệm mới bằng kiểu tải dữ liệu như trong Matrix. Các chuyên gia sẽ học cách làm đó, và thị trường cũng sẽ hình thành quanh những người muốn làm các việc như vậy
Gần đây tôi thử “một robot ngồi đối diện con người và chơi Magic: The Gathering”, nhưng ngay cả việc đưa con người vào tranh đã khó, và mô hình không biết đủ về MTG nên chỉ khớp mẫu ở mức “boardgame” hay “cardgame”
Một số ảnh tạo ra tốt hơn hẳn ảnh khác, nên tôi muốn lấy bố cục bàn của một ảnh và robot của ảnh khác, nhưng hiện tại về cơ bản là không thể. “blend” cũng không dùng được cho mục đích đó
Tôi không nghi ngờ là nó sẽ cải thiện, nhưng tôi tự hỏi liệu bên dưới có một giới hạn tổng quát hơn không. Cũng có thể đơn giản là thiếu dữ liệu. Ngay cả khi tìm Magic: The Gathering trên Google Images thì cũng khá thất vọng
Một ví dụ khác, nếu yêu cầu một logo màu xanh phát sáng được khắc trên một khối đá nguyên khối, đôi khi logo có được khắc lên thật nhưng rất hiếm, và chưa bao giờ nó phát sáng màu xanh. Thường thì toàn bộ hoặc một phần khối đá lại chuyển thành màu xanh
Tôi đặc biệt thích đoạn “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, phần lớn họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc”
Thỉnh thoảng tôi cũng vẽ minh họa, nhưng phong cách của tôi khá khác với những gì AI tạo sinh làm. Gần đây tôi đã phát hành bản 1.1 của một sách hướng dẫn trò chơi dùng hình Midjourney, và hiện đang đầu tư vào một họa sĩ minh họa đúng nghĩa. Vì hình của Midjourney thiếu cá tính
Tuy vậy, vài tháng nữa có thể sẽ khác. Tôi vẫn sẽ tiếp tục làm việc với họa sĩ minh họa vì tính nhất quán của hình ảnh, nhưng cũng có khả năng AI sẽ tạo ra kết quả hào nhoáng hơn
Điểm “2 tháng nữa là sẽ thay đổi” cũng hợp lý, nhưng câu đó đã được nói suốt một năm rưỡi nay rồi mà về chất thì vẫn chưa thay đổi. Chất lượng hình tạo sinh đã tốt hơn, nhưng chưa đến mức gọi là bước nhảy vọt về chất
Nhân tiện, liên kết civitai dẫn tới https://sambleckley.com/writing/civitai.com/images nhưng đó là liên kết chết
Liên kết: https://youtu.be/FQ6z90MuURM?t=329
Tôi cùng đối tác đang vận hành vài nghề tay trái nhỏ trên Internet. Một trong số đó là doanh nghiệp D2C dựa trên nội dung, vốn phụ thuộc nhiều vào minh họa tùy chỉnh cho mẫu quảng cáo hiển thị; CTR khá ổn và ở mức trung bình, nhưng CPC quá cao và ROAS thật sự tệ
Vài tháng trước, chúng tôi đã A/B test giữa họa sĩ minh họa thường dùng và Stable Diffusion, và kết quả khá ấn tượng. CTR tăng gần 20% và CVR cũng cải thiện đều đặn
Tôi không đồng ý với lập luận trong bài rằng hình ảnh do AI tạo hoạt động tốt nhất ở những doanh nghiệp nơi nội dung thực ra không quan trọng. Doanh nghiệp này là một phản ví dụ rất tốt. Trong trường hợp của chúng tôi, hình ảnh do AI tạo hợp với khách hàng mục tiêu hơn, đồng thời cho phép cá nhân hóa chi tiết hơn nhiều với chi phí thấp hơn trước
CPA cũng giảm đáng kể, và nhờ kiểm soát được chặt chẽ các biến thể nội dung sáng tạo, chúng tôi có thể tối ưu theo thời gian thực cho từng phân khúc khán giả. Thời gian ra mắt chiến dịch mới cũng giảm một nửa, và các cuộc bàn luận về sắc thái thiết kế, trễ hạn, bế tắc sáng tạo cũng biến mất
Tôi có cảm xúc phức tạp về việc yếu tố con người trong quá trình sáng tạo bị giảm đi, nhưng xét thuần từ góc độ growth hacking, đây là điều thay đổi cuộc chơi, và chúng tôi có số liệu để chứng minh
Nhìn chung tôi xem đây là lợi ích ròng. Nó không nhất thiết là dấu chấm hết cho họa sĩ minh họa con người, nhưng sẽ buộc họ thích ứng nhạy hơn với nhu cầu của khách hàng. Ngay cả một doanh nghiệp nội dung mà cũng gặp ma sát lớn như vậy trong việc tìm nguồn cung cấp hình ảnh thì thật vô lý
Dù sao thì cũng có hiệu quả và có linh hồn. Robot phần lớn đã làm tốt phần trước, và đôi khi cũng khiến ta ngạc nhiên ở phần sau
Tôi tò mò không biết lý do số vòng trao đổi qua lại giảm là nhờ phản hồi tức thì, có tính tương tác — tức là ít phải đối diện với con người hơn — hay là do niềm tin và sự ủy thác dành cho máy móc
Nếu theo kiểu “máy đã tạo biểu tượng này dựa trên mô tả của tôi, nên không cần nghi ngờ lựa chọn màu sắc”, thì rốt cuộc đó là vấn đề kinh điển: coi máy là không thể sai và là chuyên gia hơn con người. Có lẽ là sự pha trộn của cả hai
Mức độ quan trọng của nội thất trong một không gian nằm trên một phổ, từ khu vực chờ chỉ ở lại ngắn cho đến văn phòng kiến trúc sư, và nghệ thuật thương mại cũng không khác. Nếu hình ảnh đó thật sự vô nghĩa thì đã chẳng cần đặt nó ở đó
Các đồ họa không mang thông tin trong phần lớn bộ slide PowerPoint được thiết kế không chuyên có thể còn ít quan trọng hơn. Ngược lại, hình mở đầu dàn trang hai trang của một bài chuyên đề trên tạp chí thì, trừ khi đó là bài viết về hình ảnh do AI tạo, tôi nghĩ xác suất được tạo bằng AI gần như bằng 0. Ngay cả trong trường hợp đó, khả năng cao là các chuyên gia đã mất nhiều thời gian để tinh chỉnh hình thức hơn so với phần còn lại
Trong quy trình làm đồ họa chuyên nghiệp, tính cụ thể và khả năng kiểm soát đến từng pixel là cực kỳ quan trọng. Dù những người không phải nhà thiết kế chuyên nghiệp nói gì, các công cụ hiện nay về cơ bản không phù hợp với công việc đó. Chính giao diện đã sai
Adobe hoặc một bên nào khác trong ngành hiểu điều cần thiết có thể giải quyết việc này, nhưng hình hài của nó sẽ không giống Midjourney
“Nhạy hơn với nhu cầu của khách hàng” khác với việc phải đọc được suy nghĩ của khách hàng. Nếu bạn nghĩ đây không phải là tín hiệu tận thế đối với họa sĩ minh họa con người trong thị trường cụ thể này, thì bạn đang tự lừa mình
Tôi đã thử để AI viết bài cho mình và kết quả thật kinh khủng. Ngược lại, khi thử bỏ qua các công cụ AI như trình kiểm tra ngữ pháp, trình tóm tắt, công cụ viết lại, ứng dụng chuyển giọng nói thành văn bản, tôi thấy quá trình viết trở nên ì ạch
Với tôi, điểm trung gian là phù hợp nhất. Tôi chỉ dùng AI tạo sinh ở các bước trung gian của công việc, không dùng cho đầu vào là ý tưởng hay đầu ra là bản nháp thực sự
Cách tôi viết là như sau. Ý tưởng đến từ suy ngẫm hoặc các cuộc trò chuyện trên mạng xã hội. Những chủ đề được bàn ở đó ít nhất đã có mức độ liên quan nhất định được kiểm chứng
Sau đó tôi ngồi khoảng 10 phút và đọc suy nghĩ của mình cho một công cụ như AudioPen ghi lại; công cụ này tóm tắt nội dung 10 phút thành 5–6 đoạn. Đây là phần có AI. Khi công cụ đề xuất vài cấu trúc đoạn, tôi thử thay đổi cho đến khi tìm được cái tốt
Sau đó tôi tự viết bản nháp theo dàn ý đó. Ngoài kiểm tra ngữ pháp ở cuối, tôi không dùng thêm công cụ AI nào nữa. AI là một đối tác viết lách tuyệt vời, nhưng là một nhà văn tệ hại
Câu “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, nhìn chung họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc” đúng y như thực tế tôi đã thấy
Ngoài cộng đồng tạo media bằng AI, nhiều người vẫn nghĩ việc này chỉ là nhập văn bản rồi nhận kết quả. Trên thực tế, để có được đúng kiểu hình ảnh mong muốn, người ta phải xây dựng toàn bộ quy trình làm việc
Ví dụ: https://old.reddit.com/r/StableDiffusion/comments/14ye2eg/co...
Hình thứ hai là đầu ra, nhưng hình đầu tiên thú vị hơn. Đó là giao diện dựa trên node, tương tự những gì thường thấy trong các công cụ phát triển game như Unreal Engine: https://docs.unrealengine.com/5.2/en-US/nodes-in-unreal-engi...
Nó giống như việc kết nối các API để có được hình ảnh kết quả. Việc tạo ảnh trong tương lai có lẽ sẽ gần với lập trình backend hơn là vẽ tranh thực sự. Vì phần vẽ thực tế sẽ được tự động hóa, còn sự sáng tạo nằm ở chính quy trình làm việc
Tất nhiên một ngày nào đó phần quy trình làm việc cũng sẽ được tự động hóa, nhưng máy tính vẫn chưa thể đọc được suy nghĩ đến mức hiểu ý định của người dùng, nên chuyện đó còn xa
Bài viết có vẻ quá nghiêng về hiện tại. Các mô hình kiểu Stable Diffusion đã rất thành công với một kỹ thuật cụ thể, nhưng cho rằng phương pháp đó sẽ được cải thiện vô hạn là ngây thơ
“AI” tạo sinh sẽ có nhiều hình thái. Cuối cùng, nó có khả năng loại bỏ một phần đáng kể yếu tố kỹ pháp trong sáng tạo, qua đó lấy đi thu nhập và mức độ liên quan của nghệ sĩ cũng như chủ sở hữu nội dung
Điều đó sẽ không xảy ra chỉ sau một đêm, nhưng trong khoảng 10 năm tới, AI có lẽ vẫn giống một công cụ hữu ích hơn là một mối đe dọa
Tôi dự đoán đến một lúc nào đó, AI tạo sinh sẽ trở thành hệ thống đa giác quan bao gồm thị giác, âm thanh và xúc giác. Những hệ thống như vậy sẽ tạo ra các biểu đạt mới và chính xác dựa trên mô hình vật lý của đối tượng và môi trường, tận dụng mô tả phong phú cùng khả năng nhận biết sâu về ngữ cảnh văn hóa
Chúng sẽ tư duy bằng đối tượng và quan hệ chứ không phải pixel, rồi mô phỏng, render và lọc các yếu tố đó để khớp với mong muốn của người dùng
Tôi ủng hộ nỗ lực của các nhà văn và diễn viên nhằm tự bảo vệ trước cạnh tranh, nhưng rốt cuộc tôi nghĩ điều đó sẽ vô ích. Diễn biến pháp lý trong lĩnh vực này sẽ rất thú vị
Các hệ thống tạo sinh trong tương lai có thể cần dấu vết kiểm toán cho thấy chúng đã có được hiểu biết về thế giới như thế nào, nhằm chứng minh rằng không có việc huấn luyện trái phép. Nhưng điều này chỉ nâng tiêu chuẩn lên một chút, chứ không ngăn được việc suy ra các quan hệ quan trọng bằng những cách khác, chẳng hạn như mô tả cấp cao theo kiểu clean room
Ví dụ, việc huấn luyện AI bằng các tác phẩm có bản quyền của Harrison Ford hoặc hình ảnh chụp ở nơi công cộng có thể là bất hợp pháp, nhưng nếu rút gọn Harrison Ford thành một tập hợp đặc điểm rồi truyền cho hệ thống tạo sinh, nó có thể tạo ra thứ không thể phân biệt với Harrison Ford thật. Nếu có thể ghi lại quy trình này, có vẻ hệ thống pháp luật không có nhiều cách để ngăn chặn. Tất nhiên tôi không phải chuyên gia trong lĩnh vực này
Nhân tiện, tôi không thích “AI” hiện nay. Đặc biệt là LLM, tôi thấy chúng không đáng tin cậy và nhìn chung vô dụng. Nghệ thuật do AI tạo ra phần lớn cũng nhàm chán, không chính xác hoặc thiếu sức thuyết phục ở đâu đó. Dù vậy, tôi nghĩ xu hướng đang ngày càng rõ ràng hơn
Tôi không hiểu vì sao quan điểm “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, nhìn chung họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc” lại bị xem là không được ưa chuộng. Nó có vẻ là con đường logic trong tương lai
Giống như CoPilot không thay thế tôi, nhưng khiến một số đoạn mẫu trở nên đỡ đau đầu hơn nhiều và giúp tôi tránh được trang giấy trắng hay tình trạng bí khi chuẩn bị viết một hàm
Bắt đầu từ một thứ gì đó rồi chỉnh sửa cho đến khi nó thành hình dạng cần thiết vẫn tốt hơn là bắt đầu từ con số không. Ngay cả khi cuối cùng phải viết lại 80–99% cũng vậy
Nghệ sĩ cũng có thể được khơi gợi sáng tạo khi thấy vài ví dụ về việc line art của mình có thể trông như thế nào, rồi sau đó làm tiếp theo ý muốn
Những họa sĩ minh họa mà tôi muốn hợp tác nhất là những người tận dụng mọi công cụ có thể dùng để tạo ra hình ảnh tốt nhất có thể
Tôi đồng ý với phần lớn, nhưng không đồng ý ở phần tạo ra một hình ảnh cụ thể. Đó rõ ràng là một kỹ năng có thể phát triển được
Tôi đã dạy nhiều người cách đơn giản hóa prompt cho AI tạo ảnh và chọn ngôn ngữ phù hợp. Kỳ lạ là mọi người thường nhét vào rất nhiều thứ linh tinh không cần thiết, có lẽ gần như một dạng mê tín kiểu “mảnh câu này vài lần trước có hiệu quả”
Như bài viết nói, cách tiếp cận lai dùng nó như một công cụ trong chuỗi nhiều công cụ mới là hướng đi phía trước
Cũng có những khái niệm AI hoàn toàn không hiểu. Ví dụ hiện tại Midjourney cực kỳ chật vật với những thứ như “máy ủi”, “nhân mã”, “cung thủ fantasy”. Những thứ này chắc chắn sẽ được sửa trong các phiên bản mô hình mới có dữ liệu huấn luyện tốt hơn, và trong quá khứ chúng cũng đã được sửa như vậy
Khó khăn thật sự đến từ các chi tiết nhỏ hoặc thông tin ngữ nghĩa. Ví dụ, rất khó yêu cầu một cảnh chân thực/giống ảnh chụp trong đó cả hậu cảnh cũng đều nét, và dùng các từ khóa như “focus stacking” cũng không hiệu quả lắm. “selfie” là từ tốt nhất mà chúng tôi tìm ra, nhưng tiếc là nó có tác dụng phụ lớn
Có thể trong dữ liệu huấn luyện không có đủ ví dụ mô tả cụ thể thuộc tính đó, nhưng nói thật, ngay cả việc học các từ tiếng Anh để diễn đạt khái niệm như vậy cũng đã khó rồi
Với các chi tiết nhỏ, cách tiếp cận hiện tại sẽ không mở rộng được để xử lý những yêu cầu kiểu “sáu khối lập phương màu xanh, mỗi khối gắn một tam giác đỏ, được xếp thành hình kim tự tháp, với một quả bóng vàng cân bằng ở phía trên”. Tuy nhiên, như tác giả nói, những thứ như vậy có khả năng sẽ được xử lý bằng các asset tạo riêng và kỹ năng Photoshop tối thiểu
Khi nói về vấn đề kỹ thuật của prompt, phần đó đã bị bỏ sót hoàn toàn
Vấn đề của prompt không phải là các khối lập phương xếp chồng. Hãy bảo 10 kỹ sư phần mềm, 10 người trong đội bán hàng và 3 quản lý cấp cao nghĩ ra ý tưởng hình ảnh cho quảng cáo, kết quả sẽ là những hình ảnh rác trên nền đen, robot, anime, bản sao tệ của thứ họ đã thấy ở đâu đó và vô thức ghi nhớ, và 0 ý tưởng thị giác thực sự hiệu quả
Các nhà thiết kế và họa sĩ minh họa phải liên tục chống lại và lật ngược những thứ sáo rỗng cùng các ý tưởng tệ hại đó để tạo ra sản phẩm ổn
Tôi cũng nhìn GPT và code gần như y hệt. Tôi đã thấy những người thông minh không viết code ném yêu cầu cho GPT và nhận được thứ chạy được, nhưng từ “viết giúp tôi cái tự động bấm phím theo bộ đếm giờ” đến “hãy cập nhật repository để client xử lý logic nghiệp vụ và chức năng này” là một bước nhảy khổng lồ
Theo góc nhìn của tôi, vẫn cần người có tư duy nhà phát triển làm việc, còn AI chỉ khiến cuộc sống trong quá trình đó dễ hơn một chút
Tôi nghĩ lĩnh vực nghệ thuật cũng vậy. Lấy được một hình ảnh trông có vẻ ổn thì dễ, nhưng để có hình ảnh cụ thể và có ý nghĩa, thường cần rất nhiều hậu kỳ mà người bình thường không làm được
Chúng ta đã thấy những bước tiến nhảy vọt. Các công cụ lập trình dựa trên LLM cũng đang tốt lên, bản thân LLM cũng đang tốt hơn, và kích thước ngữ cảnh cũng tăng lên. Sự quan tâm dành cho LLM cũng đang kích thích việc phát triển các cách tiếp cận mới hiệu quả hơn
Chỉ vài năm nữa thôi, dù là dòng JEPA của Lecun, một super-coder lai nào đó mà DeepMind đang làm, hay LLM mã nguồn mở, chúng cũng sẽ vượt xa GPT-4 trong lập trình