1 điểm bởi GN⁺ 2023-08-22 | 1 bình luận | Chia sẻ qua WhatsApp
  • AI tạo ảnh dùng latent space, khử nhiễu và liên kết văn bản-hình ảnh để tạo ra kết quả có vẻ thuyết phục, nhưng có những giới hạn mang tính cấu trúc khi cần tạo chính xác một hình ảnh cụ thể như mong muốn
  • Stable Diffusion được huấn luyện bằng cách thêm nhiễu vào hàng triệu hình ảnh rồi khôi phục chúng theo từng bước, từ đó tạo ra hình ảnh có vẻ hợp lý từ nhiễu thuần túy
  • Prompt văn bản phải được chuyển đổi nhiều lần từ không gian từ ngữ sang không gian hình ảnh, và thường chỉ xử lý khoảng 75 từ mỗi lần nên khó kiểm soát chi tiết
  • Những công việc mà đầu ra không quá quan trọng như ảnh header blog đơn giản hay bài viết phục vụ SEO có thể nhanh chóng bị AI tạo sinh thay thế, nhưng các ràng buộc tinh vi như bố cục, tư thế, phong cách, màu sắc vẫn cần đầu vào của họa sĩ minh họa
  • Trong minh họa thương mại, quy trình cộng tác thực tế hơn là con người đảm nhiệm nét vẽ, bố cục và ý tưởng cốt lõi, AI điền các chi tiết ít quan trọng hơn như màu sắc, ánh sáng, nền, rồi con người chỉnh sửa lại

Latent space để hiểu Stable Diffusion

  • Màu sắc, từ ngữ và hình ảnh đều có thể được biểu diễn thành danh sách số, và một cách biểu diễn tốt sẽ được tổ chức sao cho những đối tượng giống nhau có các con số gần nhau
  • Không gian màu có nhiều cách như RGB, Lch, CMYK, và mỗi cách định nghĩa “sự giống nhau” khác nhau
    • Các con số không hẳn là tệp lưu chính màu đó mà gần hơn với nhãn và chỉ thị trỏ tới màu ấy
  • Từ ngữ cũng có thể được biểu diễn bằng hàng trăm con số; “mom” và “dad” có thể nằm gần nhau, còn “mom” và “prestidigitation” có thể nằm xa nhau hơn
  • Hình ảnh phức tạp hơn từ ngữ và màu sắc, nhưng vẫn có thể tạo không gian hình ảnh bằng hàng nghìn con số
    • Nếu liệt kê giá trị RGB của mọi pixel thì sẽ cần đến hàng triệu con số
    • Những hình ảnh giống nhau về mặt ý nghĩa như mèo đen và mèo trắng vẫn có thể rất xa nhau nếu chỉ nhìn vào giá trị pixel

Image latent space vay mượn từ caption

  • Nhiều hình ảnh có caption, nhãn hoặc văn bản xung quanh, nên có thể tạo không gian hình ảnh thông qua mối quan hệ giữa hình ảnh và văn bản
  • Các ảnh được gắn nhãn “cat” có thể được đặt gần nhau, còn các ảnh gắn nhãn “car” cũng có thể được đặt gần nhau
    • Nhãn như “Miyizaki cat-bus” có thể nằm đâu đó giữa mèo và ô tô
  • Trong nghiên cứu AI tạo sinh, kiểu không gian này được gọi là image latent space
  • Latent space có thể xấp xỉ không chỉ gần như mọi hình ảnh mà ta muốn xem, mà cả những hình ảnh ngẫu nhiên không thể diễn giải, dưới dạng danh sách số
  • Không gian này được ví như Library of Babel dành cho tranh ảnh

Stable Diffusion hoạt động như thế nào

  • Stable Diffusion không phải là cách duy nhất để tạo ảnh, nhưng là phương pháp được dùng rộng rãi
  • Quá trình huấn luyện diễn ra bằng cách thêm một ít nhiễu vào hàng triệu hình ảnh rồi huấn luyện máy tính khôi phục chúng trở lại sạch sẽ
    • Sau đó thêm nhiều nhiễu hơn nữa, rồi tiếp tục huấn luyện để đưa chúng trở lại trạng thái ít nhiễu hơn
    • Nếu lặp lại quá trình này cho đến mức hình ảnh gần như biến mất, máy tính sẽ học được cách quay ngược từng bước về bất kỳ hình ảnh nào
  • Việc học cách liên kết văn bản và hình ảnh cũng diễn ra song song
    • Ảnh mèo có khả năng cao sẽ đi kèm caption như “my cute kitty mister french fry”
    • Còn caption như “the engine from a 1959 Austin Healey” thì ít có khả năng hơn
  • Cross attention là cách kết nối nhiều hệ AI để vừa giảm nhiễu trong hình ảnh vừa đẩy hình ảnh tiến gần hơn tới một caption văn bản cụ thể
  • AI tạo sinh kết hợp các mục tiêu khác vào quá trình khử nhiễu để dẫn hình ảnh đi theo một hướng nhất định

Vì sao ngón tay và khuôn mặt bị lệch

  • Latent space không phải là không gian chứa nguyên xi các ảnh huấn luyện, mà là không gian biểu diễn mọi hình ảnh có thể có
  • Lực kéo ra xa khỏi nhiễu ưu tiên độ rõ nét của ảnh, còn lực kéo về phía nhãn văn bản tập trung vào việc làm hài lòng những hình ảnh có thể được gắn nhãn bằng đoạn văn bản đó
  • Caption ảnh thường không đề cập nhiều đến độ chính xác của bàn tay người hay số lượng ngón tay
    • Những nhãn phủ định như “no deformed hands” có hiệu quả hạn chế nếu có ít ảnh được gắn nhãn “deformed hands”
    • “polydactyly” có thể tốt hơn vì là nhãn gắn mạnh với việc thừa ngón tay
  • Khuôn mặt cũng gặp vấn đề tương tự, nên nhiều hệ tạo sinh có thành phần riêng để sửa mặt
    • Hệ thống cốt lõi có thể cho rằng chỉ cần trông giống khuôn mặt là đủ
    • Mắt người lại cực kỳ nhạy với độ chính xác của khuôn mặt, như hướng nhìn của hai mắt
  • Đưa tên tác giả như James Gurney vào prompt có thể cải thiện tính nhất quán của toàn bộ hình ảnh
    • Caption thông thường chủ yếu tập trung vào danh từ và đối tượng chính
    • Phong cách của tác giả là một gestalt trải trên toàn bộ pixel chứ không chỉ một phần của ảnh, nên có thể dẫn đến kết quả nhất quán hơn

Những công việc AI tạo sinh dễ thay thế

  • Nhu cầu của con người đối với chất liệu vật lý như hội họa thực, điêu khắc, tranh khắc gỗ hay thêu có lẽ sẽ không biến mất
  • Thành phẩm từ chất liệu vật lý vẫn có thể tiếp tục bị dùng để huấn luyện AI tạo sinh
    • Việc tác phẩm bị dùng để huấn luyện mà không được phép rồi được tận dụng để thay thế sinh kế có thể tạo cảm giác bị xâm phạm
    • Nhưng không phải hình ảnh nằm trong latent space theo một cách cụ thể nào đó; cùng lắm là với prompt phù hợp và một chút may mắn, có thể truy hồi ra ảnh tương tự
    • Không rõ có cách nào vừa cho phép hành vi sử dụng hợp lý của nghệ sĩ con người vừa chỉ hạn chế riêng việc dùng cho ML bằng pháp luật
  • AI tạo sinh có thể thay thế một số minh họa và bài viết mà nội dung thực sự không quan trọng
    • Ảnh header blog chỉ cần tương đối liên quan để lấp vào bố cục trang
    • Bài blog hằng tuần dạng spam phục vụ SEO
  • Những đầu ra này gần với nội dung kiểu đồ nội thất mà từ người làm đến người tiêu dùng cuối cùng đều không quá quan tâm
  • Các công việc đó vốn đã không được trả cao, đang biến mất rất nhanh, và ngay cả khi có quy định pháp lý mạnh cũng khó thấy lối thoát

Vì sao khó tạo ra một hình ảnh cụ thể

  • Tạo ra hình ảnh ấn tượng bằng AI tạo sinh là tương đối dễ, nhưng tạo ra một hình ảnh cụ thể đôi khi gần như bất khả thi
  • Cứ khoảng 1 trong 10 ảnh có thể khiến ta thấy “đẹp đấy”, nhưng điều đó không có nghĩa ảnh đó thực sự khớp với yêu cầu ban đầu
  • Trên các showcase ảnh tạo sinh như civitai, có thể so sánh prompt rất dài với ảnh kết quả
    • Trang này có thể chứa NSFW
    • Nhiều yếu tố trong prompt đôi khi hoàn toàn không xuất hiện trong ảnh
    • Một ý niệm tổng thể như “a mystical dragon” có thể nổi bật trong prompt nhưng lại không có trong ảnh
  • Cách sử dụng này gần với trò gacha hay máy đánh bạc để tạo tranh
    • Bạn nhập vào một prompt có nhiều ý tưởng thú vị rồi lặp lại cho đến khi ra thứ gì đó đủ hài lòng
    • Kết quả có thể hấp dẫn, nhưng có thể không phải chính hình ảnh bạn đã yêu cầu
  • Văn bản phải được chuyển từ prompt thực tế sang text latent space, rồi tiếp tục thành một hàm trong image latent space, nên nó hoạt động khá kém như công cụ điều khiển hình ảnh
    • Lượng văn bản có thể xử lý cùng lúc thường cũng chỉ vào khoảng 75 từ
    • Nếu dài hơn thì phải tách ra bằng các hệ dẫn hướng riêng trong cross attention

Đầu vào bằng hình ảnh là công cụ kiểm soát mạnh hơn

  • Hình ảnh được dịch sang image latent space tốt hơn nên trở thành điều kiện ràng buộc trực tiếp hơn so với văn bản
  • Prompt dựa trên hình ảnh có thể kiểm soát rất chi tiết nội dung và bố cục của kết quả tạo sinh
    • Tạo ảnh suy giảm về cùng line art như một ảnh khác
    • Tạo ảnh có cùng depth map lấy từ ảnh khác
    • Tạo ảnh khớp với tư thế lấy từ ảnh khác
    • Tạo ảnh có nội dung khác nhưng khớp phong cách của ảnh khác
    • Khớp các đường phối cảnh của ảnh khác
    • Khớp bảng màu của ảnh khác
  • Vấn đề là những ảnh hướng dẫn này đến từ đâu
  • Vai trò hiểu ý tưởng minh họa mong muốn rồi chuyển nó thành line art, phác thảo tư thế và phong cách trùng lặp rất nhiều với vai trò của họa sĩ minh họa truyền thống
  • Những công việc tạo ảnh có yêu cầu tinh vi rất khó hữu ích nếu không có họa sĩ minh họa

Quy trình AI khả dĩ cho minh họa thương mại

  • Họa sĩ minh họa thương mại có khả năng vẫn giữ được việc, nhưng sẽ cần học cách đưa AI vào một phần quy trình để đáp ứng tốc độ làm việc nhanh hơn
  • Điều đó không có nghĩa là phải bỏ vẽ để trở thành prompt engineer
    • Làm vậy sẽ lãng phí quá nhiều quá trình rèn luyện mà thu lại chẳng bao nhiêu
  • Một quy trình digital painting khả dĩ có thể là như sau
    • Tạo line art theo cách truyền thống, tập trung vào bố cục và ý tưởng cốt lõi
    • Để AI tạo sinh đề xuất khoảng 12 hướng tiếp cận về màu sắc và ánh sáng
    • Chọn 1 đến 2 phương án trong số đó
    • Tô đè lại gần như toàn bộ lên phần pixel do AI tạo ra, đồng thời điều chỉnh và sửa màu theo đúng ý đồ
  • Cách này có thể không phù hợp với những tác giả đặt nhiều tâm huyết và cảm xúc vào việc chọn màu
  • Không có một cách làm duy nhất phù hợp cho mọi tác giả; những người có deadline có thể dùng AI để lấp các bước ít quan trọng nhất và nhàm chán nhất
    • Cảnh đông người
    • Phong cảnh đô thị
    • Thảm thực vật
  • Nhiều hình ảnh cũng có phần đồ nội thất cần có nhưng không quan trọng như ảnh header của một trang, và đó đang là vùng đất của AI tạo sinh

Khoảng cách giữa sản phẩm và hướng nghiên cứu

  • Nghiên cứu AI tạo sinh ngày càng đi theo hướng cung cấp nhiều cách hơn để dùng đầu vào bằng hình ảnh nhằm chỉ đạo việc tạo ảnh
  • Các sản phẩm tung ra thị trường lại khó tích hợp trơn tru vào quy trình của họa sĩ minh họa
  • Việc thử nghiệm để đạt mức kiểm soát đủ hữu ích đã được thực hiện theo cách chạy mô hình dữ liệu mở trên máy tính cá nhân
  • Hình dung tương lai của minh họa thương mại gần với việc họa sĩ minh họa nắm phần cốt lõi, AI tạo sinh lấp các phần ít quan trọng hơn, rồi con người chỉnh sửa lại
  • Các sản phẩm AI tạo sinh cũng cần phát triển theo hướng hỗ trợ kiểu quy trình này

1 bình luận

 
GN⁺ 2023-08-22
Ý kiến trên Hacker News
  • Một quan điểm nữa có lẽ chẳng ai thích, nhưng tác động của AI đối với nghệ sĩ có lẽ sẽ giống như tác động của Spotify đối với ngành âm nhạc. Tức là rất có khả năng nó sẽ bóp chết dòng doanh thu của tất cả mọi người, trừ các nhà xuất bản và những nghệ sĩ/người chơi lớn
    Spotify về cơ bản đã xóa sổ số tiền đến từ phân phối vật lý, và còn tệ hơn cả nạn sao chép lậu vốn khi đó là không thể tránh khỏi. Ít nhất khi bị sao chép lậu, bạn không phải vừa không nhận được tiền vừa phải trả phí luật sư để đàm phán lại với hãng đĩa
    Những nơi như Adobe, OpenAI có vẻ sẽ trả cho nghệ sĩ vài đồng lẻ để họ vẽ tranh dùng huấn luyện mô hình, rồi bắt họ ký giấy từ bỏ kiểu “tôi không sao nếu không nhận được tiền từ tác phẩm AI này”, sau đó bán lại thành phẩm với giá cao ở những nơi như Splice: https://splice.com/features/sounds
    Cuối cùng, bản thân mô hình gần như không quan trọng; nó được huấn luyện bằng tác phẩm của ai mới là yếu tố khác biệt thật sự. Nhưng rồi sẽ thành “bức này do AI tạo nên không cần trả tiền cho anh/chị”

    • Hoàn toàn đồng ý. Tôi đã luôn nói rằng AI sẽ trở thành một cỗ máy tập trung của cải, thay thế hàng loạt loại công việc đa dạng hơn rất nhiều so với trước đây
      Máy móc trước kia chỉ thay thế ở mức 1–2 nhiệm vụ, nhưng nếu con người làm cho việc huấn luyện AI thật sự hiệu quả, nó sẽ thay thế hàng trăm nhiệm vụ cùng lúc. AI cũng có tác dụng làm tăng sự cô lập bằng cách giảm mức độ cần đến những người khác
      Vì những lý do này, tôi cho rằng thế giới sẽ tốt hơn rất nhiều nếu không có AI, và các công ty công nghệ đang phá hỏng thế giới bằng những sản phẩm quái vật của họ
    • Thực ra còn tệ hơn điều bạn nói. Nó cũng đã đập nát doanh số bán lẻ kỹ thuật số, đúng vào lúc mảng này đang trên đà cạnh tranh hoặc vượt qua doanh số bán phương tiện vật lý trước đây
      Spotify đã lấy cấu trúc kinh tế của sao chép lậu rồi phủ lên đó một lớp vỏ mỏng trông có vẻ hợp pháp
    • Điều mọi người bỏ lỡ là để tạo ra hình ảnh AI xuất sắc vẫn cần một ai đó, tức là họa sĩ đồ họa
      Thứ nhất, hình ảnh do AI tạo có tính ngẫu nhiên và gần như là đồ dùng một lần. Bạn có thể có một hình ảnh đẹp dùng được một lần, rồi sau đó thì sao? Rất khó xây dựng cả một chiến dịch bằng nó
      Thứ hai, nghệ thuật do AI tạo không được bảo hộ bản quyền, nên đối thủ bắt chước có thể thoải mái dùng hình ảnh marketing do AI tạo ra
      Ít nhất thì có thể đưa tác phẩm của một họa sĩ đồ họa được trả tiền vào AI làm seed, và hình ảnh AI dựa trên seed có thể được bảo hộ bản quyền. Nhưng họa sĩ đó sẽ làm tốt hơn một thực tập sinh không lương
    • Âm nhạc ghi âm dù Spotify là người đóng chiếc đinh cuối cùng hay là ai khác thì kiểu gì cũng đã đi theo hướng này
      Hồi nhỏ, chiều Chủ nhật cha tôi thường bật album lên và chỉ ngồi nghe. Thật sự chỉ nghe thôi. Bây giờ rất hiếm người làm như vậy
      Giờ nhu cầu lớn là âm nhạc phụ trợ khi lái xe, đọc sách, lướt Internet, viết code, dọn dẹp. Từ khoảng lúc âm nhạc trở nên có thể mang theo, cách tiêu thụ đã thay đổi căn bản, và Spotify chỉ là bên thắng trong cuộc cạnh tranh đó
    • Tôi tò mò nguồn cho lập luận “Spotify đã giết doanh thu phân phối vật lý và còn tệ hơn sao chép lậu” là gì
      So với thời kỳ đầu của nhạc số, tôi có ấn tượng rằng phân phối phương tiện vật lý thực ra đang tăng. Điều này liên quan đến việc số hóa âm nhạc nói chung hơn là do Spotify
      Xung quanh tôi, có vẻ nhiều người mua merch hoặc phương tiện vật lý để ủng hộ nghệ sĩ họ thích, hơn là để thực sự nghe nhạc trên định dạng vật lý
  • Những bài như thế này thường mặc định về tạo ảnh từ văn bản và prompt engineering, thường là vì người viết thiếu trải nghiệm trực tiếp với các mô hình đó. Nếu không phải làm cho vui thì cách đó về bản chất không phải câu trả lời đúng
    Công việc cần tính dự đoán được và khả năng kiểm soát giống với “hãy vẽ phần còn lại của những con cú theo cách tương tự những con cú khác tôi đã tự vẽ” hơn, kèm với photobashing và chỉnh sửa/ghép thủ công. Để tạo ra kết quả không nhàm chán, đây là một lĩnh vực lai đòi hỏi cả năng lực nghệ thuật lẫn kỹ thuật, tương tự 3D CGI
    Đây không phải vấn đề do mô hình hiểu ngôn ngữ tự nhiên kém; ngay cả khi xuất hiện thứ có thể hợp lý gọi là AGI, có lẽ khi đó cũng chưa chắc thay đổi nhiều. Prompt văn bản không có đủ dung lượng để chứa ý nghĩa

    • Phần trong bài viết nói rằng “họa sĩ minh họa thương mại sẽ giữ được việc, nhưng để duy trì tốc độ làm việc nhanh hơn, nhìn chung họ sẽ phải học cách dùng AI như một phần của quy trình làm việc” có đề cập thêm nội dung này
    • Tôi không nghĩ cần đến AGI để đạt tới điểm đó. Tôi cho rằng chỉ cần các mô hình hàng đầu bổ sung đầu vào đa phương thức vững chắc là được
      Một prompt chi tiết cùng vài ví dụ về phong cách mong muốn có vẻ là đủ. Tất nhiên điều đó không có nghĩa là không rất khó, nhưng tôi không thấy cần đột phá nền tảng cho việc này. Các thành phần cần thiết đã tồn tại
    • Bài gốc cũng bàn khá kỹ về quá trình đó
    • Về cơ bản bài tôi viết cũng nói chuyện này
      Nó giống như đưa AI đến trường, hoặc cho nó nhanh chóng học khái niệm mới bằng kiểu tải dữ liệu như trong Matrix. Các chuyên gia sẽ học cách làm đó, và thị trường cũng sẽ hình thành quanh những người muốn làm các việc như vậy
    • Các công cụ hiện nay nhìn chung rất tệ trong việc tận dụng tối đa dung lượng ý nghĩa của prompt văn bản. Midjourney rất giỏi tạo ra thứ đẹp mắt, nhưng yếu ở việc lắp ráp cảnh
      Gần đây tôi thử “một robot ngồi đối diện con người và chơi Magic: The Gathering”, nhưng ngay cả việc đưa con người vào tranh đã khó, và mô hình không biết đủ về MTG nên chỉ khớp mẫu ở mức “boardgame” hay “cardgame”
      Một số ảnh tạo ra tốt hơn hẳn ảnh khác, nên tôi muốn lấy bố cục bàn của một ảnh và robot của ảnh khác, nhưng hiện tại về cơ bản là không thể. “blend” cũng không dùng được cho mục đích đó
      Tôi không nghi ngờ là nó sẽ cải thiện, nhưng tôi tự hỏi liệu bên dưới có một giới hạn tổng quát hơn không. Cũng có thể đơn giản là thiếu dữ liệu. Ngay cả khi tìm Magic: The Gathering trên Google Images thì cũng khá thất vọng
      Một ví dụ khác, nếu yêu cầu một logo màu xanh phát sáng được khắc trên một khối đá nguyên khối, đôi khi logo có được khắc lên thật nhưng rất hiếm, và chưa bao giờ nó phát sáng màu xanh. Thường thì toàn bộ hoặc một phần khối đá lại chuyển thành màu xanh
  • Tôi đặc biệt thích đoạn “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, phần lớn họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc”
    Thỉnh thoảng tôi cũng vẽ minh họa, nhưng phong cách của tôi khá khác với những gì AI tạo sinh làm. Gần đây tôi đã phát hành bản 1.1 của một sách hướng dẫn trò chơi dùng hình Midjourney, và hiện đang đầu tư vào một họa sĩ minh họa đúng nghĩa. Vì hình của Midjourney thiếu cá tính
    Tuy vậy, vài tháng nữa có thể sẽ khác. Tôi vẫn sẽ tiếp tục làm việc với họa sĩ minh họa vì tính nhất quán của hình ảnh, nhưng cũng có khả năng AI sẽ tạo ra kết quả hào nhoáng hơn
    Điểm “2 tháng nữa là sẽ thay đổi” cũng hợp lý, nhưng câu đó đã được nói suốt một năm rưỡi nay rồi mà về chất thì vẫn chưa thay đổi. Chất lượng hình tạo sinh đã tốt hơn, nhưng chưa đến mức gọi là bước nhảy vọt về chất
    Nhân tiện, liên kết civitai dẫn tới https://sambleckley.com/writing/civitai.com/images nhưng đó là liên kết chết

    • Còn việc huấn luyện AI cá nhân bằng tác phẩm của chính mình thì sao? Gần đây Corridor Digital, trong một thử nghiệm tự động hóa hoạt hình, đã thuê họa sĩ minh họa tạo phong cách hoạt hình rồi dùng các bức vẽ đó để huấn luyện AI
      Liên kết: https://youtu.be/FQ6z90MuURM?t=329
    • Vấn đề là nếu họa sĩ minh họa thương mại trở nên hiệu quả hơn nhờ AI, tổng số việc làm trong lĩnh vực này sẽ giảm, hay kỳ vọng đối với minh họa thương mại sẽ tăng lên, khiến khối lượng công việc cũng tăng và số việc làm được giữ nguyên
  • Tôi cùng đối tác đang vận hành vài nghề tay trái nhỏ trên Internet. Một trong số đó là doanh nghiệp D2C dựa trên nội dung, vốn phụ thuộc nhiều vào minh họa tùy chỉnh cho mẫu quảng cáo hiển thị; CTR khá ổn và ở mức trung bình, nhưng CPC quá cao và ROAS thật sự tệ
    Vài tháng trước, chúng tôi đã A/B test giữa họa sĩ minh họa thường dùng và Stable Diffusion, và kết quả khá ấn tượng. CTR tăng gần 20% và CVR cũng cải thiện đều đặn
    Tôi không đồng ý với lập luận trong bài rằng hình ảnh do AI tạo hoạt động tốt nhất ở những doanh nghiệp nơi nội dung thực ra không quan trọng. Doanh nghiệp này là một phản ví dụ rất tốt. Trong trường hợp của chúng tôi, hình ảnh do AI tạo hợp với khách hàng mục tiêu hơn, đồng thời cho phép cá nhân hóa chi tiết hơn nhiều với chi phí thấp hơn trước
    CPA cũng giảm đáng kể, và nhờ kiểm soát được chặt chẽ các biến thể nội dung sáng tạo, chúng tôi có thể tối ưu theo thời gian thực cho từng phân khúc khán giả. Thời gian ra mắt chiến dịch mới cũng giảm một nửa, và các cuộc bàn luận về sắc thái thiết kế, trễ hạn, bế tắc sáng tạo cũng biến mất
    Tôi có cảm xúc phức tạp về việc yếu tố con người trong quá trình sáng tạo bị giảm đi, nhưng xét thuần từ góc độ growth hacking, đây là điều thay đổi cuộc chơi, và chúng tôi có số liệu để chứng minh
    Nhìn chung tôi xem đây là lợi ích ròng. Nó không nhất thiết là dấu chấm hết cho họa sĩ minh họa con người, nhưng sẽ buộc họ thích ứng nhạy hơn với nhu cầu của khách hàng. Ngay cả một doanh nghiệp nội dung mà cũng gặp ma sát lớn như vậy trong việc tìm nguồn cung cấp hình ảnh thì thật vô lý
    Dù sao thì cũng có hiệu quả và có linh hồn. Robot phần lớn đã làm tốt phần trước, và đôi khi cũng khiến ta ngạc nhiên ở phần sau

    • Đoạn “các cuộc bàn luận về sắc thái thiết kế, trễ hạn, bế tắc sáng tạo đã biến mất” làm tôi nhớ tới cảnh “có thể đổi biểu tượng sang màu xanh hoa bắp không” trong Fight Club
      Tôi tò mò không biết lý do số vòng trao đổi qua lại giảm là nhờ phản hồi tức thì, có tính tương tác — tức là ít phải đối diện với con người hơn — hay là do niềm tin và sự ủy thác dành cho máy móc
      Nếu theo kiểu “máy đã tạo biểu tượng này dựa trên mô tả của tôi, nên không cần nghi ngờ lựa chọn màu sắc”, thì rốt cuộc đó là vấn đề kinh điển: coi máy là không thể sai và là chuyên gia hơn con người. Có lẽ là sự pha trộn của cả hai
    • Tôi nghĩ “quan trọng” ở đây và “quan trọng” trong bài gốc mang nghĩa khác nhau. Trong nhà hàng, nội thất là quan trọng, và nội thất sai có thể gây hại cho việc kinh doanh. Nhưng so với món ăn thì về bản chất nó vẫn là thứ yếu
      Mức độ quan trọng của nội thất trong một không gian nằm trên một phổ, từ khu vực chờ chỉ ở lại ngắn cho đến văn phòng kiến trúc sư, và nghệ thuật thương mại cũng không khác. Nếu hình ảnh đó thật sự vô nghĩa thì đã chẳng cần đặt nó ở đó
      Các đồ họa không mang thông tin trong phần lớn bộ slide PowerPoint được thiết kế không chuyên có thể còn ít quan trọng hơn. Ngược lại, hình mở đầu dàn trang hai trang của một bài chuyên đề trên tạp chí thì, trừ khi đó là bài viết về hình ảnh do AI tạo, tôi nghĩ xác suất được tạo bằng AI gần như bằng 0. Ngay cả trong trường hợp đó, khả năng cao là các chuyên gia đã mất nhiều thời gian để tinh chỉnh hình thức hơn so với phần còn lại
      Trong quy trình làm đồ họa chuyên nghiệp, tính cụ thể và khả năng kiểm soát đến từng pixel là cực kỳ quan trọng. Dù những người không phải nhà thiết kế chuyên nghiệp nói gì, các công cụ hiện nay về cơ bản không phù hợp với công việc đó. Chính giao diện đã sai
      Adobe hoặc một bên nào khác trong ngành hiểu điều cần thiết có thể giải quyết việc này, nhưng hình hài của nó sẽ không giống Midjourney
    • Tôi tò mò đó là loại hình kinh doanh nào và các bạn đã tạo những hình ảnh gì. Tôi cũng đang nghĩ đến việc thử thứ tương tự cho doanh nghiệp của mình
    • Những ưu điểm của AI mà bạn đang khoe là những thứ một nghệ sĩ chuyên nghiệp là con người hoàn toàn không thể đáp ứng. Con người không thể thực hiện hàng trăm lần chỉnh sửa mà vẫn có lãi
      “Nhạy hơn với nhu cầu của khách hàng” khác với việc phải đọc được suy nghĩ của khách hàng. Nếu bạn nghĩ đây không phải là tín hiệu tận thế đối với họa sĩ minh họa con người trong thị trường cụ thể này, thì bạn đang tự lừa mình
  • Tôi đã thử để AI viết bài cho mình và kết quả thật kinh khủng. Ngược lại, khi thử bỏ qua các công cụ AI như trình kiểm tra ngữ pháp, trình tóm tắt, công cụ viết lại, ứng dụng chuyển giọng nói thành văn bản, tôi thấy quá trình viết trở nên ì ạch
    Với tôi, điểm trung gian là phù hợp nhất. Tôi chỉ dùng AI tạo sinh ở các bước trung gian của công việc, không dùng cho đầu vào là ý tưởng hay đầu ra là bản nháp thực sự
    Cách tôi viết là như sau. Ý tưởng đến từ suy ngẫm hoặc các cuộc trò chuyện trên mạng xã hội. Những chủ đề được bàn ở đó ít nhất đã có mức độ liên quan nhất định được kiểm chứng
    Sau đó tôi ngồi khoảng 10 phút và đọc suy nghĩ của mình cho một công cụ như AudioPen ghi lại; công cụ này tóm tắt nội dung 10 phút thành 5–6 đoạn. Đây là phần có AI. Khi công cụ đề xuất vài cấu trúc đoạn, tôi thử thay đổi cho đến khi tìm được cái tốt
    Sau đó tôi tự viết bản nháp theo dàn ý đó. Ngoài kiểm tra ngữ pháp ở cuối, tôi không dùng thêm công cụ AI nào nữa. AI là một đối tác viết lách tuyệt vời, nhưng là một nhà văn tệ hại

    • Kinh nghiệm của tôi đến nay cũng giống vậy. Nó hữu ích để dựng cấu trúc hoặc gợi ý những thứ bị bỏ sót, nhưng hiện tại là một cây bút rất kém
  • Câu “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, nhìn chung họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc” đúng y như thực tế tôi đã thấy
    Ngoài cộng đồng tạo media bằng AI, nhiều người vẫn nghĩ việc này chỉ là nhập văn bản rồi nhận kết quả. Trên thực tế, để có được đúng kiểu hình ảnh mong muốn, người ta phải xây dựng toàn bộ quy trình làm việc
    Ví dụ: https://old.reddit.com/r/StableDiffusion/comments/14ye2eg/co...
    Hình thứ hai là đầu ra, nhưng hình đầu tiên thú vị hơn. Đó là giao diện dựa trên node, tương tự những gì thường thấy trong các công cụ phát triển game như Unreal Engine: https://docs.unrealengine.com/5.2/en-US/nodes-in-unreal-engi...
    Nó giống như việc kết nối các API để có được hình ảnh kết quả. Việc tạo ảnh trong tương lai có lẽ sẽ gần với lập trình backend hơn là vẽ tranh thực sự. Vì phần vẽ thực tế sẽ được tự động hóa, còn sự sáng tạo nằm ở chính quy trình làm việc
    Tất nhiên một ngày nào đó phần quy trình làm việc cũng sẽ được tự động hóa, nhưng máy tính vẫn chưa thể đọc được suy nghĩ đến mức hiểu ý định của người dùng, nên chuyện đó còn xa

  • Bài viết có vẻ quá nghiêng về hiện tại. Các mô hình kiểu Stable Diffusion đã rất thành công với một kỹ thuật cụ thể, nhưng cho rằng phương pháp đó sẽ được cải thiện vô hạn là ngây thơ
    “AI” tạo sinh sẽ có nhiều hình thái. Cuối cùng, nó có khả năng loại bỏ một phần đáng kể yếu tố kỹ pháp trong sáng tạo, qua đó lấy đi thu nhập và mức độ liên quan của nghệ sĩ cũng như chủ sở hữu nội dung
    Điều đó sẽ không xảy ra chỉ sau một đêm, nhưng trong khoảng 10 năm tới, AI có lẽ vẫn giống một công cụ hữu ích hơn là một mối đe dọa
    Tôi dự đoán đến một lúc nào đó, AI tạo sinh sẽ trở thành hệ thống đa giác quan bao gồm thị giác, âm thanh và xúc giác. Những hệ thống như vậy sẽ tạo ra các biểu đạt mới và chính xác dựa trên mô hình vật lý của đối tượng và môi trường, tận dụng mô tả phong phú cùng khả năng nhận biết sâu về ngữ cảnh văn hóa
    Chúng sẽ tư duy bằng đối tượng và quan hệ chứ không phải pixel, rồi mô phỏng, render và lọc các yếu tố đó để khớp với mong muốn của người dùng
    Tôi ủng hộ nỗ lực của các nhà văn và diễn viên nhằm tự bảo vệ trước cạnh tranh, nhưng rốt cuộc tôi nghĩ điều đó sẽ vô ích. Diễn biến pháp lý trong lĩnh vực này sẽ rất thú vị
    Các hệ thống tạo sinh trong tương lai có thể cần dấu vết kiểm toán cho thấy chúng đã có được hiểu biết về thế giới như thế nào, nhằm chứng minh rằng không có việc huấn luyện trái phép. Nhưng điều này chỉ nâng tiêu chuẩn lên một chút, chứ không ngăn được việc suy ra các quan hệ quan trọng bằng những cách khác, chẳng hạn như mô tả cấp cao theo kiểu clean room
    Ví dụ, việc huấn luyện AI bằng các tác phẩm có bản quyền của Harrison Ford hoặc hình ảnh chụp ở nơi công cộng có thể là bất hợp pháp, nhưng nếu rút gọn Harrison Ford thành một tập hợp đặc điểm rồi truyền cho hệ thống tạo sinh, nó có thể tạo ra thứ không thể phân biệt với Harrison Ford thật. Nếu có thể ghi lại quy trình này, có vẻ hệ thống pháp luật không có nhiều cách để ngăn chặn. Tất nhiên tôi không phải chuyên gia trong lĩnh vực này
    Nhân tiện, tôi không thích “AI” hiện nay. Đặc biệt là LLM, tôi thấy chúng không đáng tin cậy và nhìn chung vô dụng. Nghệ thuật do AI tạo ra phần lớn cũng nhàm chán, không chính xác hoặc thiếu sức thuyết phục ở đâu đó. Dù vậy, tôi nghĩ xu hướng đang ngày càng rõ ràng hơn

  • Tôi không hiểu vì sao quan điểm “các họa sĩ minh họa thương mại sẽ vẫn giữ được việc làm, nhưng để duy trì tốc độ làm việc nhanh hơn, nhìn chung họ sẽ phải học cách dùng AI như một phần trong quy trình làm việc” lại bị xem là không được ưa chuộng. Nó có vẻ là con đường logic trong tương lai
    Giống như CoPilot không thay thế tôi, nhưng khiến một số đoạn mẫu trở nên đỡ đau đầu hơn nhiều và giúp tôi tránh được trang giấy trắng hay tình trạng bí khi chuẩn bị viết một hàm
    Bắt đầu từ một thứ gì đó rồi chỉnh sửa cho đến khi nó thành hình dạng cần thiết vẫn tốt hơn là bắt đầu từ con số không. Ngay cả khi cuối cùng phải viết lại 80–99% cũng vậy
    Nghệ sĩ cũng có thể được khơi gợi sáng tạo khi thấy vài ví dụ về việc line art của mình có thể trông như thế nào, rồi sau đó làm tiếp theo ý muốn

    • Quan điểm đó thì được tôi ưa chuộng. Tôi thích ý tưởng các họa sĩ minh họa thương mại thêm AI tạo sinh vào hộp công cụ của họ
      Những họa sĩ minh họa mà tôi muốn hợp tác nhất là những người tận dụng mọi công cụ có thể dùng để tạo ra hình ảnh tốt nhất có thể
  • Tôi đồng ý với phần lớn, nhưng không đồng ý ở phần tạo ra một hình ảnh cụ thể. Đó rõ ràng là một kỹ năng có thể phát triển được
    Tôi đã dạy nhiều người cách đơn giản hóa prompt cho AI tạo ảnh và chọn ngôn ngữ phù hợp. Kỳ lạ là mọi người thường nhét vào rất nhiều thứ linh tinh không cần thiết, có lẽ gần như một dạng mê tín kiểu “mảnh câu này vài lần trước có hiệu quả”
    Như bài viết nói, cách tiếp cận lai dùng nó như một công cụ trong chuỗi nhiều công cụ mới là hướng đi phía trước
    Cũng có những khái niệm AI hoàn toàn không hiểu. Ví dụ hiện tại Midjourney cực kỳ chật vật với những thứ như “máy ủi”, “nhân mã”, “cung thủ fantasy”. Những thứ này chắc chắn sẽ được sửa trong các phiên bản mô hình mới có dữ liệu huấn luyện tốt hơn, và trong quá khứ chúng cũng đã được sửa như vậy
    Khó khăn thật sự đến từ các chi tiết nhỏ hoặc thông tin ngữ nghĩa. Ví dụ, rất khó yêu cầu một cảnh chân thực/giống ảnh chụp trong đó cả hậu cảnh cũng đều nét, và dùng các từ khóa như “focus stacking” cũng không hiệu quả lắm. “selfie” là từ tốt nhất mà chúng tôi tìm ra, nhưng tiếc là nó có tác dụng phụ lớn
    Có thể trong dữ liệu huấn luyện không có đủ ví dụ mô tả cụ thể thuộc tính đó, nhưng nói thật, ngay cả việc học các từ tiếng Anh để diễn đạt khái niệm như vậy cũng đã khó rồi
    Với các chi tiết nhỏ, cách tiếp cận hiện tại sẽ không mở rộng được để xử lý những yêu cầu kiểu “sáu khối lập phương màu xanh, mỗi khối gắn một tam giác đỏ, được xếp thành hình kim tự tháp, với một quả bóng vàng cân bằng ở phía trên”. Tuy nhiên, như tác giả nói, những thứ như vậy có khả năng sẽ được xử lý bằng các asset tạo riêng và kỹ năng Photoshop tối thiểu

    • Tất cả những điều này không liên quan đến sự sáng tạo hay tư duy nguyên bản, được rèn luyện về thị giác, vốn cần thiết để hình dung ra hình ảnh hữu ích về mặt thương mại. Đó là kỹ năng thực sự được học qua nhiều năm học tập và kinh nghiệm, nhưng các quản lý và dân IT quá thường xuyên bỏ qua
      Khi nói về vấn đề kỹ thuật của prompt, phần đó đã bị bỏ sót hoàn toàn
      Vấn đề của prompt không phải là các khối lập phương xếp chồng. Hãy bảo 10 kỹ sư phần mềm, 10 người trong đội bán hàng và 3 quản lý cấp cao nghĩ ra ý tưởng hình ảnh cho quảng cáo, kết quả sẽ là những hình ảnh rác trên nền đen, robot, anime, bản sao tệ của thứ họ đã thấy ở đâu đó và vô thức ghi nhớ, và 0 ý tưởng thị giác thực sự hiệu quả
      Các nhà thiết kế và họa sĩ minh họa phải liên tục chống lại và lật ngược những thứ sáo rỗng cùng các ý tưởng tệ hại đó để tạo ra sản phẩm ổn
    • Có những mô hình hoạt động khác đi, như các mô hình mới của Google, xử lý các việc như đếm số lượng tốt hơn nhiều so với mô hình mã nguồn mở. Tôi không biết chúng đã dùng được chưa, nhưng có bài báo rồi. Những thứ như Imagen và các mô hình tốt hơn xuất hiện sau đó
  • Tôi cũng nhìn GPT và code gần như y hệt. Tôi đã thấy những người thông minh không viết code ném yêu cầu cho GPT và nhận được thứ chạy được, nhưng từ “viết giúp tôi cái tự động bấm phím theo bộ đếm giờ” đến “hãy cập nhật repository để client xử lý logic nghiệp vụ và chức năng này” là một bước nhảy khổng lồ
    Theo góc nhìn của tôi, vẫn cần người có tư duy nhà phát triển làm việc, còn AI chỉ khiến cuộc sống trong quá trình đó dễ hơn một chút
    Tôi nghĩ lĩnh vực nghệ thuật cũng vậy. Lấy được một hình ảnh trông có vẻ ổn thì dễ, nhưng để có hình ảnh cụ thể và có ý nghĩa, thường cần rất nhiều hậu kỳ mà người bình thường không làm được

    • Đúng, nhưng có vẻ mọi người đang giả định rằng những giới hạn này sẽ tồn tại lâu dài
      Chúng ta đã thấy những bước tiến nhảy vọt. Các công cụ lập trình dựa trên LLM cũng đang tốt lên, bản thân LLM cũng đang tốt hơn, và kích thước ngữ cảnh cũng tăng lên. Sự quan tâm dành cho LLM cũng đang kích thích việc phát triển các cách tiếp cận mới hiệu quả hơn
      Chỉ vài năm nữa thôi, dù là dòng JEPA của Lecun, một super-coder lai nào đó mà DeepMind đang làm, hay LLM mã nguồn mở, chúng cũng sẽ vượt xa GPT-4 trong lập trình