- Thử nghiệm biến các ca khúc nhại của Weird Al Yankovic trở lại thành giọng của ca sĩ gốc cho thấy sao chép giọng nói không chỉ là công nghệ đổi giọng đơn thuần, mà còn làm lộ cả phát âm, ngữ điệu và thói quen hát
- Cộng đồng A.I. cover phát triển nhanh quanh A.I. Hub Discord và Hugging Face, nơi mô hình, công cụ và mẹo được chia sẻ giữa các thử nghiệm phi thương mại và vùng xám bản quyền
- Dù dùng các mô hình của Michael Jackson, Madonna, Kurt Cobain, Lady Gaga hay Lorde, quãng giọng của phần vocal đầu vào và cách phát âm cường điệu đặc trưng của Weird Al vẫn còn lại, khiến kết quả giống cái bóng của Weird Al hơn là ca sĩ gốc
- Google Colab và AICoverGen cho phép cả người không có GPU cũng làm A.I. cover, còn các ứng dụng như Kits AI, Voicify AI, Voiceflip, voicemy.ai và covers.ai đang hạ thấp rào cản sử dụng
- Áp lực bản quyền từ RIAA và việc Discord chặn vĩnh viễn A.I. Hub cho thấy sao chép giọng nói đã vượt khỏi phạm vi thử nghiệm vui vẻ trên Internet để trở thành xung đột pháp lý giữa vận hành cộng đồng và ngành công nghiệp âm nhạc
Thử nghiệm trả các bài hát của Weird Al về cho ca sĩ gốc
- Bắt đầu từ tiền đề của bộ phim Weird: The Al Yankovic Story, tác giả thử dùng A.I. sao chép giọng nói để hình dung nếu các bài parody của Weird Al Yankovic là bản gốc và các ca sĩ nguyên tác hát lại chúng thì sẽ nghe ra sao
- Đối tượng đầu tiên là trường hợp Michael Jackson hát Weird Al trong bài “Eat It”
- Bản gốc của Michael Jackson được chỉnh thấp hơn bản parody của Weird Al, trong khi phần vocal lại hát cao hơn, nên tác giả thử tăng vocal lên một quãng tám và hạ toàn bài xuống nửa cung để khớp
- Ngay cả khi bỏ qua các artifact, kết quả nghe vẫn giống Michael Jackson bắt chước Weird Al hơn là Michael Jackson thật, và cách phát âm cường điệu để làm nổi bật punchline vẫn còn nguyên
- Tác giả thử 6 mô hình giọng A.I. của Michael Jackson nhưng khác biệt kết quả không lớn
- Giọng nói và cách phát âm đặc trưng của Weird Al khó biến mất ngay cả khi bị phủ lên bằng giọng A.I. khác, để lại dư âm kỳ quái xuyên suốt loạt thử nghiệm
Cộng đồng A.I. cover và cấu trúc phân phối mô hình
- Trung tâm của cộng đồng A.I. cover là Discord A.I. Hub với hơn 500.000 thành viên, nơi mọi người trao đổi mẹo, công cụ, kỹ thuật cùng các link tới bài gốc và bài cover
- Cộng đồng này mỗi ngày thêm hàng trăm mô hình giọng mới vào cơ sở dữ liệu thread trên Discord
- Các nhóm phổ biến không chỉ có nhạc sĩ mà còn trải rộng sang nhân vật ảo, nhân vật anime, YouTuber, streamer và người nổi tiếng
- Ví dụ mô hình gần đây gồm Francoise Hardy, Donald Duck, toàn bộ thành viên VCHA, Markiplier, Tom Waits, LeBron James, Knuckles và Adolf Hitler
- Việc thảo luận mô hình và chia sẻ link diễn ra trên Discord, nhưng bản thân các file thì gần như đều được tải lên Hugging Face
- Vào tháng 8/2023, Hugging Face huy động 235 triệu USD ở vòng Series D với sự tham gia của Google, Amazon, Nvidia, Salesforce, AMD, Intel, IBM và Qualcomm, đạt định giá 4,5 tỷ USD
- A.I. Hub yêu cầu link Hugging Face khi đăng ký mô hình, và AICoverGen cũng khuyến nghị dùng link trực tiếp tới mô hình Hugging Face trong UI và ví dụ của mình
- Một số người dùng gom hàng trăm đến hàng nghìn mô hình do người khác tạo vào các kho lưu trữ khổng lồ
- Một tài khoản đang giữ gần 4.000 mô hình giọng của người nổi tiếng, nhạc sĩ, nhân vật hoạt hình và nhân vật YouTube
Áp lực bản quyền và việc chặn A.I. Hub
- RIAA đã biết tới A.I. Hub và phản đối việc tải lên các bộ dữ liệu từ ca khúc có bản quyền gốc dùng để huấn luyện mô hình giọng
- Tháng 6/2023, RIAA yêu cầu Discord đóng A.I. Hub, gỡ các link tới file vi phạm và tiết lộ danh tính người tải lên
- Sau đó, A.I. Hub áp dụng quy định nghiêm ngặt với các link bộ dữ liệu bản quyền, đặc biệt là các file tách vocal đã qua xử lý A.I. dùng để huấn luyện mô hình giọng mới
- Tại thời điểm bài viết được công bố, chưa ghi nhận trường hợp RIAA hành động trực tiếp với bản thân các mô hình A.I. hay người tạo mô hình
- Hai ngày sau khi bài viết được đăng, Discord đã chặn vĩnh viễn A.I. Hub
- Ernesto Van der Sar của TorrentFreak là người đưa tin đầu tiên
- Theo các báo cáo chưa được xác minh trên máy chủ mới, có người đã sửa bài đăng để thêm link nội dung có bản quyền, khiến Discord không còn lựa chọn nào ngoài xử lý theo DMCA
Kết quả cover Weird Al bằng nhiều mô hình ca sĩ khác nhau
- Trong thử nghiệm để Madonna hát “Like A Surgeon”, tác giả dùng mô hình được huấn luyện 500 epochs trên 13 phút acapella chất lượng phòng thu sạch từ album Like a Virgin năm 1984
- Quãng giọng của Madonna cao hơn Weird Al rất nhiều nên tác giả áp dụng pitch shift lên một quãng tám
- Kết quả nghe như giọng nữ, nhưng chỉ hơi giống Madonna thập niên 1980 một cách mờ nhạt
- Trong thử nghiệm để Kurt Cobain hát “Smells Like Nirvana”, tác giả thử nhiều mô hình và mô hình tốt nhất là do YouTuber @Cleberslk tạo ra
- Người tạo viết rằng mình đã “vội vàng làm mô hình bằng điện thoại”
- Kết quả pha lẫn một chất giọng kiểu châu Âu khó giải thích
- Trong thử nghiệm để Lady Gaga hát “Perform This Way”, tác giả dùng mô hình RVC do @udrivemecrazy tạo
- Mô hình này chỉ dùng 5 phút “acapella rất sạch”
- Tác giả cũng thử để Lorde hát “Foil”
- Đây là ca khúc nằm trong Mandatory Fun, album phòng thu thứ 14 và cũng là album cuối cùng của Weird Al
- Kết quả là một trong số ít thử nghiệm khiến tác giả thấy ưng ý, dù cũng có thể chỉ là do phán đoán đã bị mài mòn
Công cụ sản xuất và rào cản sử dụng đang hạ thấp
- Để chạy suy luận mô hình cục bộ thường cần PC có GPU phù hợp, nhưng Google Colab cho phép cả người không có GPU tương thích hoặc ngại dùng terminal vẫn chạy workflow A.I. tạo sinh trên máy chủ
- Vì Mac không có GPU Nvidia cần thiết cho việc suy luận các mô hình này, tác giả dùng notebook Colab của AICoverGen
- AICoverGen là gói xử lý các bước tạo A.I. cover từ mô hình có sẵn và có cung cấp web UI
- Mất vài phút để khởi động, và mỗi bài hát được tạo trong chưa tới 1 phút
- Vì Colab và WebUI vẫn có thể gây nặng nề cho người không chuyên kỹ thuật, nhiều startup đang cung cấp A.I. vocal cover và huấn luyện mô hình dưới dạng ứng dụng đơn giản hơn
- Ví dụ được nêu gồm Kits AI, Voicify AI, Voiceflip, voicemy.ai, covers.ai
- Nhạc sĩ Dallas Dustin Ballard của kênh There I Ruined It có 3,1 triệu người theo dõi trên TikTok và 700.000 người đăng ký YouTube, và đã thử nghiệm sao chép giọng nói trong 4 tháng gần đây
- Các ví dụ gồm video The Beach Boys hát “Hurt” của Nine Inch Nails theo giai điệu “Surfin’ USA”, phiên bản “Straight Outta Compton” kiểu Hank Williams, và bản làm lại Red Hot Chili Peppers “Snow (Hey Oh)”
- Ballard tự thu vocal mới để phần nào bắt chước quãng giọng và phong cách của từng ca sĩ rồi mới áp dụng A.I. sao chép giọng nói
- Cách này phù hợp hơn với các tác phẩm thay đổi lớn lời ca, giai điệu, nhịp và ngữ điệu so với bản gốc
- Với công nghệ hiện tại, nếu muốn dự án Weird Al nghe thuyết phục hơn thì tốt hơn hết là có ai đó hát trước lời của Weird Al theo đúng quãng giọng và phong cách của ca sĩ bị parody, rồi mới áp dụng sao chép giọng nói lên trên
- Singing Voice Synthesis và Singing Voice Conversion là các lĩnh vực nghiên cứu đang tiến rất nhanh
- so-vits-svc, công cụ mà Ghostwriter dùng vào tháng 4/2023 trong “Heart on My Sleeve” để bắt chước Drake và The Weeknd, đã bị chủ kho lưu trữ archive, còn RVC đã trở thành công cụ được dùng rộng rãi
- Các nhà nghiên cứu đang cho thấy khả năng “beautify” âm sắc vocal và ngữ điệu, tổng hợp tự nhiên vocal mới từ văn bản, và chuyển chúng sang phong cách của nghệ sĩ khác
Parody phong cách và những mô hình còn trống
- Weird Al Yankovic nổi tiếng là ca sĩ parody và nghệ sĩ accordion, nhưng cũng là một nhạc sĩ sáng tác độc đáo
- Nhiều bài được yêu thích của ông là parody phong cách, không nhại trực tiếp một ca khúc cụ thể mà riff theo phong cách của nghệ sĩ khác
- Tác giả cũng muốn nghe các phiên bản tổng hợp trong đó Mark Mothersbaugh của Devo hát “Dare to Be Stupid”, David Byrne hát “Dog Eat Dog”, hay James Taylor hát “Good Old Days”, nhưng các mô hình A.I. sẵn có của những ca sĩ này không có trên A.I. Hub
- Sau một thời gian hoạt động trong A.I. Hub, tác giả thấy cộng đồng này có vẻ thiên về người trẻ, nên một số nghệ sĩ cũ hầu như không xuất hiện trong mô hình, cover hay yêu cầu
- Phần lớn hoạt động trên A.I. Hub là phi thương mại
- Các mô hình được phát hành miễn phí
- Mọi người tiếp tục chia sẻ các A.I. cover họ đăng lên YouTube
- Dù vậy, trong kênh #request-a-model cũng có những người nhận huấn luyện mô hình giọng có trả phí
Xung đột đạo đức và pháp lý quanh sao chép giọng nói
- Giống như các tranh luận về A.I. tạo sinh nói chung, công cụ sao chép giọng nói cũng khó tránh khỏi các vấn đề đạo đức và tính hợp pháp
- Lập trường của các nghệ sĩ rất khác nhau
- Holly Herndon tỏ ra tích cực với việc dùng giọng của mình theo cách này
- Grimes cho phép cả sử dụng thương mại nếu có chia sẻ doanh thu
- Một số nghệ sĩ khác không muốn điều đó dù là miễn phí
- Tháng 4/2020, Jay-Z yêu cầu YouTube gỡ nhiều bản audio parody deepfake dùng giọng của mình
- Khi đó chúng là parody rất lộ liễu, nhưng nếu không xin phép mà biến Jay-Z thành người góp giọng cho đĩa đơn mới hay người giới thiệu sản phẩm trong quảng cáo thì có thể cấu thành vi phạm bản quyền hoặc quyền khai thác hình ảnh cá nhân
- Những người sáng tạo ẩn danh như Ghostwriter dùng tên tuổi và giọng nói của nghệ sĩ nổi tiếng để kéo sự chú ý cho bài hát của họ, tạo nhạc mà không có sự biết tới, đồng ý hay đền bù cho nghệ sĩ đó
- Với “Heart on My Sleeve”, ngành công nghiệp âm nhạc đã yêu cầu gỡ bài khỏi mọi nền tảng streaming
- Sau đó Ghostwriter còn đưa lên X và TikTok một ca khúc khác dùng các phiên bản A.I. của Travis Scott và 21 Savage; TikTok xóa rất nhanh nhưng trên X thì vẫn còn
- Ngành công nghiệp thu âm có lẽ sẽ tiếp tục siết việc sử dụng thương mại các vocal A.I., nhưng có vẻ sẽ khó ngăn chặn bản thân việc tạo vocal A.I.
1 bình luận
Ý kiến trên Hacker News
Khá ngạc nhiên khi mỗi lần các công cụ kiểu này chạy lại truyền đi một bản sao của mô hình. Dù là notebook Google Colab hay máy cục bộ cũng vậy, nên tôi tự hỏi liệu chi phí băng thông của Hugging Face có khổng lồ không, hay mình đang bỏ sót điều gì
Có thể họ có thỏa thuận peering, hoặc dùng cache rất mạnh
Với chi phí truyền 100TB ra ngoài trên AWS, bạn có thể duy trì 10Gbit/s suốt 24/7, và nếu dùng 100% thì vượt 3PB mỗi tháng. Băng thông từ trước đến nay luôn rẻ đến phi lý
Tốt hơn nữa là nó hỏi trước muốn lưu mô hình ở đâu
Bài này chỉ nói về khía cạnh âm nhạc của sao chép giọng nói bằng AI, nhưng lĩnh vực phức tạp hơn là thay thế diễn viên lồng tiếng nói chung trong phim, game và hoạt hình. Ví dụ: https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
Ca sĩ muốn bị thay thế thì cần hậu kỳ đáng kể, đồng thời họ cũng có tiền và sức mạnh pháp lý đủ để không bị cạnh tranh giáng đòn quá nặng, nhưng diễn viên lồng tiếng thì khác. Chỉ với thiết lập mặc định của ElevenLabs hoặc các lựa chọn mã nguồn mở như Bark, VALL-E X cũng đã có thể sao chép ở mức tạm được; họ vốn đã bị trả lương thấp, làm theo hợp đồng, và cũng không có quyền sở hữu pháp lý đối với giọng nói của mình. Sản phẩm lồng tiếng thường thuộc về khách hàng, và khách hàng đó có thể cũng không có nhiều động lực để tích cực bảo vệ giọng nói
Tôi muốn viết một bài blog về ảnh hưởng của văn hóa diễn viên lồng tiếng Persona 5 và Genshin Impact, nhưng có lẽ phần lớn độc giả Hacker News sẽ chẳng mấy quan tâm
Kín đáo hơn nữa, họ có thể cung cấp trợ lý giọng nói và nhét vào điều khoản rằng “chúng tôi có thể dùng bản sao giọng nói của bạn cho bất kỳ mục đích nào”. Các diễn viên lồng tiếng hiện tại sẽ mất việc, và chỉ còn một nhóm nhỏ muốn giọng người thật. Với một số dự án, điều đó sẽ không quan trọng, nên tình hình có vẻ sẽ khá hỗn loạn
Dù sao tôi cũng muốn đọc
Ca sĩ không muốn bị phần mềm sao chép, nhưng giọng của diễn viên lồng tiếng thì lại bị xem như thứ có thể tùy ý sử dụng
Thị trường này có khả năng mở ra cho các doanh nghiệp nhỏ không đủ khả năng thuê diễn viên lồng tiếng chuyên nghiệp. Tôi nghĩ AI đang mở ra thị trường mới, chứ không thực sự giết chết việc làm của những người thật sự có tài
Chà, giờ tôi mới nhận ra bất kỳ ai cũng có thể giữ nguyên lời của Weird Al và làm lại bằng giọng của ca sĩ gốc. Có khi đến giờ ăn trưa ta sẽ được nghe Michael Jackson hát Just Eat It
Tôi liên tục ngạc nhiên về cách công nghệ AI mới có thể được sử dụng. Tất nhiên, theo luật bản quyền ở hầu hết các quốc gia, việc đó có khả năng là bất hợp pháp
Bản thân Weird Al có xin phép, nhưng việc parody không phải là vi phạm bản quyền thì đã được xác lập khá vững. Nếu một luật sư giỏi lập luận, cũng nên có khoảng trống cho màn trình diễn parody bằng giọng AI
Trong số các cách dùng công nghệ này mà tôi từng thấy, thứ tôi thích nhất là The Beach Boys hát Hurt. Lần đầu tiên tôi gần như không cảm nhận thấy artifact một cách nghiêm túc, và dù vốn là một tổ hợp nghe chẳng hợp lý chút nào, nó lại khớp đến đáng ngạc nhiên
Nên nghe thử: https://youtu.be/gmNSFqyg_Z8
Dù vậy tôi cũng tò mò liệu sắp tới AI nào đó có thể tổng hợp phong cách Beach Boys lên phần hợp âm và giai điệu thực của bản gốc NIN, rồi thêm một chút bi tráng kiểu Johnny Cash vào không
Nếu mọi quyền của nghệ sĩ, nhạc sĩ, v.v. đều được giải quyết rõ ràng, những thứ như thế này có thể được xem là một ví dụ sử dụng AI “chấp nhận được”. Người có tài tự nghịch vẫn luôn thú vị hơn, nhưng một album mashup quái dị kiểu này thì chắc chắn tôi sẽ nghe
Mẫu giọng không nghe giống Michael Jackson, cũng không giống Weird Al. Một nỗ lực tốt, nhưng một người chuyên giả giọng có lẽ sẽ làm tốt hơn ở cả hai phía
Các bản cover AI thật tuyệt. Từ Goku hát Don't Stop Me Now cho đến dàn nhân vật SpongeBob hát Ocean Man
https://www.youtube.com/watch?v=CkQ-44PvTs8
https://www.youtube.com/watch?v=tJjhObngcxI
Tôi không biết chuyện này. “Trung tâm của cộng đồng các bản cover AI là một Discord tên A.I. Hub với hơn 500.000 thành viên, nơi các thành viên trao đổi mẹo mới, công cụ, kỹ thuật, cùng liên kết tới bản gốc và bản cover”
Nếu tưởng tượng 500.000 người cùng ra đường thì chắc chắn ta sẽ nhận ra, nhưng trên mạng, dù có những cộng đồng khổng lồ như vậy, bạn vẫn có thể hoàn toàn không biết cho đến khi tình cờ gặp hoặc có ai đó nói cho biết
Ngay cả Reddit cũng đang kém phổ biến hơn Discord hay TikTok trong Gen-Z, và đọc /r/LocalLLMs là cảm nhận ngay được rằng một phần đáng kể cộng đồng này là vị thành niên. Nói rõ ra thì tôi nghĩ đây là điều tốt
Từng có thế hệ thích mailing list, có thế hệ thích IRC và BBS, còn thế hệ tôi thích diễn đàn và các chuỗi bình luận dài. Nghĩ rằng cách chúng ta đang dùng hiện nay sẽ tồn tại mãi là ngây thơ
Những chỉ trích đối với Discord, đặc biệt là vấn đề khả năng tìm kiếm và khám phá, là rất thực tế, nhưng đến mức này thì có vẻ ván bài đã được định đoạt. Người trẻ đã lựa chọn rồi
Tuy nhiên tôi không rõ đó là giới hạn của công nghệ, hay chỉ vì “chất liệu nguồn quá nhàm chán”. Có rất nhiều kiểu “ca khúc kinh điển do rapper thịnh hành hiện nay hát”, nhưng với tư cách một fan hip-hop lâu năm, tôi thấy gần như chẳng có gì thú vị trong giọng hát của các nghệ sĩ hip-hop nổi tiếng hiện nay
Đây là bài liên quan từ 1 năm trước, nói rằng giọng Darth Vader về sau sẽ được AI tạo ra
https://arstechnica.com/information-technology/2022/09/james...
Nếu nói về “bắt chước giọng người nổi tiếng”, cứ nghe Light My Fire trên YouTube Music là được
https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...