Dự án mã nguồn mở biến âm thanh phát ra bằng miệng thành sound effect (New UX for sound generation)
(github.com/thxxx)Xin chào, mình đã tạo một mô hình và phát hành nó dưới dạng mã nguồn mở nên muốn chia sẻ với mọi người.
Bạn đã bao giờ cần một âm thanh cụ thể để làm video hoặc game chưa?
Trong đầu bạn biết rất rõ đó là âm thanh như thế nào, nhưng có lẽ bạn không có cách nào để diễn đạt và tìm kiếm nó.
Vì lý do đó, nếu tham gia các buổi họp liên quan đến âm thanh của các studio game, bạn sẽ nghe những kiểu âm này nhiều hơn cả hội thoại.
“Phiu phiu- thì không bằng piu↘︎piu↘︎ sẽ hay hơn”
Vì thế mình đã làm ra nó!
Mô hình mình tạo là một mô hình mà bạn bắt chước âm thanh mong muốn bằng miệng, rồi đưa nó cùng với văn bản vào model làm input, sau đó model sẽ tạo ra sound effect đó. (đã dùng khá nhiều thời gian và dữ liệu)
repo: https://github.com/thxxx/VTS
demo: https://spicy-pufferfish-699.notion.site/VTS-347cf95761f480f19dc0eb790…
(Nếu vào link demo và nghe thử thì bạn sẽ hiểu rõ hơn nhiều ý nghĩa của nó haha)
12 bình luận
Đây đúng là một dự án rất tuyệt vời!
"Làm thế nào để mình có thể dễ dàng mô tả điều mình muốn cho AI agent?"
Mình nghĩ đây là một điểm cực kỳ quan trọng hiện nay và là lĩnh vực cần được suy nghĩ rất nhiều.
Cũng như chúng ta đã chứng kiến lĩnh vực UI/UX của các dịch vụ CNTT phát triển, trải nghiệm người dùng đối với AI giờ đây cũng sẽ dần được tích lũy, và mình rất mong chờ sẽ có nhiều cuộc thảo luận về điều gì thực sự hiệu quả và quan trọng.
Có vẻ rất phù hợp để ứng dụng vào công việc xử lý SFX cho phim ảnh.
Cái này thật sự vui ghê haha
Cảm ơn ạ haha
Thú vị ghê haha cái này làm được luôn nhỉ. Mình tò mò không biết các bạn đã huấn luyện mô hình như thế nào.
Nhưng bản demo dùng âm thanh tạo bằng miệng lại còn ngầu hơn khi làm hiệu ứng âm thanh nữa.
Test nhiều quá nên cũng thành thạo rồi.
Thú vị thật, không biết ngoài giọng nói đầu vào thì có thể tạo được cả những âm thanh kiểu Pokémon? R2D2? như vậy không?
Đúng vậy, vì bản thân việc huấn luyện không phải được thực hiện bằng giọng nói nên có lẽ mọi kiểu Sound to Sound đều sẽ khả thi. Tuy vậy, mình vẫn chưa từng thử kiểm tra bằng âm thanh Pokémon haha
Ồ, vậy thì có vẻ như LLM có thể tạo ra kiểu công thức để điều chỉnh cường độ, sinh ra âm thanh điện tử -> rồi đưa cùng với văn bản làm đầu vào để xuất hiệu ứng âm thanh, thì chắc còn có thể tạo ra các hiệu ứng âm thanh phù hợp ngay tại thời điểm đó nữa. Hay thật đó.
Cái này vui phết nhé haha
Cảm ơn nhé haha