2 điểm bởi GN⁺ 2023-09-18 | 1 bình luận | Chia sẻ qua WhatsApp
  • Đây là một cách tiếp cận áp dụng phân bố tiên nghiệm trong không gian ảnh của chuyển động cảnh lên một ảnh tĩnh duy nhất để biến nó thành video lặp hoặc cảnh động có thể tương tác
  • Quá trình huấn luyện sử dụng các quỹ đạo từ chuỗi video thực chứa chuyển động dao động tự nhiên như cây cối, hoa, nến và quần áo lay động trong gió
  • Mô hình xử lý chuyển động dài hạn trong miền Fourier và dự đoán spectral volume thông qua lấy mẫu khuếch tán được điều chỉnh theo tần số từ đầu vào là một ảnh đơn
  • Spectral volume được dự đoán sẽ được chuyển thành motion texture cho toàn bộ video, rồi được dùng cho việc tạo video lặp và tương tác với vật thể trong ảnh thật
  • Bản demo yêu cầu trình duyệt hỗ trợ WebGL2 và để tăng tốc, nó dùng mesh-warping thay cho mô hình kết xuất chất lượng cao trong bài báo

Tạo cảnh động từ ảnh tĩnh

  • Generative Image Dynamics là một phương pháp mô hình hóa phân bố tiên nghiệm trong không gian ảnh cho chuyển động cảnh
  • Đầu vào là một ảnh tĩnh duy nhất, đầu ra là video lặp mượt hoặc một cảnh động mà người dùng có thể tương tác
  • Có thể xem bài báo, arXiv, tài liệu bổ sung
  • Công trình này đã giành CVPR 2024 Best Paper Award

Phân bố tiên nghiệm chuyển động và cách kết xuất

  • Dữ liệu huấn luyện là tập hợp các quỹ đạo chuyển động được trích xuất từ chuỗi video thực
    • Các ví dụ gồm chuyển động tự nhiên, có tính dao động như cây cối, hoa, nến và quần áo lay động trong gió
  • Mô hình hóa phân bố tiên nghiệm chuyển động dày đặc, dài hạn trong miền Fourier
    • Khi được cung cấp một ảnh đơn, mô hình dự đoán spectral volume bằng lấy mẫu khuếch tán điều chỉnh theo tần số
    • Spectral volume có thể được chuyển thành motion texture trên toàn bộ video
  • Khi kết hợp với mô-đun kết xuất dựa trên ảnh, có thể áp dụng cho nhiều ứng dụng
    • Biến ảnh tĩnh thành video lặp mượt
    • Diễn giải spectral volume thành modal basis trong không gian ảnh để khiến các vật thể trong ảnh thật tương tác một cách chân thực
    • Phản ứng động lực học của vật thể trước kích thích từ người dùng được mô phỏng bằng phân tích modal của Davis và cộng sự

Demo và các cách ứng dụng thêm

1 bình luận

 
GN⁺ 2023-09-18
Ý kiến trên Hacker News
  • Thật sự rất tuyệt. Tôi đã thích cinemagraph từ lâu, và dù làm marketing hay quay chụp, tôi vẫn luôn cố đưa vào cảm giác tĩnh tại tinh tế kiểu đó, nên có vẻ đây có thể trở thành một công cụ tôi dùng thường xuyên
    Bí quyết của một cinemagraph đạt 10 điểm là càng tinh tế thì tác động càng lớn. Tốt nhất là khiến người xem ban đầu nghĩ đó là ảnh tĩnh, rồi não họ chợt nhận ra muộn rằng “khoan đã, có gì đó lạ, đây không phải ảnh mà là video”
  • Cây bị biến dạng khá nhiều nếu kéo từ mép. Dù vậy đây vẫn là một ý tưởng thú vị
    • Có lẽ cần kết hợp thứ này với segmentationgenerative fill cho lớp nền. May là mảng đó cũng đã tiến bộ rất nhiều
  • Tôi thắc mắc vì sao ở hoa hồng đỏ trong ảnh đầu tiên, cả các bông hoa ở nền cũng chuyển động, nhưng ở cây trong ảnh thứ ba thì lại không thấy hiệu ứng tương tự
    Lượng chuyển động khác nhau giữa ảnh thứ nhất và thứ hai cũng rất ấn tượng, và có thể là do nó xét đến mật độ quanh con trỏ. Các ví dụ chuyển động chậm nhìn thật sự rất dễ chịu
    • Không rõ vì sao, nhưng ví dụ hoa hồng khiến tôi thấy hơi rợn
  • Thật vui khi thấy các nhà nghiên cứu của Google tiếp tục công bố bài báo mở kèm demo. Tôi sẽ không nhắc lại chuyện Google không thành công trong việc biến nghiên cứu AI thành sản phẩm hoặc phát hành mã nguồn mở nữa
  • Thật sự rất tuyệt. Nó không làm đảo lộn thế giới hay tăng năng suất, nhưng vẫn cực kỳ hay
    Có vẻ có thể trở thành tính năng mặc định cho hình nền máy tính và điện thoại. Nếu xử lý được cả chuyển động mềm mại của nước hoặc mây, thì cũng rất phù hợp để áp dụng có chọn lọc lên ảnh trong những nơi như phim tài liệu lịch sử
  • Demo dùng WebGL nhỉ. Hay đấy
    • Nếu đưa vào trò chơi điện tử thì chắc sẽ rất ấn tượng. Chẳng hạn có thể đi xuyên qua bụi cây và cây cối bị kéo theo cơ thể
  • Cái này, giống EbSynth, có hạn chế là cần chuyển động vector thấp
    • Thành quả ở đây có vẻ chủ yếu nằm ở việc tạo động lực học của hình ảnh. Ví dụ nếu trong ảnh có một con mèo, mô hình hiểu rằng mèo phải thở, nên tạo ra chuyển động phổi co lại; còn bài báo có vẻ nói về cách biến động lực học hình ảnh đó cùng ảnh gốc thành một video mượt mà. Tôi có thể sai
  • Cảm giác như chỉ còn một bước nữa là ảnh tĩnh sẽ trở thành ảnh trong khung kiểu Harry Potter
  • Chà, trông siêu thực quá. Tôi muốn sớm được dùng thử khi nó được tích hợp vào Photoshop