1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Đây là mô hình nền tảng đa phương thức nhằm học chung hình ảnh, video và âm thanh trong một kiến trúc duy nhất để hợp nhất sinh nội dung, hiểu nội dung và dự đoán hành động; FLUX 3 Video được cung cấp trước dưới dạng Early Access
  • Mô hình học cấu trúc không gian của hình ảnh, động lực học thời gian và vật lý của video, cũng như quan hệ giữa sự kiện và âm thanh trong audio như các ràng buộc lẫn nhau; đồng thời mở rộng dữ liệu và tài nguyên tính toán dựa trên Self-Flow
  • Có thể tạo video kèm âm thanh native trong một lần, tối đa 20 giây; trong đánh giá ban đầu, được ưa thích hơn trong các so sánh với Grok Imagine Video tối đa 69%, Runway Gen-4.5 77% và Luma Ray 3.2 93%
  • Hỗ trợ tổng hợp/chỉnh sửa hình ảnh và render văn bản đa ngôn ngữ; có thể tinh chỉnh backbone video đã tiền huấn luyện bằng dữ liệu hạn chế theo từng tác vụ để dùng làm mô hình hành động cho robot
  • Sẽ lần lượt ra mắt Video, Image, Action và FLUX 3 Dev dựa trên trọng số mở; mục tiêu dài hạn là hợp nhất dự đoán tri giác, hành động và ngôn ngữ vào một mô hình duy nhất

Mô hình đa phương thức học thực tại một cách thống nhất

  • FLUX 3 xem hình ảnh, video và âm thanh không phải là các yếu tố tách rời, mà là kết quả quan sát cùng một thực tại qua các cảm biến khác nhau
    • Hình ảnh nắm bắt cấu trúc và quan hệ không gian tại một thời điểm cụ thể
    • Video khôi phục chiều thời gian, bộc lộ chuyển động, động lực học theo thời gian và các định luật vật lý
    • Âm thanh cho thấy các hiện tượng cơ học và quan hệ nhân quả âm học khó nhận biết chỉ bằng thị giác
    • Ngôn ngữ kết nối các tri giác này với mục tiêu, trừu tượng hóa và chỉ dẫn
  • Khi học nhiều modality cùng nhau, có thể tận dụng các ràng buộc lẫn nhau như âm thanh phải khớp với va chạm, chuyển động phải tuân theo khối lượng, và tương lai phải nối tiếp từ quá khứ
  • FLUX 3 là mô hình đầu tiên được xây dựng chỉ dựa trên các nguyên tắc này, hướng tới trí tuệ thị giác trong thế giới thực có khả năng tri giác, dự đoán và hành động trong môi trường vật lý lẫn số
  • Các kết quả ban đầu trong sáng tạo nội dung và AI vật lý cho thấy tiềm năng của cách tiếp cận này

Kiến trúc hợp nhất dựa trên Self-Flow

  • Self-Flow là cách tiếp cận giúp căn chỉnh hiệu quả khả năng sinh và hiểu đa phương thức trong một kiến trúc nền tảng duy nhất
  • Dựa trên Self-Flow, FLUX 3 mở rộng đáng kể khối lượng tính toán và tài nguyên dữ liệu để học đồng thời video, hình ảnh và âm thanh
  • Các so sánh công khai sử dụng Fréchet distance chuẩn hóa lỗi sinh theo từng modality với Flow Matching làm mốc 100, cùng tỷ lệ thành công trong thao tác trên 4 nhóm tác vụ sau tinh chỉnh

Sinh video và âm thanh native

  • FLUX 3 có thể tạo nhiều loại video và âm thanh dài tối đa 20 giây trong một lần sinh
  • Phạm vi hỗ trợ gồm:
    • Sinh văn bản thành video
    • Sinh hình ảnh thành video bằng cách nối tiếp khung hình bắt đầu hoặc dùng hình ảnh làm tham chiếu thị giác
    • Sinh video thành video, chuyển các yếu tố cốt lõi như nhân vật gốc sang cảnh hoặc bối cảnh mới
    • Tiếp nối video và audio theo kiểu sinh, dựa trên video và audio đầu vào
    • Sinh keyframe-to-video, kiểm soát chuyển cảnh giữa các cảnh được chỉ định
    • Hội thoại đa ngôn ngữ
    • Nhiều phong cách hình ảnh và tỷ lệ khung hình vượt ra ngoài định dạng điện ảnh truyền thống
    • Chuỗi kiểu tác nhân, kết nối các clip riêng lẻ thành chuỗi nhiều cảnh dài hơn
    • Phạm vi phong cách rộng, từ footage camcorder đến hoạt hình và điện ảnh
    • Tạo typography và thiết kế hoạt ảnh
  • Mọi đầu ra video đều bao gồm sinh âm thanh native

Đánh giá video ban đầu

  • Đánh giá sơ bộ được thực hiện với clip văn bản thành video 720p dài 10 giây có âm thanh
  • Trong đánh giá so sánh, tỷ lệ FLUX 3 được ưa thích như sau:
    • Tối đa 69% so với Grok Imagine Video
    • 60% so với Kling v3 Pro
    • 59% so với Happy Horse v1, 57% so với Happy Horse 1.1
    • 52% mỗi trường hợp so với Seedance 2.0 và Gemini Omni Flash
    • 77% so với Runway Gen-4.5
    • 93% so với Luma Ray 3.2
  • Do mô hình và harness xung quanh vẫn đang được phát triển, kết quả còn ở giai đoạn sơ bộ và dự kiến sẽ tiếp tục cải thiện trong thời gian Early Access
  • Các mảng hiện đặc biệt mạnh là nắm bắt biểu cảm khuôn mặt, liên kết sự kiện vật lý với âm thanh, và xử lý đa ngôn ngữ
  • Có thể kết hợp nhiều clip trong khi duy trì tính nhất quán của nhân vật trên toàn cảnh bằng tham chiếu thị giác, để tạo chuỗi dài vài phút
  • FLUX 3 Video được cung cấp dưới dạng Early Access

Tổng hợp và chỉnh sửa hình ảnh

  • FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh ở nhiều phong cách, tỷ lệ khung hình và độ phân giải khác nhau
  • Trong đánh giá sơ bộ ở giai đoạn huấn luyện trung gian, khả năng xử lý prompt phức tạp và tạo văn bản đã cải thiện đáng kể so với các phiên bản FLUX trước
  • Có thể tạo nhiều phong cách đầu ra và render văn bản ở nhiều ngôn ngữ với độ chính xác cao
  • Kết quả đánh giá vẫn ở giai đoạn sơ bộ và sẽ tiếp tục được cải thiện trước khi phát hành chính thức
  • Early Access cho FLUX 3 Image dự kiến bắt đầu trong vài tuần tới

Dự đoán hành động và học robot

  • Để mở rộng hiểu thực tại sang dự đoán hành động, hai hướng được sử dụng:
    • Mở rộng các công trình ban đầu của Self-Flow để tích hợp dự đoán hành động native vào chính FLUX 3
    • Lấy backbone video đã tiền huấn luyện làm nền tảng hiểu động lực học, rồi tinh chỉnh các mô hình hành động chuyên biệt bằng dữ liệu hạn chế theo từng tác vụ
  • Cùng đối tác tiếp cận sớm mimic robotics, họ phát triển FLUX-mimic

Ra mắt tuần tự theo chức năng

  • Mỗi chức năng sẽ được cung cấp trong vài tuần đến vài tháng tới sau giai đoạn Early Access nhằm ra mắt suôn sẻ, thu thập phản hồi và thực hiện kiểm thử an toàn nghiêm ngặt
  • Tất cả đều phái sinh từ cùng một mô hình nền tảng Flow Matching đa phương thức
    • FLUX 3 Video: sinh và chỉnh sửa video/audio qua API và quyền truy cập trọng số không công khai
    • FLUX-mimic·FLUX 3 Action: cung cấp dự đoán hành động cho các đối tác nghiên cứu/thương mại được chọn, bắt đầu với mimic robotics
    • FLUX 3 Image: tổng hợp và chỉnh sửa hình ảnh qua API và quyền truy cập trọng số không công khai
    • FLUX 3 Dev: cung cấp trọng số mở của backbone đa phương thức cho sinh nội dung video/audio/hình ảnh và dự đoán hành động
  • Các chi tiết kỹ thuật bổ sung về cách tiếp cận nền tảng cũng sẽ được công bố, và có thể đăng ký Early Access

Hợp nhất tri giác, hành động và ngôn ngữ

  • Các ứng dụng hướng tới trong tương lai gồm chỉnh sửa hình ảnh/video tương tác, mô phỏng, sử dụng máy tính và AI vật lý
  • Trong khi ra mắt dần các chức năng hiện tại, quá trình phát triển mô hình thế hệ tiếp theo cũng đang diễn ra
  • Mục tiêu cuối cùng là kết hợp dự đoán tri giác, hành động và ngôn ngữ vào một mô hình hợp nhất duy nhất

1 bình luận

 
Ý kiến trên Hacker News
  • Hy vọng phiên bản public weights sẽ là mạnh nhất (SOTA)
    Họ nói rằng trong vài tuần đến vài tháng tới sẽ cung cấp FLUX 3 Dev, một mô hình nền tảng đa phương thức cho sáng tạo nội dung và dự đoán hành vi, dưới dạng public weights, đồng thời cũng sẽ công bố các chi tiết kỹ thuật của phương pháp nền tảng

    • Dù cam kết public weights là đáng mừng, đã có ý kiến rằng trước đây những cam kết tương tự cũng từng không được thực hiện
      Nếu mô hình nền tảng ra dưới dạng bản Dev thì chỉ từ bài đăng này cũng khó biết chính xác nó sẽ bị lược bỏ những gì
  • Hầu như không có ví dụ nào có con người, thuật ngữ world model được dùng khá nhẹ tay, và dù nói là video 20 giây nhưng thực tế chỉ cho thấy jump cut
    Rốt cuộc điểm cốt lõi vẫn chỉ là “sắp công bố”

    • Trên /r/stablediffusion có rất nhiều ví dụ video được đăng lên
    • Có vẻ thuật ngữ world model từng dùng trong reinforcement learning giờ đã có thể chỉ cả những thứ đơn giản như hồi quy tuyến tính
      Có lẽ bản thân lĩnh vực RL cũng đã mượn thuật ngữ này từ khoa học hành vi, nên có lẽ cứ chấp nhận vậy thôi. Cũng giống như việc các triết gia và nghệ sĩ thị giác mỗi người lại lạm dụng object-oriented theo một kiểu khác nhau
    • Cách công bố quá kỳ lạ nên tôi còn không biết phải xem video ở đâu
  • Phản ứng ở đây tiêu cực và mỉa mai đến mức đáng ngạc nhiên, nhưng với tôi thì hiệu năng của mô hình này khá ấn tượng
    Cũng có ý rằng những người bi quan luôn là người vào buông lời chê bai đầu tiên, nên tôi sẽ tiếp tục theo dõi thêm

    • Sẽ thú vị nếu phân tích cảm xúc của HN theo chuỗi thời gian
      Dạo này tôi cảm thấy HN có bầu không khí tiêu cực hơn, mong là chỉ do tôi tưởng tượng
    • Rất có thể đây thực sự là một mô hình tốt, nhưng sau khi Qwen-Image-3 cho thấy khả năng tạo ảnh trông như render bằng LaTeX hoặc sắp xếp nhiều yếu tố song song hay có chiều sâu, tôi không chắc việc chỉ tập trung vào chất lượng hình ảnh có hoàn toàn đúng hướng hay không
    • Tôi đang tích cực dùng các LLM hiệu năng cao mới nhất cho coding và tạo công cụ tự động hóa, giao cho chúng những công việc nặng nhọc là kết nối các mã nguồn mở khác nhau để tạo ra dự án mới
      Nếu có môi trường thực thi phù hợp và đủ hiểu lĩnh vực để nhận ra khi mô hình suy luận sai hoặc cho ra kết quả tinh vi nhưng vẫn sai, thì tôi khá lạc quan. Ngược lại, nhìn mạng xã hội tràn ngập ảnh và video AI tệ hại, tôi bi quan hơn nhiều về khả năng các trình tạo ảnh/video tổng hợp hoàn toàn sẽ được dùng theo cách thật sự có ích trong đời thực. Khi rơi vào tay hàng triệu người, chúng dường như bị dùng theo hướng gây hại cho xã hội nhiều hơn là mang lại lợi ích
    • So với holodeck trong Star Trek thì thế này chưa đủ thú vị
    • Vì Martin Scorsese giờ tham gia với vai trò cố vấn, có vẻ BFL sẽ tiếp tục định vị mình là phòng thí nghiệm dành cho các nhà làm phim
      Nếu mô hình video này ở mức tương đương Seedance 2.0 thì chi phí sẽ quá cao để dùng cho việc tạo nội dung chất lượng thấp, và nhiều khả năng sẽ đi vào pipeline VFX của các dự án
  • Tôi tò mò không biết có nơi nào đang huấn luyện mô hình với dữ liệu xúc giác hay không
    Điều tôi muốn robot làm nhất là chạm vào đồ vật, nhưng người ta chỉ cung cấp audio, video và hình ảnh, nên mô hình chưa từng chạm vào thứ gì lại phải học cách tiếp xúc. Có lẽ đây cũng là lý do robot trông có vẻ chần chừ khi chạm vào vật thể

    • So với việc đưa dữ liệu xúc giác thực tế, mô phỏng tiếp xúc nhanh hơn, và như vậy cũng học nhanh hơn nhiều
  • Flux 2 Dev Klein thực tế là tốt nhất trong số các mô hình có thể chạy trên phần cứng thương mại thông thường
    Tôi hy vọng Flux 3 cũng sẽ có một mô hình public weights mới tương ứng như vậy; nếu không thì դա sẽ là tổn thất lớn với nhiều người dùng chơi hobby

  • Đây là dự án AI đầu tiên đến từ châu Âu khiến tôi rất kỳ vọng

  • Họ nói đang tuyển dụng ở Freiburg im Breisgau, nên tôi tò mò không biết việc thu hút nhân tài tại địa phương có thuận lợi không

    • Freiburg là một nơi rất đẹp
      Một người bạn sống ở đó thích đạp xe đường trường trên các ngọn núi xung quanh, còn một người bạn khác thì mùa đông đi trượt tuyết băng đồng vào giờ nghỉ trưa
    • Tôi sống gần đó; đây là một trong những vùng nhiều nắng nhất ở Đức và phong cảnh cũng rất đẹp
      Tôi không rõ về nguồn nhân lực, nhưng ở đó có trường đại học
    • University of Freiburg khá nổi tiếng
      Việc startup ngoài SF tuyển dụng tại các thành phố đại học là cách làm khá phổ biến
    • Có lý do khiến người ta gọi nơi đó là Flyburg im Nicegau
    • Dạo này việc không ở Mỹ thậm chí còn có thể là ưu điểm với nhiều ứng viên tiềm năng
  • Cho đến khi họ nhảy múa trong căn phòng bị ngập nước, tôi cứ tưởng đó là video live-action

  • Phiên bản 2.3 rất xuất sắc, và nhìn vào các video cùng đánh giá do những người được cấp quyền truy cập sớm công bố, tôi rất kỳ vọng vì có vẻ mô hình lần này sẽ là chuẩn SOTA mới cho sử dụng tại gia

  • Nếu mô hình phải học cách biểu đạt âm thanh của thế giới và các sự kiện trong đó, thì cho vui tôi mong họ nhét vào quá trình huấn luyện một lượng Wilhelm scream phi thực tế

    • Nếu lắp gioăng cao su quá thô bạo thì nó có thể hét lên, nên chắc phải xử lý cẩn thận