- Đây là mô hình nền tảng đa phương thức nhằm học chung hình ảnh, video và âm thanh trong một kiến trúc duy nhất để hợp nhất sinh nội dung, hiểu nội dung và dự đoán hành động; FLUX 3 Video được cung cấp trước dưới dạng Early Access
- Mô hình học cấu trúc không gian của hình ảnh, động lực học thời gian và vật lý của video, cũng như quan hệ giữa sự kiện và âm thanh trong audio như các ràng buộc lẫn nhau; đồng thời mở rộng dữ liệu và tài nguyên tính toán dựa trên Self-Flow
- Có thể tạo video kèm âm thanh native trong một lần, tối đa 20 giây; trong đánh giá ban đầu, được ưa thích hơn trong các so sánh với Grok Imagine Video tối đa 69%, Runway Gen-4.5 77% và Luma Ray 3.2 93%
- Hỗ trợ tổng hợp/chỉnh sửa hình ảnh và render văn bản đa ngôn ngữ; có thể tinh chỉnh backbone video đã tiền huấn luyện bằng dữ liệu hạn chế theo từng tác vụ để dùng làm mô hình hành động cho robot
- Sẽ lần lượt ra mắt Video, Image, Action và FLUX 3 Dev dựa trên trọng số mở; mục tiêu dài hạn là hợp nhất dự đoán tri giác, hành động và ngôn ngữ vào một mô hình duy nhất
Mô hình đa phương thức học thực tại một cách thống nhất
- FLUX 3 xem hình ảnh, video và âm thanh không phải là các yếu tố tách rời, mà là kết quả quan sát cùng một thực tại qua các cảm biến khác nhau
- Hình ảnh nắm bắt cấu trúc và quan hệ không gian tại một thời điểm cụ thể
- Video khôi phục chiều thời gian, bộc lộ chuyển động, động lực học theo thời gian và các định luật vật lý
- Âm thanh cho thấy các hiện tượng cơ học và quan hệ nhân quả âm học khó nhận biết chỉ bằng thị giác
- Ngôn ngữ kết nối các tri giác này với mục tiêu, trừu tượng hóa và chỉ dẫn
- Khi học nhiều modality cùng nhau, có thể tận dụng các ràng buộc lẫn nhau như âm thanh phải khớp với va chạm, chuyển động phải tuân theo khối lượng, và tương lai phải nối tiếp từ quá khứ
- FLUX 3 là mô hình đầu tiên được xây dựng chỉ dựa trên các nguyên tắc này, hướng tới trí tuệ thị giác trong thế giới thực có khả năng tri giác, dự đoán và hành động trong môi trường vật lý lẫn số
- Các kết quả ban đầu trong sáng tạo nội dung và AI vật lý cho thấy tiềm năng của cách tiếp cận này
Kiến trúc hợp nhất dựa trên Self-Flow
- Self-Flow là cách tiếp cận giúp căn chỉnh hiệu quả khả năng sinh và hiểu đa phương thức trong một kiến trúc nền tảng duy nhất
- Dựa trên Self-Flow, FLUX 3 mở rộng đáng kể khối lượng tính toán và tài nguyên dữ liệu để học đồng thời video, hình ảnh và âm thanh
- Các so sánh công khai sử dụng Fréchet distance chuẩn hóa lỗi sinh theo từng modality với Flow Matching làm mốc 100, cùng tỷ lệ thành công trong thao tác trên 4 nhóm tác vụ sau tinh chỉnh
Sinh video và âm thanh native
- FLUX 3 có thể tạo nhiều loại video và âm thanh dài tối đa 20 giây trong một lần sinh
- Phạm vi hỗ trợ gồm:
- Sinh văn bản thành video
- Sinh hình ảnh thành video bằng cách nối tiếp khung hình bắt đầu hoặc dùng hình ảnh làm tham chiếu thị giác
- Sinh video thành video, chuyển các yếu tố cốt lõi như nhân vật gốc sang cảnh hoặc bối cảnh mới
- Tiếp nối video và audio theo kiểu sinh, dựa trên video và audio đầu vào
- Sinh keyframe-to-video, kiểm soát chuyển cảnh giữa các cảnh được chỉ định
- Hội thoại đa ngôn ngữ
- Nhiều phong cách hình ảnh và tỷ lệ khung hình vượt ra ngoài định dạng điện ảnh truyền thống
- Chuỗi kiểu tác nhân, kết nối các clip riêng lẻ thành chuỗi nhiều cảnh dài hơn
- Phạm vi phong cách rộng, từ footage camcorder đến hoạt hình và điện ảnh
- Tạo typography và thiết kế hoạt ảnh
- Mọi đầu ra video đều bao gồm sinh âm thanh native
Đánh giá video ban đầu
- Đánh giá sơ bộ được thực hiện với clip văn bản thành video 720p dài 10 giây có âm thanh
- Trong đánh giá so sánh, tỷ lệ FLUX 3 được ưa thích như sau:
- Tối đa 69% so với Grok Imagine Video
- 60% so với Kling v3 Pro
- 59% so với Happy Horse v1, 57% so với Happy Horse 1.1
- 52% mỗi trường hợp so với Seedance 2.0 và Gemini Omni Flash
- 77% so với Runway Gen-4.5
- 93% so với Luma Ray 3.2
- Do mô hình và harness xung quanh vẫn đang được phát triển, kết quả còn ở giai đoạn sơ bộ và dự kiến sẽ tiếp tục cải thiện trong thời gian Early Access
- Các mảng hiện đặc biệt mạnh là nắm bắt biểu cảm khuôn mặt, liên kết sự kiện vật lý với âm thanh, và xử lý đa ngôn ngữ
- Có thể kết hợp nhiều clip trong khi duy trì tính nhất quán của nhân vật trên toàn cảnh bằng tham chiếu thị giác, để tạo chuỗi dài vài phút
- FLUX 3 Video được cung cấp dưới dạng Early Access
Tổng hợp và chỉnh sửa hình ảnh
- FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh ở nhiều phong cách, tỷ lệ khung hình và độ phân giải khác nhau
- Trong đánh giá sơ bộ ở giai đoạn huấn luyện trung gian, khả năng xử lý prompt phức tạp và tạo văn bản đã cải thiện đáng kể so với các phiên bản FLUX trước
- Có thể tạo nhiều phong cách đầu ra và render văn bản ở nhiều ngôn ngữ với độ chính xác cao
- Kết quả đánh giá vẫn ở giai đoạn sơ bộ và sẽ tiếp tục được cải thiện trước khi phát hành chính thức
- Early Access cho FLUX 3 Image dự kiến bắt đầu trong vài tuần tới
Dự đoán hành động và học robot
- Để mở rộng hiểu thực tại sang dự đoán hành động, hai hướng được sử dụng:
- Mở rộng các công trình ban đầu của Self-Flow để tích hợp dự đoán hành động native vào chính FLUX 3
- Lấy backbone video đã tiền huấn luyện làm nền tảng hiểu động lực học, rồi tinh chỉnh các mô hình hành động chuyên biệt bằng dữ liệu hạn chế theo từng tác vụ
- Cùng đối tác tiếp cận sớm mimic robotics, họ phát triển FLUX-mimic
- Đây là mô hình video-hành động kết hợp backbone FLUX 3 với chuyên môn của mimic về học thao tác robot tinh vi và triển khai production
- Nội dung thử nghiệm nền tảng chung của AI vật lý và sáng tạo nội dung trong tác vụ production thực tế của Audi cũng được công bố riêng
Ra mắt tuần tự theo chức năng
- Mỗi chức năng sẽ được cung cấp trong vài tuần đến vài tháng tới sau giai đoạn Early Access nhằm ra mắt suôn sẻ, thu thập phản hồi và thực hiện kiểm thử an toàn nghiêm ngặt
- Tất cả đều phái sinh từ cùng một mô hình nền tảng Flow Matching đa phương thức
- FLUX 3 Video: sinh và chỉnh sửa video/audio qua API và quyền truy cập trọng số không công khai
- FLUX-mimic·FLUX 3 Action: cung cấp dự đoán hành động cho các đối tác nghiên cứu/thương mại được chọn, bắt đầu với mimic robotics
- FLUX 3 Image: tổng hợp và chỉnh sửa hình ảnh qua API và quyền truy cập trọng số không công khai
- FLUX 3 Dev: cung cấp trọng số mở của backbone đa phương thức cho sinh nội dung video/audio/hình ảnh và dự đoán hành động
- Các chi tiết kỹ thuật bổ sung về cách tiếp cận nền tảng cũng sẽ được công bố, và có thể đăng ký Early Access
Hợp nhất tri giác, hành động và ngôn ngữ
- Các ứng dụng hướng tới trong tương lai gồm chỉnh sửa hình ảnh/video tương tác, mô phỏng, sử dụng máy tính và AI vật lý
- Trong khi ra mắt dần các chức năng hiện tại, quá trình phát triển mô hình thế hệ tiếp theo cũng đang diễn ra
- Mục tiêu cuối cùng là kết hợp dự đoán tri giác, hành động và ngôn ngữ vào một mô hình hợp nhất duy nhất
1 bình luận
Ý kiến trên Hacker News
Hy vọng phiên bản public weights sẽ là mạnh nhất (SOTA)
Họ nói rằng trong vài tuần đến vài tháng tới sẽ cung cấp FLUX 3 Dev, một mô hình nền tảng đa phương thức cho sáng tạo nội dung và dự đoán hành vi, dưới dạng public weights, đồng thời cũng sẽ công bố các chi tiết kỹ thuật của phương pháp nền tảng
Nếu mô hình nền tảng ra dưới dạng bản Dev thì chỉ từ bài đăng này cũng khó biết chính xác nó sẽ bị lược bỏ những gì
Hầu như không có ví dụ nào có con người, thuật ngữ world model được dùng khá nhẹ tay, và dù nói là video 20 giây nhưng thực tế chỉ cho thấy jump cut
Rốt cuộc điểm cốt lõi vẫn chỉ là “sắp công bố”
Có lẽ bản thân lĩnh vực RL cũng đã mượn thuật ngữ này từ khoa học hành vi, nên có lẽ cứ chấp nhận vậy thôi. Cũng giống như việc các triết gia và nghệ sĩ thị giác mỗi người lại lạm dụng object-oriented theo một kiểu khác nhau
Phản ứng ở đây tiêu cực và mỉa mai đến mức đáng ngạc nhiên, nhưng với tôi thì hiệu năng của mô hình này khá ấn tượng
Cũng có ý rằng những người bi quan luôn là người vào buông lời chê bai đầu tiên, nên tôi sẽ tiếp tục theo dõi thêm
Dạo này tôi cảm thấy HN có bầu không khí tiêu cực hơn, mong là chỉ do tôi tưởng tượng
Nếu có môi trường thực thi phù hợp và đủ hiểu lĩnh vực để nhận ra khi mô hình suy luận sai hoặc cho ra kết quả tinh vi nhưng vẫn sai, thì tôi khá lạc quan. Ngược lại, nhìn mạng xã hội tràn ngập ảnh và video AI tệ hại, tôi bi quan hơn nhiều về khả năng các trình tạo ảnh/video tổng hợp hoàn toàn sẽ được dùng theo cách thật sự có ích trong đời thực. Khi rơi vào tay hàng triệu người, chúng dường như bị dùng theo hướng gây hại cho xã hội nhiều hơn là mang lại lợi ích
Nếu mô hình video này ở mức tương đương Seedance 2.0 thì chi phí sẽ quá cao để dùng cho việc tạo nội dung chất lượng thấp, và nhiều khả năng sẽ đi vào pipeline VFX của các dự án
Tôi tò mò không biết có nơi nào đang huấn luyện mô hình với dữ liệu xúc giác hay không
Điều tôi muốn robot làm nhất là chạm vào đồ vật, nhưng người ta chỉ cung cấp audio, video và hình ảnh, nên mô hình chưa từng chạm vào thứ gì lại phải học cách tiếp xúc. Có lẽ đây cũng là lý do robot trông có vẻ chần chừ khi chạm vào vật thể
Flux 2 Dev Klein thực tế là tốt nhất trong số các mô hình có thể chạy trên phần cứng thương mại thông thường
Tôi hy vọng Flux 3 cũng sẽ có một mô hình public weights mới tương ứng như vậy; nếu không thì դա sẽ là tổn thất lớn với nhiều người dùng chơi hobby
Đây là dự án AI đầu tiên đến từ châu Âu khiến tôi rất kỳ vọng
Họ nói đang tuyển dụng ở Freiburg im Breisgau, nên tôi tò mò không biết việc thu hút nhân tài tại địa phương có thuận lợi không
Một người bạn sống ở đó thích đạp xe đường trường trên các ngọn núi xung quanh, còn một người bạn khác thì mùa đông đi trượt tuyết băng đồng vào giờ nghỉ trưa
Tôi không rõ về nguồn nhân lực, nhưng ở đó có trường đại học
Việc startup ngoài SF tuyển dụng tại các thành phố đại học là cách làm khá phổ biến
Cho đến khi họ nhảy múa trong căn phòng bị ngập nước, tôi cứ tưởng đó là video live-action
Phiên bản 2.3 rất xuất sắc, và nhìn vào các video cùng đánh giá do những người được cấp quyền truy cập sớm công bố, tôi rất kỳ vọng vì có vẻ mô hình lần này sẽ là chuẩn SOTA mới cho sử dụng tại gia
Nếu mô hình phải học cách biểu đạt âm thanh của thế giới và các sự kiện trong đó, thì cho vui tôi mong họ nhét vào quá trình huấn luyện một lượng Wilhelm scream phi thực tế