1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Black Forest Labs và mimic robotics đã phát triển FLUX-mimic bằng cách kết hợp backbone FLUX 3 được đồng huấn luyện trên ảnh, video và âm thanh với dự đoán hành động robot, đồng thời đã thử nghiệm và triển khai tại dây chuyền sản xuất của Audi
  • Với dự đoán video chiếm hơn 95% tổng khối lượng tính toán huấn luyện, mô hình học được tiếp xúc, chuyển động, trọng lượng và quan hệ nhân quả; hành động robot có số chiều thấp cũng được xử lý như một modality bổ sung biểu diễn cùng một thực tại vật lý
  • Ngay sau khi bổ sung dự đoán hành động, chất lượng sinh video giảm tối đa 10%, nhưng sau 3.500 bước đã phục hồi về mức ban đầu, cho thấy có thể dùng một backbone duy nhất để vừa sinh nội dung vừa dự đoán hành động
  • Bằng cách hợp nhất học sinh và học biểu diễn với Self-Flow rồi gắn thêm bộ giải mã hành động nhẹ, hệ thống đạt xử lý backbone dưới 80ms trên một NVIDIA RTX 5090 và thời gian phản hồi robot tổng thể là 101ms
  • Mô hình thế giới được huấn luyện quy mô lớn trên video phổ quát và các tác vụ thao tác có thể thích nghi với tác vụ mới chỉ với ít ví dụ trình diễn, đồng thời thử lại sau khi thất bại, nên được ứng dụng cho các công việc sản xuất vốn có chi phí tự động hóa cao như linh kiện mềm dẻo và thao tác chính xác

Một backbone cho cả sinh nội dung và điều khiển robot

  • Sau khi FLUX 1·FLUX 2 tập trung vào sinh ảnh, FLUX 3 được huấn luyện đồng thời trên ảnh, video và âm thanh ngay từ đầu để cùng sinh nội dung nghe nhìn
  • Black Forest Labs đã cung cấp phiên bản đầu của FLUX 3 cho mimic robotics, rồi kết hợp chuyên môn của hai bên về huấn luyện/triển khai robot và mô hình nền tảng để phát triển FLUX-mimic
    • mimic phụ trách robot riêng, huấn luyện robot, thao tác tinh vi và triển khai trong môi trường sản xuất
    • Black Forest Labs cung cấp năng lực về mô hình thị giác và học/mô hình hóa đa phương thức
  • FLUX-mimic là mô hình video-hành động cho thao tác tổng quát dựa trên backbone FLUX 3 và được tích hợp vào hệ thống triển khai full-stack của mimic
  • Cùng một backbone vừa sinh nội dung ảnh, video, âm thanh, vừa thực hiện hành động trong Physical AI

Học thế giới vật lý bằng dự đoán video

  • Hơn 95% khối lượng tính toán huấn luyện của FLUX 3 được dùng cho dự đoán video
    • Để tạo ra video chân thực, mô hình phải học tiếp xúc, chuyển động, trọng lượng, nguyên nhân và kết quả; nếu xử lý sai các yếu tố này thì video đầu ra cũng trở nên thiếu tự nhiên
    • Quá trình dựng lại thế giới một cách chính xác gắn liền với quá trình học cách thế giới vận hành
  • Âm thanh là modality có số chiều thấp, chiếm dưới 0,5% số token trong video 720p có âm thanh
    • Mô hình đã hiểu video có thể học quan hệ nhân quả giữa lời nói đồng bộ với chuyển động môi và hiệu ứng âm thanh gắn với các sự kiện vật lý
  • Hành động robot cũng là biểu diễn trạng thái có số chiều thấp, gắn chặt với quan sát thị giác
    • Hành động, âm thanh và khung hình video đều chỉ biểu diễn một phần của cùng một thực tại vật lý
    • Dự đoán hành động không tạo ra một mô hình nền tảng riêng biệt mà gắn thêm một cách quan sát mới vào mô hình thế giới sẵn có

Chất lượng sinh phục hồi sau khi học hành động

  • Khi thêm dự đoán hành động vào huấn luyện quy mô lớn, điểm đánh giá của con người đối với sinh text-to-video và image-to-video ban đầu giảm tối đa 10%
  • Khi mô hình học được cấu trúc của không gian hành động và căn chỉnh biểu diễn thế giới nội tại, chất lượng đã phục hồi; sau 3.500 bước, mô hình vừa quay lại mức sinh video trước đó vừa có thể dự đoán hành động
  • Trong quá trình tích hợp hành động vào đầu vào/đầu ra có xuất hiện sự xáo trộn tạm thời, nhưng không phải hy sinh vĩnh viễn năng lực sẵn có
  • Không cần các mô hình nền tảng riêng cho sinh video và dự đoán hành động; cùng một backbone duy nhất đảm nhiệm cả hai

Kiến trúc giải mã hành động từ biểu diễn thế giới

  • FLUX-mimic giải mã hành động robot từ biểu diễn thế giới nội tại mà FLUX 3 đã học để sinh video
  • Theo cách từng dùng trước đó trong mimic-video, mô hình trích xuất đặc trưng trung gian từ đường dự đoán video của FLUX rồi huấn luyện một bộ giải mã hành động nhẹ trên đó
  • Hiệu năng phụ thuộc vào hai yếu tố liên kết với nhau
    • Chất lượng mô hình thế giới: nếu không hiểu thế giới vận động ra sao thì cũng khó mô phỏng chính xác, và điều này liên quan trực tiếp đến chất lượng sinh
    • Chất lượng biểu diễn: nếu quan hệ nhân quả giữa các modality bị đan xen phi tuyến trong không gian đặc trưng thì bộ giải mã hành động sẽ phải diễn giải chúng khó như từ đầu vào thô
  • Mô hình sinh mang lại mô phỏng chất lượng cao và các quy luật mở rộng có thể dự đoán được khi tăng lượng tính toán, nhưng có thể tạo ra biểu diễn kém tách bạch hơn so với các cách học biểu diễn chuyên biệt, từ đó hạn chế khả năng dùng cho các tác vụ tiếp theo cần hiểu thế giới

Self-Flow hợp nhất học sinh và học biểu diễn

  • Self-Flow hợp nhất học sinh và học biểu diễn trong một framework duy nhất
  • Sau khi áp dụng, chất lượng của cả mô hình thế giới lẫn biểu diễn đều được cải thiện
    • Hiệu năng mô hình thế giới, đo bằng chất lượng sinh video, ảnh và âm thanh, tăng lên
    • Chất lượng biểu diễn, đo bằng tỷ lệ thành công trong các tác vụ điều khiển robot mô phỏng, cũng được cải thiện
  • FLUX 3 mở rộng Self-Flow để học ngay từ đầu cả động lực học thế giới rộng lớn lẫn năng lực thao tác
    • Hàng chục triệu giờ nội dung video phổ quát
    • Hàng trăm nghìn giờ nội dung video tập trung vào thao tác của con người và robot
  • Nhờ quá trình huấn luyện quy mô lớn này, các kết quả Self-Flow trong phòng thí nghiệm được mở rộng sang môi trường sản xuất và logistics thực tế

Công việc trong nhà máy và hiệu năng benchmark

  • mimic đã triển khai FLUX-mimic cho các công việc thực tế trong nhà máy
    • Kitting, tức xếp linh kiện vào khay có cấu trúc
    • Lắp bộ điều khiển điện tử vào đồ gá có rất ít khoảng hở
    • Lắp ráp linh kiện
    • Xử lý vật liệu mềm và linh hoạt như chỉ và cáp
  • Ngay cả khi đóng băng hoàn toàn backbone FLUX, bộ giải mã hành động vẫn cho hiệu năng cao hơn mô hình thị giác-ngôn ngữ-hành động trước đó, trong khi các mô hình cũ không thể hoàn thành tác vụ trong thiết lập này
  • Khi fine-tune đồng thời backbone và bộ giải mã hành động, FLUX-mimic đạt tỷ lệ thành công tác vụ thuộc nhóm tốt nhất
  • Huấn luyện quy mô lớn cung cấp cho backbone kiến thức về thế giới và hành động, còn Self-Flow giúp giải mã kiến thức đó dễ dàng từ biểu diễn đặc trưng

Học với ít ví dụ trình diễn và phục hồi sau thất bại

  • Khi các quy luật vật lý đã nằm trong một biểu diễn dễ truy cập, việc thích nghi với tác vụ mới trở thành quá trình nối tác vụ cụ thể vào tri thức sẵn có, thay vì phải học lại cách thế giới vận hành
  • Trong các thí nghiệm Self-Flow, số bước huấn luyện dự đoán hành động cần thiết để đạt cùng tỷ lệ thành công đã giảm còn một nửa so với mô hình video không dùng Self-Flow
  • Trong bài báo mimic-video, mô hình video-hành động cho thấy hiệu quả mẫu cao hơn tối đa 10 lần so với mô hình thị giác-ngôn ngữ-hành động; FLUX-mimic kết hợp cả hai hiệu ứng này
  • Nếu robot thất bại khi gắp vật thể, nó có thể phục hồi thất bại một cách tự nhiên bằng cách chỉnh lại tư thế, gắp lại và hoàn thành công việc
    • Không thể đưa mọi kiểu thất bại vào dữ liệu trình diễn, nên các hành vi phục hồi chưa từng được trình diễn xuất hiện từ mô hình đã học sẵn cách thế giới vận hành

Hệ thống robot phản hồi trong 101ms

  • Trong môi trường thực, mô hình phải hành động theo tốc độ thay đổi của môi trường; phần lớn chi phí tính toán của FLUX-mimic nằm ở backbone, thành phần lớn nhất của hệ thống
  • Biểu diễn thế giới có cấu trúc tốt cho phép đạt cùng hiệu năng với ít tham số hơn, từ đó có thể dùng backbone nhỏ hơn và nhanh hơn
  • Backbone đã tối ưu chạy từ đầu vào đến khi tạo biểu diễn thế giới trong chưa tới 80ms trên một NVIDIA RTX 5090, tương đương quy mô thời gian phản ứng thị giác của con người
  • mimic đã tối ưu các yếu tố sau trong toàn bộ stack triển khai để giảm thêm độ trễ
    • Bộ giải mã hành động
    • Độ trễ liên tiến trình giữa cảm biến, mô hình và bộ truyền động
    • Real-time chunking để chồng lấp dự đoán và thực thi, tránh robot bị ngắt quãng
  • Sau mọi tối ưu hóa, thời gian phản hồi cuối cùng của hệ thống robot độc lập là 101ms

Ứng dụng tại dây chuyền sản xuất của Audi

  • Dù mức tự động hóa đã cao, Audi vẫn tiếp tục xử lý thủ công các công việc liên quan đến linh kiện mềm dẻo và thao tác chính xác
  • Sản xuất sản phẩm cao cấp có nhiều biến thể, nên chi phí thiết kế lại các cell robot được lập trình theo cách truyền thống cho từng trường hợp là rất cao
    • Hệ thống dựa trên học máy làm thay đổi cấu trúc chi phí này
  • Audi Production Lab đã hợp tác với mimic để thử nghiệm và triển khai FLUX-mimic
    • Thực hiện thao tác phức tạp với vật thể mềm mà robot truyền thống không làm được
    • Có thể dùng để hỗ trợ nhân viên, nâng hiệu quả và mở rộng tự động hóa linh hoạt trong sản xuất và logistics
  • Hiệu quả mẫu và độ vững của FLUX-mimic không đến từ kỹ thuật hóa riêng cho từng tác vụ mà từ backbone FLUX 3 và biểu diễn có thể giải mã được, hỗ trợ chuyển giao giữa các tác vụ, ngành và phần cứng
  • Một mô hình dựa trên trí tuệ thị giác duy nhất vừa sinh ảnh, video, âm thanh vừa vận hành robot trên dây chuyền sản xuất

1 bình luận

 
Ý kiến trên Hacker News
  • Có vẻ như bên trong các mô hình tạo video đa phương thức được huấn luyện tốt sẽ hình thành một mô hình biểu diễn thế giới, và khi trích xuất rồi áp dụng cho robot thì cũng hoạt động tốt.
    Ý tưởng rằng mô hình video hiểu vật chất, ánh sáng và thế giới không mới, nhưng hiếm có phòng nghiên cứu video nào chuyển hướng thành phòng nghiên cứu robot. Đây có thể là một lộ trình kinh doanh: mở rộng quy mô bằng tạo video, rồi dùng năng lực đó để huấn luyện robot.
    Bàn tay của BFL, trông như giấu nhiều thiết bị bên trong găng tay, cũng khá thú vị. Robotics-1 của Xiami tạo video huấn luyện bằng kẹp gắp thông thường và găng tay dạng kẹp, nhưng mô hình BFL dường như không cần loại thiết bị đó. Vì phần cứng là lĩnh vực khó, tôi tò mò họ sẽ tiếp cận thế nào trong tương lai.

  • Khoảng phút 3:30, cảnh cánh tay robot lắp lại nẹp cửa sổ sau ba lần thử thật sự khá kinh ngạc. Đây là lần đầu tôi thấy kiểu giải quyết vấn đề sau thất bại như vậy, không biết đây có phải công nghệ mới không.

    • Hơn một năm trước, Google đã trình diễn một robot dựa trên VLA thực hiện công việc có lẽ còn ấn tượng hơn: thay dây đai cam đang chịu lực căng: https://www.youtube.com/watch?v=2AAFiuEP7iE
    • Nếu muốn bắt kịp mức hiện đại, nên xem Generalist, hiện thuộc nhóm tiên tiến nhất trong các tác vụ thao tác tinh vi: https://generalistai.com/blog/gen-1
  • Trong câu giải thích “với các tác vụ đòi hỏi hiểu thế giới, các biểu diễn ít tách rời hơn sẽ kém hữu ích hơn”, việc diễn đạt khái niệm “rối rắm hơn” thành biểu diễn ít tách rời hơn nghe buồn cười. Mô tả thế giới thực mà lại khiến chính khái niệm trở nên rối rắm hơn nữa đúng là kiểu diễn đạt rất LLM.

    • Giờ thì đến mức cứ mỗi câu lại đi tìm dấu vết của LLM mà không có căn cứ. Đã đến lúc giả định rằng mọi bài viết đều được LLM hỗ trợ ở một mức nào đó và chỉ đánh giá chất lượng đầu ra thôi.
    • Con người cũng thường viết những câu vụng về. Ngược lại, kiểu diễn đạt như vậy có thể hiếm trong dữ liệu huấn luyện, nên khả năng LLM tạo ra còn thấp hơn con người.
    • Tôi đùa thôi.
    • Dấu gạch ngang trong nguyên văn rõ ràng cũng là bằng chứng LLM đã viết bình luận này /s
  • Công nghệ đã phát triển đến mức này mà phim ảnh dường như tệ hơn bao giờ hết, thật buồn. Để tìm tác phẩm ổn, tôi hay xem phim từ vài chục năm trước; dù dùng những con rối trông lố bịch, cấu trúc câu chuyện vẫn hay gấp 1.000 lần.

    • Có thể đó là thiên kiến sống sót, vì ta không xem những phim cũ dở tệ mà chẳng ai nhớ đến.
    • Liệu có ai từ chối đầu tư vào BFL vì Robin Rombach không biết làm phim không? Sora đã xong rồi, và cũng khó tìm được ai đủ can đảm công khai nói rằng Bill Peebles không biết làm phim.
      Đây không chỉ là vấn đề của giới đầu tư mạo hiểm, mà còn liên quan đến cái gọi là Hollywood No. Ngược lại, bản thân Hollywood No cũng có thể là vấn đề; trong ngành game, người ta đã gọi điều đó là sự tích cực độc hại.
  • Thật vui khi thấy các startup châu Âu hợp tác với nhau.

    • Không phải Flux đã được Meta mua lại rồi sao?
  • Đây vừa là tương lai, vừa đã là hiện tại. Mong mọi người chia sẻ nội dung này với cả những người quen ngoài lĩnh vực phát triển phần mềm/kỹ thuật.

  • Chúng ta đang lao thẳng vào một cuộc khủng hoảng nơi giá trị của con người không sở hữu tư liệu sản xuất ngày càng giảm. Có vẻ một thời kỳ u ám đang tới.