- Được tiền huấn luyện trên 100.000 giờ quỹ đạo UMI không phụ thuộc robot, sau đó tiếp tục huấn luyện bằng dữ liệu robot thực tế, đây là mô hình nền tảng giúp giảm bớt tình trạng thiếu dữ liệu của các mô hình chính sách robot
- Tự động chú thích hơn 1.700 kịch bản để học năng lực tạo hành vi tổng quát, rồi trong giai đoạn huấn luyện tiếp theo căn chỉnh với hình thái robot và lệnh ngôn ngữ tự nhiên
- Khi dữ liệu tiền huấn luyện và mô hình lớn hơn, sai số hành động khi kiểm chứng giảm; sau huấn luyện tiếp, tỷ lệ thành công của robot thực tế đo trong môi trường và với đối tượng chưa từng thấy cũng tăng đều, không có dấu hiệu bão hòa
- Với trung bình dưới 10 giờ trình diễn cho mỗi tác vụ, đạt tỷ lệ thành công tổng hợp 75% trong các tác vụ đóng gói điện thoại, bổ sung máy in, đưa đồ giặt vào máy và đóng gói hộp; với trung bình dưới 40 giờ, đạt 85%
- Đạt hiệu năng cao nhất trên RoboCasa, RoboCasa365, VLABench và RoboDojo, cho thấy hiệu quả khái quát hóa của tiền huấn luyện UMI quy mô lớn được chuyển sang cả thích nghi robot thực tế lẫn đánh giá chuẩn
Học hai giai đoạn để vượt qua rào cản dữ liệu robot
- Các mô hình dựa trên ngôn ngữ và thị giác đã cải thiện hiệu năng khi dữ liệu, tham số và lượng tính toán tăng lên, nhưng các mô hình chính sách robot lâu nay bị giới hạn khả năng mở rộng do thiếu dữ liệu chất lượng cao quy mô lớn
- Xiaomi-Robotics-1 sử dụng phương pháp học hai giai đoạn: tiền huấn luyện bằng dữ liệu UMI quy mô lớn không phụ thuộc robot, rồi huấn luyện tiếp bằng lượng dữ liệu robot thực tế tương đối nhỏ
- Cách này cho phép đánh giá xu hướng mở rộng của mô hình chính sách robot và liệu những cải thiện từ tiền huấn luyện có được chuyển thành hiệu năng robot thực tế hay không
Cấu trúc dữ liệu tiền huấn luyện và huấn luyện tiếp
- Dữ liệu tiền huấn luyện gồm 100.000 giờ quỹ đạo UMI
- Bao phủ hơn 1.700 kịch bản và nhiều tác vụ đa dạng, gồm nhà ở, cơ sở thương mại, hiện trường công nghiệp và không gian ngoài trời
- Nhóm phát triển đã xây dựng pipeline chú thích tự động: chia quỹ đạo thành các đoạn có độ dài cố định, rồi ghi lại bằng ngôn ngữ những thay đổi trạng thái cảnh trong từng đoạn
- Giai đoạn huấn luyện tiếp sử dụng các bộ dữ liệu bao phủ nhiều hình thái robot
- Dữ liệu robot thực tế tự thu thập
- Dữ liệu robot mã nguồn mở đã lọc
- Dữ liệu UMI chất lượng cao được tuyển chọn kỹ
- Dữ liệu tự thu thập bao gồm hơn 7.200 giờ tác vụ robot thực tế được thu trong nhà thật
- Bao gồm các tác vụ như dọn sofa, phân loại tủ giày và cất đồ dùng nhà bếp
- Dữ liệu UMI dùng cho huấn luyện tiếp được con người trực tiếp chú thích các khoảng thời gian và prompt lệnh
- Đây là cách khác với mô tả chuyển trạng thái được tạo tự động dùng trong dữ liệu tiền huấn luyện
Tiền huấn luyện UMI và chú thích tự động
- Tiền huấn luyện là giai đoạn cho mô hình tiếp xúc với nhiều môi trường và tác vụ thực tế khác nhau để học biểu diễn tạo hành vi tổng quát
- Do quy mô dữ liệu khiến việc chú thích thủ công trở nên khó khăn, nhóm đã xây dựng pipeline tự động hóa dùng mô hình thị giác-ngôn ngữ (VLM) mạnh
- Chia video dài thành các clip có độ dài cố định
- VLM mô tả trong từng clip sự thay đổi trạng thái của gripper và đối tượng tương tác
- Tạo một kho ngữ liệu quy mô lớn kết hợp quỹ đạo thao tác thực tế với mô tả ngôn ngữ chính xác
- Mô hình được huấn luyện để tạo hành động làm thay đổi cảnh theo các chuyển trạng thái được mô tả bằng ngôn ngữ
- Khi quy mô dữ liệu và kích thước mô hình tăng lên, sai số hành động khi kiểm chứng liên tục giảm, cho thấy xu hướng mở rộng rõ rệt
Căn chỉnh với robot thực tế và lệnh ngôn ngữ tự nhiên
- Huấn luyện tiếp căn chỉnh năng lực tạo hành vi học được từ tiền huấn luyện theo hai trục
- Căn chỉnh hình thái robot: ánh xạ năng lực tạo hành vi tổng quát sang robot vật lý bằng dữ liệu robot thực tế chất lượng cao, đa hình thái
- Căn chỉnh lệnh: chuyển mô hình từ chỗ nhận mô tả chuyển trạng thái cảnh làm đầu vào sang hiểu và trực tiếp thực hiện lệnh ngôn ngữ tự nhiên
- Sau khi huấn luyện tiếp, mô hình có thể được dùng cho nhiều tác vụ di chuyển và thao tác thực tế mà không cần tinh chỉnh riêng
- Để kiểm tra liệu hiệu ứng mở rộng từ tiền huấn luyện có được chuyển giao hay không, hiệu năng robot thực tế được đánh giá trong các môi trường và phiên bản đối tượng chưa từng thấy
- Khi dữ liệu tiền huấn luyện và kích thước mô hình tăng, tỷ lệ thành công của robot thực tế cũng tăng đều và có thể dự đoán
- Mô hình tiền huấn luyện mạnh hơn vẫn cho hiệu năng robot thực tế cao hơn sau khi huấn luyện tiếp
- Việc cải thiện tỷ lệ thành công theo quy mô dữ liệu và mô hình không có dấu hiệu bão hòa
Học tác vụ mới với ít dữ liệu
- Xiaomi-Robotics-1 thích nghi với các tác vụ mới phức tạp chỉ bằng vài giờ trình diễn robot thực tế cho mỗi tác vụ
- Các tác vụ đánh giá gồm đóng gói điện thoại, bổ sung máy in, đưa đồ giặt vào máy và đóng gói hộp
- Với trung bình dưới 10 giờ trình diễn cho mỗi tác vụ, mô hình đạt tỷ lệ thành công tổng hợp 75%, vượt xa mức 40% của mô hình chuẩn Ï0.5 trong cùng ngân sách dữ liệu
- Đóng gói điện thoại: XR-1 70%, Ï0.5 30%
- Bổ sung máy in: XR-1 70%, Ï0.5 20%
- Đưa đồ giặt vào máy: XR-1 80%, Ï0.5 40%
- Đóng gói hộp: XR-1 80%, Ï0.5 70%
- Khi tăng lên trung bình dưới 40 giờ cho mỗi tác vụ, tỷ lệ thành công tổng hợp tăng lên XR-1 85%, Ï0.5 53%
- Đóng gói điện thoại: XR-1 80%, Ï0.5 40%
- Bổ sung máy in: XR-1 60%, Ï0.5 20%
- Đưa đồ giặt vào máy: XR-1 100%, Ï0.5 50%
- Đóng gói hộp: cả hai mô hình đều 100%
Hiệu năng trên bốn benchmark mô phỏng
- Đạt hiệu năng cao nhất trên cả 4 benchmark mô phỏng chính chú trọng khả năng khái quát hóa
- RoboCasa: tỷ lệ thành công trung bình 74,5%, cải thiện 2,6% so với vị trí thứ hai 72,6%
- RoboCasa365: 57,4%, cải thiện 23,2% so với vị trí thứ hai 46,6%
- VLABench: 59,1%, cải thiện 11,1% so với vị trí thứ hai 53,2%
- RoboDojo: 13,93%, cải thiện 58,3% so với vị trí thứ hai 8,80%
- Hiệu quả khái quát hóa và mở rộng thu được từ tiền huấn luyện cũng được chuyển sang các đánh giá mô phỏng tiêu chuẩn
Kết quả mở rộng và phạm vi ứng dụng
- Tiền huấn luyện UMI quy mô lớn giúp giảm nút thắt dữ liệu robot, còn căn chỉnh với robot thực tế và lệnh chuyển năng lực tạo hành vi tổng quát sang robot vật lý
- Cải thiện hiệu năng theo dữ liệu tiền huấn luyện và quy mô mô hình được phản ánh trực tiếp vào hiệu năng dùng ngay của robot thực tế sau huấn luyện tiếp
- Mô hình nền tảng hoàn chỉnh vừa thích nghi với tác vụ mới bằng ít dữ liệu, vừa đạt hiệu năng cao nhất trên 4 benchmark mô phỏng đánh giá khả năng khái quát hóa
- Như một ví dụ ứng dụng thực tế, nhóm cũng công bố video đóng gói vali du lịch chưa qua biên tập
1 bình luận
Các ý kiến trên Hacker News
Tôi đã cười toe toét khi xem video, đến mức không hiểu nổi phản ứng bi quan ở đây. Cuối cùng thì robot giặt giũ đã xuất hiện, và mô hình ít nhất cũng được công bố miễn phí, chẳng phải vậy sao? Đây là tương lai mà chúng ta mong đợi, và robot học nên được dùng đúng vào những việc như thế này
Video này chứa nhiều bài toán kinh điển cực kỳ khó, nên nếu bạn không thấy ấn tượng thì hãy mừng vì 10 năm trước bạn không phải tự làm ra nó
Trong đó có phối hợp hai tay, thân di động, vật thể biến dạng, các điểm thao tác mảnh như khóa kéo túi, và động tác cầm nhiều vật cùng lúc. Mỗi vấn đề đều từng được nghiên cứu riêng trong lĩnh vực nhận thức hoặc thao tác, và đủ để tạo ra nhiều luận án tiến sĩ
Nhìn robot hai tay, tôi nghĩ nếu có bàn tay thứ ba với năng lực khác, như kiểu tay kẹp dạng xúc tu, thì nhiều việc sẽ dễ hơn nhiều. Càng nhiều chi thì vấn đề càng tăng, nhưng lợi ích từ việc có thêm cách giữ và xoay vật thể là rất lớn
Tôi muốn gọi cách chấp nhận việc robot gấp quần áo hơi nhăn và cẩu thả, vì vẫn tiện hơn gấp thật chuẩn rồi ủi, là Slopfold
Tốc độ phát triển rất nhanh, và trí tuệ nhân tạo sẽ thống trị tương lai. Tôi cho rằng chúng ta mới chỉ chạm vào bề mặt của những gì có thể làm được, nhưng nhìn theo hướng bi quan thì dự đoán của Bill Joy thật có tầm nhìn xa
https://www.wired.com/2000/04/joy-2/
Phần tôi mong đợi nhất trong tương lai dự kiến của trí tuệ nhân tạo là tự động hóa việc nhà. Ở phương Đông, người giúp việc gia đình tương đối rẻ và dễ tiếp cận, nhưng ở phương Tây, thuê người dọn dẹp hay quản gia gần như là một thứ xa xỉ. Chúng ta đang tốn rất nhiều thời gian mỗi tuần để quản lý nhà cửa, và tôi chờ ngày lấy lại được khoảng thời gian đó
Video không qua biên tập nên càng tuyệt hơn. Có thể nêu ra vô số việc nó chưa làm được như cầu thang hay cửa hẹp, nhưng chỉ riêng những tác vụ đã làm được cũng đã đáng kinh ngạc, và nhờ bảng chat mà tính tương tác cũng tốt hơn
Hướng thiết kế robot phi nhân dạng là phù hợp. Trong tương lai, công cụ và thiết bị gia dụng cũng sẽ thay đổi để con người và robot cùng sử dụng, còn dây kéo trên túi đựng giày thì đòi hỏi độ chính xác quá cao
Việc tận dụng khoản đầu tư khổng lồ vào học từ tác vụ thực tế để tiếp tục cải thiện sự linh hoạt, thời lượng pin và sức mạnh của robot hình người giá rẻ có khả năng xảy ra cao hơn so với việc thiết kế lại hàng triệu đồ dùng hằng ngày cho phù hợp với robot chuyên dụng hiện nay
Tôi muốn có bầy robot dạng côn trùng để diệt muỗi, robot dạng rắn để sửa đường ống, và robot dạng nhện để làm sạch bề mặt
Vài năm nữa, có lẽ Home Assistant và LLM có thể điều phối việc nhà khi ta ra ngoài. LLM có thể lập danh mục đồ đạc trong nhà rồi điều máy hút bụi và robot đi sắp xếp
LLM đa phương thức có thể phân tích ảnh để phân biệt món nào cần cho vào máy rửa bát hay máy giặt, món nào cần đánh bóng, rồi còn có thể sắp xếp tủ quần áo, dọn giường và chăm cây. Chỉ cần làm việc cả ngày trong khi các tấm pin mặt trời cung cấp năng lượng
Tôi đang làm việc nhà toàn thời gian nên thật sự muốn có robot này. Tôi ghét gấp đồ giặt nên lúc nào cũng trì hoãn; không cần đến chức năng cho đồ vào máy giặt, chỉ cần nó gấp giúp là đủ