OK-Robot: khung robot gia đình mô-đun mở có thể nhặt và đặt đồ ở bất cứ đâu
(ok-robot.github.io)- OK-Robot là một khung robot mô-đun mở nhằm thực hiện tác vụ pick-and-drop theo kiểu zero-shot trong môi trường gia đình mới, chỉ với chỉ dẫn ngôn ngữ để tìm, nhặt và di chuyển đồ vật
- Hệ thống kết hợp mô hình thị giác-ngôn ngữ (VLM), primitive điều hướng và primitive gắp để nối liền nhận diện đối tượng, di chuyển và thao tác mà không cần huấn luyện bổ sung
- Đã đánh giá 171 tác vụ trong 10 ngôi nhà thực tế ở Thành phố New York, ghi nhận tỷ lệ thành công 58.5% trong các ngôi nhà hoàn toàn mới
- Trong môi trường sạch sẽ và ít bừa bộn hơn, tỷ lệ thành công tăng lên 82%, và cho hiệu năng cao hơn khoảng 1.8 lần so với các công trình trước đó trong Open Vocabulary Mobile Manipulation (OVMM)
- Các thất bại chủ yếu đến từ tìm kiếm đối tượng, tư thế thao tác khó và vấn đề phần cứng, cho thấy hiệu năng phụ thuộc vào mức độ tích hợp tinh chỉnh giữa mô hình tri thức mở và các mô-đun robot
Cấu trúc khung và mục tiêu
- OK-Robot là một khung mô-đun mở để thực hiện tác vụ pick-and-drop zero-shot, có điều kiện theo ngôn ngữ trong các ngôi nhà bất kỳ
- Hệ thống kết hợp ba thành phần
- Mô hình thị giác-ngôn ngữ (VLM): phát hiện đối tượng dựa trên truy vấn ngôn ngữ
- Primitive điều hướng: điều khiển di chuyển của hệ thống di động
- Primitive gắp: thao tác với nhiều loại đối tượng khác nhau
- Hệ thống áp dụng cách tiếp cận ưu tiên hệ thống, tích hợp nhận diện đối tượng, di chuyển và gắp trong các tác vụ gia đình thực tế mà không cần giai đoạn huấn luyện riêng
- Tài liệu dự án:
Đánh giá trong nhà thực tế và nguyên nhân thất bại
- Đã thử 171 tác vụ pick-and-drop trong 10 môi trường gia đình ở Thành phố New York
- Tỷ lệ thành công trong các ngôi nhà hoàn toàn mới là 58.5%, cho hiệu năng cao hơn khoảng 1.8 lần so với các công trình trước đó trong Open Vocabulary Mobile Manipulation (OVMM)
- Tỷ lệ thành công: {p:58}
- Trong môi trường sạch sẽ và ít bừa bộn hơn, tỷ lệ thành công tăng lên 82%
- Tỷ lệ thành công trong môi trường gọn gàng: {p:82}
- Nguyên nhân thất bại có phân bố đuôi dài, trong đó ba nguyên nhân lớn nhất là:
- Không tìm được đúng đối tượng cần di chuyển trong bộ nhớ ngữ nghĩa: 9.3%
- Mô-đun thao tác nhận phải tư thế khó: 8.0%
- Khó khăn về phần cứng: 7.5%
- Khi kết hợp hệ thống tri thức mở như VLM với các mô-đun robot, không chỉ hiệu năng mô hình mà cả bộ nhớ đối tượng, tư thế thao tác và độ ổn định phần cứng cũng phải đồng thời được tối ưu
3 bình luận
https://hello-robot.com/purchase
Bản đầy đủ giá 25.000 USD...
Cần mua thêm iPhone Pro
Bộ sạc dạng dock giá 995 USD, haha
Mức giá này có phải chặt chém người dùng không
Sao dock sạc lại có giá như vậy thật nhỉ
Cách kết nối cũng là kiểu cắm trực tiếp đầu nối DC luôn.. haha
https://hello-robot.com/stretch-docking-station
Các ý kiến trên Hacker News
Tôi nghĩ thị trường cho loại robot này sẽ còn nhỏ cho đến khi chúng có thể xử lý chướng ngại vật
Đồ chơi mà mèo để giữa sàn, giấy bị gió từ cửa sổ mở thổi bay khỏi bàn, đồ chơi trẻ con vứt lung tung, cây bút chì lăn khỏi bàn khi không ai để ý, quần áo giặt để trên sàn, chênh lệch độ cao giữa thảm và sàn gỗ, cửa đang mở hoặc đóng... tất cả đều là vấn đề
Trước tác vụ chính có thể chen vào nhiều tác vụ trung gian như dọn đồ chơi, nhặt giấy, nhặt đồ giặt, mở cửa
Dây cáp, các đống đồ không được phép di chuyển, đồ nội thất, thú cưng đang ngủ, chồng hộp giao hàng có thể chặn robot có bánh xe gần như vĩnh viễn
Vì vậy tôi cho rằng robot gia dụng đa dụng phải có chân chứ không phải bánh xe, và để ổn định thì có thể cần nhiều hơn hai chân
Nghe có vẻ kỳ lạ, nhưng thiết kế lý tưởng có lẽ nằm đâu đó giữa một con nhện lớn thân thiện và một con chó
Thật lạ là ngành robot học nhìn chung bị mắc kẹt trong cách nghĩ xem thế giới như một mặt phẳng 2D, và dường như đã lý tưởng hóa để loại bỏ vấn đề thực sự khó về tính cơ động trong thế giới 3D
Mọi việc robot này làm cũng chỉ diễn ra trên các mặt phẳng ngang phẳng, và để nó hoạt động thì có vẻ như con người phải đi quanh phòng dọn dẹp trước
Roomba cũng có cùng vấn đề
Chỉ cần không kéo dây cáp dài trên sàn, có thể dán băng đánh dấu lên đồ nội thất, và cũng có thể để robot nhặt dọn đồ vật để chúng không còn là nguy cơ vấp ngã
Ta cũng có thể chuyển sang dùng những đồ vật thân thiện với cả con người lẫn robot, giống như bát đĩa mà máy rửa bát có thể dễ dàng cầm, di chuyển và rửa
Thực ra chúng ta đã làm như vậy khi mua các sản phẩm dùng được với lò vi sóng hoặc máy rửa bát, đến mức sẽ thấy ngạc nhiên nếu biết thứ gì đó không dùng được
Chúng ta cũng chấp nhận chi phí lắp cửa cho thú cưng vào cửa dành cho người để thú cưng tự sử dụng
Con người là một loài có khả năng thích nghi cao
Thứ hai, tôi luôn thích ý tưởng treo robot bên dưới ray trần
Có thể thấy trong bộ phim tuyệt vời Moon, và nó có lợi thế là có thể lơ lửng phía trên đồ nội thất nên cơ động hơn con người
Chỉ cần cánh tay có thể nhặt được đồ vật trên sàn trước mặt robot là được
Việc đó không có vẻ bất khả thi, và bản demo kết nối nhiều mô hình để chỉ cần nói “hãy chuyển Takis sang tủ đầu giường trong phòng ngủ” là nó thực hiện được thật đáng kinh ngạc
Vậy là chỉ còn vấn đề robot học “nhỏ” là làm sao cho cánh tay đủ khớp để vươn tới sàn
Ở đó họ giải quyết bằng code pusher
Đó là một loại thiết bị giống lưới chắn gia súc để đẩy đồ vật trên sàn ra
Không phải vấn đề nào cũng cần giải pháp phức tạp
Tôi nghĩ điểm xuất sắc của dự án này nằm đặc biệt ở sự đơn giản trong thiết kế robot
Rất ấn tượng
Tôi gần như không có kinh nghiệm về robot học nên câu hỏi có thể ngớ ngẩn, nhưng vẫn tò mò
Nó biết vật thể là gì bằng cách nào? Có dùng thứ gì như mạng nơ-ron phân loại vật thể theo thời gian thực không, và giới hạn là gì?
Robot có biết khi nào nó không thể thực hiện yêu cầu không? Ví dụ nếu bảo nó di chuyển một chiếc hộp lớn hoặc một quả tạ kettlebell rất nặng?
Nếu vật thể bị giấu hoặc bị che khuất thì hoạt động tốt đến mức nào? Nó có đi tìm không? Nếu muốn tiếp cận vật thể được yêu cầu thì phải dọn các vật thể khác trước, trường hợp đó xử lý ra sao?
Công trình này thực sự rất hay, nhưng cũng chỉ ra nguyên vẹn nhiều giới hạn của các hệ thống học robot hiện đại
Phần này được mô tả ở đây (https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...); theo tôi hiểu thì về cơ bản họ dùng mô hình ViT, tức mô hình phân loại ảnh, để gắn nhãn cho ảnh rồi chiếu nó lên lưới voxel
Sau đó họ dùng embedding ngôn ngữ của CLIP để liên kết ngôn ngữ với lưới voxel
Giới hạn là để chạy trên robot thì không thể dùng các phiên bản cực lớn của những mô hình này
Có thể dùng mô hình lớn trên cloud, nhưng sẽ phát sinh nhiều độ trễ
Nếu yêu cầu không được embedding ngôn ngữ bao quát, robot có thể sẽ không làm gì cả
Nhưng hệ thống này dường như không có hiểu biết về vật lý, ngoài các giới hạn phần cứng của bộ điều khiển vật lý
Việc gắn nhãn voxel phụ thuộc vào mô-đun gắn nhãn cho voxel, và nếu không có thông tin thị giác thì không thể gắn nhãn
Có vẻ cũng không có suy luận bậc cao phức tạp kiểu cái nĩa nằm trong ngăn kéo, ngăn kéo ở trong bếp, và bếp thường ở phía sau nhà
Trường hợp bị che một phần thì phụ thuộc vào giới hạn của bộ phân loại thị giác, nên có thể vẫn được
ViT rất tốt, nhưng sẽ tùy vào mức độ vật thể bị che khuất
Nhận diện vật thể chủ yếu dùng Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything), còn phần nặng nhọc để liên kết hình ảnh và văn bản do embedding CLIP(https://openai.com/research/clip) đảm nhiệm
Một trong những ưu điểm của các mô hình kiểu CLIP là không cần chỉ định trước các lớp có thể truy vấn sau này, mà có thể dùng ngay biểu thức nghĩ ra trong lúc chạy
Hiện tại robot không biết các yêu cầu không thể thực hiện
Mô hình hiện nay rất đơn giản và không cố xử lý theo cách đặc biệt thông minh nào
Tuy nhiên chính vì vậy chúng tôi đã công khai mã nguồn, và hy vọng cộng đồng có thể xây dựng các robot thông minh hơn trên dự án này, tận dụng nhiều tín hiệu thị giác hơn từ môi trường
Nếu vật thể bị giấu hoặc bị che khuất trong lần quét ban đầu thì sẽ thất bại
Dù vậy tôi nghĩ đây có thể là một điểm khởi đầu tốt cho nghiên cứu tiếp theo
Một ưu điểm là vì nó xét toàn bộ thông tin 3D, nếu một vật thể chỉ nhìn thấy được từ một vài góc, robot vẫn có khả năng tìm thấy nó
Có vẻ là một công nghệ có thể thay đổi cuộc sống cho người khuyết tật, người cao tuổi, game thủ, những người cực kỳ lười và cả những người chăm sóc họ
Kiểu như khi làm vỉa hè thân thiện với xe lăn, nó cũng giúp các bậc cha mẹ đẩy xe nôi, người mang đồ nặng, người chống gậy, trẻ nhỏ đi xe đạp, và người có thị lực kém
Cá nhân tôi hy vọng có thể dạy AI đảm nhận những việc không ai muốn làm, chứ không phải những công việc mà ai cũng muốn có
Tuyệt
Nếu có thể huấn luyện nó gấp quần áo và cất đúng chỗ, tôi sẽ nghiêm túc cân nhắc mua cả robot 25.000 đô la
Để giải các tác vụ dài hạn như tìm một món đồ không có sẵn trước mắt, có thể chuyển cảnh đã được chú thích thành mô tả theo mẫu rồi đưa vào một mô hình đủ lớn đã được huấn luyện bằng interactive fiction
“Bạn đang đứng trong bếp. Phía trước bên phải có một chiếc tủ lạnh lớn với tay nắm ở bên phải. Bên trái có các tủ bếp, và trên mặt bếp phía trên chúng có một cái đĩa.”
> get beer“Bạn không thấy bia ở đây.”
<< COT: Tôi biết bia thường có trong tủ lạnh. Nên mở tủ lạnh ra> open fridge“Khi mở tủ lạnh, bạn thấy 4 lon bia.”
> get beer“Đã lấy”
Tất nhiên còn vài năm nữa thứ này mới thực sự hoạt động, nhưng nghĩ mà thấy rất thú vị
Đó là cách kết hợp câu chuyện interactive fiction do cảm biến thực cung cấp với khối chuỗi suy nghĩ như độc thoại nội tâm
Chỉ cần chụp ảnh bếp rồi hỏi ChatGPT nên tìm bia ở đâu
Thực ra tôi dùng kiểu này khá thường xuyên
Vì lười, tôi chụp ảnh linh kiện và bo mạch rồi hỏi cách đấu dây với ESP32; chỉ từ vài bức ảnh, nó phân biệt được bo mạch, chip, sơ đồ chân, nói dây nào nối vào đâu và cả những điểm cần chú ý
Nhiều khi nó còn gợi ý cả thư viện hữu ích cho linh kiện, gần như ma thuật vậy
Phần phân tích thất bại được làm rất tốt
Tôi tò mò lỗi phần cứng nghĩa là gì
Ví dụ có 5 lần thử “Realsense đưa ra độ sâu sai”, tôi tò mò họ xác định điều đó như thế nào
Trong 5 lần thử được nhắc đến, Realsense tạo ra giá trị độ sâu sai với vật thể trong suốt hoặc bán trong suốt, nên chính point cloud được tạo từ camera trên đầu robot đã sai
Dù là mã nguồn mở mà vẫn tốn gần 25.000 đô la
Không hiểu sao lại đắt như vậy
Hầu hết robot di động có khả năng thao tác đều có giá từ 5 chữ số trở lên, chủ yếu vì thị trường nhỏ, chi phí vật liệu và kỹ thuật cao, và bản thân việc chế tạo robot rất đau đầu
Lao động không miễn phí
Làm PCB và phần cứng tùy chỉnh với số lượng nhỏ cũng không rẻ, chế tạo, hiệu chuẩn và kiểm thử robot cũng không rẻ
Không biết có link trang sản phẩm không
Phần cứng là độc quyền và được bảo vệ bằng bằng sáng chế
Cái này chẳng phải giống Dobb-E sao?
https://dobb-e.com/
Nhưng trong nhóm có một số người giống nhau
Ví dụ tôi là tác giả đầu tiên của Dobb-E, và giáo sư hướng dẫn của tôi đang hướng dẫn cả hai dự án
Khác biệt chính là dự án này là zero-shot, nên không cần dữ liệu mới nào trong một ngôi nhà mới, nhưng kỹ năng chỉ có hai loại: nhặt lên và đặt xuống
Trong khi đó Dobb-E có thể có nhiều kỹ năng, nhưng bạn phải cung cấp vài lượt trình diễn trong ngôi nhà mới
Cả hai đều được nhắc đến trên website của robot mà họ dùng: https://hello-robot.com/stretch-embodied-ai
Tôi đã theo dõi dự án này một thời gian, tiến triển rất tuyệt
Tôi hình dung nó được tích hợp với thiết bị hỗ trợ di chuyển như xe lăn cho những người bị hạn chế khả năng điều khiển tay chân
Nếu nó trở thành một dạng ngoại cốt “thông minh” giúp làm những việc trước đây là bất khả thi, thì với rất nhiều người, đó thật sự có thể là thứ thay đổi cuộc chơi
Tôi rất muốn có một xe nền tảng ổn định có thể chất đồ lên và gửi từ điểm này sang điểm khác
Sẽ thật tốt nếu có thể cho một nền tảng ổn định bằng con quay hồi chuyển kiểu Segway đi từ điểm A đến điểm B rồi quay lại, trên một tuyến đường như lối đi bộ hơi gồ ghề nhưng không quá tệ
Trước đây tôi đã cố tiếp tục tìm các lựa chọn, nhưng chưa từng thấy thứ gì phù hợp cho mục đích này
Không biết có ai biết sản phẩm mới nào phù hợp với trường hợp sử dụng như vậy không
Cụ thể là cần chuyển một khay đồ uống và hors d'oeuvres từ một phía khu bất động sản sang phía kia mà không làm đổ, và ít nhất phải có chút khả năng chạy trên nhiều loại địa hình
Không rõ tôi đã thấy nó chở đồ uống chưa, nhưng đồ ăn thì chắc chắn có
Công nghệ đã có rồi, chỉ cần ghép mọi thứ lại cho tốt thôi
Trọng lực sẽ luôn giữ đáy ly hướng xuống dưới, nên không cần ổn định bằng điện tử