2 điểm bởi GN⁺ 2024-02-24 | 3 bình luận | Chia sẻ qua WhatsApp
  • OK-Robot là một khung robot mô-đun mở nhằm thực hiện tác vụ pick-and-drop theo kiểu zero-shot trong môi trường gia đình mới, chỉ với chỉ dẫn ngôn ngữ để tìm, nhặt và di chuyển đồ vật
  • Hệ thống kết hợp mô hình thị giác-ngôn ngữ (VLM), primitive điều hướng và primitive gắp để nối liền nhận diện đối tượng, di chuyển và thao tác mà không cần huấn luyện bổ sung
  • Đã đánh giá 171 tác vụ trong 10 ngôi nhà thực tế ở Thành phố New York, ghi nhận tỷ lệ thành công 58.5% trong các ngôi nhà hoàn toàn mới
  • Trong môi trường sạch sẽ và ít bừa bộn hơn, tỷ lệ thành công tăng lên 82%, và cho hiệu năng cao hơn khoảng 1.8 lần so với các công trình trước đó trong Open Vocabulary Mobile Manipulation (OVMM)
  • Các thất bại chủ yếu đến từ tìm kiếm đối tượng, tư thế thao tác khó và vấn đề phần cứng, cho thấy hiệu năng phụ thuộc vào mức độ tích hợp tinh chỉnh giữa mô hình tri thức mở và các mô-đun robot

Cấu trúc khung và mục tiêu

  • OK-Robot là một khung mô-đun mở để thực hiện tác vụ pick-and-drop zero-shot, có điều kiện theo ngôn ngữ trong các ngôi nhà bất kỳ
  • Hệ thống kết hợp ba thành phần
    • Mô hình thị giác-ngôn ngữ (VLM): phát hiện đối tượng dựa trên truy vấn ngôn ngữ
    • Primitive điều hướng: điều khiển di chuyển của hệ thống di động
    • Primitive gắp: thao tác với nhiều loại đối tượng khác nhau
  • Hệ thống áp dụng cách tiếp cận ưu tiên hệ thống, tích hợp nhận diện đối tượng, di chuyển và gắp trong các tác vụ gia đình thực tế mà không cần giai đoạn huấn luyện riêng
  • Tài liệu dự án:

Đánh giá trong nhà thực tế và nguyên nhân thất bại

  • Đã thử 171 tác vụ pick-and-drop trong 10 môi trường gia đình ở Thành phố New York
  • Tỷ lệ thành công trong các ngôi nhà hoàn toàn mới là 58.5%, cho hiệu năng cao hơn khoảng 1.8 lần so với các công trình trước đó trong Open Vocabulary Mobile Manipulation (OVMM)
    • Tỷ lệ thành công: {p:58}
  • Trong môi trường sạch sẽ và ít bừa bộn hơn, tỷ lệ thành công tăng lên 82%
    • Tỷ lệ thành công trong môi trường gọn gàng: {p:82}
  • Nguyên nhân thất bại có phân bố đuôi dài, trong đó ba nguyên nhân lớn nhất là:
    • Không tìm được đúng đối tượng cần di chuyển trong bộ nhớ ngữ nghĩa: 9.3%
    • Mô-đun thao tác nhận phải tư thế khó: 8.0%
    • Khó khăn về phần cứng: 7.5%
  • Khi kết hợp hệ thống tri thức mở như VLM với các mô-đun robot, không chỉ hiệu năng mô hình mà cả bộ nhớ đối tượng, tư thế thao tác và độ ổn định phần cứng cũng phải đồng thời được tối ưu

3 bình luận

 
yeorinhieut 2024-02-24

https://hello-robot.com/purchase

Bản đầy đủ giá 25.000 USD...
Cần mua thêm iPhone Pro
Bộ sạc dạng dock giá 995 USD, haha

Mức giá này có phải chặt chém người dùng không

 
yeorinhieut 2024-02-24

Sao dock sạc lại có giá như vậy thật nhỉ
Cách kết nối cũng là kiểu cắm trực tiếp đầu nối DC luôn.. haha

https://hello-robot.com/stretch-docking-station

 
GN⁺ 2024-02-24
Các ý kiến trên Hacker News
  • Tôi nghĩ thị trường cho loại robot này sẽ còn nhỏ cho đến khi chúng có thể xử lý chướng ngại vật
    Đồ chơi mà mèo để giữa sàn, giấy bị gió từ cửa sổ mở thổi bay khỏi bàn, đồ chơi trẻ con vứt lung tung, cây bút chì lăn khỏi bàn khi không ai để ý, quần áo giặt để trên sàn, chênh lệch độ cao giữa thảm và sàn gỗ, cửa đang mở hoặc đóng... tất cả đều là vấn đề
    Trước tác vụ chính có thể chen vào nhiều tác vụ trung gian như dọn đồ chơi, nhặt giấy, nhặt đồ giặt, mở cửa
    Dây cáp, các đống đồ không được phép di chuyển, đồ nội thất, thú cưng đang ngủ, chồng hộp giao hàng có thể chặn robot có bánh xe gần như vĩnh viễn
    Vì vậy tôi cho rằng robot gia dụng đa dụng phải có chân chứ không phải bánh xe, và để ổn định thì có thể cần nhiều hơn hai chân
    Nghe có vẻ kỳ lạ, nhưng thiết kế lý tưởng có lẽ nằm đâu đó giữa một con nhện lớn thân thiện và một con chó
    Thật lạ là ngành robot học nhìn chung bị mắc kẹt trong cách nghĩ xem thế giới như một mặt phẳng 2D, và dường như đã lý tưởng hóa để loại bỏ vấn đề thực sự khó về tính cơ động trong thế giới 3D
    Mọi việc robot này làm cũng chỉ diễn ra trên các mặt phẳng ngang phẳng, và để nó hoạt động thì có vẻ như con người phải đi quanh phòng dọn dẹp trước
    Roomba cũng có cùng vấn đề

    • Tôi nghĩ nhiều người sẽ chấp nhận những hy sinh cần thiết để đổi lấy sự tiện lợi
      Chỉ cần không kéo dây cáp dài trên sàn, có thể dán băng đánh dấu lên đồ nội thất, và cũng có thể để robot nhặt dọn đồ vật để chúng không còn là nguy cơ vấp ngã
      Ta cũng có thể chuyển sang dùng những đồ vật thân thiện với cả con người lẫn robot, giống như bát đĩa mà máy rửa bát có thể dễ dàng cầm, di chuyển và rửa
      Thực ra chúng ta đã làm như vậy khi mua các sản phẩm dùng được với lò vi sóng hoặc máy rửa bát, đến mức sẽ thấy ngạc nhiên nếu biết thứ gì đó không dùng được
      Chúng ta cũng chấp nhận chi phí lắp cửa cho thú cưng vào cửa dành cho người để thú cưng tự sử dụng
      Con người là một loài có khả năng thích nghi cao
      Thứ hai, tôi luôn thích ý tưởng treo robot bên dưới ray trần
      Có thể thấy trong bộ phim tuyệt vời Moon, và nó có lợi thế là có thể lơ lửng phía trên đồ nội thất nên cơ động hơn con người
    • Điều đó gần với phê bình về giới hạn của một nền tảng cụ thể hơn là khái niệm đa dụng
      Chỉ cần cánh tay có thể nhặt được đồ vật trên sàn trước mặt robot là được
      Việc đó không có vẻ bất khả thi, và bản demo kết nối nhiều mô hình để chỉ cần nói “hãy chuyển Takis sang tủ đầu giường trong phòng ngủ” là nó thực hiện được thật đáng kinh ngạc
      Vậy là chỉ còn vấn đề robot học “nhỏ” là làm sao cho cánh tay đủ khớp để vươn tới sàn
    • Nếu là thiết bị có bánh xe thì trong môi trường bệnh viện cũng có cùng vấn đề
      Ở đó họ giải quyết bằng code pusher
      Đó là một loại thiết bị giống lưới chắn gia súc để đẩy đồ vật trên sàn ra
      Không phải vấn đề nào cũng cần giải pháp phức tạp
      Tôi nghĩ điểm xuất sắc của dự án này nằm đặc biệt ở sự đơn giản trong thiết kế robot
  • Rất ấn tượng
    Tôi gần như không có kinh nghiệm về robot học nên câu hỏi có thể ngớ ngẩn, nhưng vẫn tò mò
    Nó biết vật thể là gì bằng cách nào? Có dùng thứ gì như mạng nơ-ron phân loại vật thể theo thời gian thực không, và giới hạn là gì?
    Robot có biết khi nào nó không thể thực hiện yêu cầu không? Ví dụ nếu bảo nó di chuyển một chiếc hộp lớn hoặc một quả tạ kettlebell rất nặng?
    Nếu vật thể bị giấu hoặc bị che khuất thì hoạt động tốt đến mức nào? Nó có đi tìm không? Nếu muốn tiếp cận vật thể được yêu cầu thì phải dọn các vật thể khác trước, trường hợp đó xử lý ra sao?

    • Nói trước là tôi làm trong lĩnh vực này nhưng không phải một trong các tác giả, các câu hỏi này đã chạm đúng trọng tâm
      Công trình này thực sự rất hay, nhưng cũng chỉ ra nguyên vẹn nhiều giới hạn của các hệ thống học robot hiện đại
      1. Họ dùng bộ phân loại vật thể
        Phần này được mô tả ở đây (https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...); theo tôi hiểu thì về cơ bản họ dùng mô hình ViT, tức mô hình phân loại ảnh, để gắn nhãn cho ảnh rồi chiếu nó lên lưới voxel
        Sau đó họ dùng embedding ngôn ngữ của CLIP để liên kết ngôn ngữ với lưới voxel
        Giới hạn là để chạy trên robot thì không thể dùng các phiên bản cực lớn của những mô hình này
        Có thể dùng mô hình lớn trên cloud, nhưng sẽ phát sinh nhiều độ trễ
      2. Có lẽ nó hầu như không nhận diện được yêu cầu không hợp lệ
        Nếu yêu cầu không được embedding ngôn ngữ bao quát, robot có thể sẽ không làm gì cả
        Nhưng hệ thống này dường như không có hiểu biết về vật lý, ngoài các giới hạn phần cứng của bộ điều khiển vật lý
      3. Vật thể bị giấu gần như chắc chắn là không được
        Việc gắn nhãn voxel phụ thuộc vào mô-đun gắn nhãn cho voxel, và nếu không có thông tin thị giác thì không thể gắn nhãn
        Có vẻ cũng không có suy luận bậc cao phức tạp kiểu cái nĩa nằm trong ngăn kéo, ngăn kéo ở trong bếp, và bếp thường ở phía sau nhà
        Trường hợp bị che một phần thì phụ thuộc vào giới hạn của bộ phân loại thị giác, nên có thể vẫn được
        ViT rất tốt, nhưng sẽ tùy vào mức độ vật thể bị che khuất
    • Với tư cách tác giả dự án/bài báo, tôi xác nhận rằng fishbotics ở phía dưới đã trả lời nhiều câu hỏi, nhưng tôi có thể bổ sung thêm
      Nhận diện vật thể chủ yếu dùng Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything), còn phần nặng nhọc để liên kết hình ảnh và văn bản do embedding CLIP(https://openai.com/research/clip) đảm nhiệm
      Một trong những ưu điểm của các mô hình kiểu CLIP là không cần chỉ định trước các lớp có thể truy vấn sau này, mà có thể dùng ngay biểu thức nghĩ ra trong lúc chạy
      Hiện tại robot không biết các yêu cầu không thể thực hiện
      Mô hình hiện nay rất đơn giản và không cố xử lý theo cách đặc biệt thông minh nào
      Tuy nhiên chính vì vậy chúng tôi đã công khai mã nguồn, và hy vọng cộng đồng có thể xây dựng các robot thông minh hơn trên dự án này, tận dụng nhiều tín hiệu thị giác hơn từ môi trường
      Nếu vật thể bị giấu hoặc bị che khuất trong lần quét ban đầu thì sẽ thất bại
      Dù vậy tôi nghĩ đây có thể là một điểm khởi đầu tốt cho nghiên cứu tiếp theo
      Một ưu điểm là vì nó xét toàn bộ thông tin 3D, nếu một vật thể chỉ nhìn thấy được từ một vài góc, robot vẫn có khả năng tìm thấy nó
  • Có vẻ là một công nghệ có thể thay đổi cuộc sống cho người khuyết tật, người cao tuổi, game thủ, những người cực kỳ lười và cả những người chăm sóc họ

    • Tôi quên đã thấy ở đâu, nhưng nhìn chung, những cải tiến dành cho người khuyết tật cũng trở nên tốt hơn cho tất cả mọi người
      Kiểu như khi làm vỉa hè thân thiện với xe lăn, nó cũng giúp các bậc cha mẹ đẩy xe nôi, người mang đồ nặng, người chống gậy, trẻ nhỏ đi xe đạp, và người có thị lực kém
    • Một trong những động lực lớn của công việc về robot gia đình này là nghĩ đến người cao tuổi, người khuyết tật, hoặc các bậc cha mẹ bận rộn không có đủ thời gian để làm hết mọi việc
      Cá nhân tôi hy vọng có thể dạy AI đảm nhận những việc không ai muốn làm, chứ không phải những công việc mà ai cũng muốn có
  • Tuyệt
    Nếu có thể huấn luyện nó gấp quần áo và cất đúng chỗ, tôi sẽ nghiêm túc cân nhắc mua cả robot 25.000 đô la

    • Nếu nó có thể xử lý giặt giũ, rửa bát, nấu ăn và dọn đồ bừa bộn của bọn trẻ, tôi sẽ mua ngay cả robot 100.000 đô la
    • Để gấp đồ, có lẽ bạn phải mua một robot thứ hai ngoài con robot này: https://pantor.github.io/speedfolding/
  • Để giải các tác vụ dài hạn như tìm một món đồ không có sẵn trước mắt, có thể chuyển cảnh đã được chú thích thành mô tả theo mẫu rồi đưa vào một mô hình đủ lớn đã được huấn luyện bằng interactive fiction
    “Bạn đang đứng trong bếp. Phía trước bên phải có một chiếc tủ lạnh lớn với tay nắm ở bên phải. Bên trái có các tủ bếp, và trên mặt bếp phía trên chúng có một cái đĩa.”
    > get beer
    “Bạn không thấy bia ở đây.”
    << COT: Tôi biết bia thường có trong tủ lạnh. Nên mở tủ lạnh ra
    > open fridge
    “Khi mở tủ lạnh, bạn thấy 4 lon bia.”
    > get beer
    “Đã lấy”
    Tất nhiên còn vài năm nữa thứ này mới thực sự hoạt động, nhưng nghĩ mà thấy rất thú vị
    Đó là cách kết hợp câu chuyện interactive fiction do cảm biến thực cung cấp với khối chuỗi suy nghĩ như độc thoại nội tâm

    • Giờ có lẽ ta có thể dạy robot đi quanh phòng và lẩm bẩm “chìa khóa, chìa khóa, chìa khóa... mình để chìa khóa ở đâu nhỉ?”
    • LLM đa phương thức vốn đã làm rất tốt những tác vụ kiểu này
      Chỉ cần chụp ảnh bếp rồi hỏi ChatGPT nên tìm bia ở đâu
      Thực ra tôi dùng kiểu này khá thường xuyên
      Vì lười, tôi chụp ảnh linh kiện và bo mạch rồi hỏi cách đấu dây với ESP32; chỉ từ vài bức ảnh, nó phân biệt được bo mạch, chip, sơ đồ chân, nói dây nào nối vào đâu và cả những điểm cần chú ý
      Nhiều khi nó còn gợi ý cả thư viện hữu ích cho linh kiện, gần như ma thuật vậy
  • Phần phân tích thất bại được làm rất tốt
    Tôi tò mò lỗi phần cứng nghĩa là gì
    Ví dụ có 5 lần thử “Realsense đưa ra độ sâu sai”, tôi tò mò họ xác định điều đó như thế nào

    • Sau khi thu thập toàn bộ dữ liệu, họ phân tích hậu kỳ để xem nguyên nhân thất bại
      Trong 5 lần thử được nhắc đến, Realsense tạo ra giá trị độ sâu sai với vật thể trong suốt hoặc bán trong suốt, nên chính point cloud được tạo từ camera trên đầu robot đã sai
  • Dù là mã nguồn mở mà vẫn tốn gần 25.000 đô la
    Không hiểu sao lại đắt như vậy

    • Vì đây là sản phẩm sản xuất số lượng nhỏ phải gánh lương cho các kỹ sư chế tạo rồi bảo trì nó
    • Theo tiêu chuẩn robot thì 25.000 đô la không tệ
      Hầu hết robot di động có khả năng thao tác đều có giá từ 5 chữ số trở lên, chủ yếu vì thị trường nhỏ, chi phí vật liệu và kỹ thuật cao, và bản thân việc chế tạo robot rất đau đầu
    • Từ khi nào mã nguồn mở có nghĩa là rẻ?
      Lao động không miễn phí
      Làm PCB và phần cứng tùy chỉnh với số lượng nhỏ cũng không rẻ, chế tạo, hiệu chuẩn và kiểm thử robot cũng không rẻ
    • Giá nằm ở đâu vậy?
      Không biết có link trang sản phẩm không
    • Phần mềm là mã nguồn mở
      Phần cứng là độc quyền và được bảo vệ bằng bằng sáng chế
  • Cái này chẳng phải giống Dobb-E sao?
    https://dobb-e.com/

    • Không
      Nhưng trong nhóm có một số người giống nhau
      Ví dụ tôi là tác giả đầu tiên của Dobb-E, và giáo sư hướng dẫn của tôi đang hướng dẫn cả hai dự án
      Khác biệt chính là dự án này là zero-shot, nên không cần dữ liệu mới nào trong một ngôi nhà mới, nhưng kỹ năng chỉ có hai loại: nhặt lên và đặt xuống
      Trong khi đó Dobb-E có thể có nhiều kỹ năng, nhưng bạn phải cung cấp vài lượt trình diễn trong ngôi nhà mới
    • Hai dự án có vẻ liên quan và có tác giả chung
      Cả hai đều được nhắc đến trên website của robot mà họ dùng: https://hello-robot.com/stretch-embodied-ai
  • Tôi đã theo dõi dự án này một thời gian, tiến triển rất tuyệt
    Tôi hình dung nó được tích hợp với thiết bị hỗ trợ di chuyển như xe lăn cho những người bị hạn chế khả năng điều khiển tay chân
    Nếu nó trở thành một dạng ngoại cốt “thông minh” giúp làm những việc trước đây là bất khả thi, thì với rất nhiều người, đó thật sự có thể là thứ thay đổi cuộc chơi

  • Tôi rất muốn có một xe nền tảng ổn định có thể chất đồ lên và gửi từ điểm này sang điểm khác
    Sẽ thật tốt nếu có thể cho một nền tảng ổn định bằng con quay hồi chuyển kiểu Segway đi từ điểm A đến điểm B rồi quay lại, trên một tuyến đường như lối đi bộ hơi gồ ghề nhưng không quá tệ
    Trước đây tôi đã cố tiếp tục tìm các lựa chọn, nhưng chưa từng thấy thứ gì phù hợp cho mục đích này
    Không biết có ai biết sản phẩm mới nào phù hợp với trường hợp sử dụng như vậy không
    Cụ thể là cần chuyển một khay đồ uống và hors d'oeuvres từ một phía khu bất động sản sang phía kia mà không làm đổ, và ít nhất phải có chút khả năng chạy trên nhiều loại địa hình

    • Có thể bạn đã thấy thứ này trong nhà hàng rồi: https://www.pudurobotics.com/product/detail/bellabot
      Không rõ tôi đã thấy nó chở đồ uống chưa, nhưng đồ ăn thì chắc chắn có
    • https://www.youtube.com/watch?v=VGzRfvgnS_s
      Công nghệ đã có rồi, chỉ cần ghép mọi thứ lại cho tốt thôi
    • Chỉ cần đặt đồ uống lên một cái đĩa treo bằng dây là được
      Trọng lực sẽ luôn giữ đáy ly hướng xuống dưới, nên không cần ổn định bằng điện tử