1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Google DeepMind đã công bố dòng mô hình Gemini Robotics 2, biến đầu vào thị giác và ngôn ngữ thành hành động để điều khiển humanoid từ bàn chân đến đầu ngón tay, đồng thời hỗ trợ thao tác tinh vi và hợp tác giữa các robot
  • Dòng mô hình gồm Gemini Robotics 2, một VLA dùng cho điều khiển toàn thân; Gemini Robotics ER 2 để lập kế hoạch và giám sát các tác vụ dài hạn; và Gemini Robotics On-Device 2 chạy cục bộ trên robot
  • Humanoid có thể kết hợp đi bộ, cúi người và vận chuyển vật thể; dùng bàn tay 5 ngón với 22 bậc tự do để thắt nút hoặc niêm phong túi zip; và nhiều robot có thể hợp tác trong các tác vụ khó xử lý nếu chỉ có một robot
  • On-Device 2 chạy không cần kết nối mạng và thường có thể áp dụng cho robot hai tay mới với hình dạng, cảm biến và bậc tự do rất khác nhau chỉ bằng dưới 200 ví dụ cùng vài giờ thích nghi
  • ER 2 được cung cấp dưới dạng private preview trên Google AI Studio và Gemini Enterprise Agent Platform; các mô hình VLA và On-Device được mở cho đối tác truy cập sớm, nhưng tốc độ di chuyển và độ chính xác vẫn cần cải thiện

Ba mô hình robot với vai trò khác nhau

  • Robot truyền thống chủ yếu dựa vào việc lập trình sẵn hoặc điều khiển từ xa các chuỗi tác vụ hẹp và lặp lại, nên khó tự thích nghi với môi trường khó dự đoán hoặc chuyển kỹ năng của một robot sang hình thái khác
  • Gemini Robotics 2mô hình thị giác-ngôn ngữ-hành động (VLA) chuyển đổi đầu vào thị giác và ngôn ngữ thành điều khiển động cơ
    • Điều khiển toàn bộ humanoid và robot hai tay
    • Hỗ trợ thao tác tinh vi bằng hai bàn tay và gripper
  • Gemini Robotics ER 2mô hình suy luận hiện thân (ER) đóng vai trò agent của robot
    • Giao tiếp với con người và hiểu môi trường vật lý
    • Lập kế hoạch cho các tác vụ nhiều bước kéo dài trong vài phút
    • Hỗ trợ làm việc nhóm giữa nhiều robot
  • Gemini Robotics On-Device 2 là một VLA hiệu quả, được tối ưu để chạy cục bộ trên thiết bị robot
    • Có thể thích nghi với hình thái robot hoàn toàn mới chỉ bằng dữ liệu trong vài giờ
  • Phạm vi cung cấp khác nhau theo từng mô hình

Điều khiển toàn thân humanoid vượt ra ngoài phần thân trên

  • Nếu mô hình trước tập trung vào điều khiển phần thân trên của humanoid cho các tác vụ trên bàn, Gemini Robotics 2 mở rộng phạm vi điều khiển tới chuyển động toàn thân
  • Apptronik Apollo 2 có thể xử lý chỉ dẫn “đặt bình tưới cây vào chiếc hộp màu xanh lá trên kệ dưới”
    • Đi tới bàn và nhặt bình tưới cây
    • Di chuyển tới kệ rồi đặt chính xác vào vị trí được chỉ định
  • Mô hình kết nối đi bộ, cúi người, giữ thăng bằng và thao tác vật thể để thực hiện tác vụ trong không gian hẹp và lộn xộn, nhưng tốc độ di chuyển vẫn cần được cải thiện thêm

Thao tác tinh vi bằng bàn tay và gripper

  • Điều khiển năm ngón tay và 22 bậc tự do của bàn tay SharpaWave gắn trên Apollo 2
    • Thực hiện các động tác tinh tế như thắt nút
    • Có thể niêm phong túi zip
  • Cũng xử lý các tác vụ phức tạp như đóng gói đồ vật thật chặt bằng gripper song song 2 ngón tiêu chuẩn của Franka Duo
  • Để đạt được độ khéo léo ở mức con người, cần tiếp tục nâng cao độ chính xác và tốc độ

Suy luận tác vụ dài hạn và hợp tác nhiều robot

  • Gemini Robotics ER 2 là bộ não cấp cao của robot, xử lý chỉ dẫn của người dùng và giao tiếp với con người
    • Quan sát không gian để suy luận các bước cần thiết
    • Phối hợp với VLA để thực hiện hành động thực tế
    • Theo dõi tiến độ cho đến khi hoàn tất
  • Khi thực thi các tác vụ nhiều bước phức tạp, nếu một bước thất bại, mô hình có thể tự sửa lỗi và khái quát hóa sang tình huống cũng như mục tiêu mới
  • Trong một tác vụ, mô hình đưa ra hàng trăm phán đoán và xử lý các chuỗi công việc kéo dài trong vài phút ổn định hơn trước
  • Mô hình hiểu thời điểm bắt đầu và kết thúc tác vụ, nhận diện thời điểm xảy ra các sự kiện quan trọng để theo dõi trạng thái tiến độ
  • Bằng cách để các loại robot khác nhau giao tiếp và hợp tác, hệ thống có thể xử lý các quy trình phức tạp mà một robot đơn lẻ khó thực hiện

Thích nghi nhanh với hình thái robot mới

  • Gemini Robotics On-Device 2 được chạy cục bộ trên thiết bị robot cho các môi trường cần hoạt động không có độ trễ mạng hoặc kết nối Internet
  • Hỗ trợ sẵn nhiều hình thái robot và kế thừa công nghệ chuyển giao hành động của Gemini Robotics 1.5
  • Thông thường có thể áp dụng cho robot hai tay mới chỉ bằng dưới 200 ví dụ cùng vài giờ thích nghi
  • Mô hình thích nghi cả với robot có ngoại hình, cảm biến và bậc tự do rất khác nhau, đồng thời thực hiện nhiều tác vụ trên các nền tảng Dexmate, SO101 và Trossen

An toàn robot xử lý cả sự bất định

  • Khi năng lực vật lý của robot tăng lên, hệ thống áp dụng cách tiếp cận an toàn nhiều lớp, kết hợp các biện pháp an toàn vật lý truyền thống với framework an toàn AI
  • ASIMOV-Agentic là benchmark mới đánh giá việc điều phối an toàn agent và xử lý bất định
    • Đo lường liệu agent suy luận hiện thân có thể từ chối các lệnh gọi công cụ không an toàn do VLA yêu cầu hay không
    • Đánh giá việc dự đoán khả năng thực hiện tác vụ và liệu hệ thống có chủ động yêu cầu con người can thiệp khi không chắc chắn hay không
  • Gemini Robotics ER 2 cho thấy hiệu năng an toàn tốt nhất trong số các mô hình robot hiện có của Google DeepMind trên benchmark tuân thủ ràng buộc an toàn và ở gần con người
    • Phát hiện người xung quanh tốt hơn
    • Khi con người đến quá gần, mô hình gọi công cụ an toàn và dừng robot một cách an toàn
    • Đây là năng lực được yêu cầu trong các tiêu chuẩn an toàn cộng tác để làm việc cùng con người
  • Có thể xem đánh giá chi tiết trong Gemini Robotics 2: Safety Technical Report
  • Mục tiêu là xây dựng trí tuệ cốt lõi cho AI vật lý đa dụng, vượt ra ngoài tự động hóa một tác vụ đơn lẻ để cùng con người giải quyết các vấn đề phức tạp

1 bình luận

 
Ý kiến trên Hacker News
  • Là một nhà nghiên cứu DeepMind tham gia phát triển mô hình này, tôi thấy DeepMind là một nơi làm việc tốt. Đây là một trong số ít viện nghiên cứu độc đáo có thể chuyển qua lại giữa gần như mọi lĩnh vực liên quan đến trí tuệ như Gemini·Gemma, robotics, và khoa học như thời tiết·sinh học; có nhiều đồng nghiệp tuyệt vời nên rất đáng cân nhắc gia nhập

    • Tôi tò mò cụ thể phát triển mô hình frontier và phát triển mô hình mở khác nhau ở điểm nào. Các mô hình mở thường nhỏ hơn và trải qua nhiều kiểm tra an toàn hơn, nhưng về bản chất có vẻ tương tự; phần lớn nghiên cứu AI nói chung có lẽ áp dụng được cho cả hai bên
    • Tôi thật sự tò mò các bạn đang ngăn chặn việc chính phủ·doanh nghiệp·quân đội lạm dụng như thế nào. Tôi cũng muốn biết công nghệ này sẽ được dùng bao nhiêu để cải thiện đời sống của người bình thường, và bao nhiêu để tăng cường giám sát và kiểm soát
    • Cách nói “viện nghiên cứu duy nhất” là quá đà. Allen Institute for AI(AI2) tuy kém hơn ở mức frontier nhưng cũng bao quát hầu hết các lĩnh vực, và khoản hỗ trợ 152 triệu USD của NSF cùng hợp tác với Nvidia cũng rất đáng kỳ vọng. Trong mảng robotics có MolmoBot, MolmoSpaces, MolmoAct, v.v.: https://allenai.org/embodied-ai
    • Với tư cách giám đốc điều hành của AGI Society, tổ chức đã vận hành AGI Conference từ năm 2007, tôi muốn mời bạn trình bày nghiên cứu tại sự kiện năm tới. Năm nay bài trình bày của Alexander Lerchner rất xuất sắc; nếu bạn cho biết email ưu tiên, tôi sẽ liên hệ
  • Anthropic và OpenAI chiếm 80% sự chú ý, nhưng phạm vi mà Google làm được — từ mô hình frontier, tốc độ cao, trọng số mở cho đến tạo ảnh·video·nhạc và robotics — thật ấn tượng

    • Google hành xử như một công ty âm thầm nhưng có năng lực ở tuyến đầu của nhiều công nghệ mới, trong khi chatbot mới nhất của OpenAI và Anthropic lại nhận các bài báo phóng đại kiểu “AI mất kiểm soát”, “quá nguy hiểm nên phải cấm”. Vòng xoáy thổi phồng như vậy đang chống đỡ các mức định giá doanh nghiệp phi lý của những đối thủ mới nổi
    • Google DeepMind đang phát triển các khái niệm mới ở tuyến đầu AI, trong khi những nơi khác đang đuổi theo vài phần trăm điểm benchmark
    • Cũng không thể bỏ qua nghiên cứu gấp protein và giải Nobel
  • Chuyển động của robot còn chậm và chưa mượt, nhưng ChatGPT thời kỳ đầu cũng trông rất ì ạch. Nếu nó phát triển nhanh như LLM, phạm vi ứng dụng có thể mở rộng khổng lồ chỉ trong vài năm

    • Việc nhà có mất lâu hơn con người làm cũng không sao. Chỉ cần dọn dẹp xong trước khi mình tan làm là đủ
    • Từ GPT-2 đến GPT-3 và từ Gemini Robotics 1 đến 2 đều mất 15 tháng, nhưng cái trước là một bước nhảy vọt khổng lồ, còn cái sau gần như không khác mấy: https://blog.google/products-and-platforms/products/gemini/h...
      Chuyển động robot chậm, tĩnh và chuyển động nhanh, linh hoạt là hai mức độ khó hoàn toàn khác nhau. Khi di chuyển nhanh, phải tính quán tính quay của nhiều khớp và khối lượng cùng thay đổi thăng bằng hàng trăm đến hàng nghìn lần mỗi giây. Gấp áo phông ở trạng thái đứng yên với xác suất 90% thì dễ, nhưng tỷ lệ thành công 99% hoặc gấp nhanh thì phức tạp đến khó tin
    • Đây là video quảng bá đầu tiên trông hợp lý ngay cả ở tốc độ thời gian thực. Tuy nhiên vẫn chưa rõ tỷ lệ thành công 50–75% trong các tài liệu khác là tính theo lần thử đầu tiên hay theo thành công cuối cùng
    • Việc Google trực diện thách thức nghịch lý Moravec khá táo bạo: https://en.wikipedia.org/wiki/Moravec%27s_paradox
    • Chuyển động thì mượt nhưng chậm, có lẽ là vì an toàn. Robot gắn động cơ mạnh thật sự có thể làm người bị thương, nên robot công nghiệp cũng hoạt động trong hàng rào an toàn
      Không nên kỳ vọng nó bắt chước y nguyên chuyển động inverse kinematics như búp bê kỹ thuật số. Nếu mục tiêu tối ưu hóa là giảm tiêu thụ năng lượng, chuyển động của cánh tay điện nhiều khớp có thể trông hơi kỳ lạ
  • Tôi đã thôi kỳ vọng vào robot hình người vì giới hạn của actuator. Sau Honda ASIMO gần như không có đổi mới nào, và có lẽ chẳng ai muốn đặt một khối kim loại 80kg lắc lư trong nhà hay nơi làm việc
    Cuộc cách mạng robot cuối cùng có thể dùng cơ thể người·động vật biến đổi gene với bộ não được thay thế. Nếu tạo ra một con gấu không có ý thức rồi điều khiển bằng Neuralink và LLM, nó sẽ phù hợp làm công nhân xây dựng hơn; động vật nhanh có thể dùng để giao hàng, còn hươu cao cổ dùng trong kho hàng

    • Hươu cao cổ chỉ cao chứ gần như không nâng được vật nặng, nên tính hữu dụng trong kho là đáng nghi. Tôi cũng khó tin tuyên bố rằng actuator không có đổi mới; actuator của MIT Cheetah hoàn toàn khác ASIMO về khả năng backdrivability và độ cứng biến thiên, và nghiên cứu kết hợp phần tử đàn hồi cũng đang rất sôi động
    • Cortical Labs nghiên cứu lĩnh vực này và từng công bố cả demo Doom. Dạng sinh học có tính tổng dụng, nhưng với nhiều tác vụ thì dạng kim loại bền hơn; não có băng thông thấp và độ trễ lớn nên chip silicon có lợi thế hơn cho suy luận
      Nhìn các công trình thú vị trong lĩnh vực in 3D, tôi nghĩ actuator cũng đang tiến bộ nhiều, nên muốn biết thêm về nhận định rằng nó bị tụt hậu
    • Tôi hoàn toàn không đồng ý rằng actuator không tiến bộ. Sau nghiên cứu MIT Mini Cheetah của Ben Katz, mật độ mô-men xoắn và giá thành đã cải thiện mạnh; actuator Unitree G1 dựa trên đó tuy nhỏ nhưng mạnh, gần với truyền động quasi-direct drive. Động cơ BD E-Atlas cũng có vẻ là làm mát hoàn toàn thụ động mà vẫn có mật độ mô-men xoắn tốt, và chưa bao giờ nó phát triển nhanh như hiện nay
    • Tương lai như vậy thật kinh khủng, nhưng có lẽ còn rất xa vì độ khó kỹ thuật và rào cản cấp phép thí nghiệm. Tuy vậy tôi đồng ý rằng hình dạng humanoid là ngõ cụt
      Chỉ cần tạo một chiếc hộp khổng lồ xử lý đầu vào và cho ra kết quả như máy rửa bát. Thay vì bắt chước bàn tay người, làm một thiết bị gấp quần áo tương ứng với máy giặt·máy sấy hoặc một bếp robot tích hợp sẽ hiệu quả hơn nhiều
    • Việc cải tạo sinh thể có vẻ khó hơn chế tạo robot hình người vài bậc độ lớn. Chúng ta còn chưa làm được hamburger không cần bò với giá có tính thị trường
  • Cần có người đánh giá thẳng thắn mức độ thực tế của công nghệ này. Tò mò về thiết bị đo lường cần thiết, chất lượng tương tác, và hiệu năng trong các tác vụ thường ngày phi cấu trúc như xoay tay nắm cửa, phục hồi sau khi ngã, tránh va chạm

    • Tôi làm trong lĩnh vực này và từng viết luận văn cử nhân về mô hình thị giác-ngôn ngữ-hành động (VLA) không phải humanoid, tức là chủ đề nối ChatGPT với cánh tay robot. Nó vẫn chưa ở giai đoạn thực dụng; linh kiện lắp ráp đôi khi còn không có tên gọi chính xác, nên robot có thể không xử lý được các chỉ dẫn mơ hồ mà con người hiểu được
      Dữ liệu độ chính xác đáng tin cậy cũng thiếu, các benchmark như LIBERO gần như đều đạt 95% nên đã bão hòa, còn mỗi công ty và nhà nghiên cứu lại dùng đánh giá riêng. Cũng có nhiều công ty gian lận demo hoặc cho robot hoạt động nguy hiểm gần con người
      Khó khăn không nằm ở bản thân tay nắm cửa hay phục hồi sau khi ngã, mà là việc căn chỉnh chính xác gạch hoặc linh kiện trong quá trình sản xuất. So với humanoid phức tạp với nhiều khớp cần quản lý, cánh tay robot có bánh xe như Mobile ALOHA có vẻ phù hợp hơn cho việc dọn phòng khách sạn hoặc nấu ăn trong nhà hàng với quy trình ổn định
    • Hiện vẫn ở mức GPT-1, nhưng có cảm giác khoảnh khắc tương đương GPT-2 đang đến rất gần
    • Tiêu chuẩn kiểm chứng thật sự là liệu một startup bán robot dịch vụ gia đình có thực sự có được người dùng lặp lại hay không. Tôi từng chuyên làm nhiều nguyên mẫu robot, tiến bộ là rõ ràng, nhưng còn rất xa mới đủ ổn định để người tiêu dùng phổ thông dùng cho việc vặt
      Như lập luận trong https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex..., sự khéo léo cũng là vấn đề phần cứng, và gripper không phải bàn tay. Ngay cả thao tác bằng bàn tay nhiều ngón vẫn rất khó, cảm biến cũng chưa đủ
    • Trong ngành robot có rất nhiều trò che mắt: từ các video được dàn dựng tinh vi chỉ cho một demo cụ thể, cho đến lừa đảo nói là tự hành nhưng thực ra là điều khiển từ xa. Chó robot hay xe mặt đất không người lái cũng kém thực dụng hơn nhiều so với quảng cáo thổi phồng
      Robotics vẫn là ngành ngách, ngoại trừ mảng cobot; ngoại lệ là drone, vốn có tiềm năng lớn nếu giải quyết được vấn đề thời gian bay. Humanoid còn lâu mới hữu ích trong môi trường thực, và phần lớn xe mặt đất không người lái thậm chí không lùi được trên cầu thang
  • Robot AI mới là cuộc cách mạng thật sự. Hiện nay người sở hữu vốn vẫn cần lao động con người để có thêm vốn, nhưng nếu chi phí suy luận của robot thấp hơn chi phí nhân công thì lao động con người sẽ không còn cần thiết nữa. AI cũng ảnh hưởng đến lao động phi thể chất, nhưng một phần lớn dân số thế giới làm lao động chân tay

    • Nếu bỏ qua các chi phí ngoài suy luận và chấp nhận trạng thái cuối cùng đó, thì sẽ rất tốt nếu vốn được dân chủ hóa, nhưng nếu tiếp tục tập trung vào một tầng lớp thiểu số thì kết quả sẽ gần như tận thế
    • Không chỉ là vấn đề chi phí suy luận. Thiệt hại khi xử lý sai đồ vật hay sinh vật trong thế giới thực hoàn toàn khác với các ứng dụng phi vật chất, nên có thể cần cơ chế an toàn khi hỏng hóc và bộ giới hạn độc lập
    • Tôi nghi ngờ liệu sự thay đổi đó có thực sự tốt hay không
  • Là một người đàn ông 47 tuổi không có con, tôi kỳ vọng khả năng nhận được sự hỗ trợ của robot chăm sóc khi về già

    • Thật đáng kinh ngạc khi khả năng được thấy droid kiểu Star Wars trong đời mình đã tăng lên, nhưng dường như mọi người lại đón nhận điều đó như chuyện quá bình thường
    • Với tư cách một người ở độ tuổi 50 và hiện có cha mẹ ở tuổi 80, thứ này sẽ rất hữu ích ngay bây giờ. Nhiều bạn bè quanh tôi cũng ở hoàn cảnh tương tự
  • Nhiều việc nhà có thể tự động hóa mà không cần humanoid. Roomba dọn sàn, còn nhà ở có thể tích hợp hệ thống xử lý rác tự động và hệ thống đưa thực phẩm vào, phân loại, lưu trữ
    Humanoid gây khó chịu và khó tin cậy. Tôi tự hỏi liệu mình có thể ngủ yên khi có một robot như vậy trong nhà, kể cả trong tình huống tôi phản đối quan điểm chính trị của người tạo ra nó hay không

    • Với các căn hộ, nhà liền kề và nhà bán độc lập hiện có, việc đưa các thiết bị như vậy vào gần như là bất khả thi; ngay cả với nhà đơn lập xây mới thì đó cũng là giải pháp đắt đỏ. Vì môi trường của con người hiện có được thiết kế phù hợp với humanoid, hình dạng humanoid là hữu ích
    • Roomba chỉ dọn được 80–90% sàn và cũng không sạch như máy hút bụi thật. Nếu tính cả việc dọn đồ chơi của chó và đổ hộp bụi, thực tế chỉ khoảng 60%, nên để xử lý 100% thì cần một cơ thể dạng người hoàn chỉnh
    • Không nên có tình huống nào buộc ta phải tin robot. Nếu Roomba hay máy rửa bát trục trặc, chúng không thể cắt đứt ngón tay, cũng không thể nghe lén hay giám sát; đó mới là robot tốt
  • Tôi thắc mắc tại sao trên một Trái Đất hữu hạn, ngoài số người ngày càng tăng, ta còn muốn thêm cả thân thể robot. AI trong trung tâm dữ liệu ít nhất không cạnh tranh vai kề vai với tôi về mặt vật lý, nhưng khi đã có con người rồi thì tôi không hiểu vì sao vẫn muốn có robot tinh vi

    • Có nhiều dấu hiệu cho thấy sự bành trướng vô hạn của con người đang dừng lại. Lý do rõ ràng cần robot tinh vi là để giao cho chúng những việc con người không muốn làm vì quá nặng đến mức gãy lưng, bẩn thỉu, nguy hiểm hoặc nhàm chán
  • Nếu dùng toàn bộ LLM để điều khiển robot thì quá nặng, ngay cả với GPU mạnh cũng có khả năng độ trễ tối thiểu là 1–2 giây, không phù hợp với robot thực dụng
    Machine vision nên do machine learning đảm nhiệm, còn điều khiển chuyển động nên giao cho điều khiển tuyến tính/phi tuyến dựa trên PID truyền thống; nếu dùng toàn bộ LLM làm bộ điều khiển thì có vẻ sẽ vấp phải giới hạn phần cứng

    • Vấn đề độ trễ hiện nay là đúng, nhưng còn rất nhiều dư địa tối ưu hóa suy luận nên trong tương lai gần khả năng cao sẽ khác. Điều khiển dựa trên phân tích/tối ưu hóa như PID đã trì trệ hàng chục năm, trong khi điều khiển end-to-end đã cho thấy hiệu năng vượt trội về hiệu suất năng lượng khi đi bộ và độ bền vững để không ngã ngay cả khi giẫm lên đống lá, đồng thời cũng dễ áp dụng hơn nhiều cho robot mới
      Các công ty như Physical Intelligence cũng đang có kết quả tốt với kiến trúc phân tầng kết hợp tầng nhanh và tầng chậm để giải quyết đồng thời trí tuệ và độ trễ
    • Nvidia đang chạy VLA 2 tỷ tham số ở 10Hz trên chip của họ, và theo tôi biết mô hình 500 triệu tham số mà họ công bố cũng hoạt động ở 10Hz