- Google DeepMind đã công bố dòng mô hình Gemini Robotics 2, biến đầu vào thị giác và ngôn ngữ thành hành động để điều khiển humanoid từ bàn chân đến đầu ngón tay, đồng thời hỗ trợ thao tác tinh vi và hợp tác giữa các robot
- Dòng mô hình gồm Gemini Robotics 2, một VLA dùng cho điều khiển toàn thân; Gemini Robotics ER 2 để lập kế hoạch và giám sát các tác vụ dài hạn; và Gemini Robotics On-Device 2 chạy cục bộ trên robot
- Humanoid có thể kết hợp đi bộ, cúi người và vận chuyển vật thể; dùng bàn tay 5 ngón với 22 bậc tự do để thắt nút hoặc niêm phong túi zip; và nhiều robot có thể hợp tác trong các tác vụ khó xử lý nếu chỉ có một robot
- On-Device 2 chạy không cần kết nối mạng và thường có thể áp dụng cho robot hai tay mới với hình dạng, cảm biến và bậc tự do rất khác nhau chỉ bằng dưới 200 ví dụ cùng vài giờ thích nghi
- ER 2 được cung cấp dưới dạng private preview trên Google AI Studio và Gemini Enterprise Agent Platform; các mô hình VLA và On-Device được mở cho đối tác truy cập sớm, nhưng tốc độ di chuyển và độ chính xác vẫn cần cải thiện
Ba mô hình robot với vai trò khác nhau
- Robot truyền thống chủ yếu dựa vào việc lập trình sẵn hoặc điều khiển từ xa các chuỗi tác vụ hẹp và lặp lại, nên khó tự thích nghi với môi trường khó dự đoán hoặc chuyển kỹ năng của một robot sang hình thái khác
- Gemini Robotics 2 là mô hình thị giác-ngôn ngữ-hành động (VLA) chuyển đổi đầu vào thị giác và ngôn ngữ thành điều khiển động cơ
- Điều khiển toàn bộ humanoid và robot hai tay
- Hỗ trợ thao tác tinh vi bằng hai bàn tay và gripper
- Gemini Robotics ER 2 là mô hình suy luận hiện thân (ER) đóng vai trò agent của robot
- Giao tiếp với con người và hiểu môi trường vật lý
- Lập kế hoạch cho các tác vụ nhiều bước kéo dài trong vài phút
- Hỗ trợ làm việc nhóm giữa nhiều robot
- Gemini Robotics On-Device 2 là một VLA hiệu quả, được tối ưu để chạy cục bộ trên thiết bị robot
- Có thể thích nghi với hình thái robot hoàn toàn mới chỉ bằng dữ liệu trong vài giờ
- Phạm vi cung cấp khác nhau theo từng mô hình
- ER 2 có thể dùng trên Google AI Studio và được cung cấp dưới dạng private preview trên Gemini Enterprise Agent Platform
- Các mô hình VLA và On-Device được cung cấp cho đối tác truy cập sớm
- Có thể xem cách áp dụng lên phần cứng tại Developer blog
Điều khiển toàn thân humanoid vượt ra ngoài phần thân trên
- Nếu mô hình trước tập trung vào điều khiển phần thân trên của humanoid cho các tác vụ trên bàn, Gemini Robotics 2 mở rộng phạm vi điều khiển tới chuyển động toàn thân
- Apptronik Apollo 2 có thể xử lý chỉ dẫn “đặt bình tưới cây vào chiếc hộp màu xanh lá trên kệ dưới”
- Đi tới bàn và nhặt bình tưới cây
- Di chuyển tới kệ rồi đặt chính xác vào vị trí được chỉ định
- Mô hình kết nối đi bộ, cúi người, giữ thăng bằng và thao tác vật thể để thực hiện tác vụ trong không gian hẹp và lộn xộn, nhưng tốc độ di chuyển vẫn cần được cải thiện thêm
Thao tác tinh vi bằng bàn tay và gripper
- Điều khiển năm ngón tay và 22 bậc tự do của bàn tay SharpaWave gắn trên Apollo 2
- Thực hiện các động tác tinh tế như thắt nút
- Có thể niêm phong túi zip
- Cũng xử lý các tác vụ phức tạp như đóng gói đồ vật thật chặt bằng gripper song song 2 ngón tiêu chuẩn của Franka Duo
- Để đạt được độ khéo léo ở mức con người, cần tiếp tục nâng cao độ chính xác và tốc độ
Suy luận tác vụ dài hạn và hợp tác nhiều robot
- Gemini Robotics ER 2 là bộ não cấp cao của robot, xử lý chỉ dẫn của người dùng và giao tiếp với con người
- Quan sát không gian để suy luận các bước cần thiết
- Phối hợp với VLA để thực hiện hành động thực tế
- Theo dõi tiến độ cho đến khi hoàn tất
- Khi thực thi các tác vụ nhiều bước phức tạp, nếu một bước thất bại, mô hình có thể tự sửa lỗi và khái quát hóa sang tình huống cũng như mục tiêu mới
- Trong một tác vụ, mô hình đưa ra hàng trăm phán đoán và xử lý các chuỗi công việc kéo dài trong vài phút ổn định hơn trước
- Mô hình hiểu thời điểm bắt đầu và kết thúc tác vụ, nhận diện thời điểm xảy ra các sự kiện quan trọng để theo dõi trạng thái tiến độ
- Bằng cách để các loại robot khác nhau giao tiếp và hợp tác, hệ thống có thể xử lý các quy trình phức tạp mà một robot đơn lẻ khó thực hiện
Thích nghi nhanh với hình thái robot mới
- Gemini Robotics On-Device 2 được chạy cục bộ trên thiết bị robot cho các môi trường cần hoạt động không có độ trễ mạng hoặc kết nối Internet
- Hỗ trợ sẵn nhiều hình thái robot và kế thừa công nghệ chuyển giao hành động của Gemini Robotics 1.5
- Thông thường có thể áp dụng cho robot hai tay mới chỉ bằng dưới 200 ví dụ cùng vài giờ thích nghi
- Mô hình thích nghi cả với robot có ngoại hình, cảm biến và bậc tự do rất khác nhau, đồng thời thực hiện nhiều tác vụ trên các nền tảng Dexmate, SO101 và Trossen
An toàn robot xử lý cả sự bất định
- Khi năng lực vật lý của robot tăng lên, hệ thống áp dụng cách tiếp cận an toàn nhiều lớp, kết hợp các biện pháp an toàn vật lý truyền thống với framework an toàn AI
- ASIMOV-Agentic là benchmark mới đánh giá việc điều phối an toàn agent và xử lý bất định
- Đo lường liệu agent suy luận hiện thân có thể từ chối các lệnh gọi công cụ không an toàn do VLA yêu cầu hay không
- Đánh giá việc dự đoán khả năng thực hiện tác vụ và liệu hệ thống có chủ động yêu cầu con người can thiệp khi không chắc chắn hay không
- Gemini Robotics ER 2 cho thấy hiệu năng an toàn tốt nhất trong số các mô hình robot hiện có của Google DeepMind trên benchmark tuân thủ ràng buộc an toàn và ở gần con người
- Phát hiện người xung quanh tốt hơn
- Khi con người đến quá gần, mô hình gọi công cụ an toàn và dừng robot một cách an toàn
- Đây là năng lực được yêu cầu trong các tiêu chuẩn an toàn cộng tác để làm việc cùng con người
- Có thể xem đánh giá chi tiết trong Gemini Robotics 2: Safety Technical Report
- Mục tiêu là xây dựng trí tuệ cốt lõi cho AI vật lý đa dụng, vượt ra ngoài tự động hóa một tác vụ đơn lẻ để cùng con người giải quyết các vấn đề phức tạp
1 bình luận
Ý kiến trên Hacker News
Là một nhà nghiên cứu DeepMind tham gia phát triển mô hình này, tôi thấy DeepMind là một nơi làm việc tốt. Đây là một trong số ít viện nghiên cứu độc đáo có thể chuyển qua lại giữa gần như mọi lĩnh vực liên quan đến trí tuệ như Gemini·Gemma, robotics, và khoa học như thời tiết·sinh học; có nhiều đồng nghiệp tuyệt vời nên rất đáng cân nhắc gia nhập
Anthropic và OpenAI chiếm 80% sự chú ý, nhưng phạm vi mà Google làm được — từ mô hình frontier, tốc độ cao, trọng số mở cho đến tạo ảnh·video·nhạc và robotics — thật ấn tượng
Chuyển động của robot còn chậm và chưa mượt, nhưng ChatGPT thời kỳ đầu cũng trông rất ì ạch. Nếu nó phát triển nhanh như LLM, phạm vi ứng dụng có thể mở rộng khổng lồ chỉ trong vài năm
Chuyển động robot chậm, tĩnh và chuyển động nhanh, linh hoạt là hai mức độ khó hoàn toàn khác nhau. Khi di chuyển nhanh, phải tính quán tính quay của nhiều khớp và khối lượng cùng thay đổi thăng bằng hàng trăm đến hàng nghìn lần mỗi giây. Gấp áo phông ở trạng thái đứng yên với xác suất 90% thì dễ, nhưng tỷ lệ thành công 99% hoặc gấp nhanh thì phức tạp đến khó tin
Không nên kỳ vọng nó bắt chước y nguyên chuyển động inverse kinematics như búp bê kỹ thuật số. Nếu mục tiêu tối ưu hóa là giảm tiêu thụ năng lượng, chuyển động của cánh tay điện nhiều khớp có thể trông hơi kỳ lạ
Tôi đã thôi kỳ vọng vào robot hình người vì giới hạn của actuator. Sau Honda ASIMO gần như không có đổi mới nào, và có lẽ chẳng ai muốn đặt một khối kim loại 80kg lắc lư trong nhà hay nơi làm việc
Cuộc cách mạng robot cuối cùng có thể dùng cơ thể người·động vật biến đổi gene với bộ não được thay thế. Nếu tạo ra một con gấu không có ý thức rồi điều khiển bằng Neuralink và LLM, nó sẽ phù hợp làm công nhân xây dựng hơn; động vật nhanh có thể dùng để giao hàng, còn hươu cao cổ dùng trong kho hàng
Nhìn các công trình thú vị trong lĩnh vực in 3D, tôi nghĩ actuator cũng đang tiến bộ nhiều, nên muốn biết thêm về nhận định rằng nó bị tụt hậu
Chỉ cần tạo một chiếc hộp khổng lồ xử lý đầu vào và cho ra kết quả như máy rửa bát. Thay vì bắt chước bàn tay người, làm một thiết bị gấp quần áo tương ứng với máy giặt·máy sấy hoặc một bếp robot tích hợp sẽ hiệu quả hơn nhiều
Cần có người đánh giá thẳng thắn mức độ thực tế của công nghệ này. Tò mò về thiết bị đo lường cần thiết, chất lượng tương tác, và hiệu năng trong các tác vụ thường ngày phi cấu trúc như xoay tay nắm cửa, phục hồi sau khi ngã, tránh va chạm
Dữ liệu độ chính xác đáng tin cậy cũng thiếu, các benchmark như LIBERO gần như đều đạt 95% nên đã bão hòa, còn mỗi công ty và nhà nghiên cứu lại dùng đánh giá riêng. Cũng có nhiều công ty gian lận demo hoặc cho robot hoạt động nguy hiểm gần con người
Khó khăn không nằm ở bản thân tay nắm cửa hay phục hồi sau khi ngã, mà là việc căn chỉnh chính xác gạch hoặc linh kiện trong quá trình sản xuất. So với humanoid phức tạp với nhiều khớp cần quản lý, cánh tay robot có bánh xe như Mobile ALOHA có vẻ phù hợp hơn cho việc dọn phòng khách sạn hoặc nấu ăn trong nhà hàng với quy trình ổn định
Như lập luận trong https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex..., sự khéo léo cũng là vấn đề phần cứng, và gripper không phải bàn tay. Ngay cả thao tác bằng bàn tay nhiều ngón vẫn rất khó, cảm biến cũng chưa đủ
Robotics vẫn là ngành ngách, ngoại trừ mảng cobot; ngoại lệ là drone, vốn có tiềm năng lớn nếu giải quyết được vấn đề thời gian bay. Humanoid còn lâu mới hữu ích trong môi trường thực, và phần lớn xe mặt đất không người lái thậm chí không lùi được trên cầu thang
Robot AI mới là cuộc cách mạng thật sự. Hiện nay người sở hữu vốn vẫn cần lao động con người để có thêm vốn, nhưng nếu chi phí suy luận của robot thấp hơn chi phí nhân công thì lao động con người sẽ không còn cần thiết nữa. AI cũng ảnh hưởng đến lao động phi thể chất, nhưng một phần lớn dân số thế giới làm lao động chân tay
Là một người đàn ông 47 tuổi không có con, tôi kỳ vọng khả năng nhận được sự hỗ trợ của robot chăm sóc khi về già
Nhiều việc nhà có thể tự động hóa mà không cần humanoid. Roomba dọn sàn, còn nhà ở có thể tích hợp hệ thống xử lý rác tự động và hệ thống đưa thực phẩm vào, phân loại, lưu trữ
Humanoid gây khó chịu và khó tin cậy. Tôi tự hỏi liệu mình có thể ngủ yên khi có một robot như vậy trong nhà, kể cả trong tình huống tôi phản đối quan điểm chính trị của người tạo ra nó hay không
Tôi thắc mắc tại sao trên một Trái Đất hữu hạn, ngoài số người ngày càng tăng, ta còn muốn thêm cả thân thể robot. AI trong trung tâm dữ liệu ít nhất không cạnh tranh vai kề vai với tôi về mặt vật lý, nhưng khi đã có con người rồi thì tôi không hiểu vì sao vẫn muốn có robot tinh vi
Nếu dùng toàn bộ LLM để điều khiển robot thì quá nặng, ngay cả với GPU mạnh cũng có khả năng độ trễ tối thiểu là 1–2 giây, không phù hợp với robot thực dụng
Machine vision nên do machine learning đảm nhiệm, còn điều khiển chuyển động nên giao cho điều khiển tuyến tính/phi tuyến dựa trên PID truyền thống; nếu dùng toàn bộ LLM làm bộ điều khiển thì có vẻ sẽ vấp phải giới hạn phần cứng
Các công ty như Physical Intelligence cũng đang có kết quả tốt với kiến trúc phân tầng kết hợp tầng nhanh và tầng chậm để giải quyết đồng thời trí tuệ và độ trễ