Google показали своего робота с Gemini2.0 - шаг к созданию роботов общего назначения, способных адаптироваться к различным задачам без специального программирования для каждой из них.
Представлен новый проект Gemini Robotics на основе мультимодальной модели Gemini 2.0. https://t.me/alwebbci/3096
Google DeepMind создали 2 специализированные системы: Gemini Robotics и Gemini Robotics-ER (Embodied Reasoning), которые выводят взаимодействие ИИ с физическим миром на новый уровень.
У Gemini Robotics есть:
1. Воплощённое мышление — это не просто система управления роботами, а полноценная когнитивная архитектура, способная к "воплощённому рассуждению". Робот не только видит объекты, но и понимает их пространственные отношения, функциональное назначение и контекст ситуации.
2. Zero-Shot и Few-Shot обучение — способность выполнять задачи с нуля/ с минимальным количеством примеров.
3. Физические действия как новая модальность - система не просто понимает команды, но и преобразует абстрактные инструкции в точные кинематические траектории.
4. Долговременная память позволяет роботу запоминать и использовать последовательности действий и наблюдений в течение длительного времени.
5. Перенос из симуляции в реальность - большая часть обучения происходит в виртуальных средах, но благодаря технологии Adaptive Domain Randomization модель успешно адаптируется к реальному миру.
6. Микро-оптимизация движений позволяет роботу корректировать свои движения на микроуровне в реальном времени на основе сенсорной обратной связи.
7. Этический фреймворк через "Constitutional AI". DeepMind интегрировал в Gemini Robotics систему автоматической генерации "конституций" — правил на естественном языке, которые управляют поведением робота.
8. Модульная архитектура, которую можно адаптировать под различные робототехнические платформы без полного переобучения.
Какое отличие от конкурентов?
Есть компании, работающие над похожими технологиями - Figure AI, Boston Dynamics, Tesla, но по комбинации всех перечисленных возможностей и уровню интеграции LLM с физическими действиями Gemini Robotics превосходит их.
На рынке также есть Hi Robot от Physical Intelligence (основан экс-сотрудниками Google) - продвинутый антропоморфный подход с "внутренним голосом".
Сложно однозначно сказать, кто прогрессивнее - обе команды движутся разными путями. Hi Robot более инновационен в когнитивной архитектуре, а Gemini Robotics - в масштабе возможностей и разнообразии задач.
Но обе компании показывают нам куда стремится будущее ИИ и робототехники.
Представлен новый проект Gemini Robotics на основе мультимодальной модели Gemini 2.0. https://t.me/alwebbci/3096
Google DeepMind создали 2 специализированные системы: Gemini Robotics и Gemini Robotics-ER (Embodied Reasoning), которые выводят взаимодействие ИИ с физическим миром на новый уровень.
У Gemini Robotics есть:
1. Воплощённое мышление — это не просто система управления роботами, а полноценная когнитивная архитектура, способная к "воплощённому рассуждению". Робот не только видит объекты, но и понимает их пространственные отношения, функциональное назначение и контекст ситуации.
2. Zero-Shot и Few-Shot обучение — способность выполнять задачи с нуля/ с минимальным количеством примеров.
3. Физические действия как новая модальность - система не просто понимает команды, но и преобразует абстрактные инструкции в точные кинематические траектории.
4. Долговременная память позволяет роботу запоминать и использовать последовательности действий и наблюдений в течение длительного времени.
5. Перенос из симуляции в реальность - большая часть обучения происходит в виртуальных средах, но благодаря технологии Adaptive Domain Randomization модель успешно адаптируется к реальному миру.
6. Микро-оптимизация движений позволяет роботу корректировать свои движения на микроуровне в реальном времени на основе сенсорной обратной связи.
7. Этический фреймворк через "Constitutional AI". DeepMind интегрировал в Gemini Robotics систему автоматической генерации "конституций" — правил на естественном языке, которые управляют поведением робота.
8. Модульная архитектура, которую можно адаптировать под различные робототехнические платформы без полного переобучения.
Какое отличие от конкурентов?
Есть компании, работающие над похожими технологиями - Figure AI, Boston Dynamics, Tesla, но по комбинации всех перечисленных возможностей и уровню интеграции LLM с физическими действиями Gemini Robotics превосходит их.
На рынке также есть Hi Robot от Physical Intelligence (основан экс-сотрудниками Google) - продвинутый антропоморфный подход с "внутренним голосом".
Сложно однозначно сказать, кто прогрессивнее - обе команды движутся разными путями. Hi Robot более инновационен в когнитивной архитектуре, а Gemini Robotics - в масштабе возможностей и разнообразии задач.
Но обе компании показывают нам куда стремится будущее ИИ и робототехники.