Google DeepMind представила ИИ способный полностью управлять гуманоидным роботом

Компания Google DeepMind представила новое поколение моделей искусственного интеллекта, способных полностью управлять человекоподобными роботами. В отличие от предыдущих систем, которые контролировали лишь отдельные механизмы или выполняли ограниченный набор операций, новая архитектура позволяет координировать движения всего тела робота — от ног и рук до кистей и пальцев. По словам разработчиков, впервые одна система способна преобразовывать намерения и команды человека в комплексные движения всего тела.
Одной из главных проблем современной робототехники остаётся работа в реальной среде, где пространство постоянно меняется, присутствуют люди и возникают непредсказуемые ситуации. Большинство существующих роботов рассчитаны на выполнение заранее определённых операций в контролируемых условиях, что существенно ограничивает возможности их практического применения.
Исследователи считают, что для полноценной работы рядом с людьми роботам необходим искусственный интеллект, который способен анализировать окружающую обстановку, понимать происходящее, самостоятельно планировать последовательность действий и принимать решения с учётом изменяющихся условий. Кроме того, такие системы должны безопасно взаимодействовать как с людьми, так и с другими роботами.
Для решения этой задачи Google DeepMind разработала новую линейку моделей, состоящую из трёх взаимосвязанных компонентов. Первый из них — Gemini Robotics 2 — представляет собой модель класса «зрение — язык — действие» (Vision-Language-Action). Она преобразует визуальную информацию и текстовые команды в конкретные движения робота, позволяя управлять как полноценными гуманоидными платформами, так и отдельными роботизированными манипуляторами. Особое внимание разработчики уделили повышению точности движений кистей и способности аккуратно захватывать хрупкие или небольшие предметы.
Вторым элементом системы стала модель Gemini Robotics ER 2, основанная на концепции воплощённого рассуждения (Embodied Reasoning). Она выполняет роль интеллектуального координатора, анализируя физическую среду, планируя выполнение задач и управляя всеми действиями робота. По словам разработчиков, эта модель позволяет машине самостоятельно исправлять собственные ошибки, адаптироваться к ранее неизвестным ситуациям и изменять план действий без вмешательства человека.
Дополнительный уровень управления даёт роботу возможность понимать окружающую среду, строить планы выполнения сложных операций продолжительностью в несколько минут, взаимодействовать с другими роботами и выполнять инструкции, полученные от человека. Такой подход значительно расширяет автономность роботизированных систем.
Третьим компонентом стала модель Gemini Robotics On-Device 2, предназначенная для локального запуска непосредственно на роботе без необходимости постоянного подключения к облачным вычислениям. По утверждению Google DeepMind, она позволяет всего за несколько часов адаптировать систему управления к совершенно новым роботизированным платформам.
В качестве демонстрации возможностей новой технологии Google DeepMind показала работу человекоподобного робота Apollo, разработанного компанией Apptronik. Во время одного из испытаний робот получил голосовую команду поставить лейку в зелёный контейнер на нижней полке. Система самостоятельно распознала инструкцию, подошла к столу, взяла лейку, затем дошла до стеллажа и аккуратно разместила предмет в указанном месте.
В других демонстрациях Apollo смог приседать, чтобы поднять лежащую на полу лейку, выбирать нужные предметы на полках и переносить их в другое место. Робот также выполнил задачи, требующие высокой точности движений пальцев: завязал узел на пакете, застегнул молнию, герметично закрыл пакет с застёжкой и даже выкрутил электрическую лампочку.
Испытания проводились не только на гуманоидной платформе. Новые модели искусственного интеллекта также использовались на роботизированной системе с двумя манипуляторами, где Apollo 2 выполнял инструкции по сортировке и размещению инструментов. Это подтверждает возможность применения новой архитектуры на различных типах роботизированных устройств.
Разработчики признают, что роботам ещё предстоит значительно увеличить скорость передвижения и выполнения операций. Однако они считают достигнутый результат важным этапом на пути к созданию машин, способных выполнять сложные практические задачи, требующие согласованной работы всего тела.
В дальнейшем Google DeepMind планирует повысить точность и быстродействие своих робототехнических моделей, чтобы приблизить их ловкость к возможностям человека. По словам исследователей, дальнейшее развитие требует перехода от автоматизации отдельных операций к созданию универсального искусственного интеллекта, способного эффективно работать в физическом мире и помогать людям при выполнении всё более сложных задач.