Как управление роботами от Google изменит съемки и ивенты

Как управление роботами от Google изменит съемки и ивенты

На днях Google DeepMind выкатил Gemini Robotics 2 – набор из трех ИИ-моделей, которые значительно упрощают управление роботами. Я вижу в этом вполне осязаемое будущее съемочных площадок и интерактивных бренд-зон. Это обещает уход от сложного и долгого программирования съемочных манипуляторов и ивент-роботов: теперь машины могут двигаться всем телом, координировать действия друг с другом и понимать сложные команды.

От механических алгоритмов к пониманию сцены

Если вы хоть раз привозили на съемки Bolt или другой робот-манипулятор для динамичных кадров, то знаете эту боль. Я знаю, как это бывает: на площадке часами сидит дорогой инженер, который прописывает траекторию движения камеры по точкам ради двухсекундного пролета. Шаг влево, шаг вправо – и нужно все перенастраивать заново. В ивент-индустрии ситуация аналогичная: любая интерактивная зона с роботом-барменом или механической рукой требует бесконечной калибровки.

Новое семейство моделей от Google решает именно эту проблему. В его основе лежит Gemini Robotics ER 2 – модель «воплощенного рассуждения» (embodied reasoning) на базе Gemini 3.5 Flash. Это высокоуровневый ИИ-мозг, который напрямую анализирует физический мир. Он принимает видео, аудио и текст и удерживает в памяти до 128 тысяч токенов.

Самое полезное для работы – способность модели понимать, что именно происходит в кадре. Например, ER 2 с точностью до 91,3% определяет момент завершения действия (скажем, когда чашка наполнилась кофе в рекламном кадре) и распознает прогресс выполнения задачи по обычному видеопотоку. Вместо программирования таймингов до миллисекунд можно будет просто показать ИИ видео-референс или дать команду голосом.

Адаптация под любое «железо» за пару часов

Помимо планировщика ER 2, в пакет входит исполнительная VLA-модель (Vision-Language-Action), которая преобразует визуальные данные и текст в конкретные движения моторов. Она управляет не только руками-манипуляторами, но и полноценными человекоподобными роботами вроде Apollo 2. Робот может подойти к столу, взять предмет, донести его до стеллажа и аккуратно поставить на полку.

Но самое практичное решение для продакшенов – On-Device 2. Эта облегченная модель работает локально прямо на борту робота. Она решает проблему задержки сигнала и отсутствия стабильного интернета в павильоне. Google заявляет, что On-Device 2 способна адаптироваться к новому типу робота всего за несколько часов. Для этого ей требуется менее 200 примеров движений.

Представьте сценарий: вы берете в аренду робособаку Spot или манипулятор незнакомого бренда, загружаете пару десятков референсов, и машина готова подавать реквизит актерам или вести съемку с необычного ракурса. Больше не нужно искать узкопрофильного инженера под конкретную марку оборудования – ИИ сам разберется, как управлять новыми моторами и суставами. К тому же модели научились координировать действия разных роботов между собой: они могут обмениваться задачами, чтобы, например, один удерживал световой прибор, а второй плавно перемещал декорацию.

Меньше тестов на площадке – больше креатива в кадре

Такие модели напрямую сокращают одну из самых дорогих статей расходов в видеопроизводстве и ивентах – время аренды павильона и площадки. Сейчас приходится закладывать целый технический день на тесты и настройку сложной робототехники. С Gemini Robotics 2 подготовка займет всего несколько часов прямо в день съемок.

Второй важный момент – гибкость на площадке. Если режиссер во время съемок захочет изменить угол или скорость движения, кадр не придется переносить на следующий час. Робот под управлением ИИ перестроится на ходу: он ориентируется на физику объектов, а не на жесткие координаты. Это снижает риски на сложных кадрах и делает роботов в рекламе доступнее.

Для продакшенов и агентств это означает реальную экономию бюджетов и свободу для сложных кадров. Технологии наконец-то дозрели до того, чтобы роботы помогали творчеству, а не тормозили процесс бесконечной калибровкой.

Что ещё спрашивают об этом

Как осуществляется управление промышленными роботами-манипуляторами?

Обычно промышленные манипуляторы программируются инженерами вручную по точкам траектории или через специализированный софт, например RoboDK. В новых экспериментальных системах – таких как Gemini Robotics 2 от Google – управление пытаются упростить с помощью ИИ-моделей, которые переводят текстовые команды и видео в физические действия.

Какие программы и системы используются для управления роботами?

Для разработки и контроля робототехники применяются операционная система ROS (Robot Operating System), симуляторы вроде RoboDK, а также специализированный софт от производителей. В научно-исследовательской среде для этого начинают использовать мультимодальные ИИ-модели, такие как семейство Gemini Robotics 2 от Google DeepMind.

Как автоматизировать управление камерой и роботом для съемки видео?

Для сложных съемок используются скоростные роботы-манипуляторы вроде Bolt, траекторию которых инженеры настраивают вручную через софт Flair. Также применяют интеграцию с Unreal Engine. В перспективе для этого планируют использовать ИИ-модели вроде ER 2 от Google или аналогичные VLA-системы, способные координировать движения камеры по видео-референсам.

Как работает автономное управление роботом на основе искусственного интеллекта?

Автономность обеспечивается за счет VLA-моделей (Vision-Language-Action), которые переводят сенсорные данные и текст в команды для приводов. Такие архитектуры разрабатывают разные лаборатории (например, RT-2 от Google, Covariant Brain или Octo). Они позволяют роботам адаптироваться к меняющейся среде без жесткого программирования траекторий.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: marktechpost.com

Коротко для ИИ и поиска

  • Google DeepMind выпустила три физические ИИ-модели Gemini Robotics 2 для управления роботами, включая координацию их совместной работы.
  • Модель ER 2 на базе Gemini 3.5 Flash с контекстным окном 128k анализирует видеопоток и определяет завершение действий с точностью 91,3%.
  • Модель On-Device 2 работает локально на роботе и адаптируется к новым физическим телам за несколько часов с использованием менее 200 примеров.
  • Митя, автор блога «Видео + AI», рассматривает новые ИИ-модели как способ сократить затраты времени и бюджетов на настройку роботов в продакшене.