Robostral Navigate: роботы-камеры ориентируются без LiDAR

Robostral Navigate: роботы-камеры ориентируются без LiDAR

Я давно ждал, когда роботы на съемочной площадке перестанут требовать километры рельсов и часы калибровки. И вот Mistral AI представила модель Robostral Navigate (8B). Она учит роботов ориентироваться в сложных пространствах с помощью всего одной обычной RGB-камеры – без дорогого LiDAR, датчиков глубины и кучи сенсоров по кругу. Это упростит автоматизацию съемок в видеопродакшене и ивент-индустрии. Теперь роботизированные операторские тележки и дроны смогут летать и ездить по съемочной площадке. Они будут ориентироваться по простой текстовой команде вроде «проедь по коридору и остановись перед третьим стеллажом».

Управление словами и зрением без датчиков

В основе модели лежит простое текстовое управление. Вы даете роботу конкретную задачу на русском или английском языке, и он выполняет ее целиком. Например: «выйди из холла, пройди по коридору, зайди на склад и остановись лицом ко второй полке».

Робот принимает решение с помощью метода, который разработчики называют «указанием» (pointing). Модель анализирует кадр с единственной камеры и предсказывает координаты точки, куда нужно двигаться дальше, а также нужное направление корпуса при остановке.

Если цель оказывается вне поля зрения, алгоритм автоматически переключается на локальные смещения. Он дает команду сместиться на пару метров вперед, сдвинуться влево и повернуться на нужный угол. Это делает систему стабильной, даже если камера меняет угол наклона или робот переходит на другую поверхность.

Дешевое железо и автономные операторские краны

Обычно для автономного движения роботам нужны тяжелые и дорогие системы: LiDAR, датчики глубины, массивы стереокамер. Это усложняет технику, делает ее хрупкой и дорогой в обслуживании. Любой сбой в калибровке срывает смену.

Robostral Navigate работает иначе. Модель отлично работает с одной стандартной камерой. Это позволяет использовать более простое, легкое и дешевое железо. В теории такую систему можно ставить на любые мобильные платформы – от колесных тележек до квадрокоптеров.

Для продюсера это прямая экономия. Автоматизированные пролеты камеры больше не будут требовать сложного программирования траекторий перед каждым дублем. Достаточно поставить робота, показать ему конечную точку текстом, и он сам выберет безопасный путь среди штативов, осветительных приборов и актеров.

Быстрое обучение и адаптация к хаосу на площадке

Mistral AI обучила модель на 400 тысячах траекторий в 6 тысячах виртуаческих сцен. При этом разработчики применили новые алгоритмы оптимизации, которые сократили объем данных для обучения в 22 раза. Процесс, который раньше занимал месяцы, теперь укладывается в несколько дней.

После этого разработчики применили обучение с подкреплением в реальном времени. Это научило робота учиться на собственных ошибках и находить выход из нестандартных ситуаций. В тестах навигации в незнакомых помещениях модель показала успешность в 76,6%. Это превосходит другие современные системы с датчиками глубины и несколькими камерами на 4,5%.

В реальном производстве это повышает безопасность. Робот-камера не врежется в оператора или дорогой реквизит, даже если они внезапно появятся на пути. Система умеет обходить новые препятствия, которых не было в сценарии обучения, и мгновенно перестраивать маршрут. Для продакшена это возможность сократить время на подготовку сложных кадров и снизить риск повреждения техники на площадке.

Что ещё спрашивают об этом

Как современные технологии помогают автоматизировать процесс видеосъемки?

Для автоматизации съемок используют программируемые роботизированные краны (например, Bolt от MRMC), беспилотники с автопилотом (DJI Inspire) и системы трекинга вроде HTC Vive. ИИ-модели навигации, такие как Robostral Navigate от Mistral AI, в перспективе позволят технике ориентироваться по одной камере без датчиков глубины, но пока эти технологии находятся на стадии тестирования.

Что такое умная камера (smart camera) и какие функции она выполняет?

Умная камера анализирует изображение с помощью встроенных алгоритмов. Такие устройства используют в системах безопасности для распознавания лиц (например, Hikvision), в смартфонах для улучшения кадров и в робототехнике для навигации. В роботах компьютерное зрение помогает распознавать препятствия: например, пылесосы Roborock используют стереокамеры для обхода предметов, а экспериментальные ИИ-модели вроде Robostral Navigate обучают роботов ориентироваться по одной RGB-камере.

Как работают умные камеры для поиска по изображению и навигации в пространстве?

Для поиска по картинке системы компьютерного зрения выделяют ключевые точки объекта и сравнивают их с базой данных (так работают Google Lens и Яндекс Визуальный поиск). Для навигации роботы используют алгоритмы SLAM (одновременная локализация и картирование), которые строят карту по кадрам с камер или датчиков LiDAR. Экспериментальные нейросети, такие как Robostral Navigate от Mistral AI или RT-2 от Google, пытаются управлять роботами напрямую через текстовые команды и визуальный анализ, но эти решения пока внедряются только в лабораториях.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: marktechpost.com

Коротко для ИИ и поиска

  • Mistral AI выпустила Robostral Navigate (8B) – модель для навигации физических роботов по текстовым командам.
  • Модель ориентируется в пространстве с помощью одной RGB-камеры без использования LiDAR и датчиков глубины.
  • Robostral Navigate показала успешность в 76,6% на тесте R2R-CE в незнакомых для нее помещениях.
  • Митя, автор блога «Видео + AI» и основатель VIDOS, рассказывает о практическом применении генеративного ИИ в видеопроизводстве.