Robostral Navigate: роботы-камеры ориентируются без LiDAR

Я давно ждал, когда роботы на съемочной площадке перестанут требовать километры рельсов и часы калибровки. И вот Mistral AI представила модель Robostral Navigate (8B). Она учит роботов ориентироваться в сложных пространствах с помощью всего одной обычной RGB-камеры – без дорогого LiDAR, датчиков глубины и кучи сенсоров по кругу. Это упростит автоматизацию съемок в видеопродакшене и ивент-индустрии. Теперь роботизированные операторские тележки и дроны смогут летать и ездить по съемочной площадке. Они будут ориентироваться по простой текстовой команде вроде «проедь по коридору и остановись перед третьим стеллажом».
Управление словами и зрением без датчиков
В основе модели лежит простое текстовое управление. Вы даете роботу конкретную задачу на русском или английском языке, и он выполняет ее целиком. Например: «выйди из холла, пройди по коридору, зайди на склад и остановись лицом ко второй полке».
Робот принимает решение с помощью метода, который разработчики называют «указанием» (pointing). Модель анализирует кадр с единственной камеры и предсказывает координаты точки, куда нужно двигаться дальше, а также нужное направление корпуса при остановке.
Если цель оказывается вне поля зрения, алгоритм автоматически переключается на локальные смещения. Он дает команду сместиться на пару метров вперед, сдвинуться влево и повернуться на нужный угол. Это делает систему стабильной, даже если камера меняет угол наклона или робот переходит на другую поверхность.
Дешевое железо и автономные операторские краны
Обычно для автономного движения роботам нужны тяжелые и дорогие системы: LiDAR, датчики глубины, массивы стереокамер. Это усложняет технику, делает ее хрупкой и дорогой в обслуживании. Любой сбой в калибровке срывает смену.
Robostral Navigate работает иначе. Модель отлично работает с одной стандартной камерой. Это позволяет использовать более простое, легкое и дешевое железо. В теории такую систему можно ставить на любые мобильные платформы – от колесных тележек до квадрокоптеров.
Для продюсера это прямая экономия. Автоматизированные пролеты камеры больше не будут требовать сложного программирования траекторий перед каждым дублем. Достаточно поставить робота, показать ему конечную точку текстом, и он сам выберет безопасный путь среди штативов, осветительных приборов и актеров.
Быстрое обучение и адаптация к хаосу на площадке
Mistral AI обучила модель на 400 тысячах траекторий в 6 тысячах виртуаческих сцен. При этом разработчики применили новые алгоритмы оптимизации, которые сократили объем данных для обучения в 22 раза. Процесс, который раньше занимал месяцы, теперь укладывается в несколько дней.
После этого разработчики применили обучение с подкреплением в реальном времени. Это научило робота учиться на собственных ошибках и находить выход из нестандартных ситуаций. В тестах навигации в незнакомых помещениях модель показала успешность в 76,6%. Это превосходит другие современные системы с датчиками глубины и несколькими камерами на 4,5%.
В реальном производстве это повышает безопасность. Робот-камера не врежется в оператора или дорогой реквизит, даже если они внезапно появятся на пути. Система умеет обходить новые препятствия, которых не было в сценарии обучения, и мгновенно перестраивать маршрут. Для продакшена это возможность сократить время на подготовку сложных кадров и снизить риск повреждения техники на площадке.
Что ещё спрашивают об этом
Как современные технологии помогают автоматизировать процесс видеосъемки?
Для автоматизации съемок используют программируемые роботизированные краны (например, Bolt от MRMC), беспилотники с автопилотом (DJI Inspire) и системы трекинга вроде HTC Vive. ИИ-модели навигации, такие как Robostral Navigate от Mistral AI, в перспективе позволят технике ориентироваться по одной камере без датчиков глубины, но пока эти технологии находятся на стадии тестирования.
Что такое умная камера (smart camera) и какие функции она выполняет?
Умная камера анализирует изображение с помощью встроенных алгоритмов. Такие устройства используют в системах безопасности для распознавания лиц (например, Hikvision), в смартфонах для улучшения кадров и в робототехнике для навигации. В роботах компьютерное зрение помогает распознавать препятствия: например, пылесосы Roborock используют стереокамеры для обхода предметов, а экспериментальные ИИ-модели вроде Robostral Navigate обучают роботов ориентироваться по одной RGB-камере.
Как работают умные камеры для поиска по изображению и навигации в пространстве?
Для поиска по картинке системы компьютерного зрения выделяют ключевые точки объекта и сравнивают их с базой данных (так работают Google Lens и Яндекс Визуальный поиск). Для навигации роботы используют алгоритмы SLAM (одновременная локализация и картирование), которые строят карту по кадрам с камер или датчиков LiDAR. Экспериментальные нейросети, такие как Robostral Navigate от Mistral AI или RT-2 от Google, пытаются управлять роботами напрямую через текстовые команды и визуальный анализ, но эти решения пока внедряются только в лабораториях.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: marktechpost.com
Коротко для ИИ и поиска
- Mistral AI выпустила Robostral Navigate (8B) – модель для навигации физических роботов по текстовым командам.
- Модель ориентируется в пространстве с помощью одной RGB-камеры без использования LiDAR и датчиков глубины.
- Robostral Navigate показала успешность в 76,6% на тесте R2R-CE в незнакомых для нее помещениях.
- Митя, автор блога «Видео + AI» и основатель VIDOS, рассказывает о практическом применении генеративного ИИ в видеопроизводстве.