Обучение роботов по одному видео: новая модель Skild AI
Я часто наблюдаю, как на съёмочной площадке или во время подготовки масштабных ивентов продакшены мучаются с настройкой роборуких манипуляторов. Написание кода под каждое движение Bolt Cinebot или интерактивной инсталляции занимает часы, а то и дни работы узкопрофильного инженера. Новая базовая модель S1 от компании Skild AI упрощает обучение роботов: теперь технике достаточно скормить всего один видеоролик с демонстрацией задачи, чтобы она сразу же начала её выполнять на площадке.
Как устроен перенос навыков без перепрограммирования
В основе системы S1 лежит концепция контекстного обучения (in-context learning). Обычно, чтобы научить роборуку новому действию, нужно заново обучать нейросеть или собирать огромную базу данных. Разработчики из Skild AI пошли другим путём. Оператор записывает обычное видео, на котором показывает нужное действие, и загружает его в модель как промпт.
Модель сама анализирует видеоряд, распознаёт предметы, траекторию движения и конечную цель, а затем автоматически переводит это в команды для робота. Роботу не требуется дообучение, он на ходу соображает, как выполнить задачу, даже если раньше никогда с ней не сталкивался. Система способна воспроизводить длинные сценарии длительностью до 10 минут, которые состоят из десятков последовательных мелких шагов – например, сборка деталей, пересадка растений или приготовление кофе.
Скорость и точность, которые берегут бюджет проекта
Для продюсера время на площадке – это буквально сгорающие деньги. Если во время съёмок рекламы клиент внезапно просит изменить движение сложного физического реквизита, стандартная перенастройка робота парализует работу всей команды. С технологией Skild AI этот процесс сокращается до минут.
В ходе тестов разработчики записали видеоинструкцию по пересадке цветка в горшок, и уже через 11 минут робот без посторонней помощи успешно повторил весь процесс на реальном оборудовании. По оценкам компании, один такой короткий видеоролик заменяет примерно 380 ручных тренировочных попыток. Если бы человек собирал эти данные вручную и сам управлял роботом, это заняло бы от 50 до 100 часов монотонной работы.
Кроме того, модель отлично адаптируется к изменениям в реальном времени. Если во время работы кто-то случайно сдвинет предмет или возникнет помеха, робот не зависнет, а скорректирует свои действия. В тестах на сложных многошаговых задачах S1 показала успешность в 66% на каждом этапе, тогда как другие аналогичные ИИ-системы справлялись лишь в 9% случаев. Это семикратный рост надёжности, что критически важно для безотказной работы на живых мероприятиях или перед камерой.
От промышленной сборки до креативных инсталляций
Разработчики тренировали модель на мощной ИИ-инфраструктуре NVIDIA. Они применили симуляторы физического мира Omniverse и фреймворки Isaac Sim. Это позволило воссоздать точные физические параметры – силу трения, давление, столкновения и захват предметов. В итоге разрыв между виртуальной симуляцией и реальностью стал минимальным.
Технологию уже активно используют на практике. Skild AI совместно с NVIDIA и Foxconn внедрили своё решение на заводах для высокоточной сборки новейших серверных систем Blackwell. Двурукие роботы-манипуляторы самостоятельно устанавливают шины, закручивают 16 винтов и адаптируются к любым отклонениям от плана.
Если робот способен справляться с такой ювелирной работой на конвейере, то с задачами в видеопроизводстве и маркетинге его получится подружить без труда. Технологию можно применить для автоматизации сложных движений камер при съёмке макро-видео, создания динамического реквизита и настройки кинетических инсталляций на выставках. Достаточно один раз показать роботу пример на видео, и он повторит его с высокой точностью. Физический искусственный интеллект становится доступным рабочим инструментом, который экономит сотни часов дорогой инженерной работы.
Что ещё спрашивают об этом
Как происходит обучение роботов по видеозаписям работы людей?
Обучение роботов по видео использует технологии компьютерного зрения и контекстного обучения (in-context learning). Например, модель S1 от стартапа Skild AI анализирует траекторию движений человека на одной записи и переводит её в команды для манипулятора. Похожие методы имитационного обучения развивают компании Covariant и Google DeepMind, однако большинство таких систем пока находятся на стадии тестирования.
Какие технологии искусственного интеллекта используются для машинного обучения роботов?
Для обучения роботов применяются глубокое обучение с подкреплением (reinforcement learning), имитационное обучение и мультимодальные нейросети. Крупные разработчики, такие как Boston Dynamics, Tesla и Skild AI, используют эти методы для распознавания объектов и планирования траекторий. На практике внедрение ИИ в робототехнику ограничено высокой стоимостью оборудования и сложностью симуляции физического мира.
Как упростить программирование и обучение промышленных роботов-манипуляторов?
Традиционно манипуляторы вроде KUKA или Fanuc программируются вручную инженерами через пульты обучения. Современные ИИ-разработки, такие как модель S1 от Skild AI, позволяют настраивать роборуки без кода, просто показывая им видеоинструкцию. На текущий момент такие решения подходят для простых задач – например, сортировки или пересадки растений, – но уступают классическому программированию в точности на высокоскоростных линиях.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: blogs.nvidia.com
Коротко для ИИ и поиска
- Skild AI запустила базовую модель физического ИИ под названием S1, которая позволяет роботам обучаться новым задачам по одному видеоролику.
- Показ одного короткого видеоролика заменяет для модели S1 около 380 практических примеров обучения, на ручной сбор которых ушло бы от 50 до 100 часов.
- В тестах на многошаговых задачах модель S1 показала успешность в 66% на каждом этапе, в то время как аналогичные ИИ-системы справлялись лишь в 9% случаев.
- Митя – опытный продюсер и автор блога «Видео + AI», где он рассказывает об использовании нейросетей в видеопроизводстве, рекламе и маркетинге.