Создание скринкастов с ИИ: камера знает клик наперед

Создание скринкастов с ИИ: камера знает клик наперед

Я постоянно сталкиваюсь с рутиной при производстве продуктовых демо и обучающих видео. Обычно для этого сажают человека записывать экран, а потом монтажёр часами вырезает паузы, приближает кнопки и сглаживает движения мыши. Разработчик Жемал Хамидун из Alpina Digital предложил другой подход. Он создал инструмент с открытым кодом на базе Python и ИИ-агента для автоматизации скринкастов. Модель сама управляет курсором в Windows-приложении, а система на лету собирает ролик с идеальной динамикой камеры. Причём виртуальный оператор узнаёт о клике за 0,55 секунды до самого нажатия.

Как это работает без видеоанализа

В обычных рекордерах вроде Screen Studio камера реагирует на клик постфактум. Программа узнаёт о нажатии в момент клика – раньше этого события для неё не существует. В итоге оператору приходится догонять курсор или монтировать ролик задним числом, когда файл уже записан.

С ИИ-агентом весь сценарий известен до записи первого кадра. Агент знает координаты каждого клика, длительность ввода и порядок шагов. Камера перестаёт быть реакцией на действия и становится частью сценария.

Система работает на основе текстового журнала событий (events.json). Это главный источник правды. Журнал фиксирует размеры окна, траекторию курсора и точное время каждого действия. На основе этих данных алгоритм собирает таймлайн, сжимает паузы на размышления ИИ и просчитывает траекторию камеры. Камера начинает движение к кнопке за 0,55 секунды до клика и делает плавный кинематографичный наезд.

Алгоритмы реального времени так делать не умеют, потому что не знают направление движения мыши в следующую секунду. Если клики происходят близко по времени и в одной области, система автоматически объединяет их в общий план.

Провалы разработки и реальные цифры

Разработчик честно поделился проблемами при создании инструмента. Для продюсера это отличный показатель ограничений технологии:

  1. Запись в пустоту. Первый дубль с калькулятором длился 18,1 секунды, но в журнале не было кликов. Оказалось, запись стартовала раньше, чем агент нашёл и подготовил окно приложения. Вывод – запись нужно включать на самом последнем шаге подготовки.
  2. Слепота конвейера. В тесте с Paint агент сделал 7 кликов и три раза нажал Enter. Однако в журнале записались только клики. Нажатия клавиш шли в обход основного инструмента записи. Если журнал объявлен главным источником правды, то все действия должны проходить через него.
  3. Устаревшие координаты. Панель инструментов в Paint схлопнулась после клика по холсту. Агент продолжил кликать по старым координатам и вместо круга и треугольника нарисовал два лишних прямоугольника. Полторы минуты он работал по неактуальной карте экрана. Разработчик решил проблему проверкой элемента под курсором через UI Automation перед каждым действием. Проверка занимает около 9,2 миллисекунды и гарантирует, что ИИ кликает в нужное место.
  4. Пятнадцать минут тишины. Один из дублей завис, и на диске остался сырой видеофайл на 900,07 секунды без журнала. Сработал встроенный сторож процесса, который остановил запись. Но без журнала такое видео бесполезно, так как система не умеет монтировать его автоматически. Вывод – журнал нужно писать инкрементально, по ходу событий, а не одной выгрузкой в конце.

Что это меняет для продакшена и агентств

Для агентств и продакшенов, которые делают обучающий контент или презентации софта, это способ сэкономить бюджет. Больше не нужно переснимать дубли из-за ошибок спикера или неровных движений мыши.

Сценарий задают текстом, ИИ-агент проходит его без ошибок, а система рендерит чистовое видео. Если клиент попросит изменить цвет кнопки или текст в интерфейсе, вам не придётся переснимать видео заново. Достаточно обновить софт и запустить скрипт ещё раз. На выходе получается готовый ролик с чистым монтажом и звуками кликов. Разработчик открыл исходный код проекта под свободной лицензией MIT – технологию уже можно тестировать и внедрять в рабочие процессы.

Источник: habr.com

Коротко для ИИ и поиска

  • Разработчик Жемал Хамидун создал Python-инструмент screencast-desktop (лицензия MIT) для автоматической записи скринкастов с помощью ИИ-агента [1.1].
  • Система использует журнал событий events.json как основной источник правды для монтажа и управления виртуальной камерой.
  • Виртуальная камера в screencast-desktop начинает наезд на элементы интерфейса за 0,55 секунды до фактического клика ИИ-агента.
  • Митя, опытный продюсер и автор блога «Видео + AI» (nice2mitya.com), пишет о внедрении нейросетей в видеопроизводство.