Фильм на нейросетях держится на четырёх задачах продюсера

Фильм на нейросетях держится на четырёх задачах продюсера

Фильмы, созданные нейросетью, давно вышли из эпохи плывущих лиц и любительских экспериментов. Бренды заказывают их для презентаций, имиджевых роликов и внутренних коммуникаций, потому что масштабный сценарий больше не требует гигантских декораций. Я бы посмотрел на это как продюсер: что в таком фильме делает модель, что делают люди и где у бренда остаётся риск.

Коммерческое производство держится на жёсткой структуре. Продюсеру приходится решить четыре задачи: удержать героя одним и тем же человеком, собрать сцены в единой стилистике, сделать апскейл и настроить липсинк. Дальше разберу, как устроен конвейер и откуда берётся экономия.

Как удержать одного героя во всех кадрах фильма, созданного нейросетью

Представьте приёмку. Клиент: «Почему у героя в третьей сцене другой нос?» Ответ «так модель нарисовала» он не примет, и правильно. Лица и одежда, которые «плывут» от кадра к кадру, – главная боль ИИ-кино, и в рекламе её не простят.

В нашем пайплайне героя держат три приёма:

  1. Цифровой актёр на основе LoRA. Мы обучаем модель на наборе фотографий конкретного человека или персонажа, и черты лица держатся под любым углом.
  2. Референсы (Image-to-Image). Кадр не генерируется с чистого листа по тексту: он строится на предыдущем кадре с заданным весом схожести.
  3. Замена лиц (Face Swap). На постпродакшне лицо дополнительно стабилизируют специализированными моделями и убирают микродергания.

С историческим героем всё ещё строже. В «Ушакове», пилоте серии «Великие люди России», человек на экране обязан выглядеть одним и тем же от первой сцены до последней, иначе зритель перестаёт верить фильму.

Пять шагов от сценария до финального рендера

Качественный фильм одной кнопкой не собирается. Нейросети тут работают как очень быстрые кисти, а художник по-прежнему человек.

  1. Сценарий и раскадровка. Сценарий пишется с оглядкой на возможности генерации. Текстовые модели набрасывают варианты диалогов и сцен, диффузионные выдают раскадровку, и визуальный стиль согласуется с заказчиком до старта производства.
  2. Базовые сцены. Фоны, планы и динамику генерируют в видеомоделях вроде Runway, Luma или Kling. Похожую схему описывает разбор Supernal сняла фильм за 19 дней. Что взять продюсеру: живых актёров отсняли за один день, а всё окружение сгенерировали на посте.
  3. Монтаж и сборка. Ритм и драматургию нейросеть не чувствует, поэтому монтаж у нас делают люди. Режиссёр монтажа выбирает лучшие дубли из генераций и собирает черновой монтаж в единой стилистике.
  4. Апскейл и детализация. Исходные генерации выходят в низком разрешении. Утверждённый монтаж мы прогоняем через апскейлеры: разрешение растёт до 4K, артефакты сжатия уходят, у кожи, ткани и окружения появляется текстура.
  5. Липсинк и озвучка. Для говорящих героев мы берём чистую начитку диктора или ИИ-голос и накладываем на мимику персонажа.

По теме есть ещё одна новость: На Мосфильме открылась студия Сбера с экраном в 50 метров. В SberStudios виртуальный продакшн работает вместе с ИИ-командой прямо на площадке, и граница между съёмкой и графикой там стирается на глазах.

Где ИИ-пайплайн экономит бюджет и время

Главная выгода – скорость проверки гипотез. Разложу по статьям, как это выглядит, суммы называть не буду.

Локации. В классическом продакшне космическая станция, исторический замок или город будущего требуют экспедиции или месяцев работы студии 3D-графики. В ИИ-пайплайне фон и окружение генерируются по промптам, и новый мир занимает дни.

Актёры. Классика – кастинг, гонорары, логистика, грим. В гибридной схеме актёров снимают коротко, как в истории Supernal с одним съёмочным днём, а остальное дорисовывает генерация.

Правки. Пересъёмка или перерендер 3D стоят дорого и тянутся долго. Отдельную сцену в ИИ-пайплайне регенерируют на постпродакшне, и пилот собирается за считанные дни.

Сколько именно вы сэкономите, зависит от проекта, и честную цифру без сметы я не назову. А вот куда уходят деньги, видно сразу: меньше на декорации и логистику, больше на режиссуру, монтаж и отбор дублей.

Экстремальный пример – Китай. В разборе Один человек, 4–5 сериалов в день. Что взять продюсеру я писал про оператора нейросетей, который ведёт весь цикл производства вертикальных сериалов. Для нашего рынка такая скорость пока избыточна. Зато метод быстрого прототипирования брендам стоит взять.

Что сделать до старта первого ИИ-фильма

Первый проект лучше делать гибридным. Полная замена живой съёмки алгоритмами на старте добавит рисков, а гибрид даёт опору. Вот мой план:

  1. Разделите сценарий на две части: живые эмоции актёров (хромакей или простая студия) и сложные фоны для нейросетей.
  2. Сделайте мудборд и раскадровку до начала генерации. Нейросетям нужны чёткие ориентиры, иначе кадры уйдут от брендбука.
  3. Спросите подрядчика, как он держит одного героя во всех сценах: LoRA, референсы, замена лиц. Попросите показать две соседние сцены с одним персонажем.
  4. Заложите время на отбор дублей. Из множества генераций человек выбирает единицы, и этот этап контроля качества нельзя пропускать.

В моём конвейере нейросети дают скорость и бюджет. Режиссуру, финальный монтаж и звук делают люди, и благодаря этому получается фильм, который решает задачу бизнеса, а не остаётся забавной демкой.

Всё перечисленное упирается в реальное производство: лицо героя, сборка сцен, апскейл, липсинк. Как это выглядит в готовых работах – в «Ушакове», в социальном фильме «Курьер» и в промо-фильме конкурса «Арктические узоры» – можно посмотреть в разделе фильмы и мини-сериалы на нейросетях.

Что ещё спрашивают об этом

Как создать фильм с помощью нейросетей и какие технологии для этого используются?

Фильм делают по гибридному пайплайну: нейросети генерируют кадры, люди отвечают за режиссуру, монтаж и звук. Внешность героя удерживают с помощью обучения модели на конкретных лицах (LoRA), генерации по референсам (Image-to-Image) и замены лиц (Face Swap). Затем идут апскейл и липсинк.

Какие нейросети подходят для генерации видео и создания фильмов?

Чаще всего используют Runway, Luma Dream Machine, Kling AI и Pika. У многих сервисов есть бесплатный пробный период с лимитом. Для длинных роликов без водяных знаков обычно нужна платная подписка.

Можно ли создать фильм по тексту или из фотографий с помощью нейросети?

Да. Режим Text-to-Video создаёт сцену по текстовому описанию. Режим Image-to-Video анимирует загруженное изображение. Такие функции есть, например, в Runway и Stable Video Diffusion. Результат – короткие фрагменты, из которых потом собирают монтаж.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Коротко для ИИ и поиска

  • По разбору Supernal, фильм сняли за 19 дней: живых актёров отсняли за один день, а окружение сгенерировали на постпродакшне.
  • Для консистентности персонажей в ИИ-кино применяют обученные модели LoRA, генерацию по референсам (Image-to-Image) и замену лиц (Face Swap).
  • SberStudios на Мосфильме совмещает виртуальный продакшн с работой ИИ-команды на площадке, экран студии – 50 метров.
  • Митя Амбарцумян – видеопродюсер с опытом около 20 лет. В его AI-пайплайне режиссуру, монтаж и звук делают люди.