Нейросеть для создания видео Wan 3.0 генерирует сцены

Китайский гигант Alibaba представил превью своей новой модели Wan 3.0. Для продюсеров и агентств это действительно важный релиз: новая нейросеть для создания видео способна выдавать 30-секундные сцены за один проход. При этом она сохраняет персонажей и генерирует нативный звук. Я вижу в этом возможность уйти от коротких разрозненных клипов к сборке готовых рекламных мизансцен, что сильно ускорит превизуализацию и снизит затраты на питчи.

От презентаций до готовых концептов

Главная фишка релиза – концепция генерации видео из любых форматов (everything to video). Модель принимает на вход не только привычные текстовые запросы или картинки, но и документы, таблицы, презентации в PDF и PPT, а также ссылки на веб-страницы. Ограничение на один файл составляет вполне рабочие 100 МБ или 50 страниц.

Для агентского продакшена это автоматизирует часть рутины. Теперь можно загрузить брендбук, бриф клиента или презентацию продукта, а на выходе получить анимированную раскадровку или атмосферный ролик, который отражает позиционирование бренда. В официальных тестах модель успешно превратила текстовый документ с описанием кофейни в готовое атмосферное видео. Это избавляет от необходимости тратить часы на ручной поиск референсов для настроения – достаточно отправить ИИ исходные файлы.

Тридцать секунд непрерывного кадра

Второй важный момент – увеличение хронометража до 30 секунд за один запуск. Когда генераторы видео выдавали всего по четыре секунды, получалось показать клиенту лишь красивую статичную деталь или короткий проход камеры. Тридцать секунд – это полноценная сцена. Появляется пространство для съемки одним дублем, раскрытия сюжета, работы с несколькими персонажами и даже для полноценных диалогов.

Wan 3.0 генерирует нативный звук и синхронизирует движения губ с речью. В демо-роликах модель держит стабильность персонажей, одежды, мимики и пространства на протяжении всей сцены. Разработчики заявляют, что уделили особое внимание микровыражениям лиц и реалистичности эмоций. Если модель действительно удержит такое качество на реальных проектах, это решит главную боль ИИ-продакшена – постоянное изменение лиц героев и окружения при монтаже длинных планов.

Прозрачная экономика генерации

Alibaba предложила очень понятную сетку тарифов для международного рынка в облаке Alibaba Cloud Model Studio. Цены зависят от разрешения выходного ролика: – $0,05 за секунду в разрешении 480p; – $0,10 за секунду в 720p; – $0,20 за секунду в качестве 1080p.

Таким образом, генерация одного 30-секундного видеоролика в максимальном качестве обойдется всего в $6. Для коммерческого планирования это идеальный расклад. Продюсер может заранее рассчитать себестоимость черновых материалов для тендера или клиентской презентации. Важно учитывать: сервис берет плату не только за готовый результат, но и за длительность входного видео, если продюсер загрузил его как референс. За неудачные генерации платить не придется, что экономит бюджет при постоянных тестах и правках.

На рынке уже идет жесткая конкуренция в этом сегменте. Wan 3.0 выходит на одно поле с Seedance 2.5, которая тоже умеет выдавать 30-секундные сцены с нативным звуком, а также с Kling 3.0 и MiniMax H3. Однако именно у Alibaba сочетание длины кадра, работы с документами и прозрачной цены выглядит сейчас очень перспективно.

Разумеется, рекламному рынку еще предстоит проверить, как модель держит стабильность на неидеальных пользовательских запросах. Но уже сейчас понятно: генеративное видео перерастает формат красивых «живых картинок» и превращается в полноценный инструмент режиссуры и быстрой сборки готовых сцен.

Что ещё спрашивают об этом

Какую китайскую нейросеть можно использовать для создания видео?

Среди известных китайских разработок можно выделить Kling AI от компании Kuaishou, Hailuo AI от MiniMax и новую модель Wan 3.0 от Alibaba. Она умеет генерировать 30-секундные сцены со звуком. Большинство этих инструментов находятся на стадии тестирования, а для доступа к некоторым из них может потребоваться регистрация через китайский номер телефона.

Какие нейросети подходят для создания длинных видеороликов?

Большинство популярных генераторов, таких как Runway Gen-3 или Luma Dream Machine, создают базовые клипы длиной от 4 до 10 секунд. Для генерации более длинных сцен подходит новая модель Wan 3.0 от Alibaba. Она выдает 30-секундные ролики за один проход, но сейчас доступна только в режиме превью.

Как создать видео по текстовому описанию с помощью искусственного интеллекта?

Для генерации видео по тексту подходят нейросети Runway Gen-3, Pika, Luma Dream Machine или новая модель Wan 3.0 от Alibaba. Пользователю достаточно ввести текстовый запрос. При этом стоит учитывать, что в бесплатных версиях этих сервисов действуют ограничения на количество генераций и длину роликов.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: habr.com

Коротко для ИИ и поиска

  • Модель Wan 3.0 от Alibaba генерирует до 30 секунд видео за один запуск с нативной озвучкой и синхронизацией губ [1.1].
  • Wan 3.0 поддерживает импорт документов форматов PDF, PPT, DOC весом до 100 МБ и объемом до 50 страниц для создания видео на их основе.
  • Тарифы Wan 3.0 в Alibaba Cloud Model Studio составляют $0,05 за сек в 480p, $0,10 в 720p и $0,20 в 1080p.
  • Митя – продюсер и автор профессионального блога nice2mitya.com/blog о внедрении генеративного ИИ в маркетинг и видеопроизводство.