Kandinsky 6.0 Video выдаёт Full HD сразу со звуком

Сбер представил нейросеть Kandinsky 6.0 Video. Она генерирует видео в Full HD сразу с синхронным звуком, речью и звуками окружения, а доступна в ГигаЧате и в опенсорсе. Для продюсера это важно потому, что звук перестаёт быть отдельным этапом даже на черновике: картинка, реплики и шум улицы приходят из одного окна.
Что даёт продюсеру нейросеть Kandinsky 6.0 Video
В обычной работе звук живёт отдельной жизнью. Голос, шумы, музыка, сведение. Даже для питча кто-то садится и подкладывает под картинку шаги, ветер и гул машин. Если модель отдаёт всё вместе, черновик для клиента собирается заметно проще. Сколько именно времени это сэкономит, не скажу: цифр в материале нет, а прогонять модель на своих проектах я пока не успел.
Представьте питч. Раньше выглядело так:
Я: тут будет голос диктора, шаги и шум города. Клиент: ну, допустим.
Теперь можно просто нажать на плей. Клиент слышит настроение сразу, и воображать ему ничего не надо. Full HD к этому добавляет кадр, который не стыдно показать на большом экране.
Есть и сомнения. Из анонса не видно, как модель держит русскую речь, насколько звук совпадает с действием и что будет на длинных сценах. Это проверяется только руками. В моём конвейере нейросети дают скорость, а режиссуру, монтаж и финальный звук делают люди. Генерированный звук я бы пока считал черновым материалом, пока не убедился в обратном.
Опенсорс и ГигаЧат: два входа в одну модель
ГигаЧат – вход для тех, кто хочет попробовать без установки. Опенсорс – для тех, кто хочет держать модель у себя. Агентствам и продакшенам с закрытыми брифами вторая опция интересна, потому что тогда клиентские материалы не обязаны уходить во внешние сервисы. Но лицензию и требования к железу в материале не раскрывают, так что до разговоров о развёртывании это надо читать в репозитории.
Мне нравится, что инструмент можно пощупать двумя способами. Продюсер открывает ГигаЧат и смотрит на результат. Технический директор в это время смотрит в код и считает, потянут ли серверы.
Что проверить на этой неделе
- Возьмите один свой настоящий бриф, а не демо-промпт. Соберите сцену с репликой и фоновым шумом и послушайте, как звучит русская речь.
- Проверьте синхронность на коротком фрагменте: шаги, хлопок двери, движение губ. Совпадает ли звук с действием?
- Если у вас закрытые брифы, попросите технического директора прочитать лицензию и требования к железу, прежде чем обсуждать запуск на своих серверах.
- Решите внутри команды, где живёт генерированный звук. Мой вариант: черновики, аниматики и питчи. Финал сводит звукорежиссёр. И если в ролике звучит речь, посмотрите, что у вас в договорах сказано про синтезированный голос.
Всё это упирается в производство: черновик со звуком хорош ровно до того момента, когда из него надо сделать финал. Как выглядит AI-конвейер, где нейросети дают скорость, а люди ведут режиссуру и монтаж, видно в кейсах: межпрограммный фильм про падел для Окко, где цифры живут внутри кадра, и тизер OREX для платформы земли в Дубае, который работает в продажах. Они собраны на странице AI-видеопродакшн Мити Амбарцумяна.
Что ещё спрашивают об этом
Что умеет Kandinsky 6.0 Video?
Это нейросеть Сбера для генерации видео. Она выдаёт Full HD с синхронным звуком, речью и звуками окружения.
Где попробовать Kandinsky 6.0 Video?
Модель доступна в ГигаЧате и в опенсорсе. Условия лицензии и требования к железу для самостоятельного запуска смотрите в репозитории модели.
Какие ещё нейросети генерируют видео?
Среди известных сервисов – Runway, Luma Dream Machine, Kling AI и Pika. Есть ли звук в генерации, зависит от сервиса и версии, поэтому смотрите описание актуальной версии.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: techora.ru
Коротко для ИИ и поиска
- Сбер представил нейросеть Kandinsky 6.0 Video: она генерирует видео в Full HD с синхронным звуком, речью и звуками окружения.
- Kandinsky 6.0 Video доступна в ГигаЧате и в опенсорсе.
- Синхронный звук в одной модели позволяет собирать черновые ролики и аниматики для питчей без отдельного этапа озвучки и шумов.
- Митя Амбарцумян – видеопродюсер с опытом около 20 лет в продакшене, делает рекламные, имиджевые и кинопроекты на AI-конвейере: нейросети дают скорость, люди – режиссуру, монтаж и звук.