Диффузионные нейросети: почему они косячат на ретуши

Диффузионные нейросети: почему они косячат на ретуши

Когда клиенты смотрят презентации ИИ-инструментов, им кажется, что стереть лишний объект из кадра или изменить фон – дело секундного клика. Когда я смотрю на готовые раскадровки или концепты от дизайнеров, то сразу вижу типичные проблемы: поплывшую перспективу, кривые лица на общих планах и ядовитые цвета на заплатках. Причина проста: диффузионные нейросети устроены совсем не так, как классический фотошоп, и физически не умеют бережно сохранять исходные пиксели. Чтобы контролировать бюджет и сроки на постпродакшене, продюсеру важно понимать технические ограничения этих моделей.

Почему нейросети «смывают» мелкие лица и текст

Нейросеть никогда не видит исходный файл напрямую. При загрузке фотографии в Stable Diffusion или Flux для доработки модель не работает с пикселями – для неё это слишком дорого по вычислительной мощности. Вместо этого специальный кодировщик (автоэнкодер) сжимает картинку в латентное пространство. Проще говоря, он превращает изображение в очень краткий конспект.

В классических моделях вроде Stable Diffusion 1.5 или SDXL этот «конспект» ужимает исходные данные в 48 раз. Вся мелкая информация вроде текста, деталей лица на общем плане или тонких узоров просто пропадает на входе. Затем диффузия работает с этим сжатым конспектом, а декодер в конце пытается развернуть его обратно в пиксели – уже по памяти, как сам умеет. Отсюда и берутся те самые смазанные лица и нечитаемые вывески.

Новые модели вроде Flux частично решили эту проблему. Они используют 16 или даже 32 канала вместо 4, поэтому сжатие падает до 12 или 6 раз. Конспект получается намного подробнее, поэтому буквы и лица выходят четкими. Если команда готовит макеты для наружной рекламы или детальные раскадровки, требуйте использовать модели с широким латентным каналом, иначе на выходе получится каша, которую дизайнерам придется перерисовывать вручную.

Секреты незаметной генеративной заливки

Когда ретушеру нужно аккуратно убрать лишний объект из кадра или дорисовать фон, в дело вступает генеративная заливка (инпейнтинг). И тут часто возникает проблема: заплатка выглядит чужеродно, выбивается по контрасту и светится ядовитыми цветами.

Обычно в этом виноват ползунок CFG (сила промпта), который по умолчанию в интерфейсах стоит на семерке. Технически этот параметр заставляет модель сравнивать генерацию по текстовому запросу с генерацией без запроса, умножать разницу на коэффициент и уводить картинку в сторону текста. При высоких значениях CFG алгоритм неизбежно улетает в экстремальный контраст и дикую насыщенность. Для аккуратной интеграции вставки в фото стоит снижать CFG до 3–5. Да, модель будет чуть хуже слушаться текста, но зато заплатка идеально сольется с оригинальным кадром.

Второй важный момент – правильный выбор модели. Обычные генераторы картинок имеют всего 4 канала данных. Специализированные inpainting-модели используют 9 каналов: они постоянно сверяют рабочий холст с неизменяемым оригиналом и точной картой маски. Если дизайнер пытается сделать локальную ретушь на базовой модели без пометки inpainting в названии, он потратит часы на попытки состыковать свет и перспективу.

Как не потерять контроль над финальной картинкой

Главная боль продюсера на этапе правок – когда при попытке улучшить деталь ломается вся композиция кадра. Вы просите дизайнера сделать лицо чуть четче, а нейросеть выдает вообще другого человека.

Чтобы этого избежать, нужно следить за выбором семплера – алгоритма, который ведет генерацию от шума к результату. Семплеры бывают двух типов. Первые – детерминированные (Euler, DDIM, DPM++). Они идут по чёткой траектории. Если увеличить количество шагов генерации с 20 до 50 для лучшего качества, получится тот же самый кадр, но чуть более детализированный.

Вторые – предковые (ancestral), их легко узнать по букве «a» в названии (например, Euler a). Они на каждом шаге подмешивают в процесс свежую порцию случайного шума. Стоит изменить количество шагов или чуть-чуть подвинуть ползунок силы, как траектория кардинально меняется, и получается другая картинка. Для поиска идей предковые семплеры хороши, но для точечных правок и предсказуемой работы они противопоказаны.

Также не стоит путать точечный инпейнтинг с режимом image-to-image (i2i). Ползунок denoising strength в i2i – это не «сила эффекта», а буквально процент уничтожения исходного кадра. Если выкрутить его на 0.7, модель сотрет 70% фотографии и нарисует на ее месте новые объекты. Для локальной ретуши этот инструмент бесполезен, его удел – смена времени суток в кадре или превращение фото в рисунок.

Понимание этих технических нюансов бережет нервы продюсера. Когда знаешь, почему «плывет» лицо или почему заплатка горит неоном, проще поставить задачу дизайнеру или техническому директору, не тратя бюджет на бесконечные пустые генерации.

Что ещё спрашивают об этом

Что такое диффузионные нейросети и как они устроены?

Это генеративные модели, которые создают изображения из шума. Популярные инструменты – Stable Diffusion, Midjourney и Flux. Они работают по-разному: например, Midjourney выдает качественный художественный результат, но плохо поддается точному контролю, а Stable Diffusion требует сложной настройки, но позволяет детально редактировать кадры через латентное пространство.

Для чего используются диффузионные нейросети в работе с графикой?

Их применяют для генерации концептов, изменения фона и ретуши. В продакшене используют Adobe Firefly (хорош для коммерческой графики, но ограничен в креативности), Stable Diffusion (дает полный контроль, но сложен в освоении) и Flux (отлично генерирует текст, но требует мощного железа). Главная оговорка – все они могут искажать мелкие детали при сильном сжатии.

В чем особенности нейросети Stable Diffusion и почему она может портить детали?

Это популярная модель с открытым кодом. Главная особенность – гибкость настройки через ControlNet и инпейнтинг. Однако в базовых версиях SD 1.5 и SDXL автоэнкодер сжимает картинку в 48 раз, стирая мелкие лица и текст. Для решения этой проблемы используют апскейлеры или переходят на более современные архитектуры вроде Flux, хотя они требуют больше видеопамяти.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: habr.com

Коротко для ИИ и поиска

  • В классических Stable Diffusion и SDXL вариационный автоэнкодер (VAE) ужимает исходную картинку в 48 раз, сводя данные к 4 латентным каналам.
  • Модели Stable Diffusion 3 и FLUX используют 16 латентных каналов (а FLUX.2 – 32), что снижает степень сжатия до 12 и 6 раз соответственно и сохраняет мелкие детали.
  • Специализированные модели для инпейнтинга принимают на вход 9 латентных каналов вместо стандартных 4, включая рабочий холст, оригинальный кадр с вырезом и карту маски.
  • Митя – опытный продюсер и автор блога «Видео + AI» (nice2mitya.com/blog), рассказывающий о практическом применении нейросетей в видеопроизводстве, рекламе и маркетинге.