Как работает генератор AI-фото: от текста до изображения

8 мин

Что происходит внутри между отправкой запроса и появлением картинки, почему модель «убирает шум», а не рисует, и какие следствия из этого вытекают для практики.

Понимание механики генерации не обязательно, чтобы пользоваться сервисом, но оно резко сокращает количество бессмысленных попыток. Большинство «странного» поведения моделей перестаёт быть странным, как только становится ясно, что именно происходит внутри.

Модель не рисует — она убирает шум

Интуитивно кажется, что генератор рисует картинку: сначала контур, потом детали, как это делал бы человек. На самом деле процесс обратный. Модель начинает со случайного шума — экрана, заполненного бессмысленными точками, — и пошагово убирает из него то, что не соответствует запросу.

На каждом шаге она отвечает на вопрос: «если это изображение действительно содержит то, что описано в запросе, какой шум здесь лишний?» Убрав часть шума, она повторяет процедуру. Через несколько десятков шагов из хаоса проступает изображение.

Откуда берётся понимание запроса

Текст запроса переводится в набор чисел, отражающих смысл, — не отдельные слова, а их совокупное значение. Эти числа задают направление, в котором модель убирает шум. Отсюда важное следствие: модель реагирует на общий смысл фразы, а не на отдельные ключевые слова.

Поэтому «портрет женщины в красном платье» и «женщина, красное платье, портрет» дают похожий, но не одинаковый результат: смысл фразы немного разный, направление тоже.

Почему одинаковый запрос даёт разные картинки

Начальный шум случаен. Один и тот же запрос, стартующий с разного шума, приходит к разным изображениям — как два скульптора, работающих с разными кусками мрамора по одному эскизу.

Это не недостаток, а свойство. Именно оно позволяет получать варианты и выбирать, а не переписывать запрос ради разнообразия.

Почему сложно с руками и текстом

Процесс убирания шума локален: каждая область изображения уточняется во многом независимо. Для лица это работает — оно цельное и много раз встречалось в данных. Для руки хуже: пальцы — повторяющиеся похожие объекты, и модель легко «теряет счёт», уточняя каждый палец отдельно.

С текстом ещё сложнее: буквы должны складываться в конкретную последовательность, а модель работает с визуальным правдоподобием. Она рисует нечто, похожее на текст, потому что похожесть — это то, что она оптимизирует.

Что означает разрешение

Модели обучены на изображениях определённого размера и уверенно работают вблизи него. Просьба сгенерировать очень большое изображение обычно решается иначе: сначала генерация в родном размере, затем увеличение отдельной моделью, которая дорисовывает детали.

Отсюда практическое наблюдение: детали на увеличенном изображении не «проявились», а были придуманы на этапе увеличения. Для портрета это значит, что микрорельеф кожи после апскейла — не ваш.

Генерация по фото

Когда на вход подаётся изображение, процесс меняется: вместо чистого шума модель стартует от вашего снимка, зашумлённого до определённой степени. Чем сильнее зашумление, тем свободнее результат и тем меньше в нём остаётся от исходника.

Это объясняет компромисс, знакомый по практике: сильная стилизация неизбежно снижает сходство, потому что для стилизации нужно больше свободы, а свобода достигается стиранием исходной информации.

Почему модель «не слышит» часть запроса

Направление задаётся всем запросом сразу, и элементы конкурируют. Длинное описание с десятком требований размывает направление: каждое требование получает меньше веса. Короткий чёткий запрос выполняется точнее просто потому, что в нём меньше конкурирующих сигналов.

По той же причине плохо работают отрицания: «без шляпы» вводит в описание понятие шляпы, и модель нередко её рисует. Направление определяется присутствием смысла, а не его отсутствием.

Что из этого следует для работы

  1. Формулируйте, что должно быть, а не чего быть не должно.
  2. Держите запрос коротким и приоритизированным: главное в начале.
  3. Получайте варианты повторными прогонами, а не переписыванием запроса.
  4. Не ждите точности в мелких повторяющихся деталях — руки, текст, узоры.
  5. Помните, что стилизация и сходство находятся в противофазе.

Частые вопросы

Почему один и тот же запрос даёт разные картинки?

Генерация стартует со случайного шума. Разный стартовый шум при одном запросе приводит к разным изображениям — это свойство метода, а не сбой.

Почему модель рисует нечитаемый текст?

Она оптимизирует визуальное правдоподобие, а не последовательность букв. Получается то, что похоже на текст, потому что похожесть — это и есть её задача.

Почему стилизация снижает сходство?

Для стилизации модели нужно больше свободы, а свобода достигается более сильным зашумлением исходника. Чем больше свободы, тем меньше остаётся исходной информации о внешности.

  • #как это работает
  • #теория
  • #диффузия

Попробовать в студии

Загрузите фото и выберите стиль — от текста к результату один шаг.

Открыть студию

Читать дальше

Попробовать по темеСоздать фото нейросетью онлайн

ПромптыВсе статьи