Почему у нейросетей проблемы с руками, текстом и симметрией
Три классических слабых места генерации разбираются одной причиной. Что с этим делают разработчики моделей и что можно сделать самому при подготовке кадра.
Шесть пальцев на руке стали визитной карточкой генеративных изображений. Вместе с нечитаемым текстом на вывесках и разными серьгами в ушах это составляет тройку самых узнаваемых дефектов. У всех трёх общая причина, и понимание её помогает обходить проблему.
Общая причина: локальность
Модель обрабатывает изображение как совокупность взаимосвязанных областей, но связь между далёкими областями слабее, чем между соседними. Каждый фрагмент уточняется во многом самостоятельно — это делает генерацию быстрой и позволяет работать с большими изображениями.
Плата за это — трудности с тем, что требует глобального учёта: сколько всего пальцев в кадре, какая буква должна идти третьей, симметричны ли серьги. Локально каждый палец выглядит правильно; проблема возникает только при взгляде на кисть целиком.
Почему именно руки
Кисть — уникально сложный объект. Она состоит из повторяющихся похожих элементов, которые могут находиться в огромном числе взаимных положений, часто перекрывают друг друга и меняют видимую форму при любом повороте.
Добавьте к этому статистику обучающих данных: на фотографиях руки чаще всего либо частично скрыты, либо размыты движением, либо мелкие. Модель видела множество примеров, но большинство из них — не чёткие эталоны анатомии.
Почему текст
Изображение текста должно удовлетворять требованию, чуждому визуальному правдоподобию: конкретная последовательность конкретных символов. Модель оптимизирует то, насколько картинка похожа на настоящую, а «похоже на текст» и «является текстом» — разные вещи.
Современные модели с этим справляются заметно лучше прежних, особенно с короткими надписями крупным шрифтом. Но длинный текст мелким кеглем остаётся зоной риска, и на вывесках второго плана буквы всё ещё расползаются.
Почему симметрия
Парные объекты — серьги, пуговицы, узоры на ткани, элементы интерьера — требуют согласования между областями, которые обрабатываются независимо. Правая серьга не «знает», как выглядит левая.
Лицо здесь исключение: оно настолько частый и цельный объект, что модель обращается с ним как с единым целым. Именно поэтому лица получаются лучше рук, хотя по сложности сопоставимы.
Что делать при подготовке кадра
- Выбирайте композицию без рук в фокусе: опущены, за спиной, вне кадра, в карманах.
- Избегайте жестов у лица — они собирают все три проблемы сразу: анатомия, перекрытие, внимание зрителя.
- Убирайте текст: одежда без надписей, фон без вывесок.
- Снимайте украшения с парной симметрией, если кадр крупный.
- Простой фон уменьшает количество мелких деталей, требующих согласования.
Что делать с готовым кадром
Локальные дефекты часто дешевле убрать кадрированием, чем повторной генерацией. Обрезать нижнюю часть кадра с руками — секунда работы; добиться правильной анатомии перебором прогонов — несколько попыток с неопределённым исходом.
Для парных деталей иногда достаточно зеркального копирования одной половины в редакторе. Для текста — замены на нейтральный фон или на настоящий текст, добавленный поверх.
Куда движется технология
Слабые места постепенно закрываются. Руки в новых моделях получаются заметно чаще правильными, чем два-три года назад; короткие надписи стали работать. Причина — и в объёме данных, и в архитектурных изменениях, улучшающих согласование между областями.
Но принцип остаётся: пока модель оптимизирует правдоподобие, а не правила, задачи с жёсткими правилами будут даваться ей хуже задач с мягкими критериями. Кадр, не зависящий от таких правил, всегда получится надёжнее.
Частые вопросы
Почему лица получаются лучше рук?
Лицо модель обрабатывает как цельный объект: оно встречалось в данных огромное количество раз. Кисть состоит из повторяющихся элементов, которые уточняются во многом независимо, и модель теряет счёт пальцам.
Можно ли попросить в промпте правильные руки?
Формулировка почти не помогает: проблема не в понимании запроса, а в способе построения изображения. Надёжнее выбрать композицию, где руки не в фокусе.
Станет ли лучше со временем?
Уже стало: короткие надписи и анатомия рук в новых моделях заметно надёжнее. Но задачи с жёсткими правилами останутся сложнее задач с мягкими критериями.
- #артефакты
- #ограничения
- #разбор