// LOADING STUDIO CONNECTING MODELS WARMING UP GPU BUILDING INTERFACE 7%

Как работает нейросеть простыми словами

Коротко: она не ищет готовые картинки и не копирует их из интернета. Она заново собирает изображение из шума, шаг за шагом подгоняя его под ваше описание.

Три вещи, которые объясняют почти всё поведение

  • Модель не помнит конкретные картинки — она усвоила закономерности.
  • Результат собирается заново каждый раз, поэтому два запуска не совпадают.
  • Чего нет в описании — модель дополняет сама, опираясь на самое частое.

Откуда берётся картинка

На обучении модель видела огромное количество изображений вместе с их описаниями. Она не запоминала их целиком — она усваивала связи: как выглядит «кружка», что означает «мягкий свет», чем «крупный план» отличается от «общего».

Когда вы отправляете запрос, модель начинает со случайного шума и постепенно превращает его в картинку, на каждом шаге проверяя: похоже ли то, что получается, на описанное вами. Отсюда и знакомое поведение — изображение будто «проявляется».

Почему одинаковый запрос даёт разные картинки

Потому что стартовый шум каждый раз новый. Это не сбой и не «модель ошиблась» — это способ, которым она устроена. Чтобы кадры получились похожими, описывайте свет, фон и ракурс одинаково: чем меньше решений остаётся модели, тем ближе результаты друг к другу.

Почему выходят «лишние пальцы» и кривые надписи

Модель работает с общей композицией, а не с правилами анатомии или алфавита. Она усвоила, что у руки обычно несколько пальцев, но не считает их. Текст в кадре — то же самое: буквы для неё элемент изображения, а не последовательность знаков. Поэтому надписи получаются похожими на текст, но нередко бессмысленными. У свежих моделей это заметно лучше, но не решено полностью.

Чем отличаются модели между собой

  • На чём обучались — отсюда разница в стилях и в том, что модель «знает».
  • Насколько точно следуют описанию — одни держатся текста, другие вольничают.
  • Сколько считают — тяжёлые модели дольше обрабатывают сцену и дороже стоят.
  • Что принимают на вход — только текст или ещё и картинки-референсы.

Понятнее всего на своём примере

Запустите один и тот же запрос дважды и сравните. Разница между кадрами показывает ровно то, что описано выше: модель каждый раз собирает картинку заново.