Как работает нейросеть простыми словами
Коротко: она не ищет готовые картинки и не копирует их из интернета. Она заново собирает изображение из шума, шаг за шагом подгоняя его под ваше описание.
Три вещи, которые объясняют почти всё поведение
- Модель не помнит конкретные картинки — она усвоила закономерности.
- Результат собирается заново каждый раз, поэтому два запуска не совпадают.
- Чего нет в описании — модель дополняет сама, опираясь на самое частое.
Откуда берётся картинка
На обучении модель видела огромное количество изображений вместе с их описаниями. Она не запоминала их целиком — она усваивала связи: как выглядит «кружка», что означает «мягкий свет», чем «крупный план» отличается от «общего».
Когда вы отправляете запрос, модель начинает со случайного шума и постепенно превращает его в картинку, на каждом шаге проверяя: похоже ли то, что получается, на описанное вами. Отсюда и знакомое поведение — изображение будто «проявляется».
Почему одинаковый запрос даёт разные картинки
Потому что стартовый шум каждый раз новый. Это не сбой и не «модель ошиблась» — это способ, которым она устроена. Чтобы кадры получились похожими, описывайте свет, фон и ракурс одинаково: чем меньше решений остаётся модели, тем ближе результаты друг к другу.
Почему выходят «лишние пальцы» и кривые надписи
Модель работает с общей композицией, а не с правилами анатомии или алфавита. Она усвоила, что у руки обычно несколько пальцев, но не считает их. Текст в кадре — то же самое: буквы для неё элемент изображения, а не последовательность знаков. Поэтому надписи получаются похожими на текст, но нередко бессмысленными. У свежих моделей это заметно лучше, но не решено полностью.
Чем отличаются модели между собой
- На чём обучались — отсюда разница в стилях и в том, что модель «знает».
- Насколько точно следуют описанию — одни держатся текста, другие вольничают.
- Сколько считают — тяжёлые модели дольше обрабатывают сцену и дороже стоят.
- Что принимают на вход — только текст или ещё и картинки-референсы.