Разбор дня

Как нейросети создают изображения, которых никогда не существовало

МАВИИ — Агентные системы··~3 мин чтения
Как нейросети создают изображения, которых никогда не существовало

Вы пишете «рыжий кот в скафандре на фоне Марса», и через десять секунд получаете картинку, которой никогда не существовало. Кажется, что модель где-то нашла похожее и подрисовала. На деле всё наоборот: она начинает с бессмысленного цветного шума и пошагово вычищает его, пока из хаоса не проступит именно ваш кот. Понимание этой механики сразу объясняет и магию, и странные баги вроде шести пальцев.

Всё начинается со случайного шума

Возьмите телевизор без сигнала — та самая «рябь». Примерно с этого стартует любая современная модель-генератор: с квадрата случайных пикселей. Дальше она не добавляет детали, а убирает лишнее: за 20–50 шагов постепенно предсказывает, «что здесь на самом деле должно быть», и снимает слой шума за слоем. Этот процесс называется диффузией. К последнему шагу ряби не остаётся — остаётся изображение.

Модель научили портить, чтобы она умела чинить

Логика обучения выглядит вывернутой наизнанку. Инженеры берут миллионы реальных картинок с подписями и намеренно засыпают их шумом — сначала чуть-чуть, потом до полной каши. Нейросеть тренируют на обратную задачу: по зашумлённому кадру угадать, как убрать одну «порцию» шума. Повторив это миллиарды раз, она выучивает не конкретные картинки, а закономерности — как выглядит мех, как падает тень, как устроено лицо. Поэтому она и рисует то, чего не было: она собирает новое из выученных правил.

Причём тут текст: энкодер-переводчик

Ваш промпт сам по себе модели-художнику непонятен. Его сначала обрабатывает отдельная часть — текстовый энкодер, — которая превращает слова в набор чисел, отражающих смысл. «Кот» и «котёнок» окажутся рядом, «кот» и «трактор» — далеко. Этот числовой смысл подмешивается в каждый шаг очистки шума и работает как компас: он направляет, в какую сторону «проявлять» картинку. Чем точнее модель понимает связь слов и образов, тем ближе результат к задумке.

Латентное пространство: почему это быстро и дёшево

Чистить шум прямо на полноразмерной картинке в миллионы пикселей — долго и прожорливо. Поэтому Stable Diffusion и Kandinsky работают не с пикселями, а со сжатым «смысловым слепком» изображения — латентным пространством. Грубо: модель рисует в уменьшенном внутреннем формате, где кот занимает не 4 миллиона точек, а компактный код, и только в самом конце разворачивает результат обратно в полную картинку. Отсюда скорость и то, что генерация стала по карману обычным сервисам, а не только дата-центрам.

Три модели — три характера

Под капотом принцип общий, но акценты разные. Midjourney заточена на художественность: она вытягивает красивый свет, композицию и «насмотренность», за что её любят дизайнеры и маркетологи. DALL-E от OpenAI сильна в понимании сложных описаний — лучше держит смысл длинной фразы и текст на картинке. Kandinsky от Сбера — российская модель, обученная в том числе на русскоязычных данных, поэтому она ближе к нашим культурным образам и работает без VPN и зарубежной оплаты. Выбор — вопрос задачи, а не «кто умнее».

Где всё это ломается

Руки с лишними пальцами, кривой текст на вывеске, съехавшие отражения — не случайность. Модель выучила «как выглядит рука вообще», но не считает пальцы и не знает физику, поэтому в сложных местах уверенно ошибается. Ещё она наследует перекосы обучающих данных и не понимает, что именно нарисовала — красивая картинка и фактическая верность для неё не связаны. Для бизнеса это значит простую вещь: генерация отлично закрывает черновики, фоны, концепты и соцсети, но финальный кадр всё ещё проходит через глаз человека.

Что это меняет для бизнеса

Стоковая иллюстрация, которая раньше стоила несколько тысяч рублей и день ожидания, теперь рождается за десять секунд и стоит копейки. Малый бизнес получил то, что было доступно только компаниям с бюджетом на дизайн-студию: обложки для постов, карточки товаров, баннеры, концепты упаковки. Дизайнер при этом не исчезает — он смещается от «рисую с нуля» к «ставлю задачу модели и довожу результат». Меняется не профессия, а скорость и порог входа.

Вывод

Генератор изображений — не поисковик картинок и не кисть в руках робота. Это модель, которая выучила закономерности мира по миллионам примеров и умеет проявлять из шума то, чего никто не снимал. Знание механики убирает лишние ожидания: где доверять, где перепроверять, а где просто сэкономить время и деньги. МАВИИ помогает бизнесу встроить такие инструменты в реальные процессы — чтобы генерация приносила результат, а не только красивые тесты.

Хотите такого ИИ-агента себе?

Разберём ваши процессы и покажем, что можно автоматизировать за 5–7 дней.

Получить бесплатный разбор