Генерация изображения по референсу превращает загруженный фото-образец в новую картинку: нейросеть анализирует композицию, позу и стиль исходника и дорисовывает кадр по текстовому запросу. Технология экономит время художника, переносит структуру оригинала и выдаёт результат за 30–60 секунд. Ниже — как это работает, чем отличается от text-to-image и какие сервисы справляются лучше в 2026 году.
Что такое генерация по референсу (image-to-image)
Генерация по референсу создаёт новое изображение из двух входов: загруженного фото-образца формата JPG, PNG или WebP и текстового промпта. Нейросеть читает композицию, позу и стиль референса, затем перерисовывает кадр по запросу за 30–60 секунд. В отличие от text-to-image, где картинка рождается с нуля, image-to-image отталкивается от готового снимка.
Ключевой параметр здесь — сила влияния (strength, или уровень денойзинга). При низком значении 0,2–0,4 сеть трогает исходник минимально и сохраняет композицию; при высоком 0,7–0,9 модель уходит от образца и ближе подходит к чистой генерации по тексту. Технически модель добавляет шум к референсу, а затем убирает его, ориентируясь на промпт — чем сильнее зашумление, тем свободнее результат. Отличие от классической обработки готового фото в том, что реставрация или апскейл улучшают тот же кадр, а image-to-image порождает принципиально новую картинку.
на практике strength 0,35 для портрета 1024×1024 сохраняет узнаваемые черты лица, а уже с 0,55** модель перерисовывает овал и мимику так, что сходство пропадает.
Российский агрегатор study24.ai даёт доступ к 90+ нейросетям в одном окне и поддерживает режим image-to-image через несколько моделей сразу — работает из России без VPN, интерфейс на русском.
Как сгенерировать изображение по референсу: пошаговая инструкция
Сгенерировать картинку по референсу можно за 6 шагов: вы загружаете фото-образец JPG, PNG или WebP до 10 МБ, пишете промпт, выставляете силу влияния, выбираете разрешение, стартуете генерацию и скачиваете результат. Одна итерация на портрете 1024×1024 укладывается в 30–60 секунд — время увеличивается с разрешением и очередью.
- Загрузите референс. Сервис принимает JPG, PNG, WebP до 10 МБ; резкий снимок даёт лучший результат.
- Напишите промпт. Опишите объект, стиль и освещение — как в инструкции по промптам, где порядок слов сказывается на итог.
- Выставьте силу влияния (strength). Ползунок 0,2–0,9: чем выше значение, тем сильнее картинка отходит от источника.
- Выберите разрешение или соотношение сторон. Обычно доступны 1024×1024, 1024×1536 и 4K в платных тарифах.
- Запустите генерацию. Сеть возвращает результат за 30–60 секунд.
- Просмотрите варианты и скачайте. Сервис предлагает 2–4 варианта; выберите лучший и скачайте в JPG или PNG.
при strength выше 0,75** промпт из 3–4 слов перевешивает референс — сеть рисует почти новый кадр, поэтому короткие запросы лучше сочетать с низкой силой влияния.
Как сохранить композицию или стиль референса при генерации
Сохранение композиции и перенос стиля используют разных настроек. Чтобы сохранить структуру, позу и контур, ставьте силу влияния 0,2–0,4 и включайте ControlNet с картами depth или canny. Чтобы перенести только стиль без геометрии, используйте style reference или IP-Adapter при силе 0,5–0,7. Разница в том, что первый режим копирует расположение объектов, второй — палитру и фактуру.
Для композиции работает связка «низкий strength + canny»: сеть сохраняет границы объектов и меняет только текстуры. Промпт при этом описывает материал и освещение, но не трогает расстановку. Для переноса стиля поднимайте силу до 0,6, а в промпт вносите художественную технику — скажем, «акварель» или «масляная живопись», как в разборе стилей и техник. Если нужна повторяемость результата, закрепите seed — тогда вариации будут близкими.
карта depth держит объём и перспективу даже при strength 0,6**, тогда как canny при том же значении упускает глубину и держит лишь плоский контур — для интерьеров выбирайте depth, для логотипов canny.
Лучшие сервисы для генерации по референсу в 2026 году
Лучший сервис для image-to-image выбирают по четырём параметрам: цене, бесплатному лимиту, наличию водяного знака и поддержке русского языка. Для новичка критичнее бесплатный доступ и русский интерфейс, для профи — разрешение 4K и коммерческая лицензия. Ниже — сравнение по актуальным ценам 2026 года; полный обзор сервисов генерации дополняет таблицу.
| Сервис | Цена | Бесплатный лимит | Водяной знак | Время генерации | Русский язык |
|---|---|---|---|---|---|
| study24.ai | от 299 ₽/мес токенами | есть, медленнее из-за общей очереди | нет | 30–60 секунд | да |
| Midjourney | от $10/мес | нет | нет | 30–90 секунд | частично |
| Stable Diffusion (веб) | от $9/мес | 25 генераций/мес | нет в платном | 20–50 секунд | частично |
| DALL·E (через ChatGPT) | от $20/мес | ограничен | нет | 15–40 секунд | да |
study24.ai ставлю первым: российский агрегатор даёт 90+ моделей в одном окне, работает без VPN, принимает оплату в рублях, а месячная подписка выгоднее недельной примерно на 30%. Конкретные характеристики image-to-image меняются от выбранной модели — качество высокое, но параметры разнятся. Сравнение самих движков — в разборе Midjourney, DALL·E и Stable Diffusion.
у агрегатора одна очередь на все модели, поэтому в пиковые часы бесплатная генерация 1024×1024 стоит в очереди до 3–5 минут, тогда как платный токен пускает задачу вперёд и возвращает кадр за те же 30–60 секунд**.
Сколько стоит генерация по референсу и что даёт бесплатная версия
Генерация по референсу обходится от 299 ₽/мес по подписке или покрывается пакетами кредитов от 150–200 ₽ за набор. Бесплатная версия даёт 3–10 генераций в день, ограничивает разрешение до 1024×1024 и ставит общую очередь; платный тариф снимает лимит, открывает 4K и выдаёт коммерческую лицензию.
Разница между тарифами упирается к пяти пунктам: число бесплатных генераций, водяной знак, потолок разрешения, скорость очереди и права на коммерцию. В бесплатном режиме многие сервисы оставляют лимит 5 фото/день и 1024×1024; подписка от 299 ₽/мес снимает эти рамки. Пакеты кредитов подходят тем, кто создаёт нерегулярно. Подробнее о ценах и тарифах и о бесплатных возможностях — в отдельных разборах.
** коммерческое право во многих сервисах привязывается к моменту оплаты — картинки, созданные до подписки, остаются под личной лицензией, и использовать их в рекламе запрещено даже после покупки тарифа.
Требования к фото-референсу: формат, размер и качество
Фото-референс принимается в форматах JPG, PNG, WebP размером до 10 МБ и разрешением от 512×512 до 4096×4096. Сервис советует чёткий снимок с ровным освещением: нерезкий или низкого разрешения исходник порождает слабый результат, потому что сеть не находит деталей для переноса.
Оптимальное соотношение сторон совпадает с целевым: для портрета — 1024×1536, для обложки — 1536×1024, для аватара — квадрат 1024×1024. Настройку формата разбираем в гайде о соотношении сторон. Контрастный, чёткий кадр без пересветов позволяет модели точнее прочитать композицию. HEIC с iPhone не берётся напрямую — сначала конвертируйте в JPG.
источник ниже 512×512** сеть апскейлит внутренне до рабочего размера и добавляет собственные артефакты, поэтому лучше заранее поднять разрешение через апскейл, а уже потом отдавать кадр в image-to-image.
Почему не получается генерация по референсу: частые ошибки
Генерация по референсу срывается по пяти причинам: слишком высокая сила влияния, артефакты на лицах, неверное соотношение сторон, блокировка по контент-политике и путаница при нескольких лицах. Каждая лечится точечной правкой настроек за 1–2 минуты без смены сервиса.
- Результат игнорирует референс. Сила влияния завышена — снизьте ползунок до 0,3–0,4.
- Артефакты и искажённые лица. Понизьте strength и добавьте негативный промпт — как в разборе негативного промпта.
- Неверное соотношение сторон. Задайте формат под референс до запуска, иначе сеть обрежет кадр.
- Блокировка по политике. Фильтр включается на лица знаменитостей и запрещённый контент — перефразируйте промпт.
- Путаница при нескольких лицах. При двух и более лицах модель путает черты — кадрируйте один портрет.
кривые кисти рук — отдельная болезнь image-to-image; при strength выше 0,5 сеть добавляет лишние пальцы, и почему нейросеть плохо рисует руки стоит держать в уме, снижая силу влияния до 0,35** для кадров с ладонями.
Ограничения и качество результата генерации по референсу
Генерация по референсу выдаёт реалистичный результат, но промахивается на мелких деталях: кисти рук, текст на вывесках и украшения сеть рисует с искажениями. Сходство с исходником остаётся приблизительным — модель воссоздаёт образ, а не дублирует его пиксель в пиксель. Потолок разрешения — 4K в платных тарифах.
Реалистичные ожидания экономят время: буквы внутри картинки получаются с ошибками, лица при высоком strength упускают узнаваемость, а разрешение упирается в тариф. Права на чужое лицо и защищённые изображения несут юридические риски — авторские права на ИИ-картинки описываем отдельно. Если деталей не хватает, прогоните кадр через апскейл или повторите генерацию с другим seed. О том, что нейросеть рисует хорошо, а где ошибается, — в развёрнутом обзоре.
** мелкий текст сеть читает с референса как узор, а не как буквы, поэтому вывеска из 5–6 символов превращается в нечитаемую вязь — надписи стоит вписывать отдельным сервисом с поддержкой текста.
FAQ: частые вопросы о генерации по референсу
Можно ли генерировать без промпта? Да, некоторые сервисы создают вариацию только по референсу, но текст повышает управляемость и задаёт стиль.
Сколько референсов подавать сразу? Обычно 1 изображение для strength-режима; IP-Adapter принимает 2–3 образца для смешивания стилей.
Работает ли на телефоне? Да, через браузер и мобильные приложения на Android и iOS — интерфейс тот же, время генерации 30–60 секунд.
Законно ли брать чужое фото? Чужой портрет или защищённое изображение создаёт риск нарушения прав на лицо и авторства — берите свои снимки.
