Исходный размер 1059x1486
Проект принимает участие в конкурсе

Идея проекта

Во время путешествия по Америке я много фотографировала пейзажи: дороги между скалами, пустынные равнины, каньоны и горные силуэты. В этих кадрах для меня важны не только конкретные места, но и ощущение пути — расстояние, свет и ожидание того, что появится за следующим поворотом.

В проекте «Дорога, которой не было» я использую собственный фотоархив как материал для дообучения генеративной модели. Мне интересно, сможет ли нейросеть перенять визуальные особенности моих фотографий и создать новые пейзажи, которые воспринимаются как продолжение того же путешествия.

Так возникает воображаемый маршрут: его изображения связаны с реальным опытом, но не документируют посещённые мной места.

Исходные фотографии

big
Исходный размер 1024x1024
big
Исходный размер 1024x1024
Исходный размер 1024x1024
Исходный размер 1024x1024
Исходный размер 1024x1024
Исходный размер 1024x1024
Исходный размер 1024x1024

«Авторские фотографии из путешествия. Датасет для обучения».

Для обучения отобраны 16 фотографий из моего американского роад-трипа. В подборку вошли пустынные дороги, красные скалы, каньоны, арки, редкая растительность и отдельные элементы инфраструктуры.

Кадры объединяют повторяющиеся цвета и мотивы: охристая земля, серо-голубое небо, глубокие тени, протяжённые дороги и крупные скальные формы. При этом освещение меняется — от яркого солнца до облачной погоды и заката.

Все исходные фотографии сделаны мной. Для обучения подготовлены квадратные версии размером 1024 × 1024 пикселя без дополнительной цветокоррекции. Каждое изображение сопровождается текстовым описанием сцены.

Метод

В качестве основы используется Stable Diffusion XL. Дообучение выполняется методом LoRA: обучается небольшой набор дополнительных параметров, который затем подключается к базовой модели.Для проекта адаптирован учебный ноутбук курса «Искусственный интеллект для креативных индустрий». В подписях к фотографиям используется общая фраза in alisharoad photographic style, связывающая изображения с выбранной фотографической манерой.Задача эксперимента — проверить, какие особенности исходного архива модель сможет воспроизвести в новых сценах: палитру, освещение, фактуру поверхностей и характер композиции.В учебном ноутбуке я заменила исходный датасет на 16 собственных фотографий американского роад-трипа. Подписи к изображениям подготовлены с помощью Codex вместо автоматического описания моделью BLIP. Обучение выполнено за 300 шагов при разрешении 512 × 512 пикселей. Веса адаптера сохранены на Google Диск.

Настройки обучения

Для дообучения использована модель Stable Diffusion XL Base 1.0 и метод DreamBooth LoRA. Датасет составили 16 авторских фотографий из путешествия по Америке. Обучение выполняется в Google Colab на видеокарте NVIDIA Tesla T4 при разрешении 512 × 512 пикселей.

Число шагов обучения — 300, со скоростью обучения 0,0001 и рангом LoRA 4. Размер пакета составляет одно изображение, а градиенты накапливаются за четыре итерации перед обновлением параметров. Для воспроизводимости эксперимента задан seed 42.

Сравнение до и после обучения

Слева — результат базовой SDXL, справа — результат с обученным адаптером LoRA. Использованы одинаковый текстовый запрос и seed 100.

Итоговая серия

Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768
Исходный размер 768x768

Анализ результатов

В итоговой серии повторяются мотивы моего фотографического архива: пустынные дороги, красные скалы, каньоны и редкая растительность. Изображения объединяют охристые оттенки, приглушённое небо и глубокие тени.В контрольной паре после подключения LoRA изображение стало темнее, а цвет скал — более сдержанным. Вместо сплошных скальных стен появились отдельные массивы и башни. Эти изменения визуально сближают результат с моими фотографиями. Однако одна контрольная пара не позволяет распространить этот вывод на любые запросы.Серия передаёт разные впечатления от путешествия: дорога создаёт ощущение движения, каньон — масштаба и замкнутости, ветряки — дистанции, закат — завершения маршрута. Так складывается воображаемое продолжение реальной поездки.У эксперимента есть ограничения. Некоторые композиции близки к обучающим фотографиям, особенно сцены с изгибом реки, аркой и закатом. В двух изображениях появились незапрошенные человеческие фигуры, а отдельные детали ветряков выглядят неправдоподобно. Поэтому результат требует визуального отбора и не обеспечивает полного контроля над содержанием.Изображения сгенерированы в разрешении 768 × 768 пикселей за 25 шагов, с guidance scale 6 и силой LoRA 0,8. Для серии использованы seed от 100 до 107.

Описание применения генеративной модели

Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше