Исходный размер 1140x1600

Обучение генеративной модели на изображеиях лиминальных пространств

Концепция

Лиминальные пространства — это архитектурные и городские зоны, предназначенные не для длительного пребывания человека, а для перемещения между различными функциональными частями здания или среды. К таким пространствам относятся коридоры, лестницы, холлы, парковки и другие промежуточные зоны. Сам термин связан с понятием лиминальности (от лат. līmen — «порог»), которое в рамках антропологии описывает переходное состояние между различными стадиями или статусами.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

В контексте визуальной культуры лиминальные пространства часто воспринимаются как места неопределённости. Они хорошо знакомы человеку, поскольку являются частью повседневной архитектурной среды, но в определённых условиях начинают восприниматься иначе. Отсутствие людей, тишина и статичность могут вызывать ощущение странности, тревоги или нереальности происходящего.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

Целью данного проекта является обучение генеративной модели Stable Diffusion на наборе изображений лиминальных пространств с последующей генерацией серии новых изображений в аналогичном визуальном стиле. В рамках проекта предполагается определить, насколько нейросеть способна воспроизводить ключчевые характеристики подобных пространств и передавать их атмосферу.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

Выбор данной темы обусловлен тем, что лиминальные пространства обладают относительно устойчивым набором визуальных признаков. К ним относятся повторяемость архитектурных элементов, специфические типы освещения, отсутствие людей и выраженная композиционная симметрия. Эти особенности формируют узнаваемый визуальный язык, что делает данный стиль удобным и показательным для обучения нейросети даже на сравнительно небольшом датасете изображений.

Датасет

Для формирования обучающей выборки использовались изображения из открытых фотостоков (Unsplash, Freepik, Wikimedia) с лицензией, допускающей их использование в учебных и исследовательских целях. Дополнительно часть изображений была сгенерирована с помощью таких инструментов как ChatGPT, Krea AI и Nano Banana Pro. Такой подход позволил расширить вариативность изображений и при этом сохранить стилистическую целостность датасета.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

В итоговую выборку вошло 100 изображений, приведённых к единому формату (квадратное соотношение сторон и разрешение 512х512 пикселей), что обеспечило корректность и стабильность процесса обучения модели.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

При отборе изображений особое внимание уделялось визуальным характеристикам лиминальных пространств, упомянутых ранее. В качестве основного референса использовалась интернет-эстетика Backrooms, для которой характерны однообразные коридорные пространства, жёлтые оттенки, а также ощущение бесконечности и дезориентации.

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

Исходный размер 2088x1024

Примеры изображений, использованных для обучения генеративной модели

Процесс обучения модели

В начале работы было выполнено подключение облачного хранилища Google Drive для доступа к датасету и сохранения результатов. Также была выведена информация о GPU.

Исходный размер 3339x317

Фрагмент кода

Далее были установлены основные библиотеки, необходимые для работы с генеративными моделями и оптимизации обучения, подключён репозиторий с реализацией метода DreamBooth для Stable Diffusion XL.

Исходный размер 3339x215

Фрагмент кода

На следующем этапе были заданы пути к обучающему датасету и директории для сохранения результатов, определены ключевые параметры обучения. Дополнительно была настроена кодировка UTF-8 для корректной работы с файлами и предотвращения возможных ошибок при обработке данных.

Исходный размер 3339x735

Фрагмент кода

Затем была использована модель BLIP (Bootstrapping Language-Image Pre-training) для автоматической генерации текстовых описаний изображений. Каждое изображение из датасета анализировалось нейросетью, после чего формировалось краткое текстовое описание, сохраняемое в отдельный файл. Данный этап является важным, поскольку Stable Diffusion обучается на связке изображений и текстовых описаний.

Исходный размер 3339x1895

Фрагмент кода

После этого была проведена подготовка датасета. Сформирован файл metadata.jsonl и проверена корректность структуры данных. Каждая запись в метаданных содержит путь к изображению и соответствующее текстовое описание.

Исходный размер 3339x815

Фрагмент кода

Основной этап работы заключался в запуске обучения модели с использованием подхода DreamBooth и метода LoRA на базе Stable Diffusion XL 1.0. В процессе обучения задавались параметры, определяющие описание обучаемого стиля, размер изображений, снижение потребления памяти и другие.

Исходный размер 3339x1407

Фрагмент кода

Обучение генеративной модели на изображеиях лиминальных пространств
Проект создан 21.03.2026
Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше