Концепция
Лиминальные пространства — это архитектурные и городские зоны, предназначенные не для длительного пребывания человека, а для перемещения между различными функциональными частями здания или среды. К таким пространствам относятся коридоры, лестницы, холлы, парковки и другие промежуточные зоны. Сам термин связан с понятием лиминальности (от лат. līmen — «порог»), которое в рамках антропологии описывает переходное состояние между различными стадиями или статусами.
Примеры изображений, использованных для обучения генеративной модели
В контексте визуальной культуры лиминальные пространства часто воспринимаются как места неопределённости. Они хорошо знакомы человеку, поскольку являются частью повседневной архитектурной среды, но в определённых условиях начинают восприниматься иначе. Отсутствие людей, тишина и статичность могут вызывать ощущение странности, тревоги или нереальности происходящего.
Примеры изображений, использованных для обучения генеративной модели
Целью данного проекта является обучение генеративной модели Stable Diffusion на наборе изображений лиминальных пространств с последующей генерацией серии новых изображений в аналогичном визуальном стиле. В рамках проекта предполагается определить, насколько нейросеть способна воспроизводить ключчевые характеристики подобных пространств и передавать их атмосферу.
Примеры изображений, использованных для обучения генеративной модели
Выбор данной темы обусловлен тем, что лиминальные пространства обладают относительно устойчивым набором визуальных признаков. К ним относятся повторяемость архитектурных элементов, специфические типы освещения, отсутствие людей и выраженная композиционная симметрия. Эти особенности формируют узнаваемый визуальный язык, что делает данный стиль удобным и показательным для обучения нейросети даже на сравнительно небольшом датасете изображений.
Датасет
Для формирования обучающей выборки использовались изображения из открытых фотостоков (Unsplash, Freepik, Wikimedia) с лицензией, допускающей их использование в учебных и исследовательских целях. Дополнительно часть изображений была сгенерирована с помощью таких инструментов как ChatGPT, Krea AI и Nano Banana Pro. Такой подход позволил расширить вариативность изображений и при этом сохранить стилистическую целостность датасета.
Примеры изображений, использованных для обучения генеративной модели
В итоговую выборку вошло 100 изображений, приведённых к единому формату (квадратное соотношение сторон и разрешение 512х512 пикселей), что обеспечило корректность и стабильность процесса обучения модели.
Примеры изображений, использованных для обучения генеративной модели
При отборе изображений особое внимание уделялось визуальным характеристикам лиминальных пространств, упомянутых ранее. В качестве основного референса использовалась интернет-эстетика Backrooms, для которой характерны однообразные коридорные пространства, жёлтые оттенки, а также ощущение бесконечности и дезориентации.
Примеры изображений, использованных для обучения генеративной модели
Примеры изображений, использованных для обучения генеративной модели
Процесс обучения модели
В начале работы было выполнено подключение облачного хранилища Google Drive для доступа к датасету и сохранения результатов. Также была выведена информация о GPU.
Фрагмент кода
Далее были установлены основные библиотеки, необходимые для работы с генеративными моделями и оптимизации обучения, подключён репозиторий с реализацией метода DreamBooth для Stable Diffusion XL.
Фрагмент кода
На следующем этапе были заданы пути к обучающему датасету и директории для сохранения результатов, определены ключевые параметры обучения. Дополнительно была настроена кодировка UTF-8 для корректной работы с файлами и предотвращения возможных ошибок при обработке данных.
Фрагмент кода
Затем была использована модель BLIP (Bootstrapping Language-Image Pre-training) для автоматической генерации текстовых описаний изображений. Каждое изображение из датасета анализировалось нейросетью, после чего формировалось краткое текстовое описание, сохраняемое в отдельный файл. Данный этап является важным, поскольку Stable Diffusion обучается на связке изображений и текстовых описаний.
Фрагмент кода
После этого была проведена подготовка датасета. Сформирован файл metadata.jsonl и проверена корректность структуры данных. Каждая запись в метаданных содержит путь к изображению и соответствующее текстовое описание.
Фрагмент кода
Основной этап работы заключался в запуске обучения модели с использованием подхода DreamBooth и метода LoRA на базе Stable Diffusion XL 1.0. В процессе обучения задавались параметры, определяющие описание обучаемого стиля, размер изображений, снижение потребления памяти и другие.
Фрагмент кода




