Введение
Тексты Славы КПСС существуют в постоянном напряжении между искренностью и ролью. Они звучат как исповедь, но при этом почти всегда маска — нарочитая, гротескная, иногда саморазоблачающаяся.
Один и тот же автор говорит разными голосами. Слава КПСС, Валентин Дядька и Воровская Лапа — это не просто псевдонимы, а способы говорить о мире, о себе и о слушателе разным языком. Где-то это прямая эмоциональная атака, где-то ироничный рассказ, где-то — театральная криминальная фантазия.
В этом проекте тексты рассматриваются не как поэзия в привычном смысле, а как структуры: с ритмом, повтором, плотностью слов и внутренней логикой. Эти структуры можно измерять, сравнивать и визуализировать, не обесценивая их художественную природу.
Когда текст перестаёт быть только высказыванием, он становится формой.
Анализ данных здесь не пытается объяснить, «о чём» эти песни. Он показывает, как они устроены — и почему одни формы становятся массовыми, а другие остаются нишевыми.

Выбор данных и источник
В данном проекте анализируются тексты песен Славы КПСС, а также данные о популярности его различных художественных личностей на платформе Яндекс Музыка.
Использованы следующие данные:
- Тексты песен — собраны в табличном формате (CSV). Каждый трек представлен отдельной строкой с названием и текстом.
- Таблица соответствия личностей (persona_map.csv) — вручную составленный файл, где каждому треку сопоставлена одна из трёх личностей: • Слава КПСС • Валентин Дядька • Воровская Лапа
- Прослушивания в месяц — публичные данные Яндекс Музыки: • Слава КПСС — 1 398 264 • Валентин Дядька — 174 197 • Воровская Лапа — 65 712
Все данные были приведены к табличному виду для анализа с помощью Pandas.
Почему именно эти данные?
Слава КПСС — редкий пример артиста, который использует псевдонимы не формально, а как полноценные художественные роли. Каждая личность отличается манерой письма, ритмом, лексикой и способом взаимодействия с аудиторией.
Этот кейс представляет особую ценность, потому что позволяет: • количественно сравнить художественные образы; • исследовать связь формы текста и массовой популярности; • показать, как методы анализа данных применимы к культурным явлениям.
Тексты здесь — не просто стихи, а структуры, которые можно измерить и сравнить.
Стилистическое решение
Визуальное оформление проекта выполнено в тёмной, контрастной эстетике, вдохновлённой музыкальными зинами и афишами. Такой стиль подчёркивает эмоциональную напряжённость материала и позволяет воспринимать графики как цельную инфографику, а не как технический отчёт.
Для цветового кодирования личностей использована устойчивая система: Слава КПСС — голубой, Валентин Дядька — оранжевый, Воровская Лапа — зелёный. Эти цвета сохраняются во всех графиках и помогают быстро различать персонажей.
В проекте применяется лаконичный шрифт без засечек с высокой читаемостью, что поддерживает аналитический характер визуализаций и не отвлекает от содержания данных.
Выбор типов графиков
Для анализа использованы разные типы визуализаций, так как каждый отвечает своей задаче: • Столбчатые диаграммы — сравнение величин • Круговые диаграммы — доли аудитории • Гистограммы — распределения • Скрипичные диаграммы — форма и плотность распределений • Точечные диаграммы — взаимосвязи между параметрами • Радарные диаграммы — комплексный «вайб» • Кривые Лоренца — концентрация словаря • Итоговый постер — синтез всех выводов
Этапы работы
Подготовка и обработка данных
Анализ выполнялся в среде Google Colab с использованием библиотеки Pandas.
Основные этапы:
- Загрузка CSV-файлов с текстами.
- Очистка текстов: • удаление служебных пометок (куплеты, припевы), • удаление лишних символов, • приведение к нижнему регистру.
- Токенизация — разбиение текста на слова.
- Расчёт метрик: • длина текста, • количество уникальных слов, • TTR (лексическое разнообразие), • hapax ratio (доля редких слов), • экспрессия (восклицательные и вопросительные знаки).
- Объединение текстовых данных с таблицей популярности.
Анализ и визуализации данных
Прослушивания в месяц
Столбчатая диаграмма подчёркивает резкий разрыв между личностями.
Разница между массовым и нишевым проектом оказывается кратной, а не постепенной.
Доля аудитории
Круговая диаграмма отображает распределение аудитории между личностями. Слава КПСС занимает подавляющую долю, в то время как Валентин Дядька и Воровская Лапа формируют нишевые сегменты.
Массовость здесь — это форма узнаваемости, а не показатель художественной сложности.
Распределение длины слов
Гистограмма показывает, какие слова доминируют по длине у каждой личности. • Слава КПСС чаще использует короткие слова. • Валентин Дядька склоняется к средней длине. • Воровская Лапа выделяется длинными и необычными словами.
Язык Воровской Лапы разрастается, тогда как язык Славы КПСС рубит короткими ударами.













