«До Сути»← Все статьи

Метрики · 4 сентября 2026 г.

Кластерный анализ респондентов: как сегментировать аудиторию по ответам

Кластерный анализ респондентов — метод, который делит участников опроса на группы со схожими ответами, не опираясь на заранее заданные категории вроде пола или возраста: алгоритм сам находит, какие респонденты похожи друг на друга по тому, что они ответили, и объединяет их в кластеры. Метод полезен, когда есть подозрение, что аудитория неоднородна по своему отношению к продукту или бренду, но неясно заранее, по какому именно признаку она делится. Результат — не готовые названия сегментов, а числовая структура, которую исследователь дальше интерпретирует и подписывает содержательно. Дальше разберём, чем метод отличается от сегментации по демографии, как выбрать число кластеров, разбор на условном примере и какие у метода есть ограничения.

Чем это отличается от сегментации по демографии

Привычная сегментация аудитории задаёт группы заранее: мужчины и женщины, младше и старше тридцати пяти, Москва и регионы. Такое деление удобно, но не гарантирует, что внутри группы люди действительно похожи по интересующему признаку — отношению к продукту, мотивации или поведению. Кластерный анализ переворачивает логику: он не спрашивает демографию заранее, а смотрит на сами ответы респондентов по содержательным вопросам — что для них важно, чем они недовольны, как часто пользуются продуктом — и группирует тех, кто отвечает похоже, независимо от пола и возраста.

На практике часто оказывается, что найденные кластеры плохо совпадают с демографией: группа клиентов, ценящих скорость обслуживания превыше всего, может включать и молодых, и пожилых людей в равной пропорции, а разделение по возрасту в этом случае просто не улавливает реальной разницы в мотивации. Это вовсе не значит, что демография бесполезна — после того как кластеры уже найдены, полезно посмотреть, как именно они соотносятся с демографическими признаками группы, — но начинать сегментацию именно с демографии, когда на деле интересует поведенческое или мотивационное различие, часто означает попросту искать совсем не там, где нужно.

Когда метод оправдан

Кластерный анализ стоит применять, когда есть гипотеза о неоднородности аудитории и несколько содержательных вопросов, по которым эта неоднородность потенциально проявляется, — например, набор вопросов о приоритетах при выборе сервиса, о частоте использования разных функций или о причинах покупки. Метод плохо подходит для анкеты из одного-двух вопросов: кластеризовать по одному числу можно и без специального метода, простой сортировкой по значению. Ценность метода растёт с числом переменных: он находит структуру там, где вручную свести пять-семь признаков в наглядные группы уже сложно.

Типичный практический повод — планирование продуктовой стратегии или коммуникации: если вся аудитория интернет-магазина усреднённо описывается как «в целом довольна ценой и доставкой», под этим усреднением может скрываться группа, для которой критична скорость доставки, и другая, для которой важнее ассортимент и готовая переплатить за него. Одно сообщение и один продуктовый приоритет для обеих групп будет неоптимальным компромиссом, а кластерный анализ помогает увидеть эти группы явно, прежде чем строить стратегию на усреднённом портрете.

Как метод находит группы

Интуиция похожа на расстановку точек на карте: каждый респондент — точка, координаты которой заданы его ответами на несколько вопросов, а метод ищет плотные скопления точек, расположенных близко друг к другу, и проводит границы между ними. Самый распространённый алгоритм, метод k-средних, работает так: сначала задаётся число групп, затем алгоритм итеративно подбирает центры групп и распределяет респондентов по ближайшему центру, повторяя процесс, пока распределение не стабилизируется. Итоговый результат — метка кластера у каждого респондента и описание типичного профиля ответов для каждой группы.

Перед расчётом переменные обычно приводят к одному масштабу — иначе вопрос, измеренный в рублях, «перевесит» вопрос, измеренный по шкале от 1 до 5, просто за счёт разницы в диапазоне чисел, а не за счёт реальной значимости. Эта техническая деталь легко упускается при самостоятельном расчёте и приводит к кластерам, фактически построенным вокруг одной доминирующей переменной, а не вокруг содержательного сочетания всех признаков сразу.

Разбор на условном примере

Возьмём опрос клиентов сервиса доставки с вопросами о важности скорости, цены и ассортимента по шкале от 1 до 10. Цифры в примере условные и нужны только для того, чтобы показать формат чтения результата: кластерный анализ на собранных ответах выделил три группы с разными профилями приоритетов, которые слабо совпадали с делением по полу и возрасту.

КластерВажность скоростиВажность ценыВажность ассортиментаДоля аудитории
«Спешащие»9,15,44,234%
«Экономные»5,89,35,141%
«Разборчивые»4,95,69,025%
Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Три группы явно различаются по тому, что для них приоритетно, и это разное, а не усреднённое отношение к сервису: сообщение «мы теперь доставляем быстрее» сработает на треть аудитории и почти не заинтересует «Экономных» и «Разборчивых», для которых важнее другое. Практическая ценность такого деления — не в самих названиях кластеров, а в возможности адресовать коммуникацию и приоритеты разработки конкретной группе вместо одного усреднённого сообщения для всех, которое ни для кого не звучит убедительно.

Как выбрать число кластеров

Число групп не очевидно заранее и не выбирается произвольно на глаз. Стандартный практический приём — метод локтя: посчитать решение для двух, трёх, четырёх и более кластеров и посмотреть, как с ростом числа групп падает внутригрупповой разброс ответов. На графике этот разброс сначала падает быстро, а затем темп замедляется — точка, где падение резко замедляется, похожая на локоть, обычно и считается разумным числом кластеров: добавление ещё одной группы улучшает решение уже незначительно ценой дополнительной сложности интерпретации.

Статистический критерий даёт диапазон разумных вариантов, а не единственно верный ответ. Между решением на три и на четыре кластера часто приходится выбирать не по графику, а по содержательному критерию: какое число групп можно осмысленно описать и на какое число сегментов у команды хватит ресурса выстроить отдельную коммуникацию или продуктовое решение. Семь статистически обоснованных кластеров бесполезны, если компания реально может настроить сообщение только для двух-трёх сегментов.

Что делать после того, как кластеры найдены

Числовое решение — это середина работы, не конец. Следующий шаг — дать каждому кластеру содержательное имя и описание на основе профиля ответов, а не оставлять их «кластер 1», «кластер 2» в отчёте: имя вроде «Спешащие» сразу подсказывает команде, как с этой группой работать, а номер — нет. Дальше полезно посмотреть, как кластеры соотносятся с уже известными данными о респондентах — демографией, каналом привлечения, историей покупок, если она доступна, — это часто добавляет понимание, даже если сами демографические признаки не участвовали в первоначальном расчёте.

Полезно проверить каждый найденный кластер и на статистическую значимость различий, а не только на визуальную наглядность. Если разница по важности скорости между «Спешащими» и остальными группами составляет доли балла на большой выборке, статистический тест на разницу средних может показать, что различие незначимо и, вероятно, объясняется случайным шумом, а не реальной сегментацией. Кластерный алгоритм технически выдаст границу между группами почти всегда, даже когда содержательного различия между ними нет, — он не проверяет значимость самостоятельно, эту проверку нужно делать отдельно, уже после получения решения.

И последний шаг, который часто пропускают: проверить, устойчивы ли кластеры на новой волне данных. Сегменты, найденные один раз на одной выборке, не гарантированно останутся теми же через полгода — аудитория меняется, продукт меняется, и деление, актуальное сегодня, может через год не описывать реальность точно. Разумная практика — пересчитывать кластеризацию примерно раз в год-полтора на свежих данных, а не превращать найденные единожды сегменты в постоянную неизменную классификацию, которая со временем перестаёт отражать реальность, но по инерции продолжает использоваться в отчётах и презентациях команды.

Другие алгоритмы кластеризации

Метод k-средних — самый распространённый, но не единственный, и у него есть особенность, которую стоит знать заранее: он ищет кластеры примерно округлой формы и одинакового по порядку размера, а число групп нужно задать до расчёта. Иерархическая кластеризация устроена иначе: она не требует заранее задавать число групп, а строит дерево последовательных объединений — от каждого респондента как отдельного кластера до одной общей группы — и позволяет выбрать нужное число кластеров уже после расчёта, просто «разрезав» дерево на нужном уровне. За это удобство приходится платить заметно худшей производительностью на действительно больших выборках: такой метод обычно плохо масштабируется за пределы нескольких тысяч отдельных респондентов.

Есть и третий класс алгоритмов, основанных на плотности, — они ищут скопления точек произвольной формы и умеют помечать часть респондентов как «шум», не относящийся ни к одному кластеру, вместо того чтобы насильно распределять каждого по ближайшей группе. Это полезно, когда часть аудитории действительно не укладывается ни в один типичный профиль — например, случайные или невнимательные респонденты, — и их лучше явно исключить из сегментации, а не размывать ими границы реальных групп. Выбор конкретного алгоритма — задача аналитика, но исследователю полезно понимать, что k-средних не единственный и не всегда лучший вариант для конкретных данных.

Ограничения метода

Метод чувствителен к выбору переменных: включите в расчёт не те вопросы, и получите кластеры, отражающие случайное или малозначимое различие, а не реальную содержательную неоднородность аудитории. Отбор вопросов для кластеризации — содержательное решение, а не техническая деталь, и его стоит делать заранее, осознанно отталкиваясь от рабочей гипотезы о том, по какому именно признаку аудитория может реально делиться, а не включать в расчёт разом все доступные вопросы анкеты подряд в наивной надежде, что метод сам как-то разберётся, что здесь важно, а что нет.

Требования к выборке тоже нельзя игнорировать: устойчивое кластерное решение обычно требует не меньше нескольких сотен ответов, особенно если ожидаемых групп в итоге окажется больше двух-трёх, — на заметно меньшей выборке решение может оказаться нестабильным и способно сильно меняться при добавлении новой партии собранных данных. И главное методическое ограничение — кластеры существуют настолько, насколько они содержательно интерпретируемы и полезны для решений; чисто статистически «лучшее» по критерию число кластеров не всегда совпадает с тем числом, которое реально можно использовать в работе команды.

Ещё одно организационное ограничение — то же, что и у факторного анализа: расчёт требует человека, умеющего работать со статистическим пакетом или инструментом кластеризации, интерпретировать выбор алгоритма и число групп. Это не расчёт в одну формулу, и без такого специалиста в команде задача либо откладывается, либо решается на глаз — сегментацией по интуиции, которая не хуже кластерного анализа для быстрого рабочего ориентира, но не заменяет его там, где решение реально дорогое и нужна статистическая опора под него.

Типичные ошибки

  1. Включать в расчёт все вопросы анкеты подряд вместо содержательно отобранных переменных.
  2. Не приводить переменные к одному масштабу перед расчётом, получая перекос в сторону одного признака.
  3. Выбирать число кластеров исключительно по графику, не проверяя содержательную интерпретируемость.
  4. Оставлять кластеры без содержательных названий и описаний в отчёте.
  5. Считать однажды найденную сегментацию неизменной и не пересчитывать её на новых данных.
  6. Путать кластерный анализ с факторным: первый группирует респондентов, второй — вопросы анкеты.

С чего начать

Начните с содержательной гипотезы, а не с самого алгоритма: чётко сформулируйте, по какому именно признаку аудитория предположительно неоднородна, и включите в анкету пять-семь содержательных вопросов, которые как раз эту гипотезу и проверяют напрямую. Собрав хотя бы пару сотен ответов, посчитайте кластерное решение в статистическом пакете или в готовом инструменте с функцией кластеризации — большинство современных таблиц и BI-платформ такую функцию уже давно поддерживают, поэтому специализированное статистическое ПО тут не всегда строго обязательно.

Сервис «До Сути» подходит для сбора ответов на нужные вопросы в одной анкете и выгрузки их в таблицу для дальнейшего анализа, но сам расчёт кластеризации делается уже во внешнем инструменте после экспорта данных. Получив решение, не спешите сразу перестраивать продукт или коммуникацию под все найденные сегменты одновременно — начните с одной группы, для которой действие наиболее очевидно, проверьте гипотезу на практике, и только затем масштабируйте подход на остальные кластеры.

Стоит заранее договориться в команде, кто владеет итоговой сегментацией после того, как отчёт сдан. Кластерное деление, которым никто конкретно не занимается дальше, обычно живёт в одной презентации и забывается, а команда возвращается к прежней работе с усреднённым портретом аудитории. Если сегментация действительно ценна, у неё должен появиться владелец — человек или команда, отвечающие за то, чтобы деление использовалось в реальных решениях и обновлялось по мере устаревания, а не оставалось красивой, но забытой находкой одного разового исследования.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Чем кластерный анализ отличается от сегментации по демографии?

Сегментация по демографии задаёт группы заранее — пол, возраст, город — и не гарантирует, что внутри группы люди похожи по интересующему признаку, например по мотивации или поведению. Кластерный анализ, наоборот, ищет группы по фактическим ответам на содержательные вопросы, не опираясь на демографию заранее. На практике найденные кластеры часто слабо совпадают с делением по демографии — соотнести их полезно уже после расчёта, а не использовать демографию как исходную основу деления.

Сколько респондентов нужно для кластерного анализа?

Устойчивое решение обычно требует не меньше нескольких сотен ответов, особенно если ожидаемых групп больше двух-трёх. На меньшей выборке кластеры могут оказаться нестабильными и заметно меняться при добавлении новой партии данных, что делает выводы преждевременными. Если данных пока меньше, разумнее ограничиться простым ручным сравнением ответов по паре ключевых вопросов, чем доверять формальному, но статистически шаткому кластерному решению.

Как понять, сколько кластеров выделять?

Стандартный приём — метод локтя: посчитать решение для нескольких вариантов числа групп и посмотреть, как падает внутригрупповой разброс ответов с ростом их числа, выбрав точку, где падение заметно замедляется. Но статистический критерий даёт диапазон разумных вариантов, а не единственный верный ответ — финальный выбор должен также учитывать, можно ли содержательно описать каждую группу и хватит ли у команды ресурса выстроить для неё отдельное решение или сообщение.

Можно ли использовать кластерный анализ на малой выборке пилотного опроса?

Формально посчитать можно и на пятидесяти ответах, но результат стоит воспринимать как предварительный ориентир, а не окончательное деление аудитории: на малой выборке решение крайне чувствительно к отдельным респондентам и может сильно измениться при добавлении новых данных. Разумнее использовать пилотную кластеризацию для проверки самой гипотезы о неоднородности аудитории, а окончательное деление на сегменты строить уже на основной волне сбора с достаточным объёмом ответов.

Читайте также