«До Сути»← Все статьи

Метрики · 4 сентября 2026 г.

Корреляционный анализ в опросах: как искать связи между вопросами

Корреляционный анализ в опросах показывает, насколько связаны между собой ответы на два вопроса: растёт ли один показатель вместе с другим, падает ли в противовес или не связан вовсе. Результат — коэффициент от минус единицы до плюс единицы, где ноль означает отсутствие линейной связи, а значения ближе к краям — сильную связь в одну или другую сторону. Метод отвечает только на вопрос «связаны ли», но не на вопрос «что от чего зависит», и это разграничение — главный источник ошибок при чтении результатов. Дальше разберём, как считается коэффициент, какие значения считать сильной связью, почему корреляция не доказывает причинность и как применять метод к данным опроса на практике.

Что показывает коэффициент корреляции

Коэффициент корреляции — число, которое сжимает облако точек «ответ на вопрос А против ответа на вопрос Б» по каждому респонденту в одно значение. Плюс единица означает идеальную прямую связь: каждый, кто выше оценил один пункт, ровно настолько же выше оценил и второй. Минус единица — идеальную обратную связь. Ноль — связи нет вовсе, значения одного вопроса никак не предсказывают значения другого. На практике идеальные значения не встречаются: реальные данные дают что-то среднее, и задача исследователя — понять, какую силу связи считать содержательной, а какую — шумом на конкретной выборке.

В опросах корреляцию чаще всего считают между парой числовых или порядковых вопросов: удовлетворённостью и готовностью рекомендовать, вовлечённостью и намерением остаться в компании, ценой и воспринимаемым качеством. Стандартный коэффициент Пирсона предполагает, что связь линейна и что шкала ведёт себя как числовая; для порядковых шкал типа Лайкерта чаще уместнее коэффициент Спирмена, который работает с рангами ответов, а не с самими числами, и меньше зависит от того, насколько равномерны интервалы между пунктами шкалы.

Как читать значение коэффициента

Условные ориентиры для интерпретации силы связи: до 0,2 по модулю — связь практически отсутствует или пренебрежимо слаба; 0,2–0,4 — слабая связь, заметная статистически, но малополезная для решений в одиночку; 0,4–0,6 — умеренная связь, на неё уже можно опираться как на один из аргументов; выше 0,6 — сильная связь, редкая в опросных данных о человеческом поведении и мнениях, где на результат влияет множество факторов сразу. В социальных исследованиях коэффициент выше 0,7 между двумя разными вопросами — скорее повод проверить, не измеряют ли они по сути одно и то же, чем повод радоваться неожиданно сильной находке.

КоэффициентСила связиПрактический вывод
0,0–0,2Отсутствует или пренебрежимо слабаНе использовать как аргумент в решении
0,2–0,4СлабаяЗаметна статистически, недостаточна сама по себе
0,4–0,6УмереннаяМожно использовать как один из аргументов
0,6–0,8СильнаяВеский аргумент, стоит проверить на устойчивость
Выше 0,8Очень сильнаяПроверить, не измеряют ли вопросы одно и то же

Условные цифры в примере нужны только для того, чтобы показать формат интерпретации: точные пороги отличаются между дисциплинами, и в некоторых прикладных задачах даже коэффициент 0,3 считается значимой находкой, если он подтверждается на независимых выборках или согласуется с другими источниками данных. Важнее абсолютного значения — устойчивость связи: коэффициент, повторяющийся в нескольких волнах опроса или в нескольких сегментах аудитории, весит больше, чем такой же коэффициент, посчитанный один раз на одной выборке.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Корреляция не доказывает причинность

Это правило звучит банально, но именно его нарушение — самая частая ошибка при чтении результатов опроса. Найденная связь между удовлетворённостью сервисом и готовностью рекомендовать не доказывает, что первое вызывает второе: возможно, оба показателя вызваны третьей, не измеренной переменной — например, общим уровнем лояльности клиента к бренду, который проявляется сразу в обеих оценках. Классический учебный пример вне опросов — связь между продажами мороженого и числом утоплений: оба показателя растут летом, но одно не вызывает другое, а оба вызваны сезоном.

В опросных данных скрытая третья переменная встречается почти всегда, потому что респонденты — не случайные числа, а люди с целым набором связанных характеристик: тот, кто в целом более лоялен к компании, будет выше оценивать почти любой отдельный аспект взаимодействия с ней, и эта общая расположенность создаёт корреляции между вопросами, которые на первый взгляд кажутся причинно связанными, а на деле просто отражают один и тот же фоновый фактор.

Прежде чем формулировать вывод «улучшение А приведёт к росту Б», спросите себя: есть ли правдоподобная третья причина, объясняющая оба показателя разом. Если да — заявление о причинности нужно смягчить до «связаны», а не «одно определяет другое». Экспериментальная проверка причинности — например, A/B-тест, где меняют только А и смотрят на Б, — единственный надёжный способ отличить одно от другого; сам по себе опрос этого не покажет, каким бы сильным ни был коэффициент.

Как считать на практике

Расчёт не требует специализированного статистического образования: формула коэффициента корреляции встроена в Excel, Google Sheets и любой статистический пакет, и от исследователя требуется только правильно подготовить данные — два столбца с ответами одних и тех же респондентов на два вопроса, без пропусков или с явной договорённостью, как их обрабатывать. Результат — одно число, но интерпретировать его в отрыве от объёма выборки нельзя: на выборке из пятнадцати человек коэффициент 0,5 может оказаться случайным шумом, а на выборке из трёхсот — устойчивой и значимой находкой.

  1. Выберите пару вопросов, для которых связь содержательно интересна, а не считайте все пары подряд.
  2. Подготовьте два столбца ответов одних и тех же респондентов без пропущенных значений.
  3. Определите тип шкалы: числовая — коэффициент Пирсона, порядковая шкала Лайкерта — коэффициент Спирмена.
  4. Постройте диаграмму рассеяния и посмотрите на неё глазами, прежде чем доверять одному числу.
  5. Посчитайте коэффициент и проверьте его статистическую значимость на данном объёме выборки.
  6. Сформулируйте вывод как «связаны», а не «одно вызывает другое», если нет экспериментальной проверки.

Почему стоит сначала смотреть на график

Коэффициент корреляции — это одно число, и оно способно скрыть форму реальной связи. Классическая иллюстрация — набор данных, где коэффициент Пирсона получается близким к нулю, хотя между переменными существует явная нелинейная связь: например, удовлетворённость растёт с ростом цены до определённого уровня, а затем падает — коэффициент, предполагающий прямую линию, эту закономерность просто не видит и покажет слабую связь там, где связь на самом деле сильная, но изогнутая. Диаграмма рассеяния перед расчётом занимает минуту и защищает от такого промаха.

График также сразу показывает выбросы — единичных респондентов с нетипичными ответами, способных сильно исказить коэффициент на небольшой выборке. Один человек, поставивший единицу по всем вопросам шкалы из принципа или по ошибке, на выборке в тридцать ответов способен заметно сдвинуть коэффициент в любую сторону. На графике такая точка видна сразу, а в готовом числе — нет, поэтому решение исключить или оставить выброс стоит принимать осознанно, а не автоматически доверять результату расчёта по всей выборке без разбора.

Ограничения метода

Кроме нечувствительности к нелинейным связям, у метода есть ограничение по числу переменных: обычная корреляция считается для пары вопросов, и при желании сравнить связи сразу между десятком пунктов анкеты получается громоздкая матрица, в которой легко потеряться и найти случайную значимую связь просто в силу количества проверенных пар. Чем больше пар вопросов проверяется без предварительной гипотезы, тем выше шанс отдельных ложноположительных находок — это тот же эффект множественных сравнений, что и в A/B-тестировании. Разумная практика — заранее сформулировать, какие связи содержательно интересны, а не перебирать всю матрицу в поисках чего-нибудь значимого.

Ещё одно ограничение — коэффициент показывает связь на уровне всей выборки в среднем и может скрывать разные закономерности внутри разных сегментов аудитории. Связь между ценой и удовлетворённостью может быть положительной у одной группы клиентов и отрицательной у другой, а общий коэффициент по всей выборке при этом выйдет близким к нулю просто потому, что противоположные эффекты взаимно гасят друг друга. Если есть основания подозревать разнородность аудитории, стоит посчитать корреляцию отдельно по значимым сегментам, а не полагаться на одну сводную цифру.

Корреляционная матрица: когда связей много

Если в анкете десять вопросов и все они потенциально интересны попарно, вместо расчёта каждой пары вручную удобнее построить корреляционную матрицу — таблицу, где на пересечении строки и столбца стоит коэффициент между соответствующими двумя вопросами. Такую таблицу считает одной командой любой статистический пакет, а визуально её обычно раскрашивают тепловой картой: тёмные ячейки — сильная связь, светлые — слабая или отсутствующая. Такой вид сразу показывает кластеры связанных вопросов — группы пунктов, которые движутся вместе и, возможно, измеряют смежные или общие понятия.

Опасность матрицы та же, что уже упоминалась при переборе пар без гипотезы, только заметнее: при десяти вопросах получается сорок пять уникальных пар, и просто по теории вероятностей несколько коэффициентов в матрице окажутся заметными на глаз случайно, без содержательной причины. Матрицу стоит использовать для генерации гипотез — «эти два вопроса неожиданно сильно связаны, стоит разобраться почему», — а не как источник готовых выводов. Любая находка из матрицы, на которой планируется строить решение, требует отдельной содержательной проверки и, желательно, подтверждения на другой волне сбора.

Частная корреляция: когда нужно убрать влияние третьей переменной

Обычная корреляция между двумя вопросами может оказаться в основном следствием влияния третьего фактора — например, связь между удовлетворённостью ценой и общей удовлетворённостью может частично объясняться тем, что оба вопроса зависят от общей лояльности респондента к бренду. Частная корреляция — техника, которая статистически «вычитает» влияние указанной третьей переменной и показывает, какая связь между первыми двумя вопросами остаётся после этого. Если после вычитания коэффициент заметно падает, это сигнал, что исходная связь была в основном опосредована третьим фактором, а не была прямой.

Метод требует заранее назвать подозреваемую третью переменную — он не находит её автоматически, а только проверяет конкретную гипотезу о её роли. На практике это делает частную корреляцию инструментом для проверки уже возникшей идеи, а не для первичной разведки данных: сначала обычная корреляционная матрица и содержательное размышление о возможных общих причинах, и только затем прицельная проверка через частную корреляцию той связи, которая вызывает наибольшие сомнения в своей прямоте.

Типичные ошибки

Полезно проговорить и границу применимости частной корреляции: она хорошо работает, когда подозреваемая третья переменная измерена в том же опросе и имеет достаточную вариативность в выборке. Если общую лояльность к бренду вообще не спрашивали отдельным вопросом, вычесть её влияние статистически невозможно — метод не умножает данные, а только пересчитывает уже собранные. Отсюда практический вывод для дизайна анкеты: если команда заранее подозревает, что на два интересующих вопроса влияет один общий фактор, его стоит измерить отдельным вопросом сразу же, а не пытаться восстановить задним числом после того, как данные уже собраны.

С чего начать

Начните с одной содержательной гипотезы, а не с расчёта всех возможных пар. Если команда предполагает, что скорость ответа поддержки связана с готовностью клиента остаться, сформулируйте это заранее, соберите оба показателя в одной выборке и посчитайте один коэффициент, а не десятки ради поиска чего-нибудь интересного. Такой подход и статистически честнее, и практичнее: результат сразу отвечает на конкретный вопрос бизнеса, а не превращается в список случайных находок без ясной интерпретации.

Сервис «До Сути» подходит для сбора парных ответов на оба вопроса в одной анкете и выгрузки их в единую таблицу, но сам расчёт коэффициента и построение диаграммы рассеяния делаются уже во внешнем инструменте — Excel, Google Sheets или статистическом пакете. Если результат подтвердит гипотезу, следующий шаг — не сразу менять процесс на основе одной корреляции, а продумать, как проверить предполагаемую причинность экспериментально, прежде чем вкладывать ресурсы в изменения по её мотивам.

И последнее практическое правило: любую найденную корреляцию стоит проверять на устойчивость во времени, а не считать окончательной находкой после первой же волны сбора. Связь, посчитанная на одной выборке в один конкретный момент времени, может оказаться артефактом сезона, разовой маркетинговой кампании или временного изменения в продукте, а не устойчивой закономерностью, на которую стоит опираться в дальнейшем. Если связь важна для решений, повторите расчёт на следующей волне опроса и сравните полученные коэффициенты между собой — совпадение направления и примерной силы связи убедительнее, чем один сильный результат, полученный лишь единожды на старте.

Соберите такой опрос за 2 минуты
Опишите задачу своими словами — ИИ составит вопросы, даст ссылку для сбора ответов и проанализирует результаты.
Создать опрос

Частые вопросы

Что означает коэффициент корреляции, равный нулю?

Ноль означает отсутствие линейной связи между двумя вопросами: изменения ответов на один вопрос не предсказывают изменения ответов на другой в среднем по выборке. Это не всегда означает полное отсутствие связи — коэффициент Пирсона не видит нелинейные закономерности, например, когда показатель сначала растёт, а потом падает. Перед выводом об отсутствии связи стоит посмотреть на диаграмму рассеяния: она может показать изогнутую зависимость там, где коэффициент выдал ноль.

Можно ли по корреляции сказать, что один фактор влияет на другой?

Нет, корреляция показывает только совместное движение двух показателей, а не то, что один вызывает другой. Оба могут зависеть от третьей, не измеренной переменной — например, от общей лояльности клиента, которая проявляется сразу в нескольких оценках. Единственный надёжный способ проверить причинность — эксперимент, в котором меняют один фактор и смотрят на изменение другого; сам опрос, даже с сильным коэффициентом, причинность не доказывает.

Чем коэффициент Пирсона отличается от коэффициента Спирмена?

Пирсон предполагает, что связь линейна и что шкала ведёт себя как числовая с равными интервалами между значениями. Спирмен работает с рангами ответов, а не с самими числами, и подходит лучше для порядковых шкал вроде Лайкерта, где расстояние между «скорее согласен» и «полностью согласен» не обязательно равно расстоянию между другими соседними пунктами. На практике для опросных данных со шкалами согласия коэффициент Спирмена чаще даёт более честную оценку связи.

Какой размер выборки нужен для надёжного расчёта корреляции?

Универсального числа нет, но практический ориентир — не меньше тридцати-пятидесяти пар ответов для предварительной оценки и сотни и больше для устойчивого результата, на основе которого принимаются решения. На малых выборках коэффициент сильно чувствителен к отдельным респондентам и может заметно измениться при добавлении даже нескольких новых ответов, поэтому расчёт стоит сопровождать проверкой статистической значимости, а не доверять голому числу.

Читайте также