Метрики · 6 сентября 2026 г.
T-критерий: как понять, что разница между группами не случайна
T-критерий — статистический тест, который отвечает на вопрос, реальна ли разница средних баллов между двумя группами опроса, или она объясняется обычным случайным разбросом выборки. Клиенты нового тарифа поставили в среднем на полбалла выше клиентов старого — но при небольших группах такая разница вполне может возникнуть просто из-за того, кто именно попал в опрос. Тест соотносит разницу средних с разбросом ответов внутри групп и их размером и даёт p-значение — вероятность получить такую разницу случайно, если на самом деле её нет. Ниже — как читать результат, чем независимые выборки отличаются от парных измерений и почему тест иногда не находит разницу, которая реально существует.
Когда нужен t-критерий, а когда что-то другое
Одна из самых частых практических задач после опроса — сравнить средний балл в двух группах и понять, реальна ли разница или это просто шум выборки. Пример: клиенты нового тарифа в среднем ставят удовлетворённость 8,1, старого — 7,6. Разница в полбалла выглядит убедительно, но при выборках в тридцать-сорок человек на группу такая разница вполне может возникнуть случайно, просто из-за того, кто именно попал в опрос. T-критерий — статистический тест, который отвечает на вопрос, насколько вероятно получить такую или большую разницу средних, если на самом деле никакой разницы между группами нет.
Важно сразу разграничить область применения. T-критерий сравнивает средние значения ровно двух групп по одной непрерывной переменной — оценке, времени, сумме. Если групп больше двух, например четыре филиала или пять тарифов, применять t-критерий к каждой паре по отдельности некорректно — для этого существует дисперсионный анализ, о котором отдельный разговор. Если же переменная не числовая, а категориальная — например, доля клиентов, выбравших определённый вариант ответа, — сравнивают не средние, а доли, и это уже другой тест.
Стоит также отличать содержательный вопрос от статистического. Даже если тест находит значимую разницу между двумя группами, это не объясняет, почему она возникла: разница в удовлетворённости между новым и старым тарифом может отражать сам тариф, а может — то, что на новый тариф в среднем переходят более лояльные клиенты. Статистика отвечает, реальна ли разница, а не откуда она взялась, и эти два вопроса требуют разных инструментов для ответа.
Как работает сравнение: разница средних и разброс
T-критерий не просто смотрит на разницу средних — он соотносит её с разбросом ответов внутри каждой группы и размером выборки. Одна и та же разница в полбалла будет выглядеть убедительно на выборке в пятьсот человек с небольшим разбросом ответов и совершенно ничего не значить на тридцати участниках с ответами от двух до десяти баллов. Логика похожа на слух: шёпот на фоне тишины слышен отчётливо, тот же шёпот в шумном зале не разобрать вовсе — сигнал один и тот же, но соотношение сигнала и шума разное.
На выходе тест даёт t-значение — число, показывающее, во сколько раз разница средних больше стандартной ошибки этой разницы, — и p-значение, о котором отдельно ниже. Чем больше t-значение по модулю, тем менее вероятно, что наблюдаемая разница случайна. Условная граница «t больше двух по модулю» на выборках среднего размера примерно соответствует p-значению около 0,05, но точное соответствие зависит от размера выборки, поэтому ориентироваться стоит именно на p-значение, а не на само t как таковое.
На практике t-значение редко разглядывают отдельно от p-значения — большинство калькуляторов и статистических пакетов сразу выдают оба числа вместе, и p-значение проще интерпретировать без специальных таблиц. Тем не менее знание, что стоит за p-значением — соотношение сигнала и шума, — помогает избежать слепого доверия к цифре: одно и то же p-значение 0,03 может получиться и на надёжных данных с большой выборкой, и на пограничном случае с малой выборкой и одним удачно легшим наблюдением.
Пример: два тарифа и вопрос значимости
Цифры в примере ниже условные и нужны только для того, чтобы показать формат вывода теста, а не как реальный бенчмарк. Двум группам клиентов — новому и старому тарифу — задали один и тот же вопрос об удовлетворённости по десятибалльной шкале. Средние баллы различаются, но t-критерий дополнительно учитывает разброс ответов и число респондентов в каждой группе, поэтому итоговый вывод о значимости не всегда совпадает с интуицией по одним лишь средним.
| Группа | Средний балл | N | Разброс (стд. отклонение) |
|---|---|---|---|
| Новый тариф | 8.1 | 42 | 1.3 |
| Старый тариф | 7.6 | 138 | 1.9 |
При таких вводных тест обычно даёт p-значение в районе 0,03–0,05 — разница признаётся статистически значимой, несмотря на то что группа нового тарифа почти втрое меньше группы старого. Причина в том, что разброс ответов в маленькой группе оказался ниже: клиенты нового тарифа отвечали более единообразно, и это компенсировало меньший размер выборки. Здесь и проявляется главное преимущество формального теста перед взглядом на голые средние: интуиция обычно недооценивает влияние разброса и переоценивает влияние размера группы.
P-значение и что оно в этом контексте означает
P-значение — вероятность получить такую или ещё более выраженную разницу средних при условии, что в реальности между группами разницы нет вообще. Порог 0,05 — это условность, принятая по традиции, а не физический закон: p равное 0,04 не «значимо», а p равное 0,06 — «незначимо» в каком-то абсолютном смысле, это просто две стороны одной и той же непрерывной шкалы уверенности. Полезнее относиться к p-значению как к степени неожиданности результата при нулевой гипотезе, а не как к бинарному вердикту «работает — не работает».
Отдельная и более частая ошибка — путать статистическую значимость с практической важностью. При достаточно большой выборке даже разница в 0,1 балла из десяти окажется статистически значимой, хотя для бизнеса такая разница может быть совершенно неощутимой. Обратное тоже верно: на маленькой выборке реальная и существенная разница в полтора балла может не достичь порога значимости просто из-за нехватки данных. Поэтому p-значение стоит смотреть вместе с самой величиной разницы и её практическим смыслом, а не отдельно от них.
Независимые выборки и парные измерения
T-критерий существует в двух основных вариантах, и путать их — частая ошибка. Для независимых выборок — когда в двух группах разные люди, например клиенты двух разных филиалов, — используют один вариант расчёта. Для парных измерений — когда одни и те же люди отвечают дважды, например до и после изменения в продукте, — используют другой, специально учитывающий, что ответы одного человека в двух замерах связаны между собой сильнее, чем ответы разных людей.
Парный вариант обычно чувствительнее: поскольку он сравнивает изменение внутри каждого человека, а не средние по двум разным группам, ему требуется меньше участников, чтобы обнаружить реальный эффект. Если у вас есть возможность опросить одних и тех же людей до и после, а не две разные группы, парный дизайн почти всегда предпочтительнее — он убирает из шума индивидуальные различия между людьми, которые в независимых выборках просто добавляются к общему разбросу.
Есть ещё один практический нюанс, который часто упускают: классический t-критерий предполагает, что разброс ответов в обеих группах примерно одинаков. Когда это не так — например, у одной группы ответы разбросаны широко, а у другой сосредоточены плотно вокруг среднего, — используют модификацию теста, не требующую равенства дисперсий. Она даёт чуть более консервативную оценку значимости, зато остаётся корректной именно в ситуации неравного разброса, которая на практике встречается чаще, чем предполагает учебник.
Маленькие группы: почему тест иногда «не видит» разницу
На маленьких выборках t-критерий систематически не находит различия даже там, где они реально есть — это называют недостаточной статистической мощностью. Разница в полтора балла между группами по пятнадцать человек с большой вероятностью останется статистически незначимой просто потому, что данных мало для уверенного вывода, а не потому, что разницы нет на самом деле. Вывод «значимой разницы не обнаружено» в таком случае честнее читать как «выборка слишком мала, чтобы её обнаружить», а не как доказательство отсутствия эффекта.
Множественные сравнения: ловушка при большом числе групп
Соблазн, в который легко попасть при работе с сегментированными данными, — сравнить t-критерием сразу много пар: пять филиалов, десять тарифов, двадцать сегментов клиентов. Каждое отдельное сравнение при пороге 0,05 даёт пять процентов шанса найти случайную разницу там, где её нет, а при двадцати сравнениях подряд шанс хотя бы одного ложного срабатывания вырастает до половины и выше. Часть «интересных находок» в таких выгрузках — статистический шум, возникший просто от количества попыток.
Практическое решение — либо заранее ограничить число сравнений теми парами, которые действительно интересуют по содержательным причинам, а не перебирать все подряд, либо использовать поправку на множественные сравнения, которая ужесточает порог значимости пропорционально числу тестов. Самый простой вариант поправки — разделить обычный порог 0,05 на число сравнений: при десяти парах порог значимости для каждой отдельной пары становится 0,005. Это резко снижает число ложных находок ценой того, что часть настоящих различий тоже перестанет проходить порог.
Ещё один практический вариант — заранее решить, что сравнение вообще одно, содержательно важное, а не десять любопытных. Если стоит вопрос «отличается ли новый тариф от старого», а не «чем вообще отличаются все возможные пары сегментов», поправка на множественность просто не нужна: она защищает именно от ситуации, когда вы перебираете много гипотез и выбираете задним числом ту, что сработала. Одно заранее сформулированное сравнение остаётся одним сравнением независимо от того, сколько других данных лежит рядом в той же таблице.
Типичные ошибки
- Сравнивать t-критерием больше двух групп попарно вместо дисперсионного анализа.
- Путать независимые выборки с парными измерениями и применять не тот вариант расчёта.
- Делать вывод об отсутствии разницы по маленькой выборке без проверки мощности теста.
- Перебирать десятки сравнений подряд без поправки на множественные сравнения.
- Приравнивать статистическую значимость к практической важности разницы.
- Игнорировать разброс ответов и судить о разнице только по средним значениям.
- Не проверять, насколько ответы в группах распределены нормально, при очень малых выборках.
Ограничения метода
T-критерий предполагает, что данные внутри каждой группы распределены более или менее по нормальному закону, а разброс ответов в группах сопоставим между собой. На больших выборках отклонения от этих условий обычно не критичны, но на маленьких — меньше тридцати человек в группе — сильно скошенное распределение ответов может исказить результат теста; в этом случае используют непараметрические альтернативы, которые не требуют нормальности.
Второе ограничение касается интерпретации, а не расчёта: t-критерий говорит о разнице средних, но ничего не говорит о причине этой разницы. Клиенты нового тарифа могли отвечать выше не из-за самого тарифа, а потому что на него в среднем переходят более лояльные клиенты. В сервисе «До Сути» опрос собирает баллы по группам, которые вы сами определяете при экспорте, а сам t-критерий считается во внешнем статистическом инструменте — сервис не решает за вас, сравнима ли разница по составу групп, и на этот вопрос стоит отвечать до расчёта, а не после.
Ещё одно практическое ограничение — t-критерий сравнивает только средние значения, а не всё распределение ответов целиком. Две группы могут иметь одинаковое среднее, но совершенно разный разброс: в одной все отвечают близко к середине шкалы, в другой ответы делятся на два полюса — очень довольных и очень недовольных, почти без промежуточных оценок. Такая разница реальна и важна для интерпретации, но обычный t-критерий её просто не увидит, потому что смотрит только на среднее.
С чего начать
Если раньше разница между группами оценивалась на глаз по средним баллам, первый шаг — прогнать те же данные через простой калькулятор t-критерия: таких бесплатных инструментов достаточно, а расчёт занимает секунды. Второй шаг — определить заранее, какие сравнения вам действительно нужны, и не увеличивать их число задним числом, увидев в данных что-то любопытное. Третий — держать в голове размер выборки: разница, которую вы хотите обнаружить, должна быть реалистична для числа респондентов, которое у вас есть, а не для того, что вы бы хотели увидеть.
Полезная привычка — прогонять t-критерий не только на итоговых баллах, но и на промежуточных метриках вроде отдельных вопросов анкеты, если есть гипотеза, что группы различаются именно в конкретном аспекте, а не в общей оценке. Локальный тест на одном вопросе иногда обнаруживает значимую разницу там, где общий средний балл выглядит одинаковым просто потому, что различия в разных вопросах компенсируют друг друга.
- Определите заранее, какие ровно две группы вы сравниваете и почему.
- Проверьте размер каждой группы: меньше тридцати — повод быть осторожным с выводами.
- Выберите вариант теста: независимые выборки или парные измерения.
- Смотрите на p-значение вместе с величиной разницы, а не отдельно.
- При нескольких сравнениях подряд примените поправку на множественные сравнения.
Частые вопросы
Когда нужно сравнить средние значения ровно двух групп по одной непрерывной переменной — оценке, времени, сумме. Если групп больше двух, сравнивать их попарно t-критерием некорректно, для этого существует дисперсионный анализ. Если переменная категориальная, например доля выбравших определённый вариант ответа, сравнивают доли, а не средние, и используют другой тест. T-критерий также делится на вариант для независимых выборок и вариант для парных измерений одних и тех же людей.
Это вероятность получить такую или ещё более выраженную разницу средних при условии, что в реальности между группами разницы нет вообще. Порог 0,05 — условность по традиции, а не физический закон: значение 0,04 не «значимо», а 0,06 — «незначимо» в каком-то абсолютном смысле, это две точки одной непрерывной шкалы уверенности. P-значение стоит рассматривать вместе с величиной самой разницы, а не как отдельный бинарный вердикт о том, работает гипотеза или нет.
Причина обычно в маленькой выборке — недостаточной статистической мощности теста. Разница в полтора балла между группами по пятнадцать человек с большой вероятностью останется статистически незначимой просто потому, что данных мало для уверенного вывода, а не потому, что разницы не существует. Вывод «значимой разницы не обнаружено» в таком случае честнее читать как «выборка слишком мала, чтобы её обнаружить», а не как доказательство отсутствия эффекта.
Технически можно применить его к каждой паре по отдельности, но это некорректно: каждое сравнение при обычном пороге 0,05 добавляет свой шанс случайной ложной находки, и при пяти-шести группах общий риск ошибки становится неприемлемо большим. Для сравнения трёх и более групп сразу существует дисперсионный анализ, который одним тестом отвечает на общий вопрос о наличии различий, а дальнейшие попарные сравнения проводят уже с поправкой на множественность.