Корреляция показывает силу и направление статистической связи между переменными, а регрессия описывает, как меняется одна выбранная переменная при изменении другой, и позволяет строить прогноз. В корреляционном анализе переменные равноправны: связь между X и Y та же, что между Y и X. В регрессии заранее выделяют зависимую переменную — результат — и независимые переменные, или предикторы. Оба метода применяют в исследованиях, аналитике, маркетинге и HR, но ни корреляция, ни обычная регрессия сами по себе не доказывают причинно-следственную связь.
Основные различия
Критерий
Корреляция
Регрессия
Главный вопрос
Насколько связаны переменные?
Как Y изменяется в зависимости от X?
Роли переменных
Равноправны
Есть отклик Y и предиктор X
Результат
Коэффициент связи
Уравнение и коэффициенты модели
Направление анализа
Симметричное
Асимметричное
Единицы измерения
Коэффициент безразмерный
Коэффициенты имеют единицы
Прогноз
Обычно не основная задача
Одна из основных задач
Несколько факторов
Корреляционная матрица
Множественная регрессия
Причинность
Не доказывает
Без специального дизайна тоже не доказывает
Например, корреляция может показать связь удовлетворённости и готовности рекомендовать компанию. Регрессия позволяет оценить, как изменяется ожидаемая оценка NPS при изменении удовлетворённости с учётом возраста, стажа или сегмента клиента.
Как работает корреляция
Корреляционный анализ оценивает совместное изменение двух признаков. Коэффициент Пирсона r находится в диапазоне от −1 до +1:
r > 0 — показатели преимущественно растут вместе;
r < 0 — рост одного связан со снижением другого;
r ≈ 0 — линейная связь слаба или отсутствует;
|r| ближе к 1 — линейная связь сильнее.
Коэффициент Пирсона предназначен прежде всего для линейной связи количественных переменных. Для порядковых данных или монотонной нелинейной зависимости часто используют корреляцию Спирмена. Нулевой коэффициент Пирсона не исключает выраженной криволинейной связи, поэтому до расчёта нужно изучить диаграмму рассеяния.
Корреляция симметрична:
r(X, Y) = r(Y, X).
Если поменять переменные местами, значение коэффициента не изменится.
где X — число месяцев опыта, то увеличение опыта на один месяц связано со снижением ожидаемого времени выполнения на три единицы. Это интерпретация статистической модели, а не автоматическое доказательство того, что именно опыт вызвал изменение.
Регрессия может включать несколько предикторов, категориальные признаки, взаимодействия и нелинейные зависимости. Для числового результата используют линейную регрессию, для бинарного исхода — например, «ушёл или остался» — логистическую.
Связь между методами
В простой линейной регрессии с одним предиктором и свободным членом:
знак коэффициента наклона совпадает со знаком корреляции;
коэффициент детерминации R² = r²;
высокая корреляция обычно соответствует заметному наклону линии.
Но коэффициент корреляции и коэффициент регрессии — не одно и то же. Корреляция стандартизирована и не зависит от единиц измерения. Наклон регрессии изменится, если перевести рубли в тысячи рублей или минуты в секунды.
Пример
Исследователь анализирует связь между временем ожидания ответа поддержки и удовлетворённостью клиентов.
Корреляция r = −0,65 означает: более длительное ожидание связано с более низкими оценками.
Регрессия:
Удовлетворённость = 9,1 − 0,12 × время ожидания.
Модель показывает, что каждый дополнительный момент ожидания связан в среднем со снижением оценки на 0,12 балла. Она также позволяет рассчитать ожидаемое значение для заданного времени.
Однако связь может объясняться тяжестью обращения: сложные проблемы одновременно требуют больше времени и вызывают низкие оценки. Для причинного вывода нужны эксперимент, квазиэксперимент или контроль смешивающих факторов.
Как выбрать метод
Используйте корреляцию, когда требуется:
быстро проверить наличие связи;
сравнить силу связей нескольких показателей;
построить корреляционную матрицу;
провести разведочный анализ.
Используйте регрессию, когда требуется:
оценить изменение результата;
учесть несколько факторов одновременно;
построить прогноз;
проверить вклад каждого предиктора;
получить модель вероятности события.
Перед анализом проверьте тип данных, выбросы, форму зависимости, пропуски и независимость наблюдений. Повторные ответы одного респондента требуют специальных моделей, поскольку обычная корреляция предполагает независимость наблюдений.
Примеры по сферам
Сфера
Корреляция
Регрессия
IT
связь ошибок и отказа от функции
прогноз оттока пользователя
HR
связь вовлечённости и стажа
оценка факторов увольнения
Производство
связь температуры и брака
прогноз числа дефектов
Банки
связь дохода и суммы кредита
оценка вероятности дефолта
Медицина
связь возраста и давления
прогноз риска осложнений
Образование
связь посещаемости и баллов
прогноз результата экзамена
Ритейл
связь скидки и объёма продаж
прогноз чека по характеристикам
B2B
связь NPS и продления
прогноз вероятности сделки
Типичные ошибки
называть корреляцию доказательством влияния;
считать нулевой Pearson r отсутствием любой связи;
строить регрессию без изучения графика;
использовать сильно связанные предикторы без проверки мультиколлинеарности;
прогнозировать далеко за пределами наблюдавшихся значений;
оценивать модель только по R²;
включать в модель данные, появившиеся после прогнозируемого события;
игнорировать различия между сегментами.
Высокий R² не гарантирует правильность формы модели, отсутствие систематических ошибок и пригодность прогноза. Графики остатков и проверка на новых данных остаются обязательными.
Как использовать в ФОКУЗ
В ФОКУЗ можно собрать данные для корреляционного и регрессионного анализа через NPS, CSI, eNPS, опросы вовлечённости, U&A и исследования клиентского опыта.
Можно измерить:
связь удовлетворённости с готовностью рекомендовать;
связь управленческих практик с вовлечённостью;
факторы намерения продлить договор;
зависимость клиентских усилий от отдельных этапов пути;
вероятность попадания респондента в группу критиков.
В отчётах получают распределения, сравнение сегментов и кросс-таблицы. Для регрессионной модели ответы можно выгрузить и объединить с CRM-, HR- или транзакционными данными. Корреляция помогает выбрать потенциально связанные признаки, а регрессия — оценить их совместный вклад. Анализ опроса должен учитывать, что обнаруженная статистическая связь не равна причинному объяснению.