Рассчитать размер выборки — значит определить, сколько респондентов, клиентов, сотрудников или других объектов нужно изучить, чтобы оценить показатель генеральной совокупности с заданной точностью. Расчёт применяют в опросах, маркетинговых и HR-исследованиях, контроле качества, медицине и экспериментальных тестах. Требуемое количество наблюдений зависит от цели исследования, допустимой погрешности, уровня доверия, вариативности признака, размера генеральной совокупности и способа отбора. Большая выборка уменьшает случайную ошибку, но не устраняет смещение, вызванное неправильным набором участников.
Формула расчёта размера выборки
Для оценки доли в большой генеральной совокупности используется формула:
n₀ = Z² × p × (1 − p) / e²
где:
- n₀ — минимальное число завершённых анкет;
- Z — коэффициент, соответствующий уровню доверия;
- p — ожидаемая доля изучаемого признака;
- e — допустимая погрешность в долях единицы.
Такая формула применяется прежде всего к простой случайной выборке и оценке доли: например, процента довольных клиентов или сотрудников, готовых рекомендовать работодателя.
Если предполагаемая доля неизвестна, принимают p = 0,5. При этом произведение p × (1 − p) максимально, поэтому расчёт даёт наиболее осторожную оценку.
Пример расчёта
Нужно определить долю удовлетворённых клиентов при:
- уровне доверия 95%;
- погрешности ±5%;
- неизвестной ожидаемой доле.
n₀ = 1,96² × 0,5 × 0,5 / 0,05² = 384,16.
Результат округляют вверх: необходимо получить не менее 385 заполненных анкет.
При погрешности ±3% потребуется уже около 1068 ответов. Уменьшение погрешности заметно увеличивает необходимую выборку.
Поправка на конечную совокупность
Если генеральная совокупность невелика и выборка составляет более 5–10% от неё, применяется поправка:
n = N × n₀ / (N + n₀ − 1)
где N — размер генеральной совокупности. Поправка учитывает, что обследуется существенная часть всех доступных объектов.
Например, при N = 1000 и исходном n₀ = 384,16:
n ≈ 278 человек.
Как учесть неответы и сложный дизайн
Расчёт показывает число полученных ответов, а не количество приглашений. Если ожидаемый response rate равен 60%, для получения 278 анкет потребуется пригласить:
278 / 0,60 = 464 человека.
Для кластерной, многоступенчатой или взвешенной выборки базовый размер умножают на design effect, или дизайн-эффект. В рекомендациях ВОЗ также предлагается отдельно учитывать ожидаемую долю неответов.
Практический порядок:
- Рассчитать базовую выборку.
- Применить поправку на конечную совокупность.
- Умножить результат на дизайн-эффект.
- Разделить на ожидаемую долю ответивших.
- Проверить достаточность каждого анализируемого сегмента.
Когда стандартная формула не подходит
Для проверки различий между группами размер выборки рассчитывают через статистическую мощность, уровень значимости и ожидаемый размер эффекта. Формула для оценки одной доли не заменяет power analysis для эксперимента.
Примеры применения
Типичные ошибки
- применять формулу 385 к любому исследованию;
- считать размер выборки без указания главной метрики;
- путать число приглашений с числом завершённых анкет;
- не учитывать отдельные подразделения и сегменты;
- считать квотную или доступную выборку автоматически репрезентативной;
- увеличивать объём, не исправляя смещение отбора;
- указывать общую погрешность для малых подгрупп;
- рассчитывать выборку после завершения исследования.
Номинальное число ответов не всегда равно эффективному размеру выборки: взвешивание, кластеризация и неравные вероятности отбора могут снижать точность оценок.
Как использовать в ФОКУЗ
В ФОКУЗ размер выборки определяют до запуска клиентского, маркетингового или HR-опроса. Для расчёта фиксируют генеральную совокупность, главную метрику, допустимую ошибку, уровень доверия, необходимые сегменты и ожидаемый процент ответов.
После сбора можно анализировать:
- количество приглашений и завершённых анкет;
- response rate;
- распределение респондентов по квотам;
- NPS, eNPS, CSAT, CSI и доли ответов;
- результаты подразделений, регионов и клиентских сегментов;
- динамику между волнами.
Это позволяет определить, достаточно ли данных для общего вывода, какие сегменты требуют добора и можно ли корректно сравнивать группы.
Часто задаваемые вопросы
Как рассчитать размер выборки для опроса?
Задать уровень доверия, погрешность и ожидаемую долю, затем применить формулу.
Почему часто нужна выборка 385 человек?
Она соответствует 95%-му уровню доверия и погрешности около ±5% при p = 0,5 для большой совокупности.
Зависит ли выборка от численности населения?
Слабо — для больших совокупностей. Для небольших применяется конечная поправка.
Какую погрешность выбрать?
Часто используют ±3–5%, но выбор зависит от цены ошибки и цели решения.
Что означает уровень доверия 95%?
Он характеризует процедуру построения интервала, а не вероятность истинности конкретного результата.
Сколько человек опросить из 1000?
При 95% и ±5% — примерно 278 при случайном отборе.
Нужно ли учитывать неответы?
Да. Приглашений должно быть больше требуемого числа заполненных анкет.
Как рассчитать выборку для двух групп?
Через ожидаемое различие, статистическую мощность и уровень значимости.
Делает ли большая выборка исследование репрезентативным?
Нет. Необходимы корректный отбор и достаточное покрытие целевой аудитории.
Нужно ли по 385 человек в каждом сегменте?
Только если для каждого сегмента требуется самостоятельная точность ±5%.
Кратко
- Размер выборки зависит от цели исследования.
- Для доли используют Z, p и допустимую погрешность.
- При 95% и ±5% обычно требуется около 385 ответов.
- Для небольших совокупностей применяется конечная поправка.
- Число приглашений увеличивают с учётом неответов.
- Сложный дизайн требует поправки на дизайн-эффект.
- Подгруппы нужно планировать отдельно.
- Для A/B-тестов применяется анализ мощности.
- Большой объём не исправляет ошибочный отбор.