Эксперимент завершён, p-value ниже порога, прирост целевой метрики выглядит убедительно — и всё равно после релиза ничего не происходит. Такой сценарий знаком почти каждому аналитику, и в большинстве случаев причина не одна. Ошибки группируются в три категории: организационные, статистические и технические. Нередко все три присутствуют в одном тесте одновременно.
Три группы ошибок A/B-теста
Каждая группа ломает результат по-своему, и часть из них дашборд не покажет: цифра выглядит убедительно, а решение уже принято.
Организационные ошибки
Это ошибки на уровне процесса: как эксперимент запускался, кто и когда принял решение его остановить. Типичные примеры — преждевременная остановка при первом «красивом» результате, отсутствие заранее зафиксированного горизонта теста, изменения в продукте, которые произошли параллельно с экспериментом и исказили выборку.
Статистические ошибки
Сюда относятся проблемы с расчётом размера выборки, неверный выбор метрики, p-hacking (множественные сравнения без поправки), игнорирование эффекта новизны и некорректная интерпретация статистической значимости как практической значимости.
Технические ошибки
Это сбои на уровне инфраструктуры: пользователи попадают в группы A и B не по задуманной логике, происходит утечка пользователей между группами (leakage), логирование событий теряет часть данных или дублирует их. Такие ошибки особенно коварны, потому что данные формально «есть» — они просто неверные.
Что сделать на практике
- Зафиксировать гипотезу, метрику и горизонт теста до запуска — и не менять их в процессе.
- Рассчитать необходимый размер выборки заранее, исходя из ожидаемого минимального эффекта (MDE).
- Проверить корректность сплитования: убедиться, что пользователь не мигрирует между группами.
- Проверить данные на наличие утечек и дублей до анализа результатов.
- Применять поправку на множественные сравнения, если тестируется несколько метрик или сегментов.
- После завершения теста сравнить поведение групп в пост-экспериментальном периоде, чтобы исключить эффект новизны.
Вывод
Расхождение между результатом теста и реальным эффектом в проде — это не случайность и не невезение. Как правило, это системная ошибка, которую можно предотвратить ещё на этапе дизайна эксперимента. Структурированный чек-лист проверок — базовый инструмент, который стоит применять к каждому тесту, независимо от его масштаба.