Дашборды4 августа 2026 г.369

A/B-тест показал рост, но после релиза — ноль

Коротко

A/B-тест показывает прирост, но после релиза метрика не двигается — почти всегда за этим стоят организационные, статистические или технические ошибки, которые дашборд не выявляет сам по себе.

Эксперимент завершён, p-value ниже порога, прирост целевой метрики выглядит убедительно — и всё равно после релиза ничего не происходит. Такой сценарий знаком почти каждому аналитику, и в большинстве случаев причина не одна. Ошибки группируются в три категории: организационные, статистические и технические. Нередко все три присутствуют в одном тесте одновременно.

Три группы ошибок A/B-теста

Каждая группа ломает результат по-своему, и часть из них дашборд не покажет: цифра выглядит убедительно, а решение уже принято.

Организационные ошибки

Это ошибки на уровне процесса: как эксперимент запускался, кто и когда принял решение его остановить. Типичные примеры — преждевременная остановка при первом «красивом» результате, отсутствие заранее зафиксированного горизонта теста, изменения в продукте, которые произошли параллельно с экспериментом и исказили выборку.

Статистические ошибки

Сюда относятся проблемы с расчётом размера выборки, неверный выбор метрики, p-hacking (множественные сравнения без поправки), игнорирование эффекта новизны и некорректная интерпретация статистической значимости как практической значимости.

Технические ошибки

Это сбои на уровне инфраструктуры: пользователи попадают в группы A и B не по задуманной логике, происходит утечка пользователей между группами (leakage), логирование событий теряет часть данных или дублирует их. Такие ошибки особенно коварны, потому что данные формально «есть» — они просто неверные.

Что сделать на практике

  • Зафиксировать гипотезу, метрику и горизонт теста до запуска — и не менять их в процессе.
  • Рассчитать необходимый размер выборки заранее, исходя из ожидаемого минимального эффекта (MDE).
  • Проверить корректность сплитования: убедиться, что пользователь не мигрирует между группами.
  • Проверить данные на наличие утечек и дублей до анализа результатов.
  • Применять поправку на множественные сравнения, если тестируется несколько метрик или сегментов.
  • После завершения теста сравнить поведение групп в пост-экспериментальном периоде, чтобы исключить эффект новизны.

Вывод

Расхождение между результатом теста и реальным эффектом в проде — это не случайность и не невезение. Как правило, это системная ошибка, которую можно предотвратить ещё на этапе дизайна эксперимента. Структурированный чек-лист проверок — базовый инструмент, который стоит применять к каждому тесту, независимо от его масштаба.

Частые вопросы

Почему A/B-тест показывает улучшение, а после релиза метрика не растёт?+

Чаще всего это следствие одной или нескольких групп ошибок: организационных (некорректная остановка теста), статистических (недостаточная выборка, p-hacking) или технических (неверный сплит, утечки пользователей между группами).

Что такое утечка пользователей (leakage) в A/B-тесте?+

Leakage — ситуация, когда пользователь, назначенный в группу A, получает воздействие группы B (или наоборот). Это нарушает изоляцию групп и делает сравнение некорректным.

Как избежать преждевременной остановки A/B-теста?+

Необходимо заранее зафиксировать горизонт теста и минимальный детектируемый эффект (MDE), а не останавливать эксперимент в момент, когда результат впервые стал значимым.

Что такое эффект новизны в A/B-тестировании?+

Эффект новизны — временный всплеск метрики из-за того, что пользователи реагируют на изменение само по себе, а не на его реальную ценность. Чтобы его исключить, результаты теста проверяют в пост-экспериментальном периоде.

14💯6🔥5
Читать оригинал в Telegram
Там можно оставить реакцию и написать комментарий
✈️ Открыть
🥰
Валерия Смирнова
Senior BI-аналитик в Авито · @mozzalerra
Сотрудничество →