Кейс Volta: воронка, A/B и retention на синтетике необанка

Кратко

Volta — учебный портфолио-кейс: аналитика необанка на синтетических данных, где каждый результат воспроизводим (seeded-пайплайны) и каждое решение проходит ship-gate. Четыре последовательных проекта: воронкаA/B-тестretentionсегментация. Ниже — не «отчёт о результатах», а лог решений: где терялись пользователи, как мы не дали статистике наврать и что из этого получилось.

Контекст: почему синтетика

Продакшен-данных банка нет, а учебные датасеты не дают системной картины. Поэтому данные сгенерированы с фиксированным seed: детерминированный пайплайн, повторяемый из прогона в прогон. Это меняет культуру работы: любой вывод можно перепроверить перезапуском, а не «поверить на слово». Синтетика — не замена реальным данным, но для методологии она честнее, чем молчаливые чужие данные.

Воронка: где терялся онбординг

Считалась воронка онбординга до первого продуктивного действия. Главная утечка оказалась в KYC — этапе верификации. Гипотеза: слишком длинная форма и отсутствие промежуточного подтверждения. Изменение флоу (KYC разбит на шаги с прогрессом) подняло конверсию на +6.24pp при Z = 6.35, p < 0.0001.

Прикидка эффекта: при реалистичной аудитории это ≈ €716K/год при ROI около 48×. Цифры синтетические, но механика оценки — та же, что для реального фикса: конверсия × число пользователей × LTV.

A/B: как не дали статистике наврать

Результат воронки — «эффект есть», но его надо было проверить как эксперимент, а не как срез. Схема теста:

  • CUPED с ковариатом «число сессий до теста» — убрали часть шума, выборка не росла.
  • AA-тест перед запуском: Type I error = 0.050 в пределах шума вокруг 5% — метод не мнит значимость.
  • Bonferroni для нескольких метрик (конверсия, время до завершения, доля бросивших) — контроль множественности.
  • Ship-gate: релиз только если доверительный интервал не пересекает ноль и эффект согласуется с бизнес-порогом.

Урок не в цифрах, а в порядке: сначала калибровка инструмента, потом вывод. АА-тест дешёвый, а молчаливо сломанный критерий — дорогой.

Retention: что показали треугольники

Удержание считалось когортными треугольниками (месяц регистрации × возраст), а не «средним по всем». По диагонали видно: когорты с включённым новым онбордингом держат M3-удержание на +9.2pp относительно старых когорт, что даёт +€227K/год инкрементального LTV (та же синтетическая оценка).

Наблюдение за возрастом: новый онбординг улучшает и первую неделю (быстрее доходят до ценности), и 3-й месяц (меньше отток после «медового месяца»). Без треугольников этот вывод спрятался бы за средним.

Сегментация: 4 профиля вместо 125 ячеек

На наборе поведенческих признаков (транзакции/месяц, средний чек, сбережения, логины, P2P, выручка) — кластеризация, а не классический RFM: у необанка «активность» шире покупок. Получилось 4 сегмента с персональной стратегией монетизации: Power Users (апсейл), Growth Users (кросс-сейл), Casual Users (retention-кампании), Dormant Users (реактивация). Правило — один сегмент = одно действие = одна метрика успеха.

Уроки

  • Сначала калибруй инструмент — A/A и power-кривая дешевле, чем сломанное решение.
  • Когорты только одного возраста — сравнение «новой и старой» без учёта возраста врёт.
  • Дизайн сегментов под действие — 4 сегмента с действием лучше 125 без него.
  • Синтетика легитимна для методологии — если все результаты воспроизводимы и подписаны как синтетические.

Ссылки

Смотрите также

← К статьям