Кейс Volta: воронка, A/B и retention на синтетике необанка
Кратко
Volta — учебный портфолио-кейс: аналитика необанка на синтетических данных, где каждый результат воспроизводим (seeded-пайплайны) и каждое решение проходит ship-gate. Четыре последовательных проекта: воронка → A/B-тест → retention → сегментация. Ниже — не «отчёт о результатах», а лог решений: где терялись пользователи, как мы не дали статистике наврать и что из этого получилось.
Контекст: почему синтетика
Продакшен-данных банка нет, а учебные датасеты не дают системной картины. Поэтому данные сгенерированы с фиксированным seed: детерминированный пайплайн, повторяемый из прогона в прогон. Это меняет культуру работы: любой вывод можно перепроверить перезапуском, а не «поверить на слово». Синтетика — не замена реальным данным, но для методологии она честнее, чем молчаливые чужие данные.
Воронка: где терялся онбординг
Считалась воронка онбординга до первого продуктивного действия. Главная утечка оказалась в KYC — этапе верификации. Гипотеза: слишком длинная форма и отсутствие промежуточного подтверждения. Изменение флоу (KYC разбит на шаги с прогрессом) подняло конверсию на +6.24pp при Z = 6.35, p < 0.0001.
Прикидка эффекта: при реалистичной аудитории это ≈ €716K/год при ROI около 48×. Цифры синтетические, но механика оценки — та же, что для реального фикса: конверсия × число пользователей × LTV.
A/B: как не дали статистике наврать
Результат воронки — «эффект есть», но его надо было проверить как эксперимент, а не как срез. Схема теста:
- CUPED с ковариатом «число сессий до теста» — убрали часть шума, выборка не росла.
- AA-тест перед запуском: Type I error = 0.050 в пределах шума вокруг 5% — метод не мнит значимость.
- Bonferroni для нескольких метрик (конверсия, время до завершения, доля бросивших) — контроль множественности.
- Ship-gate: релиз только если доверительный интервал не пересекает ноль и эффект согласуется с бизнес-порогом.
Урок не в цифрах, а в порядке: сначала калибровка инструмента, потом вывод. АА-тест дешёвый, а молчаливо сломанный критерий — дорогой.
Retention: что показали треугольники
Удержание считалось когортными треугольниками (месяц регистрации × возраст), а не «средним по всем». По диагонали видно: когорты с включённым новым онбордингом держат M3-удержание на +9.2pp относительно старых когорт, что даёт +€227K/год инкрементального LTV (та же синтетическая оценка).
Наблюдение за возрастом: новый онбординг улучшает и первую неделю (быстрее доходят до ценности), и 3-й месяц (меньше отток после «медового месяца»). Без треугольников этот вывод спрятался бы за средним.
Сегментация: 4 профиля вместо 125 ячеек
На наборе поведенческих признаков (транзакции/месяц, средний чек, сбережения, логины, P2P, выручка) — кластеризация, а не классический RFM: у необанка «активность» шире покупок. Получилось 4 сегмента с персональной стратегией монетизации: Power Users (апсейл), Growth Users (кросс-сейл), Casual Users (retention-кампании), Dormant Users (реактивация). Правило — один сегмент = одно действие = одна метрика успеха.
Уроки
- Сначала калибруй инструмент — A/A и power-кривая дешевле, чем сломанное решение.
- Когорты только одного возраста — сравнение «новой и старой» без учёта возраста врёт.
- Дизайн сегментов под действие — 4 сегмента с действием лучше 125 без него.
- Синтетика легитимна для методологии — если все результаты воспроизводимы и подписаны как синтетические.
Ссылки
- Volta Neobank — Product Analytics — четыре части кейса с кодом и графиками
- Калибровка A/B-методов симуляцией — как проверялся каждый модуль
- Почему агрегат врёт: когортные треугольники — инструмент, которым читался retention
- Почему мы перешли на байесовское A/B-тестирование — альтернативный фреймворк для тех же вопросов