медиан 2. Неправильный подход к анализу ratio-метрик 3. Ранняя остановка тестов без использования последовательного тестирования 4. Отсутствие поправок на множественное тестирование для зависимых гипотез
ли данный критерий нормального распределения данных? Теряет ли он мощность при скошенных данных? Этап t-критерий U-критерий Ошибка I рода Ошибка II рода Ошибка I рода Ошибка II рода 1 0.051 0.200 0.051 0.217 2 0.051 0.199 0.049 0.218 3 0.047 0.193 0.050 0.209 Результаты A/A/B симуляций для нормального распределения 𝑁(1.82, 2.36) Этап t-критерий U-критерий Ошибка I рода Ошибка II рода Ошибка I рода Ошибка II рода 1 0.051 0.208 0.051 0 2 0.049 0.206 0.051 0 3 0.048 0.201 0.051 0 Результаты A/A/B симуляций для логнормального распределения 𝐿𝑜𝑔𝑛𝑜𝑟𝑚𝑎𝑙(1.82, 2.36)
400 4 55656574677 3000 2 Total 4756 7 ARPU = (1356+2400+400+3000)/3=2385,3 AOV =4756/7 = 679,4 Ratio-метрика это метрика, состоящая из отношения сумм двух случайных величин
к пользовательской метрике через другое признаковое пространство, по сути, являющийся перевешиванием пользователей по вкладу в ratio-метрику. Осуществляется по формуле:
проводимые изменения могут требовать значительных затрат, так еще и существует вероятность того, что эти изменения могут отрицательно сказаться на клиентах, что снизит их лояльность. Не удивительно, что у всех появляется желание пораньше закончить эксперимент, когда результат, кажется, достиг наших ожиданий до срока остановки теста.
рода. Проведем симуляцию с A/A-тестами и проверим, что будет, если останавливать эксперимент тогда, когда мы по мере поступления данных, впервые обнаружили стат. значимую разность средних.
последовательного тестирования. Метод не требует, в отличии от классического SPRT, конкретного значения 𝜃 1 Авторы замечательной статьи Peeking at A/B Tests предложили следующую реализацию mSPRT:
нами гипотез те, что приводят к изменению метрик. • Нулевая гипотеза: наше изменение не приводит к значимым отличиям в метриках. • Альтернативная гипотеза состоит в том, что изменение действительно дает нам улучшение в метриках. Следовательно, нужно оценивать FWER: FWER = 1 - (1-α)m
множеству метрик, гипотезы являются зависимыми, потому что мы считаем метрики на одних и тех же данных. Причины, по которым не работают классические методы: 1. Парадокс применения классических поправок на множественное тестирование 2. Выбросы в эффектах при верной H0