Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 1/11
Кратко:
- Статья предлагает 11 уроков по 10 минут для изучения A/B-тестирования и анализа его результатов.
- Уроки включают освоение техники Bootstrap.
- Цель курса - помочь понять, поможет ли запуск новой функциональности метрикам.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 2/11
Кратко:
- A/B-тестирование (сплит-тестирование) - метод проверки гипотез для оценки влияния изменений сервиса или продукта на пользователей.
- Аудитория делится на контрольную (A) и тестовую (B) группы, с разными версиями сервиса.
- Эксперимент длится фиксированное время, например, две недели.
- В ходе тестирования собираются данные о поведении пользователей в разных группах.
- Если ключевая метрика в тестовой группе выросла, новая функциональность внедряется.
- Перед A/B-тестом может проводиться A/A-тест для проверки корректности.
- При сравнении метрик нужно учитывать факторы, такие как разброс значений и длительность эксперимента.
- Результаты A/B-теста помогают оценить, насколько сильно метрики могут отклоняться.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 3/11
Кратко:
- A/B-тест используется для сравнения результатов использования разных версий продукта или функций.
- Выбор времени проведения A/B-теста зависит от поведения пользователей и времени, необходимого им для привыкания к нововведению.
- Проблема подглядывания (peek problem) возникает, когда новые данные поступают в начало эксперимента, искажая общий результат.
- Размер выборки определяется до начала теста, чтобы избежать проблемы подглядывания.
- Онлайн-калькуляторы, такие как vwo.com, могут помочь определить размер выборки для A/B-теста.
- Пример использования калькулятора для определения размера выборки: 100 000 посетителей, 1% конверсии, 5% относительного изменения конверсии, 2 вариации теста.
- Традиционное A/B-тестирование требует минимум 13 дней.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 4/11
Кратко:
- Анализ результатов А/В-теста позволяет определить, нужна ли новая функциональность.
- Среднее значение метрики описывает поведение всех пользователей вместе.
- Результаты измерения и средние значения - случайные величины, в них могут быть случайные погрешности.
- Нулевая гипотеза: новая функциональность не улучшает метрики.
- Альтернативная гипотеза: новая функциональность улучшает метрики.
- Ошибка первого рода: нулевая гипотеза отклоняется, но ложный положительный результат.
- Ошибка второго рода: нулевая гипотеза не отклоняется, но ложный отрицательный результат.
- Для принятия или отвержения нулевой гипотезы вычисляется уровень значимости - p-value.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 5/11
Кратко:
- В бизнесе важно понимать риски и оценивать возможные значения нужных величин.
- Доверительный интервал - отрезок числовой оси, в который с заданной вероятностью попадает нужный нам параметр генеральной совокупности.
- При вычислении доверительного интервала с каждой из его сторон обычно выбрасывают одинаковую долю экстремальных значений.
- Доверительный интервал - это не просто диапазон значений случайной величины.
- Вероятность возникает потому, что число неизвестно и оценивается по выборке.
- Случайность выборки вносит случайность и в оценку.
- Доверительный интервал оценивает уверенность в этой оценке.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 6/11
Кратко:
- Центральная предельная теорема позволяет определить доверительный интервал для среднего на основе выборки.
- Размер выборки влияет на точность оценки среднего значения.
- Стандартная ошибка уменьшается с увеличением размера выборки.
- Стандартное нормальное распределение используется для стандартизации выборочных средних.
- 5% и 95% квантили стандартного нормального распределения определяют 90% доверительный интервал.
- Стандартную ошибку можно оценить по выборке, вместо дисперсии генеральной совокупности.
- Распределение Стьюдента используется для описания выборочных средних при неизвестной дисперсии.
- Функция scipy.stats.t в Python помогает вычислить доверительный интервал.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 7/11
Кратко:
- Bootstrap - техника для вычисления сложных величин без формул.
- Подвыборки формируются из исходного набора данных, и среднее значение вычисляется на каждой из них.
- Подвыборки могут формироваться многократно для получения нескольких значений интересующего показателя.
- Название техники происходит от выражения "вытащить себя за ремешки ботинок".
- Бутстреп применим для любых выборок и полезен, когда нет нормальных статистических тестов.
- Техника бутстрепа используется для оценки доверительных интервалов и анализа результатов A/B-тестов.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 8/11
Кратко:
- Компания "УберегиБанк" исследует время ожидания клиентов в очередях.
- Цель эксперимента - 0.99-квантиль распределения времени ожидания.
- Необходимо оценить 90%-й доверительный интервал для 0.99-квантиля.
- Для бутстрепа создаются подвыборки с помощью функции sample() и объекта RandomState().
- Важно указать аргумент replace=True для подвыборок, чтобы элементы могли повторяться.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 9/11
Кратко:
- Bootstrap может быть применен для анализа результатов A/B-теста.
- Цель: проверить изменение среднего чека покупки после изменения интерфейса интернет-магазина.
- Накоплены данные о сумме каждой покупки в контрольной и экспериментальной группах.
- Рассчитывается фактическая разница средних чеков в группах.
- Формулируются и проверяются гипотезы: нулевая - равенство средних чеков, альтернативная - средний чек выше в экспериментальной группе.
- Находим p-value - вероятность случайного получения такой разницы.
- Бутстреп используется для объединения выборок и получения распределения среднего чека.
- Создаются подвыборки, каждая из которых делится пополам, и находится разница среднего чека между ними.
- Оценивается доля разниц средних чеков в бутстрепе, которые оказались не меньше, чем в исходных выборках.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 10/11
Кратко:
- Школа английского языка разрабатывает модель для оценки вероятности посещения урока.
- Модель уже обучена и предсказания находятся в файле eng_probabilities.csv.
- Одно занятие стоит 1000 рублей, в день можно запланировать до 10 уроков.
- Текущая выручка за день - 5000 рублей (половина учеников отменяет занятие).
- За день поступает в среднем 25 заявок.
- Для внедрения достаточно большая выручка - 7500 рублей, ее вероятность должна быть не меньше 99%.
Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 11/11
Кратко:
- Умение анализировать результаты A/B-тестирования.
- Вычисление доверительного интервала.
- Расчет сложных величин с помощью техники Bootstrap.
- Следующая тема: сбор данных и проверка моделей.
- Шпаргалка и конспект темы для удобства.
Заключение
Теперь вы умеете:
- Анализировать результаты A/B-тестирования;
- Вычислять доверительный интервал;
- Рассчитывать сложные величины техникой Bootstrap.
В следующей теме вы узнаете, как собирать данные и более надёжно проверять на них модели.
Заберите с собой
Чтобы ничего не забыть, скачайте шпаргалку и конспект темы.