Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 1/11

Кратко:
  • Статья предлагает 11 уроков по 10 минут для изучения A/B-тестирования и анализа его результатов.
  • Уроки включают освоение техники Bootstrap.
  • Цель курса - помочь понять, поможет ли запуск новой функциональности метрикам.

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 2/11

Кратко:
  • A/B-тестирование (сплит-тестирование) - метод проверки гипотез для оценки влияния изменений сервиса или продукта на пользователей.
  • Аудитория делится на контрольную (A) и тестовую (B) группы, с разными версиями сервиса.
  • Эксперимент длится фиксированное время, например, две недели.
  • В ходе тестирования собираются данные о поведении пользователей в разных группах.
  • Если ключевая метрика в тестовой группе выросла, новая функциональность внедряется.
  • Перед A/B-тестом может проводиться A/A-тест для проверки корректности.
  • При сравнении метрик нужно учитывать факторы, такие как разброс значений и длительность эксперимента.
  • Результаты A/B-теста помогают оценить, насколько сильно метрики могут отклоняться.

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 3/11

Кратко:
  • A/B-тест используется для сравнения результатов использования разных версий продукта или функций.
  • Выбор времени проведения A/B-теста зависит от поведения пользователей и времени, необходимого им для привыкания к нововведению.
  • Проблема подглядывания (peek problem) возникает, когда новые данные поступают в начало эксперимента, искажая общий результат.
  • Размер выборки определяется до начала теста, чтобы избежать проблемы подглядывания.
  • Онлайн-калькуляторы, такие как vwo.com, могут помочь определить размер выборки для A/B-теста.
  • Пример использования калькулятора для определения размера выборки: 100 000 посетителей, 1% конверсии, 5% относительного изменения конверсии, 2 вариации теста.
  • Традиционное A/B-тестирование требует минимум 13 дней.

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 4/11

Кратко:
  • Анализ результатов А/В-теста позволяет определить, нужна ли новая функциональность.
  • Среднее значение метрики описывает поведение всех пользователей вместе.
  • Результаты измерения и средние значения - случайные величины, в них могут быть случайные погрешности.
  • Нулевая гипотеза: новая функциональность не улучшает метрики.
  • Альтернативная гипотеза: новая функциональность улучшает метрики.
  • Ошибка первого рода: нулевая гипотеза отклоняется, но ложный положительный результат.
  • Ошибка второго рода: нулевая гипотеза не отклоняется, но ложный отрицательный результат.
  • Для принятия или отвержения нулевой гипотезы вычисляется уровень значимости - p-value.

МОБ. Задача 1

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 5/11

Кратко:
  • В бизнесе важно понимать риски и оценивать возможные значения нужных величин.
  • Доверительный интервал - отрезок числовой оси, в который с заданной вероятностью попадает нужный нам параметр генеральной совокупности.
  • При вычислении доверительного интервала с каждой из его сторон обычно выбрасывают одинаковую долю экстремальных значений.
  • Доверительный интервал - это не просто диапазон значений случайной величины.
  • Вероятность возникает потому, что число неизвестно и оценивается по выборке.
  • Случайность выборки вносит случайность и в оценку.
  • Доверительный интервал оценивает уверенность в этой оценке.

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 6/11

Кратко:
  • Центральная предельная теорема позволяет определить доверительный интервал для среднего на основе выборки.
  • Размер выборки влияет на точность оценки среднего значения.
  • Стандартная ошибка уменьшается с увеличением размера выборки.
  • Стандартное нормальное распределение используется для стандартизации выборочных средних.
  • 5% и 95% квантили стандартного нормального распределения определяют 90% доверительный интервал.
  • Стандартную ошибку можно оценить по выборке, вместо дисперсии генеральной совокупности.
  • Распределение Стьюдента используется для описания выборочных средних при неизвестной дисперсии.
  • Функция scipy.stats.t в Python помогает вычислить доверительный интервал.

МОБ. Задача 1

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 7/11

Кратко:
  • Bootstrap - техника для вычисления сложных величин без формул.
  • Подвыборки формируются из исходного набора данных, и среднее значение вычисляется на каждой из них.
  • Подвыборки могут формироваться многократно для получения нескольких значений интересующего показателя.
  • Название техники происходит от выражения "вытащить себя за ремешки ботинок".
  • Бутстреп применим для любых выборок и полезен, когда нет нормальных статистических тестов.
  • Техника бутстрепа используется для оценки доверительных интервалов и анализа результатов A/B-тестов.

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 8/11

Кратко:
  • Компания "УберегиБанк" исследует время ожидания клиентов в очередях.
  • Цель эксперимента - 0.99-квантиль распределения времени ожидания.
  • Необходимо оценить 90%-й доверительный интервал для 0.99-квантиля.
  • Для бутстрепа создаются подвыборки с помощью функции sample() и объекта RandomState().
  • Важно указать аргумент replace=True для подвыборок, чтобы элементы могли повторяться.

МОБ. Задача 1

МОБ. Задача 2

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 9/11

Кратко:
  • Bootstrap может быть применен для анализа результатов A/B-теста.
  • Цель: проверить изменение среднего чека покупки после изменения интерфейса интернет-магазина.
  • Накоплены данные о сумме каждой покупки в контрольной и экспериментальной группах.
  • Рассчитывается фактическая разница средних чеков в группах.
  • Формулируются и проверяются гипотезы: нулевая - равенство средних чеков, альтернативная - средний чек выше в экспериментальной группе.
  • Находим p-value - вероятность случайного получения такой разницы.
  • Бутстреп используется для объединения выборок и получения распределения среднего чека.
  • Создаются подвыборки, каждая из которых делится пополам, и находится разница среднего чека между ними.
  • Оценивается доля разниц средних чеков в бутстрепе, которые оказались не меньше, чем в исходных выборках.

МОБ. Задача 1

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 10/11

Кратко:
  • Школа английского языка разрабатывает модель для оценки вероятности посещения урока.
  • Модель уже обучена и предсказания находятся в файле eng_probabilities.csv.
  • Одно занятие стоит 1000 рублей, в день можно запланировать до 10 уроков.
  • Текущая выручка за день - 5000 рублей (половина учеников отменяет занятие).
  • За день поступает в среднем 25 заявок.
  • Для внедрения достаточно большая выручка - 7500 рублей, ее вероятность должна быть не меньше 99%.

МОБ. Задача 1

МОБ. Задача 2

Спринт 12/24 → Тема 3/7: Запуск новой функциональности → Урок 11/11

Кратко:
  • Умение анализировать результаты A/B-тестирования.
  • Вычисление доверительного интервала.
  • Расчет сложных величин с помощью техники Bootstrap.
  • Следующая тема: сбор данных и проверка моделей.
  • Шпаргалка и конспект темы для удобства.
Заключение

Теперь вы умеете:

  • Анализировать результаты A/B-тестирования;
  • Вычислять доверительный интервал;
  • Рассчитывать сложные величины техникой Bootstrap.

В следующей теме вы узнаете, как собирать данные и более надёжно проверять на них модели.

Заберите с собой

Чтобы ничего не забыть, скачайте шпаргалку и конспект темы.