Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 1/11

Кратко:
  • Тема посвящена автоматизированной настройке моделей для решения задач классификации.
  • Рассматривается дерево решений как новая модель для решения задач классификации.
  • Обсуждаются параметры и гипер параметры моделей.
  • Три способа автоматизированного поиска для подбора лучших значений гиперпараметров.
  • Важность определения значимых признаков для дерева решений.
  • Девять уроков по 30-40 минут каждый.
  • Применение: транспортная компания "Маршрут Экспресс" и предсказание удовлетворенности пассажиров.

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 2/11

Кратко:
  • Транспортная компания "Маршрут Экспресс" занимается пассажирскими перевозками.
  • Компания хочет научиться предсказывать, понравится ли пассажиру поездка.
  • Используются данные о поездках с помощью pandas и индексация идентификаторов клиентов.
  • Модель Decision Tree лучше подходит для данных с большим количеством категориальных признаков.
  • В библиотеке sklearn модель для классификации реализована в модуле tree классом DecisionTreeClassifier.
  • При инициализации модели необходимо зафиксировать параметр random_state.
  • В статье представлены этапы обучения модели дерева решений.

КМ. Задача 1

КМ. Задача 2

КМ. Задача 3

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 3/11

Кратко:
  • Дерево решений - иерархическая структура, состоящая из правил "Если ... , то ...".
  • В машинном обучении правила создаются автоматически в процессе обучения на тренировочной выборке.
  • Элементы дерева решений: корневой узел, узлы принятия решений, конечные узлы (листья), глубина дерева.
  • При предсказании класса новый объект проходит через схему дерева решений и сравнивается с установленными правилами.
  • Определить класс объекта можно по листу, в котором он оказался.

КМ. Задача 1

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 4/11

Кратко:
  • Модель дерева решений состоит из параметров и гиперпараметров.
  • Параметры подбираются автоматически, гиперпараметры настраиваются вручную.
  • Гиперпараметры влияют на построение дерева решений, параметры - нет.
  • Основные гиперпараметры: max_depth, min_samples_split, min_samples_leaf.
  • Экспериментирование с гиперпараметрами для улучшения качества модели.
  • Автоматизированный поиск лучших гиперпараметров с использованием специальных классов в sklearn.

КМ. Задача 1

КМ. Задача 2

КМ. Задача 3

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 5/11

Кратко:
  • GridSearchCV автоматизирует подбор гиперпараметров, экономя время и код.
  • GridSearchCV создает отдельную модель для каждой комбинации гиперпараметров и обучает ее.
  • Большие диапазоны значений гиперпараметров могут замедлить процесс поиска.
  • GridSearchCV требует инициализированной модели и словаря с гиперпараметрами.
  • Перебор гиперпараметров циклом занимает много времени и требует написания сложного кода.
  • GridSearchCV - удобный инструмент для автоматизированного подбора гиперпараметров.

КМ. Задача 1

КМ. Задача 2

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 6/11

Кратко:
  • Модель для предсказания удовлетворённости поездкой даёт много ложноположительных ответов.
  • Заказчик недоволен моделью и требует улучшения.
  • Решение: следить за метрикой FPR (доля ложноположительных ответов) вместе с ROC-AUC.
  • Метрика FPR не входит в стандартный набор метрик sklearn, поэтому создана функция для её подсчёта.
  • Модель обучается с использованием GridSearchCV и метрик ROC-AUC и FPR.
  • Результаты GridSearchCV показывают, что модель с лучшей FPR даёт меньше ложноположительных ответов.
  • Заказчик выбирает модель с лучшей FPR, если важнее находить недовольных пассажиров, или модель с высокой ROC-AUC, если важнее качественно классифицировать данные.

КМ. Задача 1

КМ. Задача 2

КМ. Задача 3

КМ. Задача 4

Спринт 10/24 → Тема 6/11: Дерево решений и гиперпараметры → Урок 7/11

Кратко:
  • GridSearchCV имеет недостатки, такой поиск занимает много времени.
  • Рандомизированный поиск (RandomizedSearchCV) позволяет перебирать фиксированное количество значений гиперпараметров.
  • GridSearchCV перебирает все возможные комбинации гиперпараметров, RandomizedSearchCV - только ограниченное число.
  • RandomizedSearchCV лучше применять при широких диапазонах гиперпараметров.
  • Параметры RandomizedSearchCV включают модель, словарь со значениями гиперпараметров и random_state.
  • Метрику при кросс-валидации можно узнать по атрибуту bestscore.
  • RandomizedSearchCV работает быстрее, но не всегда лучше GridSearchCV.
  • При инициализации класса RandomizedSearchCV нужно зафиксировать random_state для стабильности результатов.

КМ. Задача 1

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 8/11

Кратко:
  • Байесовская оптимизация - итеративный метод оптимизации, который оценивает оптимальное значение функции без производной.
  • Байесовская оптимизация работает итерациями, указывает, в какой следующей точке с наибольшей вероятностью улучшается текущая оценка.
  • Байесовская оптимизация позволяет вычислять функцию реже и тратить меньше времени на вычисления.
  • Байесовская оптимизация быстрее находит лучшие значения гиперпараметров и за меньшее количество итераций, чем случайный поиск и поиск по сетке.
  • OptunaSearchCV - инструмент для байесовской оптимизации, который можно использовать для подбора гиперпараметров.

КМ. Задача 1

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 9/11

Кратко:
  • Сравнение трех способов автоматизированного поиска гиперпараметров: GridSearchCV, RandomizedSearchCV и OptunaSearchCV.
  • GridSearchCV: перебор по сетке, занимает больше времени, но можно ускорить вычисления с помощью n_jobs=-1.
  • RandomizedSearchCV: перебор гиперпараметров случайно, занимает меньше времени, но перебирает не все комбинации.
  • OptunaSearchCV: перебор с помощью байесовской оптимизации, занимает меньше времени, чем GridSearchCV, но больше времени, чем RandomizedSearchCV.
  • Задача: проверить особенности разных способов поиска на практике и сравнить результаты.
  • Используются одинаковые диапазоны гиперпараметров для корректного сравнения.
  • Инициализируются классы для каждого способа с определенными значениями кросс-валидации и метрики.
  • Каждый способ имеет свои преимущества и недостатки, выбор зависит от конкретных задач и требований.

КМ. Задача 1

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 10/11

Кратко:
  • Улучшено качество дерева решений благодаря автоматическому подбору гиперпараметров.
  • Задача о перевозках в "Маршрут Экспресс" не решена полностью, требуется интерпретация результатов работы модели.
  • Результат обучения и предсказания деревьев решений также можно интерпретировать.
  • Оценка важности признаков осуществляется с помощью атрибута featureimportances.
  • Важность признаков показывает, насколько часто они участвуют в правилах разделения на классы.
  • Задача: сформировать таблицу важности признаков на данных о пассажирских перевозках.
  • Задача: отобразить важность признаков на графике с помощью seaborn.
  • Результат работы функции export_text: отображение правил разделения на классы и направления движения по дереву.
  • Выводы: результат обучения и предсказания дерева решений можно интерпретировать с помощью правил разделения и важности признаков.

КМ. Задача 1

КМ. Задача 2

Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 11/11

Кратко:
  • Завершена новая глава обучения работе с новой моделью МО и подбору гиперпараметров.
  • Освоены методы использования дерева решений для задач классификации и отличия гиперпараметров от параметров.
  • Изучены три способа автоматизированного поиска лучших значений гиперпараметров: GridSearchCV, RandomizedSearchCV и OptunaSearchCV.
  • Научились интерпретировать результаты предсказания дерева решений и определять важность признаков.
  • Шпаргалка по теме предоставлена для сохранения знаний.
  • В следующей теме продолжите заниматься признаками, преобразовывать категориальные переменные и создавать новые признаки для обучения модели.
  • Компания «Маршрут Экспресс» собирает новые данные для улучшения предсказаний и нуждается в помощи.
Заключение

Подошла к концу новая глава! Вы столько успели освоить: работу с новой моделью МО, подбор гиперпараметров. Теперь вы умеете виртуозно подбирать гиперпараметры и делать это не руками, а с помощью целых трёх способов.

Чему вы научились

  • Использовать дерево решений для задач классификации. Модель формирует правила и разделяет выборку на подвыборки, чтобы отделить объекты одного класса от другого.
  • Отличать гиперпараметры от параметров. Параметры — это настройки модели, которые подбираются в процессе обучения. Гиперпараметры — настройки модели, которые вручную фиксирует специалист до начала обучения. В процессе обучения они никак не меняются.
  • Подбирать лучшие значения гиперпараметров с помощью трёх способов автоматизированного поиска. GridSearchCV — поиск по сетке, находит лучшую модель на всех комбинациях гиперпараметров; RandomizedSearchCV — случайный поиск, находит лучшую модель на случайном количестве комбинаций гиперпараметров; OptunaSearchCV — байесовская оптимизация, находит лучшую модель в той области значений гиперпараметров, в которой большая метрика вероятнее.
  • Интерпретировать результат предсказания дерева решений. Определить важность признаков для дерева решений можно с помощью правил разделения: чем чаще в них встречается признак, тем он полезнее для решения задачи.

Заберите с собой

Чтобы ничего не забыть, скачайте шпаргалку по теме.