Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 1/11
Кратко:
- Тема посвящена автоматизированной настройке моделей для решения задач классификации.
- Рассматривается дерево решений как новая модель для решения задач классификации.
- Обсуждаются параметры и гипер параметры моделей.
- Три способа автоматизированного поиска для подбора лучших значений гиперпараметров.
- Важность определения значимых признаков для дерева решений.
- Девять уроков по 30-40 минут каждый.
- Применение: транспортная компания "Маршрут Экспресс" и предсказание удовлетворенности пассажиров.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 2/11
Кратко:
- Транспортная компания "Маршрут Экспресс" занимается пассажирскими перевозками.
- Компания хочет научиться предсказывать, понравится ли пассажиру поездка.
- Используются данные о поездках с помощью pandas и индексация идентификаторов клиентов.
- Модель Decision Tree лучше подходит для данных с большим количеством категориальных признаков.
- В библиотеке sklearn модель для классификации реализована в модуле tree классом DecisionTreeClassifier.
- При инициализации модели необходимо зафиксировать параметр random_state.
- В статье представлены этапы обучения модели дерева решений.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 3/11
Кратко:
- Дерево решений - иерархическая структура, состоящая из правил "Если ... , то ...".
- В машинном обучении правила создаются автоматически в процессе обучения на тренировочной выборке.
- Элементы дерева решений: корневой узел, узлы принятия решений, конечные узлы (листья), глубина дерева.
- При предсказании класса новый объект проходит через схему дерева решений и сравнивается с установленными правилами.
- Определить класс объекта можно по листу, в котором он оказался.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 4/11
Кратко:
- Модель дерева решений состоит из параметров и гиперпараметров.
- Параметры подбираются автоматически, гиперпараметры настраиваются вручную.
- Гиперпараметры влияют на построение дерева решений, параметры - нет.
- Основные гиперпараметры: max_depth, min_samples_split, min_samples_leaf.
- Экспериментирование с гиперпараметрами для улучшения качества модели.
- Автоматизированный поиск лучших гиперпараметров с использованием специальных классов в sklearn.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 5/11
Кратко:
- GridSearchCV автоматизирует подбор гиперпараметров, экономя время и код.
- GridSearchCV создает отдельную модель для каждой комбинации гиперпараметров и обучает ее.
- Большие диапазоны значений гиперпараметров могут замедлить процесс поиска.
- GridSearchCV требует инициализированной модели и словаря с гиперпараметрами.
- Перебор гиперпараметров циклом занимает много времени и требует написания сложного кода.
- GridSearchCV - удобный инструмент для автоматизированного подбора гиперпараметров.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 6/11
Кратко:
- Модель для предсказания удовлетворённости поездкой даёт много ложноположительных ответов.
- Заказчик недоволен моделью и требует улучшения.
- Решение: следить за метрикой FPR (доля ложноположительных ответов) вместе с ROC-AUC.
- Метрика FPR не входит в стандартный набор метрик sklearn, поэтому создана функция для её подсчёта.
- Модель обучается с использованием GridSearchCV и метрик ROC-AUC и FPR.
- Результаты GridSearchCV показывают, что модель с лучшей FPR даёт меньше ложноположительных ответов.
- Заказчик выбирает модель с лучшей FPR, если важнее находить недовольных пассажиров, или модель с высокой ROC-AUC, если важнее качественно классифицировать данные.
Спринт 10/24 → Тема 6/11: Дерево решений и гиперпараметры → Урок 7/11
Кратко:
- GridSearchCV имеет недостатки, такой поиск занимает много времени.
- Рандомизированный поиск (RandomizedSearchCV) позволяет перебирать фиксированное количество значений гиперпараметров.
- GridSearchCV перебирает все возможные комбинации гиперпараметров, RandomizedSearchCV - только ограниченное число.
- RandomizedSearchCV лучше применять при широких диапазонах гиперпараметров.
- Параметры RandomizedSearchCV включают модель, словарь со значениями гиперпараметров и random_state.
- Метрику при кросс-валидации можно узнать по атрибуту bestscore.
- RandomizedSearchCV работает быстрее, но не всегда лучше GridSearchCV.
- При инициализации класса RandomizedSearchCV нужно зафиксировать random_state для стабильности результатов.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 8/11
Кратко:
- Байесовская оптимизация - итеративный метод оптимизации, который оценивает оптимальное значение функции без производной.
- Байесовская оптимизация работает итерациями, указывает, в какой следующей точке с наибольшей вероятностью улучшается текущая оценка.
- Байесовская оптимизация позволяет вычислять функцию реже и тратить меньше времени на вычисления.
- Байесовская оптимизация быстрее находит лучшие значения гиперпараметров и за меньшее количество итераций, чем случайный поиск и поиск по сетке.
- OptunaSearchCV - инструмент для байесовской оптимизации, который можно использовать для подбора гиперпараметров.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 9/11
Кратко:
- Сравнение трех способов автоматизированного поиска гиперпараметров: GridSearchCV, RandomizedSearchCV и OptunaSearchCV.
- GridSearchCV: перебор по сетке, занимает больше времени, но можно ускорить вычисления с помощью n_jobs=-1.
- RandomizedSearchCV: перебор гиперпараметров случайно, занимает меньше времени, но перебирает не все комбинации.
- OptunaSearchCV: перебор с помощью байесовской оптимизации, занимает меньше времени, чем GridSearchCV, но больше времени, чем RandomizedSearchCV.
- Задача: проверить особенности разных способов поиска на практике и сравнить результаты.
- Используются одинаковые диапазоны гиперпараметров для корректного сравнения.
- Инициализируются классы для каждого способа с определенными значениями кросс-валидации и метрики.
- Каждый способ имеет свои преимущества и недостатки, выбор зависит от конкретных задач и требований.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 10/11
Кратко:
- Улучшено качество дерева решений благодаря автоматическому подбору гиперпараметров.
- Задача о перевозках в "Маршрут Экспресс" не решена полностью, требуется интерпретация результатов работы модели.
- Результат обучения и предсказания деревьев решений также можно интерпретировать.
- Оценка важности признаков осуществляется с помощью атрибута featureimportances.
- Важность признаков показывает, насколько часто они участвуют в правилах разделения на классы.
- Задача: сформировать таблицу важности признаков на данных о пассажирских перевозках.
- Задача: отобразить важность признаков на графике с помощью seaborn.
- Результат работы функции export_text: отображение правил разделения на классы и направления движения по дереву.
- Выводы: результат обучения и предсказания дерева решений можно интерпретировать с помощью правил разделения и важности признаков.
Спринт 10/24 → Тема 6/11: Дерево решений и гипер параметры → Урок 11/11
Кратко:
- Завершена новая глава обучения работе с новой моделью МО и подбору гиперпараметров.
- Освоены методы использования дерева решений для задач классификации и отличия гиперпараметров от параметров.
- Изучены три способа автоматизированного поиска лучших значений гиперпараметров: GridSearchCV, RandomizedSearchCV и OptunaSearchCV.
- Научились интерпретировать результаты предсказания дерева решений и определять важность признаков.
- Шпаргалка по теме предоставлена для сохранения знаний.
- В следующей теме продолжите заниматься признаками, преобразовывать категориальные переменные и создавать новые признаки для обучения модели.
- Компания «Маршрут Экспресс» собирает новые данные для улучшения предсказаний и нуждается в помощи.
Заключение
Подошла к концу новая глава! Вы столько успели освоить: работу с новой моделью МО, подбор гиперпараметров. Теперь вы умеете виртуозно подбирать гиперпараметры и делать это не руками, а с помощью целых трёх способов.
Чему вы научились
- Использовать дерево решений для задач классификации. Модель формирует правила и разделяет выборку на подвыборки, чтобы отделить объекты одного класса от другого.
- Отличать гиперпараметры от параметров. Параметры — это настройки модели, которые подбираются в процессе обучения. Гиперпараметры — настройки модели, которые вручную фиксирует специалист до начала обучения. В процессе обучения они никак не меняются.
- Подбирать лучшие значения гиперпараметров с помощью трёх способов автоматизированного поиска. GridSearchCV — поиск по сетке, находит лучшую модель на всех комбинациях гиперпараметров; RandomizedSearchCV — случайный поиск, находит лучшую модель на случайном количестве комбинаций гиперпараметров; OptunaSearchCV — байесовская оптимизация, находит лучшую модель в той области значений гиперпараметров, в которой большая метрика вероятнее.
- Интерпретировать результат предсказания дерева решений. Определить важность признаков для дерева решений можно с помощью правил разделения: чем чаще в них встречается признак, тем он полезнее для решения задачи.
Заберите с собой
Чтобы ничего не забыть, скачайте шпаргалку по теме.