Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 1/6

Кратко:
  • В прошлой теме вы изучили разные способы работать с признаками перед моделированием.
  • Вы научились применять OrdinalEncoder, отслеживать утечку целевого признака, и формировать новые полезные признаки.
  • В этой теме вы изучите инструменты для отбора признаков и оценки их важности.
  • Вы также научитесь интерпретировать результаты моделирования для бизнеса.
  • Четыре урока по 30-40 минут

Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 2/6

Кратко:
  • Отбор признаков в машинном обучении важен для уменьшения сложности модели и сохранения качества.
  • Объемное признаковое описание увеличивает время вычислений и риск переобучения.
  • Метод фильтрации - универсальный способ отбора признаков, применяемый до этапа обучения.
  • L1-регуляризация подходит для обучения логистической регрессии и может помочь избавиться от избыточных признаков.
  • SelectKBest - популярный метод отбора признаков, основанный на статистических тестах.
  • Метод введения шума может быть использован для удаления лишних признаков.
  • Существуют и другие методы отбора признаков, такие как PCA и Feature Importance.

Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 3/6

Кратко:
  • Отбор модели и признаков - это постепенный процесс.
  • Сначала вы обучаете бейзлайн-модель, затем смотрите на её метрики, а потом начинаете искать более надёжные решения, превосходящие базовое по качеству.
  • Чтобы качественно отобрать признаки, нужно провести тщательный анализ данных и подобрать подходящие для вашей ситуации инструменты.
  • Не всегда базовая метрика будет коррелировать с показателем, который вы должны улучшить, внедрив модель МО.
  • Поэтому всегда уделяйте время подбору метрики, которая будет корректно отражать способность модели решать вашу задачу.

КМ. Задача 1

КМ. Задача 2

Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 4/6

Кратко:
  • Модели машинного обучения часто называют "чёрными ящиками", так как их внутренние принципы непонятны.
  • Интерпретация модели подразумевает анализ работы алгоритмов и оценку важности признаков.
  • Permutation importance - простой метод оценки важности признаков в моделях без весов.
  • SHAP - метод оценки вклада признака в каждый прогноз, основанный на значениях Шепли.
  • Вычисления значений Шепли требуют большой мощности компьютера, поэтому для их расчёта используют алгоритмы оптимизации вычислений.
  • На графиках SHAP можно увидеть вклад каждого признака в классификацию каждого наблюдения.
  • Модель машинного обучения - "чёрный ящик", и для устранения неизвестности существуют средства для интерпретации моделей.

Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 5/6

Кратко:
  • Интерпретация моделей: практика.
  • Выяснение наиболее влиятельных признаков логистической регрессии.
  • Оценка вклада признаков модели по коэффициентам значимости.
  • Использование permutation importance для проверки качества модели.
  • Анализ SHAP-значений для более детальной интерпретации модели.
  • Выявление различий между эпизодическими и постоянными клиентами.
  • Рекомендации заказчику по итоговым рекомендациям после интерпретации модели.

КМ. Задача 1

КМ. Задача 2

Спринт 10/24 → Тема 8/11: Отбор признаков и интерпретация → Урок 6/6

Кратко:
  • Тема пройдена - новые навыки в копилку!
  • Уменьшение признакового описания без потери качества модели.
  • Метод фильтрации, L1-регуляризация и алгоритм SelectKBest для отбора нужных признаков.
  • Оценка важности признаков разными способами, включая permutation importance и значения Шепли.
  • Улучшенная интерпретация результатов работы модели для понимания её работы.
  • Шпаргалка по теме для сохранения знаний.
  • Изучение пайплайнов для автоматизации разработки модели в следующей теме.
Заключение

Тема пройдена — новые навыки в копилку! Может быть, модель всё ещё и чёрный ящик, но для вас уже точно не такой непроницаемый. Теперь вы знаете, как уменьшить признаковое описание без потери качества модели, и можете объяснить бизнесу, как модель принимает решения.

Чему вы научились

  • Отбирать нужные для модели признаки. При уменьшении признакового описания вы можете не только сохранить качество модели, но и увеличить его. В этом вам помогут метод фильтрации, L1-регуляризация и алгоритм SelectKBest.
  • Оценивать важность признаков разными способами. Теперь вы можете полагаться не только на встроенные в модели инструменты для оценки важности. Вы также умеете оценивать permutation importance признаков, который проверит качество модели при рандомизации всех входных признаков. Не забывайте и о значениях Шепли: они помогут понять, к какому решению каждый признак склоняет модель.
  • Лучше интерпретировать результаты работы модели. Бизнесу важно понимать, как «рассуждает» модель, чтобы грамотно рассчитывать последствия от её внедрения. Ведь любая ошибка чревата убытками и стратегическими просчётами — используйте все доступные средства, чтобы их предотвратить.

Заберите с собой

Чтобы ничего не забыть, скачайте шпаргалку по теме.