Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 1/7

Кратко:

  • Метод опорных векторов не боится выбросов и проводит нелинейные границы между наблюдениями.
  • Однако, модель может плохо классифицировать объекты из тестовых данных из-за привыкания к тренировочным и валидационным данным.
  • В этой теме вы научитесь замечать, что модель "подогнана" под тренировочные данные, использовать термины "переобучение" и "недообучение", работать со смещением и разбросом в ошибках модели, контролировать этап обучения при помощи настройки моделей.
  • Обучение займет 5 уроков по 30-40 минут

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 2/7

Кратко:
  • Валидационная и тестовая выборки - это относительные понятия.
  • Переобучение и недообучение - это две крайности плохой работы модели.
  • Чтобы избежать переобучения, используйте более простые модели.
  • Чтобы найти золотую середину, нужно проверять модель на разных данных.

КМ. Задача 1

КМ. Задача 2

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 3/7

Кратко:

  • Регуляризация линейных моделей: метод борьбы с переобучением в машинном обучении.
  • Регуляризация автоматически оценивает и ограничивает сложность модели.
  • Два способа наложения штрафов: L2-регуляризация (ридж-регуляризация) и L1-регуляризация (лассо-регуляризация).
  • L2-регуляризация ограничивает максимальное влияние "переоцененных" признаков.
  • L1-регуляризация удаляет неинформативные признаки.
  • Оба метода нужно проверять на валидационной выборке для определения эффективности.

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 4/7

Кратко:

  • Переобучение модели - ситуация с высоким качеством на тренировочных данных и низким на валидационных или тестовых.
  • Регуляризация помогает при переобучении, штрафуя модель за высокий приоритет отдельным признакам.
  • Модель всегда будет ошибаться, 100% верных ответов недостижимы.
  • Ошибки модели описываются формулой: смещение (bias^2(a)) - погрешность предсказания из-за ошибочных предположений модели, разброс (variance(a)) - ошибка из-за чувствительности модели к отклонениям от привычной структуры данных.
  • Задача обучения модели - минимизировать ошибку, чтобы значения метрик на тренировочных и валидационных данных не сильно различались.
  • Смещение и разброс модели влияют на суммарную ошибку, их можно разделить на компоненты: смещение и разброс.
  • Высокое смещение и низкий разброс указывают на недообучение, низкое смещение и высокий разброс - на переобучение.
  • Каждый тип ошибок можно уменьшить, усложнив модель и увеличив тренировочную выборку.

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 5/7

Кратко:

  • Регуляризация предотвращает переобучение в логистической регрессии.
  • L1- и L2-регуляризация применяются для снижения переоцененных коэффициентов.
  • В логистической регрессии используются штрафы за слишком высокие коэффициенты.
  • В sklearn можно настроить регуляризацию, указав параметр penalty.
  • Задача "Морские вкусняшки" используется для проверки эффективности регуляризации.
  • Качество модели с регуляризацией может быть улучшено за счет изменения параметров C и l1_ratio.
  • Настройка регуляризации может помочь сэкономить деньги в задачах прогнозирования.

КМ. Задача 1

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 6/7

Кратко:

  • Регуляризация в модели SVM: для линейной и логистической регрессии достаточно добавить коэффициент λ, для SVM - нет.
  • SVM имеет свои настройки для регуляризации: коэффициент C и γ.
  • C регулирует допустимое количество нарушителей и настраивает регуляризацию.
  • γ определяет, насколько наблюдения "разнесёт" в многомерном пространстве.
  • Нет общих критериев для выбора C и γ, нужно пробовать разные комбинации и смотреть на результат.
  • Важно отслеживать структурные изменения в данных и адаптировать модель под новые реалии.

КМ. Задача 1

Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 7/7

Кратко:

  • Поздравляем с приобретением нового инструмента для контроля обучения моделей.
  • Умение замечать переобучение и недообучение модели.
  • Понимание ошибки модели через смещение и разброс.
  • Настройка параметров регуляризации для предотвращения переобучения.
  • Шпаргалка по теме для быстрого запоминания ключевых моментов.
  • Изучение новой модели - метод k-ближайших соседей.

Заключение

Поздравляем, теперь в ваших руках есть новый инструмент, чтобы направлять обучение модели к нужному результату! Теперь вы не просто строите модели, а умеете лучше контролировать этот процесс.

Чему вы научились

  • Замечать переобучение и недообучение модели. Переобучение — это состояние, при котором модель демонстрирует хорошее качество на тренировочной выборке, но плохое — на валидационной или тестовой. Недообучение — состояние, при котором модель не уловила все закономерности данных и в целом плохо работает.
  • Понимать, из чего складывается ошибка модели. Теперь вы знаете, как описать переобучение в терминах смещения и разброса. Модель переобучилась, когда её разброс значительно больше смещения, и недообучилась, когда смещение больше разброса.
  • Настраивать параметры регуляризации. Регуляризация — это способ предотвратить переобучение модели с помощью разных ограничений. Основанные на регрессиях модели можно оштрафовать за повышенные веса признаков с помощью коэффициента λ. В SVM вы можете менять количество допустимых ошибок с помощью коэффициента C, а также влиять на порог поиска опорных векторов коэффициентом γ.

Заберите с собой

Чтобы ничего не забыть, скачайте шпаргалку по теме.