Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 1/7
Кратко:
- Метод опорных векторов не боится выбросов и проводит нелинейные границы между наблюдениями.
- Однако, модель может плохо классифицировать объекты из тестовых данных из-за привыкания к тренировочным и валидационным данным.
- В этой теме вы научитесь замечать, что модель "подогнана" под тренировочные данные, использовать термины "переобучение" и "недообучение", работать со смещением и разбросом в ошибках модели, контролировать этап обучения при помощи настройки моделей.
- Обучение займет 5 уроков по 30-40 минут
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 2/7
Кратко:
- Валидационная и тестовая выборки - это относительные понятия.
- Переобучение и недообучение - это две крайности плохой работы модели.
- Чтобы избежать переобучения, используйте более простые модели.
- Чтобы найти золотую середину, нужно проверять модель на разных данных.
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 3/7
Кратко:
- Регуляризация линейных моделей: метод борьбы с переобучением в машинном обучении.
- Регуляризация автоматически оценивает и ограничивает сложность модели.
- Два способа наложения штрафов: L2-регуляризация (ридж-регуляризация) и L1-регуляризация (лассо-регуляризация).
- L2-регуляризация ограничивает максимальное влияние "переоцененных" признаков.
- L1-регуляризация удаляет неинформативные признаки.
- Оба метода нужно проверять на валидационной выборке для определения эффективности.
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 4/7
Кратко:
- Переобучение модели - ситуация с высоким качеством на тренировочных данных и низким на валидационных или тестовых.
- Регуляризация помогает при переобучении, штрафуя модель за высокий приоритет отдельным признакам.
- Модель всегда будет ошибаться, 100% верных ответов недостижимы.
- Ошибки модели описываются формулой: смещение (bias^2(a)) - погрешность предсказания из-за ошибочных предположений модели, разброс (variance(a)) - ошибка из-за чувствительности модели к отклонениям от привычной структуры данных.
- Задача обучения модели - минимизировать ошибку, чтобы значения метрик на тренировочных и валидационных данных не сильно различались.
- Смещение и разброс модели влияют на суммарную ошибку, их можно разделить на компоненты: смещение и разброс.
- Высокое смещение и низкий разброс указывают на недообучение, низкое смещение и высокий разброс - на переобучение.
- Каждый тип ошибок можно уменьшить, усложнив модель и увеличив тренировочную выборку.
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 5/7
Кратко:
- Регуляризация предотвращает переобучение в логистической регрессии.
- L1- и L2-регуляризация применяются для снижения переоцененных коэффициентов.
- В логистической регрессии используются штрафы за слишком высокие коэффициенты.
- В sklearn можно настроить регуляризацию, указав параметр penalty.
- Задача "Морские вкусняшки" используется для проверки эффективности регуляризации.
- Качество модели с регуляризацией может быть улучшено за счет изменения параметров C и l1_ratio.
- Настройка регуляризации может помочь сэкономить деньги в задачах прогнозирования.
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 6/7
Кратко:
- Регуляризация в модели SVM: для линейной и логистической регрессии достаточно добавить коэффициент λ, для SVM - нет.
- SVM имеет свои настройки для регуляризации: коэффициент C и γ.
- C регулирует допустимое количество нарушителей и настраивает регуляризацию.
- γ определяет, насколько наблюдения "разнесёт" в многомерном пространстве.
- Нет общих критериев для выбора C и γ, нужно пробовать разные комбинации и смотреть на результат.
- Важно отслеживать структурные изменения в данных и адаптировать модель под новые реалии.
Спринт 10/24 → Тема 3/11: Проблема переобучения → Урок 7/7
Кратко:
- Поздравляем с приобретением нового инструмента для контроля обучения моделей.
- Умение замечать переобучение и недообучение модели.
- Понимание ошибки модели через смещение и разброс.
- Настройка параметров регуляризации для предотвращения переобучения.
- Шпаргалка по теме для быстрого запоминания ключевых моментов.
- Изучение новой модели - метод k-ближайших соседей.
Заключение
Поздравляем, теперь в ваших руках есть новый инструмент, чтобы направлять обучение модели к нужному результату! Теперь вы не просто строите модели, а умеете лучше контролировать этот процесс.
Чему вы научились
- Замечать переобучение и недообучение модели. Переобучение — это состояние, при котором модель демонстрирует хорошее качество на тренировочной выборке, но плохое — на валидационной или тестовой. Недообучение — состояние, при котором модель не уловила все закономерности данных и в целом плохо работает.
- Понимать, из чего складывается ошибка модели. Теперь вы знаете, как описать переобучение в терминах смещения и разброса. Модель переобучилась, когда её разброс значительно больше смещения, и недообучилась, когда смещение больше разброса.
- Настраивать параметры регуляризации. Регуляризация — это способ предотвратить переобучение модели с помощью разных ограничений. Основанные на регрессиях модели можно оштрафовать за повышенные веса признаков с помощью коэффициента λ. В SVM вы можете менять количество допустимых ошибок с помощью коэффициента C, а также влиять на порог поиска опорных векторов коэффициентом γ.
Заберите с собой
Чтобы ничего не забыть, скачайте шпаргалку по теме.