Урок 1
Кратко:
- Отличные данные важны для успешного прогноза, но не всегда подходят для моделирования.
- Предобработка данных необходима для подготовки данных перед обучением модели.
- В статье обсуждаются: определение типов признаков, масштабирование количественных признаков, преобразование категориальных признаков в количественные.
- Для подготовки данных используется библиотека sklearn.
- Обучение включает 5 уроков по 15-30 минут каждый.
- Работа продолжается с данными агентства недвижимости, обогащенными новыми категориальными признаками.
- Цель: пройти путь от предобработки данных до проверки качества итоговой модели
Урок 2
Кратко:
Подготовка данных включает в себя две основные процедуры: масштабирование и кодирование
Выводы
- Признаки в датасете делятся на несколько типов: количественные, номинальные, порядковые и бинарные.
- По умолчанию большинство моделей умеют работать только с количественными данными. Поэтому все остальные, которые вместе называют категориальными, нужно кодировать, чтобы преобразовать в количественные.
- Количественные признаки часто отличаются по масштабу. Их нужно приводить к единому с помощью масштабирования.
Урок 3
Кратко:
- Масштабирование данных - важный принцип в работе с данными для обучения моделей.
- Разные диапазоны значений признаков могут вызвать проблемы при обучении моделей.
- Масштабирование приводит данные к одному диапазону и сохраняет исходные закономерности влияния признаков на целевой.
- Стандартизация и нормализация - два основных метода масштабирования данных.
- Стандартизация приводит данные к средним значениям и стандартным отклонениям, принятым в сообществе Data Science.
- Нормализация преобразует значения признаков в диапазон от 0 до 1.
- Выбор метода масштабирования зависит от алгоритма машинного обучения и качества модели
Выводы
- Масштабирование данных — это процедура, в ходе которой значения признаков приводят к одному диапазону, чтобы каждый признак был одинаково важен. При этом закономерности в самих признаках сохраняются. Масштабирование применяется к количественным данным.
- Два основных метода масштабирования — это стандартизация и нормализация. При стандартизации признаков их стандартное отклонение становится равным 1, среднее значение — 0. Нормализованные признаки лежат в диапазоне от 0 до 1, но при этом их среднее значение может отличаться.
- Для каждого алгоритма машинного обучения масштабирование нужно по разным причинам. Для линейной регрессии это важно для правильной интерпретации весов модели. При дальнейшем изучении других моделей будет показано, почему им важно масштабирование.
Урок 4
Кратко:
- One-Hot Encoding - метод кодирования категориальных признаков, который применяется для обработки данных в машинном обучении.
- Он преобразует категориальный признак в числовой, отображая его как набор бинарных признаков со значениями 0 и 1.
- Результат прямого кодирования можно записать в виде вектора из нулей и единиц.
- Дамми-ловушка - проблема, возникающая при прямом кодировании, когда два закодированных бинарных признака имеют 100% корреляцию.
- Избежать дамми-ловушки можно, удалив один из столбцов.
- One-Hot Encoding используется в библиотеках sklearn и pandas для кодирования категориальных признаков
Выводы
- One-Hot Encoding — это метод кодирования категориальных признаков. Он раскладывает исходный признак на N бинарных, где N — исходное значение категориального признака, а затем проставляет значения 0 и 1 каждому объекту. Закодированное значение можно записать в виде вектора.
- В закодированном значении признака может быть только одна единица, поскольку каждому объекту в датасете соответствует только одно значение исходного признака.
- Дамми-ловушка — это ситуация, при которой закодированные данные содержат избыточную информацию. Чтобы её избежать, достаточно удалить один столбец из результатов кодирования.
- Существует два способа для прямого кодирования:
OneHotEncoder()из библиотекиsklearnиget_dummies()из библиотекиpandas.
Урок 5
Кратко:
- Плохо подготовленные данные и неспособность уловить закономерности между признаками могут привести к нестабильной работе модели.
- Анализ остатков помогает изучить качество модели и выявить закономерности, которые позволяют судить о ее качестве.
- Остатки модели показывают разницу между предсказанными и истинными значениями, а также отражают закономерности, которые позволяют судить о качестве модели.
- Анализ остатков проверяет, насколько хорошо модель замечает взаимосвязи между признаками.
- Если модель правильно подобрана к исходным данным, то в остатках не должно остаться никаких закономерностей.
- Основное правило анализа остатков: если модель правильно подобрана к исходным данным, то в остатках не должно остаться никаких закономерностей
Выводы
- Анализ остатков выявляет причины, из-за которых модель может работать нестабильно. Строить прогноз и рассчитывать метрики стоит только после того, как проведёте анализ остатков.
- Остатки модели должны быть нормально распределены, симметрично располагаться на графике, а также иметь постоянную дисперсию для всех значений предсказаний. Если анализ остатков выявил отклонения, то необходимо улучшать модель.
- Если у остатков нет нормального распределения и симметричного графика, то моделью можно пользоваться, пускай она и не даёт идеального решения. Нарушение распределения — это в первую очередь сигнал того, что она не достигла максимального качества. Тем не менее, в зависимости от ситуации такая модель всё равно может быть полезна.
- Если у остатков нарушается свойство постоянства дисперсии, то модель в работе использовать нежелательно, её нужно улучшить.
Урок 6
Кратко:
- Линейная регрессия - это метод статистического анализа, который используется для предсказания неизвестных значений.
- В этом уроке вы пройдёте через все четыре этапа работы над моделью линейной регрессии.
- В этом уроке вы пройдёте через все четыре этапа работы над моделью линейной регрессии.
- На этом уроке вы закрепили на практике основные этапы подготовки данных перед обучением модели
Выводы¶
На этом уроке вы закрепили на практике основные этапы подготовки данных перед обучением модели:
- разделить датасет на тренировочную и тестовую выборки;
- выделить категориальные и количественные признаки;
- отмасштабировать количественные признаки;
- закодировать категориальные признаки;
- объединить категориальные и количественные признаки;
- обучить модель;
- проверить её качество методом анализа остатков;
- получить итоговую метрику качества работы модели.
Урок 7
Кратко:
- Вы успешно прошли подготовку к работе с данными.
- Вы научились кодировать категориальные признаки с помощью OneHotEncoder() из библиотеки sklearn.
- Вы научились масштабировать числовые признаки с помощью StandardScaler().
- Вы научились оценивать качество работы модели линейной регрессии методом анализа остатков.
- Вы хорошо освоились с задачами регрессии.
- Вы переходите к новой области знаний: задачам классификации
Чему вы научились¶
- Кодировать категориальные признаки. Большинство моделей не умеют работать с качественными признаками, поэтому их нужно преобразовывать методом прямого кодирования. Для этого используйте
OneHotEncoder()из библиотекиsklearn. Не забывайте избегать дамми-ловушек! - Масштабировать числовые признаки. Числовые признаки в датасете могут сильно различаться по масштабу. Чтобы это не мешало обучению, нужно их унифицировать с помощью
StandardScaler(). - Применять анализ остатков. Теперь вы умеете оценивать качество работы модели линейной регрессии методом анализа остатков.