Спринт 12/24 → Тема 4/7: Сбор данных → Урок 1/11
- Контролировать качество разметки голосованием по большинству;
- Избегать утечек целевого признака;
- Кросс-валидацией увеличивать надёжность оценки модели.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 2/11
Кратко:
- Нет данных - нет машинного обучения.
- Извлечь данные из хранилища компании для построения модели.
- Если данных нет, можно найти их в открытых источниках.
- Kaggle, Калифорнийский университет, открытые данные разных госучреждений, портал правительства Москвы.
- Для некоторых задач можно собрать данные в интернете.
- Скачивание страниц портала, извлечение данных с помощью программ «кроулер» или «скрейпер».
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 3/11
Кратко:
- Разметка данных необходима для обучения моделей с использованием неразмеченных данных.
- Разметка данных включает определение правильного ответа для каждого снимка.
- Разметкой занимаются специальные сервисы, такие как Яндекс.Толока и Amazon Mechanical Turk.
- Заказчики ставят задачи для исполнителей, а последние получают вознаграждение за выполнение.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 4/11
Кратко:
- Декомпозиция задачи помогает уменьшить количество ошибок среди исполнителей и упростить процесс проверки выполненного задания.
- Декомпозировать можно вертикально и горизонтально.
- Вертикальная декомпозиция: деление задачи на несколько проектов или шагов.
- Горизонтальная декомпозиция: проверка выполненных заданий другими исполнителями.
- Пример: исходная задача не выполнена, после декомпозиции задачи появились более простые подзадачи, которые были выполнены успешно.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 5/11
Кратко:
- Метод контроля качества разметки: голосование по большинству.
- Каждый объект размечается тремя асессорами, финальный ответ - выбор большинства.
- Пример использования метода: медицинская компания автоматизирует диагностику заболеваний сердца.
- 303 пациента с данными по возрасту, полу, боли в груди, артериальному давлению, холестерину, уровню сахара крови и другим признакам.
- Разметка: ответы трех врачей (label_1, label_2, label_3).
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 6/11
Кратко:
- Контрольные задания - способ контроля качества в проектах веб-страниц.
- Заказчик добавляет контрольные задания с правильными ответами в проект.
- Контрольные задания оценивают качество работы исполнителя в реальном времени.
- В пуле веб-страниц с контрольными заданиями должно быть 10% контрольными заданиями.
- Заказчик задает пропорции классов в наборе контрольных заданий.
- Если качество или скорость разметки низкие, проверяют контрольные задания.
- Способы создания контрольных заданий: выбор специалистов, задания с одинаковыми ответами.
- Контрольные задания не следует путать с обучающими заданиями.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 7/11
Кратко:
- Утечка целевого признака - случайное попадание информации о целевом признаке в признаки.
- Пример: модель для онлайн-игры «Крайний герой» предсказывает платные услуги для прокачки персонажа.
- Признаки: Возраст, Пол, Никнейм, Покупки в других играх, Уровень персонажа, Прошел ли квест, Часы в игре, Сообщения на форуме.
- Признаки «Уровень персонажа» и «Общее количество часов в игре» доступны после предсказания.
- Чтобы избежать утечки целевого признака, не использовать подобные признаки.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 8/11
Кратко:
- Кросс-валидация - проверка качества модели на нескольких случайных выборках.
- Метод K-Fold делит данные на K равных частей и каждый раз использует одну часть для валидации, а остальные - для обучения.
- Среднее оценок, полученных в результате кросс-валидации, является оценкой качества модели.
- Кросс-валидация используется для сравнения моделей, подбора гиперпараметров и оценки полезности признаков.
- Она минимизирует случайность разделения данных и дает более точный результат.
- Недостатком кросс-валидации является время на вычисления, особенно при большом количестве наблюдений или блоков.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 9/11
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 10/11
Кратко:
- Кросс-валидация в sklearn позволяет оценить качество модели.
- Функция cross_val_score из модуля sklearn.model_selection используется для этой цели.
- Функция принимает несколько аргументов, включая модель, признаки и целевой признак.
- Число блоков для кросс-валидации (по умолчанию 5) указывается через параметр cv.
- Деление данных на блоки или валидационную и обучающую выборки происходит автоматически.
- На выходе получаем список оценок качества моделей, каждая оценка равна model.score() на валидационной выборке.
- Для задачи классификации, это может быть accuracy.
Спринт 12/24 → Тема 4/7: Сбор данных → Урок 11/11
Кратко:
- Умение контролировать качество разметки с помощью голосования по большинству.
- Нахождение и устранение утечек целевого признака.
- Использование библиотеки sklearn для кросс-валидации.
- Уроки по поведенческим алгоритмам и самостоятельный проект.
- Шпаргалка и конспект темы для напоминания о ключевых моментах.
Заключение
Теперь вы умеете:
- Контролировать качество разметки процедурой голосования по большинству;
- Находить и устранять утечки целевого признака;
- Средствами библиотеки sklearn выполнять кросс-валидацию.
Дальше — уроки по поведенческим алгоритмам и самостоятельный проект.
Заберите с собой
Чтобы ничего не забыть, скачайте шпаргалку и конспект темы.