Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 1/8
Кратко:
- Базовые понятия компьютерного зрения: изображение, его состав и преобразование.
- Типы задач компьютерного зрения: классификация, сегментация.
- Различие между растровыми и векторными изображениями.
- Устройство цветовой модели RGB.
- Параметры, описывающие изображение.
- Аугментация и ее применение.
- Изучение задач, решаемых компьютерным зрением.
- 6 уроков по 15-20 минут каждый.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 2/8
Кратко:
- Компьютерное зрение используется в беспилотных автомобилях, медицине, поиске по картинкам и других областях.
- Беспилотные автомобили используют камеры и лидары для распознавания объектов на дороге.
- Нейронные сети в медицине помогают изучать биопсии и анализировать снимки КТ.
- Яндекс использует компьютерное зрение для поиска информации и распознавания лиц.
- Распознавание лиц используется для проверки личности и финансовых операций.
- Дипфейк - технология изменения лиц на видео или фото, вызывает опасения у общественности.
- Генеративные нейросети, такие как DALL-E, создают изображения по текстовому описанию.
- Развитие компьютерного зрения ставит новые задачи перед обществом, включая обработку изображений.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 3/8
Кратко:
- Изображения делятся на растровые и векторные, растровые состоят из пикселей, векторные - из геометрических примитивов.
- Векторные изображения не позволяют создать содержательное изображение, но удобны для создания логотипов и эмблем.
- RGB - самая распространенная цветовая модель, состоящая из трех основных цветов: красного, зеленого и синего.
- Пиксель - мельчайшая неделимая частица растрового изображения, цвет пикселя задается числовыми параметрами цветовой модели.
- Разрешение изображения описывает его размер, а соотношение сторон - его форму.
- Три главных параметра растрового RGB-изображения: ширина, высота и количество каналов.
- Размер изображения в байтах равен произведению ширины, высоты и количества каналов.
- Сжатие файлов помогает уменьшить размер изображения, используя форматы JPEG и PNG.
- Оперативная память и память видеокарты также должны учитываться при работе с изображениями.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 4/8
Кратко:
- Аугментация изображений - увеличение выборки данных, создающее новые данные из существующих.
- OpenCV - библиотека, использующая алгоритмы компьютерного зрения.
- Отражение по горизонтали и вертикали - простейшие преобразования изображений.
- Яркость, контраст и гамма - основные операции для изменения изображения.
- Ограничения типов данных и их преобразования - важная тема.
- Аугментации используются для улучшения обучения.
- Большинство преобразований изображений - преобразования NumPy-массивов.
- В большинстве случаев для аугментации хватает готовых библиотек.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 5/8
Кратко:
- Классификация изображений - задача определения класса изображения с помощью компьютерного зрения.
- Ограничения классов: модель работает только с изображениями, которые она обучалась предсказывать.
- Препроцессинг данных: изменение размера и нормализация изображений перед классификацией.
- Современное компьютерное зрение основано на нейронных сетях.
- Функции потерь и метрики качества: бинарная кросс-энтропия для двухклассовой классификации и обычная кросс-энтропия для многоклассовой классификации.
- Метрики качества: точность (accuracy), f1-метрика, ROC-AUC.
- Обучение модели классификации изображений: загрузка изображений и их классов, предобработка изображений, обучение нейросети.
- Классификация изображений использует нейросети и имеет некоторые особенности по сравнению с классификацией табличных данных.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 6/8
Кратко:
- Свёрточные нейросети используются для решения задач классификации, детекции и сегментации изображений.
- Задача детекции состоит в поиске объектов и выделении их прямоугольником на изображении.
- Метрики качества детекции учитывают показатель IoU (отношение площади пересечения к общей площади).
- Алгоритм детекции объектов включает выделение областей интереса и классификацию с помощью свёрточной нейросети.
- Модель YOLO является популярным одноэтапным алгоритмом детекции объектов.
- Задача сегментации изображений состоит в предсказании класса каждого пикселя.
- Метрики качества сегментации включают попиксельную долю правильных ответов и метрику IoU.
- Алгоритм сегментации объектов основан на модели U-Net.
- Функция потерь в задаче семантической сегментации включает кросс-энтропию на пиксельном уровне.
- Для задач детекции и сегментации используются различные архитектуры, такие как YOLO и U-Net.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 7/8
Кратко:
- Основные датасеты изображений в компьютерном зрении: MNIST, Fashion MNIST, CIFAR, ImageNet, MS COCO, Cityscapes.
- MNIST и Fashion MNIST: датасеты для классификации рукописных цифр и одежды соответственно.
- CIFAR: датасеты цветных изображений для классификации объектов.
- ImageNet: большой датасет фотографий для классификации.
- MS COCO: датасет для детекции и сегментации объектов.
- Cityscapes: сегментационный датасет городских улиц для сравнения алгоритмов беспилотных автомобилей.
Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 8/8
Кратко:
- Компьютерное зрение используется для анализа изображений и решения различных задач.
- Изображения состоят из пикселей, цвет которых определяется значениями каналов цветовой модели (например, RGB).
- Аугментации изображений увеличивают объем данных и улучшают качество работы модели.
- Освоение библиотеки Keras поможет работать с распространенными алгоритмами и нейронными сетями в компьютерном зрении.