Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 1/8

Кратко:
  • Базовые понятия компьютерного зрения: изображение, его состав и преобразование.
  • Типы задач компьютерного зрения: классификация, сегментация.
  • Различие между растровыми и векторными изображениями.
  • Устройство цветовой модели RGB.
  • Параметры, описывающие изображение.
  • Аугментация и ее применение.
  • Изучение задач, решаемых компьютерным зрением.
  • 6 уроков по 15-20 минут каждый.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 2/8

Кратко:
  • Компьютерное зрение используется в беспилотных автомобилях, медицине, поиске по картинкам и других областях.
  • Беспилотные автомобили используют камеры и лидары для распознавания объектов на дороге.
  • Нейронные сети в медицине помогают изучать биопсии и анализировать снимки КТ.
  • Яндекс использует компьютерное зрение для поиска информации и распознавания лиц.
  • Распознавание лиц используется для проверки личности и финансовых операций.
  • Дипфейк - технология изменения лиц на видео или фото, вызывает опасения у общественности.
  • Генеративные нейросети, такие как DALL-E, создают изображения по текстовому описанию.
  • Развитие компьютерного зрения ставит новые задачи перед обществом, включая обработку изображений.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 3/8

Кратко:
  • Изображения делятся на растровые и векторные, растровые состоят из пикселей, векторные - из геометрических примитивов.
  • Векторные изображения не позволяют создать содержательное изображение, но удобны для создания логотипов и эмблем.
  • RGB - самая распространенная цветовая модель, состоящая из трех основных цветов: красного, зеленого и синего.
  • Пиксель - мельчайшая неделимая частица растрового изображения, цвет пикселя задается числовыми параметрами цветовой модели.
  • Разрешение изображения описывает его размер, а соотношение сторон - его форму.
  • Три главных параметра растрового RGB-изображения: ширина, высота и количество каналов.
  • Размер изображения в байтах равен произведению ширины, высоты и количества каналов.
  • Сжатие файлов помогает уменьшить размер изображения, используя форматы JPEG и PNG.
  • Оперативная память и память видеокарты также должны учитываться при работе с изображениями.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 4/8

Кратко:
  • Аугментация изображений - увеличение выборки данных, создающее новые данные из существующих.
  • OpenCV - библиотека, использующая алгоритмы компьютерного зрения.
  • Отражение по горизонтали и вертикали - простейшие преобразования изображений.
  • Яркость, контраст и гамма - основные операции для изменения изображения.
  • Ограничения типов данных и их преобразования - важная тема.
  • Аугментации используются для улучшения обучения.
  • Большинство преобразований изображений - преобразования NumPy-массивов.
  • В большинстве случаев для аугментации хватает готовых библиотек.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 5/8

Кратко:
  • Классификация изображений - задача определения класса изображения с помощью компьютерного зрения.
  • Ограничения классов: модель работает только с изображениями, которые она обучалась предсказывать.
  • Препроцессинг данных: изменение размера и нормализация изображений перед классификацией.
  • Современное компьютерное зрение основано на нейронных сетях.
  • Функции потерь и метрики качества: бинарная кросс-энтропия для двухклассовой классификации и обычная кросс-энтропия для многоклассовой классификации.
  • Метрики качества: точность (accuracy), f1-метрика, ROC-AUC.
  • Обучение модели классификации изображений: загрузка изображений и их классов, предобработка изображений, обучение нейросети.
  • Классификация изображений использует нейросети и имеет некоторые особенности по сравнению с классификацией табличных данных.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 6/8

Кратко:
  • Свёрточные нейросети используются для решения задач классификации, детекции и сегментации изображений.
  • Задача детекции состоит в поиске объектов и выделении их прямоугольником на изображении.
  • Метрики качества детекции учитывают показатель IoU (отношение площади пересечения к общей площади).
  • Алгоритм детекции объектов включает выделение областей интереса и классификацию с помощью свёрточной нейросети.
  • Модель YOLO является популярным одноэтапным алгоритмом детекции объектов.
  • Задача сегментации изображений состоит в предсказании класса каждого пикселя.
  • Метрики качества сегментации включают попиксельную долю правильных ответов и метрику IoU.
  • Алгоритм сегментации объектов основан на модели U-Net.
  • Функция потерь в задаче семантической сегментации включает кросс-энтропию на пиксельном уровне.
  • Для задач детекции и сегментации используются различные архитектуры, такие как YOLO и U-Net.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 7/8

Кратко:
  • Основные датасеты изображений в компьютерном зрении: MNIST, Fashion MNIST, CIFAR, ImageNet, MS COCO, Cityscapes.
  • MNIST и Fashion MNIST: датасеты для классификации рукописных цифр и одежды соответственно.
  • CIFAR: датасеты цветных изображений для классификации объектов.
  • ImageNet: большой датасет фотографий для классификации.
  • MS COCO: датасет для детекции и сегментации объектов.
  • Cityscapes: сегментационный датасет городских улиц для сравнения алгоритмов беспилотных автомобилей.

Спринт 19/25 → Тема 2/6: Введение в компьютерное зрение → Урок 8/8

Кратко:
  • Компьютерное зрение используется для анализа изображений и решения различных задач.
  • Изображения состоят из пикселей, цвет которых определяется значениями каналов цветовой модели (например, RGB).
  • Аугментации изображений увеличивают объем данных и улучшают качество работы модели.
  • Освоение библиотеки Keras поможет работать с распространенными алгоритмами и нейронными сетями в компьютерном зрении.