Следующая тема: ИАД. Валидация результатов

Вернуться в раздел: Исследовательский анализ данных

Вернуться в оглавление: Я.Практикум

 
 

Введение

Когда у вас два набора данных, будьте готовы к тому, что связь придётся искать не для двух, а для четырёх, шести, восьми наборов — параметров может быть много. Для таких поисков вам понадобится совместное распределение множества величин.

Чему вы научитесь:

  • Строить диаграмму рассеяния;
  • Считать коэффициент корреляции Пирсона;
  • Находить совместное распределение для множества величин

Вам предстоит:

Построить две матрицы диаграмм рассеяния: для исходных и отфильтрованных данных.

Сколько времени это займет:

4 урока по 15 минут

Постановка задачи:

Убедитесь в том, что избавление от аномалий не повлияло на природу распределения исходных данных.

Изучим числовые характеристики:

hw.describe()

                     height           weight
count 7634.000000      7634.000000
mean   172.640603        57.688374
std         4.875440         5.274638
min       153.956131        37.687478
25%       169.297852        54.155792
50%       172.641400        57.746296
75%       175.939310        61.205201
max       190.888112        76.604422

...и гистограммы:

hw.plot(x='height', y='weight', kind='scatter', alpha=0.3)

p1

Какие красивые соты получились! Отчётливо видно, что в центре графика не однородное пятно, а определённая структура данных. В самой «густой» зоне люди с ростом от 170 до 175 см и весом от 55 до 60 кг.

0.5196907833692264
0.5196907833692264