Вспомните уроки по исследовательскому анализу данных и постройте матрицу корреляции для датасета о недвижимости.
# необходимые импорты
import pandas as pd
# считывание CSV-файла в датафрейм pandas
df = pd.read_csv('real_estate_clean.csv')
print(df.corr())
Результат
total_area living_area ... years_after_repair price
total_area 1.000000 0.893997 ... -0.012738 0.888296
living_area 0.893997 1.000000 ... -0.015997 0.780817
ceil_height -0.003698 0.001148 ... 0.003032 0.057126
rooms_number 0.762376 0.683558 ... -0.006658 0.691411
city_center_distance 0.015211 0.011322 ... -0.007749 -0.078439
years_after_repair -0.012738 -0.015997 ... 1.000000 -0.158384
price 0.888296 0.780817 ... -0.158384 1.000000
[7 rows x 7 columns]
Матрица корреляции готова! Осталось в ней разобраться.
Чтобы было проще работать с матрицами корреляции, полезно строить тепловые карты. Создать такую можно с помощью метода heatmap из библиотеки seaborn. Первым аргументом нужно передать матрицу, потом для отображения коэффициентов на карте задать параметр annot=True, а затем — fmt='.2f', чтобы оставить только два знака после запятой у коэффициентов: