Вернёмся к задаче предсказания стоимости недвижимости. Постройте частотную гистограмму распределения и ящик с усами, чтобы проанализировать целевой признак.
import pandas as pd
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
from matplotlib import pyplot as plt
# создание константы RANDOM_STATE
RANDOM_STATE = 42
# загрузите данные CSV-файла 'real_estate_clean.csv' в датафрейм pandas
df = pd.read_csv('real_estate_clean.csv')
# формируем выборки тренировочных и тестовых данных
X = df.drop('price', axis=1)
y = df['price']
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
random_state=RANDOM_STATE
)
## визуализация распределения целевого признака
# постройте частотную гистограмму распределения целевого признака с bins=50
bins = plt.hist(y_train, bins=50)
plt.vlines(x=y_train.mean(), colors='red', ymin=bins[0].min(), ymax=bins[0].max(), label='Среднее')
plt.vlines(x=y_train.median(), colors='red', ymin=bins[0].min(), ymax=bins[0].max(), linestyles='--', label='Медиана')
plt.title('Гистограмма распределения целевого признака')
plt.legend()
plt.show()
# постройте ящик с усами целевого признака с горизонтальной ориентацией
plt.title('График ящик с усами для целевого признака')
plt.boxplot(y_train, vert=False)
plt.show()