Получите предсказанные значения целевого признака тестовой выборки и сохраните их в переменную predictions.
Выведите второе предсказанное значение из переменной predictions и соответствующее известное значение из переменной y_test, а потом сравните их. Хорошо ли сработала модель?
# необходимые импорты
import pandas as pd
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
# создание константы RANDOM_STATE
RANDOM_STATE = 42
# считывание CSV-файла в датафрейм pandas, сохранение выборок
df = pd.read_csv('real_estate_2.csv')
X = df.drop('price', axis=1)
y = df['price']
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
random_state=RANDOM_STATE
)
# инициализация и обучение модели
model_lr = LinearRegression()
model_lr.fit(X_train, y_train)
# предсказанные значения для X_test
predictions = model_lr.predict(X_test)
print(predictions[1], y_test.reset_index(drop=True)[1])
Результат
4153816.4896177943 2180000.0
Итак, вы впервые обучили модель и получили прогноз. К сожалению, он неутешительный. Если сравнить предсказание с заранее известной цифрой из тестовой выборки, то видно, что модель ошиблась в два раза. Она предсказала цену квартиры в 4 млн 153 тыс. 816 рублей, хотя реальная стоимость этого жилья — всего 2 млн 180 тыс. Что-то явно пошло не так. Не печальтесь, выход есть всегда!