В предыдущем уроке вы очистили данные от аномалий, пропусков и дубликатов. Чтобы продолжить работать с датасетом, сохраните входные признаки в переменную X, а целевой — в переменную y. Затем выведите первые пятёрки объектов и значений их признаков.

Напомним признаки:

  • total_area — общая площадь;
  • living_area — жилая площадь;
  • ceil_height — высота потолка;
  • rooms_number — количество комнат;
  • city_center_distance — расстояние от центра города;
  • years_after_repair — количество лет с момента последнего ремонта;
# импорт библиотеки pandas
import pandas as pd
# считывание CSV-файла в датафрейм pandas
df = pd.read_csv('real_estate_clean.csv')
# сохранение входных признаков в переменную X
X = df.drop('price', axis=1)
# вывод первых пяти объектов переменной X
print(X.head())
# сохранение целевого признака в переменную y
y = df['price']
# вывод первых пяти значений переменной y
print(y.head())

 

Результат
   total_area  living_area  ...  city_center_distance  years_after_repair
0        72.0         39.6  ...                   4.1                 8.0
1        61.9         32.2  ...                   8.2                 4.0
2       122.0         54.9  ...                   8.1                 0.0
3        57.9         31.8  ...                   3.4                 9.0
4       140.0         61.6  ...                   5.0                 4.0

[5 rows x 6 columns]
0    4819200.0
1    3736870.0
2    8598200.0
3    2552410.0
4    8570000.0
Name: price, dtype: float64