В предыдущем уроке вы очистили данные от аномалий, пропусков и дубликатов. Чтобы продолжить работать с датасетом, сохраните входные признаки в переменную X, а целевой — в переменную y. Затем выведите первые пятёрки объектов и значений их признаков.
Напомним признаки:
total_area— общая площадь;living_area— жилая площадь;ceil_height— высота потолка;rooms_number— количество комнат;city_center_distance— расстояние от центра города;years_after_repair— количество лет с момента последнего ремонта;
# импорт библиотеки pandas
import pandas as pd
# считывание CSV-файла в датафрейм pandas
df = pd.read_csv('real_estate_clean.csv')
# сохранение входных признаков в переменную X
X = df.drop('price', axis=1)
# вывод первых пяти объектов переменной X
print(X.head())
# сохранение целевого признака в переменную y
y = df['price']
# вывод первых пяти значений переменной y
print(y.head())
Результат
total_area living_area ... city_center_distance years_after_repair
0 72.0 39.6 ... 4.1 8.0
1 61.9 32.2 ... 8.2 4.0
2 122.0 54.9 ... 8.1 0.0
3 57.9 31.8 ... 3.4 9.0
4 140.0 61.6 ... 5.0 4.0
[5 rows x 6 columns]
0 4819200.0
1 3736870.0
2 8598200.0
3 2552410.0
4 8570000.0
Name: price, dtype: float64