- Разделите датасет на тренировочную и тестовую выборки.
- Проведите анализ категориальных признаков: выведите число уникальных значений в каждом из категориальных столбцов.
import pandas as pd
from matplotlib import pyplot as plt
# импортируйте функцию для разделения датасета на выборки
from sklearn.model_selection import train_test_split
# создание константы RANDOM_STATE
RANDOM_STATE = 42
# считываем CSV-файл в датафрейм pandas
# выделяем в отдельные переменные целевой признак и входные признаки
df = pd.read_csv('real_estate_clean_cat.csv')
X = df.drop('price', axis=1)
y = df['price']
# разделите данные на тренировочные и тестовые, зафиксируйте random_state
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
random_state=RANDOM_STATE
)
# список категориальных признаков тренировочной выборки
cat_col_names = ['building_type', 'parking_place', 'rooms_number']
# выведите на экран количество уникальных значений в категориальных признаках тренировочной выборки
# используйте для этого команду print()
print(X[cat_col_names].nunique())