Изучите распределение признаков Оценка комфортности покупки билета онлайн и Оценка качества wifi на тренировочных данных: посчитайте частоту появления каждой категории в абсолютных величинах. Для удобства выведите наименование столбца перед распределением.
# импортируем библиотеки и объявляем константы
import pandas as pd
from sklearn.model_selection import train_test_split
RANDOM_STATE = 42
TEST_SIZE = 0.25
# считываем данные из CSV-файла
df_full = pd.read_csv('railway_full.csv')
# делим данные на входные и целевые
X = df_full.drop(['Удовлетворён предоставленной услугой'], axis=1)
y = df_full['Удовлетворён предоставленной услугой']
# делим данные на тренировочные и тестовые
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
test_size=TEST_SIZE,
random_state=RANDOM_STATE,
stratify=y)
# собираем столбцы для изучения в список
cols_ordinal = [
'Оценка комфортности покупки билета онлайн', 'Оценка качества wifi'
]
for column in cols_ordinal:
# выведите наименование столбца
print(column)
# изучите распределение признаков из тренировочной выборки
print(X_train[column].value_counts(), '\n')
Результат
Оценка комфортности покупки билета онлайн
нормально 2315
плохо 2208
хорошо 477
отсутствует 250
Name: Оценка комфортности покупки билета онлайн, dtype: int64
Оценка качества wifi
отсутствует 2370
плохо 1499
нормально 993
хорошо 388
Name: Оценка качества wifi, dtype: int64