Изучите распределение признаков Оценка комфортности времени отправления/прибытия и Общая оценка качества предоставленной услуги на тренировочных данных, посчитав частоту появления каждой категории в абсолютных величинах.
- Создайте список с названиями признаков.
- Перед распределением выведите на экран название признака.
- Посчитайте категории в абсолютных величинах.
# импортируем библиотеки и объявляем константы
import pandas as pd
from sklearn.model_selection import train_test_split
RANDOM_STATE = 42
TEST_SIZE = 0.25
# считываем данные из CSV-файла
df_full = pd.read_csv('railway_full.csv')
# делим данные на входные и целевые
X = df_full.drop(['Удовлетворён предоставленной услугой'], axis=1)
y = df_full['Удовлетворён предоставленной услугой']
# делим данные на тренировочные и тестовые
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
test_size=TEST_SIZE,
random_state=RANDOM_STATE,
stratify=y)
# создайте список столбцов для изучения
cols_ordinal_ordered = [
'Оценка комфортности времени отправления/прибытия',
'Общая оценка качества предоставленной услуги'
]
for column in cols_ordinal_ordered:
# выведите наименование столбца
print(column)
# изучите распределение признаков на тренировочной выборке
print(X_train[column].value_counts(), '\n')
Результат
Оценка комфортности времени отправления/прибытия
нормально 2308
плохо 1625
хорошо 1317
Name: Оценка комфортности времени отправления/прибытия, dtype: int64
Общая оценка качества предоставленной услуги
нормально 3482
хорошо 1064
плохо 704
Name: Общая оценка качества предоставленной услуги, dtype: int64