Изучите распределение признака Оценка качества питания на тренировочных данных: посчитайте частоту появления каждого класса в абсолютных величинах.
# импортируем библиотеки и объявляем константы
import pandas as pd
from sklearn.model_selection import train_test_split
RANDOM_STATE = 42
TEST_SIZE = 0.25
# считываем данные из CSV-файла
df_full = pd.read_csv('railway_full.csv')
# делим данные на входные и целевые
X = df_full.drop(['Удовлетворён предоставленной услугой'], axis=1)
y = df_full['Удовлетворён предоставленной услугой']
# делим данные на тренировочные и тестовые
X_train, X_test, y_train, y_test = train_test_split(
X,
y,
test_size=TEST_SIZE,
random_state=RANDOM_STATE,
stratify=y)
# изучите распределение признака 'Оценка качества питания'
# в абсолютных величинах на тренировочной выборке
print(X_train['Оценка качества питания'].value_counts())
Результат
отсутствует 2054
нормально 1402
плохо 1180
хорошо 614
Name: Оценка качества питания, dtype: int64