Выведите все строки с аномальными значениями в столбце price. Удалите их, а потом посмотрите описательные статистики и убедитесь, что аномалий нет.
import pandas as pd
# считывание CSV-файла в датафрейм pandas и очистка данных
df = pd.read_csv('real_estate.csv')
df = df.dropna()
# вывод строк, в которых значения признака price равны 0
print(df[df['price']==0])
# удаление строк, в которых значения признака price равны 0
df = df[df['price']!=0]
# вывод описательных статистик
print(df.describe())
Результат
total_area living_area ... years_after_repair price
3009 62.3 27.4 ... 3.0 0.0
6736 75.0 33.0 ... 8.0 0.0
[2 rows x 7 columns]
total_area living_area ... years_after_repair price
count 9997.000000 9997.000000 ... 9997.000000 9.997000e+03
mean 72.160618 37.920166 ... 5.698510 4.170747e+06
std 21.644487 12.606462 ... 4.123388 1.382654e+06
min 23.200000 10.800000 ... 0.000000 8.228800e+05
25% 61.000000 29.900000 ... 3.000000 3.289500e+06
50% 66.300000 35.300000 ... 5.000000 3.957010e+06
75% 75.800000 42.000000 ... 8.000000 4.686800e+06
max 217.000000 130.000000 ... 19.000000 1.363000e+07
[8 rows x 7 columns]
Вы провели важную операцию — удалили аномальные значения целевого признака.