Заполните пропущенные значения в датафрейме нулями. Функцией describe() выведите на экран результаты, чтобы убедиться в корректности заполнения значений.
import numpy as np
import pandas as pd
from pyspark.sql import SparkSession
APP_NAME = "DataFrames"
SPARK_URL = "local[*]"
spark = SparkSession.builder.appName(APP_NAME) \
.config('spark.ui.showConsoleProgress', 'false') \
.getOrCreate()
taxi = spark.read.load('/datasets/pickups_terminal_5.csv',
format='csv', header='true', inferSchema='true')
print(taxi.fillna(0).describe().show())
Результат
| summary | hour | minute | pickups |
|---|---|---|---|
| count | 128974 | 128974 | 128974 |
| mean | 11.566509529052366 | 15.004419495402175 | 29.00832725975778 |
| stddev | 6.908556452594711 | 15.000057500526209 | 22.449669931429067 |
| min | 0 | 0 | 0.0 |
| max | 23 | 30 | 310.0 |
None 128974! И там, и тут, и там. Теперь число значений одинаково во всех столбцах! Данные к анализу готовы.