Заполните пропущенные значения в датафрейме нулями. Функцией describe() выведите на экран результаты, чтобы убедиться в корректности заполнения значений.

import numpy as np
import pandas as pd
from pyspark.sql import SparkSession

APP_NAME = "DataFrames"
SPARK_URL = "local[*]"

spark = SparkSession.builder.appName(APP_NAME) \
        .config('spark.ui.showConsoleProgress', 'false') \
        .getOrCreate()

taxi = spark.read.load('/datasets/pickups_terminal_5.csv', 
                       format='csv', header='true', inferSchema='true')

print(taxi.fillna(0).describe().show())

Результат

summary hour minute pickups
count 128974 128974 128974
mean 11.566509529052366 15.004419495402175 29.00832725975778
stddev 6.908556452594711 15.000057500526209 22.449669931429067
min 0 0 0.0
max 23 30 310.0

None 128974! И там, и тут, и там. Теперь число значений одинаково во всех столбцах! Данные к анализу готовы.