Удалите из датафрейма пропущенные значения. Затем напечатайте на экране количество строк в датафрейме.

import numpy as np
import pandas as pd
from pyspark.sql import SparkSession

APP_NAME = "DataFrames"
SPARK_URL = "local[*]"

spark = SparkSession.builder.appName(APP_NAME) \
        .config('spark.ui.showConsoleProgress', 'false') \
        .getOrCreate()

taxi = spark.read.load('/datasets/pickups_terminal_5.csv', 
                       format='csv', header='true', inferSchema='true')

print(taxi.dropna().count())

Результат

128969

Данных стало меньше. Для временных рядов это не очень хорошо: между объектами будут промежутки разной длины. Поэтому рассмотрим другой метод обработки пропущенных значений.