Изучите статистические выбросы. В переменной result сохраните результат запроса, который выберет строки с заказами такси у терминала №5. Расположите их от большего числа заказов в день к меньшему. Выведите на экран первые пять строк, используя функцию show.

APP_NAME = "DataFrames"
SPARK_URL = "local[*]"

spark = SparkSession.builder.appName(APP_NAME) \
        .config('spark.ui.showConsoleProgress', 'false') \
        .getOrCreate()

taxi = spark.read.load('/datasets/pickups_terminal_5.csv', 
                       format='csv', header='true', inferSchema='true')

taxi = taxi.fillna(0)

taxi.registerTempTable("taxi")

result = spark.sql("""SELECT * 
                      FROM taxi 
                      ORDER BY pickups DESC
                      """)
print(result.show())

Результат

date hour minute pickups
2015-11-01 1 30 310.0
2010-09-23 22 30 288.0
2012-03-07 21 0 268.0
2011-03-02 20 30 264.0
2011-03-02 18 30 263.0

only showing top 5 rows

None В данных два одинаково загруженных периода 2 марта 2011 года. Видимо, прибыла большая делегация на форум по «правильному поглаживанию котиков».