Изучите статистические выбросы. В переменной result сохраните результат запроса, который выберет строки с заказами такси у терминала №5. Расположите их от большего числа заказов в день к меньшему. Выведите на экран первые пять строк, используя функцию show.
APP_NAME = "DataFrames"
SPARK_URL = "local[*]"
spark = SparkSession.builder.appName(APP_NAME) \
.config('spark.ui.showConsoleProgress', 'false') \
.getOrCreate()
taxi = spark.read.load('/datasets/pickups_terminal_5.csv',
format='csv', header='true', inferSchema='true')
taxi = taxi.fillna(0)
taxi.registerTempTable("taxi")
result = spark.sql("""SELECT *
FROM taxi
ORDER BY pickups DESC
""")
print(result.show())
Результат
| date | hour | minute | pickups |
|---|---|---|---|
| 2015-11-01 | 1 | 30 | 310.0 |
| 2010-09-23 | 22 | 30 | 288.0 |
| 2012-03-07 | 21 | 0 | 268.0 |
| 2011-03-02 | 20 | 30 | 264.0 |
| 2011-03-02 | 18 | 30 | 263.0 |
only showing top 5 rows
None В данных два одинаково загруженных периода 2 марта 2011 года. Видимо, прибыла большая делегация на форум по «правильному поглаживанию котиков».