Загрузите датафрейм из файла /datasets/pickups_terminal_5.csv. Посмотрите в документации, как работает функция show(). Напечайте на экране пять строк из датафрейма.
import numpy as np
import pandas as pd
from pyspark.sql import SparkSession
APP_NAME = "DataFrames"
SPARK_URL = "local[*]"
spark = SparkSession.builder.appName(APP_NAME) \
.config('spark.ui.showConsoleProgress', 'false') \
.getOrCreate()
taxi = spark.read.load('/datasets/pickups_terminal_5.csv', format='csv', header='true', inferSchema='true')
print(taxi.show(5))
Результат
| date | hour | minute | pickups |
|---|---|---|---|
| 2009-01-01 | 0 | 0 | 24.0 |
| 2009-01-01 | 0 | 30 | 35.0 |
| 2009-01-01 | 1 | 0 | 25.0 |
| 2009-01-01 | 1 | 30 | 25.0 |
| 2009-01-01 | 2 | 0 | 16.0 |
only showing top 5 rows