Выберите из датафрейма только столбцы с датами, часами и минутами в указанном порядке. Выбор подмножества столбцов выполняется так же, как в Pandas. Напечатайте на экране пять строк получившейся таблицы.
import numpy as np
import pandas as pd
from pyspark.sql import SparkSession
APP_NAME = "DataFrames"
SPARK_URL = "local[*]"
spark = SparkSession.builder.appName(APP_NAME) \
.config('spark.ui.showConsoleProgress', 'false') \
.getOrCreate()
taxi = spark.read.load('/datasets/pickups_terminal_5.csv',
format='csv', header='true', inferSchema='true')
print(taxi[['date', 'hour', 'minute']].show(5))
Результат
| date | hour | minute |
|---|---|---|
| 2009-01-01 | 0 | 0 |
| 2009-01-01 | 0 | 30 |
| 2009-01-01 | 1 | 0 |
| 2009-01-01 | 1 | 30 |
| 2009-01-01 | 2 | 0 |
only showing top 5 rows
None Даже если подмножества в PySpark размножатся, вы и с ними справитесь без труда! Совсем как в Pandas.