Выберите из датафрейма только столбцы с датами, часами и минутами в указанном порядке. Выбор подмножества столбцов выполняется так же, как в Pandas. Напечатайте на экране пять строк получившейся таблицы.

import numpy as np
import pandas as pd
from pyspark.sql import SparkSession

APP_NAME = "DataFrames"
SPARK_URL = "local[*]"

spark = SparkSession.builder.appName(APP_NAME) \
        .config('spark.ui.showConsoleProgress', 'false') \
        .getOrCreate()

taxi = spark.read.load('/datasets/pickups_terminal_5.csv', 
                       format='csv', header='true', inferSchema='true')

print(taxi[['date', 'hour', 'minute']].show(5))

Результат

date hour minute
2009-01-01 0 0
2009-01-01 0 30
2009-01-01 1 0
2009-01-01 1 30
2009-01-01 2 0

only showing top 5 rows

None Даже если подмножества в PySpark размножатся, вы и с ними справитесь без труда! Совсем как в Pandas.