Справочник по PySpark

На этой странице представлен обзор справки, доступной для PySpark, Python API для Spark. Дополнительные сведения о PySpark см. в разделе PySpark на Azure Databricks.

Типы данных

Полный список типов данных PySpark см. в разделе " Типы данных PySpark".

Классы

таблицы данных

Reference Description
Столбец Операции для работы со столбцами DataFrame, включая преобразования и выражения.
DataFrame Распределенная коллекция данных, упорядоченная по именованным столбцам, аналогично таблице в реляционной базе данных.
DataFrameNaFunctions Функции для работы с отсутствующими данными в кадре данных.
DataFrameReader Интерфейс, используемый для загрузки кадра данных из внешних систем хранения.
DataFrameStatFunctions Функции статистических функций с кадром данных.
DataFrameWriter Интерфейс, используемый для записи кадра данных во внешние системы хранения.
DataFrameWriterV2 Интерфейс, используемый для записи кадра данных во внешнее хранилище (версия 2).
GroupedData Методы группировки данных и выполнения операций агрегации с группированными кадрами данных.
Row Представляет строку в DataFrame, предоставляя доступ к значениям отдельных полей.

Пользовательские источники данных

Reference Description
DataSource API для реализации пользовательских источников данных для чтения из внешних систем. Сведения о пользовательских источниках данных см. в разделе "Пользовательские источники данных PySpark".
DataSourceArrowWriter Базовый класс для записи источников данных, обрабатывающих данные с помощью PyArrow RecordBatch.
DataSourceRegistration Оболочка для регистрации источника данных.
DataSourceReader Базовый класс для средств чтения источников данных.
DataSourceStreamArrowWriter Базовый класс для записи потоков данных, обрабатывающих данные с помощью PyArrow RecordBatch.
DataSourceStreamReader Базовый класс для чтения источников данных потоковой передачи.
DataSourceStreamWriter Базовый класс для записи потоков данных.
DataSourceWriter Базовый класс для записи источников данных, отвечающий за сохранение данных в пользовательском источнике данных в пакетном режиме.
InputPartition Базовый класс, представляющий входную секцию, возвращаемую методом partitions()DataSourceReader.
SimpleDataSourceStreamReader Базовый класс для упрощенных средств чтения источников данных потоковой передачи, который считывает данные и планирует последнее смещение одновременно.
WriterCommitMessage Сообщение фиксации, возвращаемое DataSourceWriter.write и отправленное драйверу в качестве входного параметра DataSourceWriter.commit или DataSourceWriter.abort.

Структурированная потоковая передача

Reference Description
DataStreamReader Интерфейс, используемый для загрузки потокового кадра данных из внешних систем хранения.
DataStreamWriter Интерфейс, используемый для записи потокового кадра данных во внешние системы хранения.
Обработчик с сохранением состояния Управляет состоянием между пакетами потоковой передачи для сложных операций с отслеживанием состояния в структурированной потоковой передаче.
StreamingQuery Дескриптор запроса, выполняющегося непрерывно в фоновом режиме по мере поступления новых данных.
StreamingQueryListener Абстрактный класс для прослушивания событий жизненного цикла потокового запроса.
StreamingQueryManager Управляет всеми активными StreamingQuery экземплярами, связанными с объектом SparkSession.

Функции, определённые пользователем

Reference Description
UserDefinedFunction (UDF) Определяемые пользователем функции для применения пользовательской логики Python к столбцам DataFrame.
UDFRegistration Оболочка для регистрации определяемой пользователем функции. Доступ к этому экземпляру можно получить.spark.udf
UserDefinedTableFunction (UDTF) Определяемые пользователем функции таблицы, возвращающие несколько строк для каждой входной строки.
UDTFRegistration Оболочка для регистрации определяемой пользователем функции таблицы. Доступ к этому экземпляру можно получить.spark.udtf

Другие основные классы

Reference Description
Каталог Интерфейс для управления базами данных, таблицами, функциями и другими метаданными каталога.
География Класс, представляющий значение Geography в Python.
Геометрия Класс, представляющий значение Geometry в Python.
Наблюдение Собирает метрики и отслеживает DataFrames в процессе выполнения запроса для целей мониторинга и отладки.
ГрафикAccessor Функция доступа для графиков кадра данных в PySpark.
ProtoBuf Поддержка сериализации и десериализации данных с помощью формата буферов протокола.
RuntimeConfig Параметры конфигурации среды выполнения для Spark SQL, включая параметры выполнения и оптимизатора.
Сведения о конфигурации, доступной только в Databricks, см. в разделе Свойства конфигурации Spark в Azure Databricks.
SparkSession Точка входа для чтения данных и выполнения запросов SQL в приложениях PySpark.
VariantVal Представляет полуструктурированные данные с гибкой схемой, которая поддерживает динамические типы и вложенные структуры.
Окно Функции окна для выполнения вычислений в наборе строк таблицы, связанных с текущей строкой.
WindowSpec Функции окна для выполнения вычислений в наборе строк таблицы, связанных с текущей строкой.

Функции

Полный список доступных встроенных функций см. в разделе "Функции PySpark".