Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
На этой странице представлен обзор справки, доступной для PySpark, Python API для Spark. Дополнительные сведения о PySpark см. в разделе PySpark на Azure Databricks.
Типы данных
Полный список типов данных PySpark см. в разделе " Типы данных PySpark".
Классы
таблицы данных
| Reference | Description |
|---|---|
| Столбец | Операции для работы со столбцами DataFrame, включая преобразования и выражения. |
| DataFrame | Распределенная коллекция данных, упорядоченная по именованным столбцам, аналогично таблице в реляционной базе данных. |
| DataFrameNaFunctions | Функции для работы с отсутствующими данными в кадре данных. |
| DataFrameReader | Интерфейс, используемый для загрузки кадра данных из внешних систем хранения. |
| DataFrameStatFunctions | Функции статистических функций с кадром данных. |
| DataFrameWriter | Интерфейс, используемый для записи кадра данных во внешние системы хранения. |
| DataFrameWriterV2 | Интерфейс, используемый для записи кадра данных во внешнее хранилище (версия 2). |
| GroupedData | Методы группировки данных и выполнения операций агрегации с группированными кадрами данных. |
| Row | Представляет строку в DataFrame, предоставляя доступ к значениям отдельных полей. |
Пользовательские источники данных
| Reference | Description |
|---|---|
| DataSource | API для реализации пользовательских источников данных для чтения из внешних систем. Сведения о пользовательских источниках данных см. в разделе "Пользовательские источники данных PySpark". |
| DataSourceArrowWriter | Базовый класс для записи источников данных, обрабатывающих данные с помощью PyArrow RecordBatch. |
| DataSourceRegistration | Оболочка для регистрации источника данных. |
| DataSourceReader | Базовый класс для средств чтения источников данных. |
| DataSourceStreamArrowWriter | Базовый класс для записи потоков данных, обрабатывающих данные с помощью PyArrow RecordBatch. |
| DataSourceStreamReader | Базовый класс для чтения источников данных потоковой передачи. |
| DataSourceStreamWriter | Базовый класс для записи потоков данных. |
| DataSourceWriter | Базовый класс для записи источников данных, отвечающий за сохранение данных в пользовательском источнике данных в пакетном режиме. |
| InputPartition | Базовый класс, представляющий входную секцию, возвращаемую методом partitions()DataSourceReader. |
| SimpleDataSourceStreamReader | Базовый класс для упрощенных средств чтения источников данных потоковой передачи, который считывает данные и планирует последнее смещение одновременно. |
| WriterCommitMessage | Сообщение фиксации, возвращаемое DataSourceWriter.write и отправленное драйверу в качестве входного параметра DataSourceWriter.commit или DataSourceWriter.abort. |
Структурированная потоковая передача
| Reference | Description |
|---|---|
| DataStreamReader | Интерфейс, используемый для загрузки потокового кадра данных из внешних систем хранения. |
| DataStreamWriter | Интерфейс, используемый для записи потокового кадра данных во внешние системы хранения. |
| Обработчик с сохранением состояния | Управляет состоянием между пакетами потоковой передачи для сложных операций с отслеживанием состояния в структурированной потоковой передаче. |
| StreamingQuery | Дескриптор запроса, выполняющегося непрерывно в фоновом режиме по мере поступления новых данных. |
| StreamingQueryListener | Абстрактный класс для прослушивания событий жизненного цикла потокового запроса. |
| StreamingQueryManager | Управляет всеми активными StreamingQuery экземплярами, связанными с объектом SparkSession. |
Функции, определённые пользователем
| Reference | Description |
|---|---|
| UserDefinedFunction (UDF) | Определяемые пользователем функции для применения пользовательской логики Python к столбцам DataFrame. |
| UDFRegistration | Оболочка для регистрации определяемой пользователем функции. Доступ к этому экземпляру можно получить.spark.udf |
| UserDefinedTableFunction (UDTF) | Определяемые пользователем функции таблицы, возвращающие несколько строк для каждой входной строки. |
| UDTFRegistration | Оболочка для регистрации определяемой пользователем функции таблицы. Доступ к этому экземпляру можно получить.spark.udtf |
Другие основные классы
| Reference | Description |
|---|---|
| Каталог | Интерфейс для управления базами данных, таблицами, функциями и другими метаданными каталога. |
| География | Класс, представляющий значение Geography в Python. |
| Геометрия | Класс, представляющий значение Geometry в Python. |
| Наблюдение | Собирает метрики и отслеживает DataFrames в процессе выполнения запроса для целей мониторинга и отладки. |
| ГрафикAccessor | Функция доступа для графиков кадра данных в PySpark. |
| ProtoBuf | Поддержка сериализации и десериализации данных с помощью формата буферов протокола. |
| RuntimeConfig | Параметры конфигурации среды выполнения для Spark SQL, включая параметры выполнения и оптимизатора. Сведения о конфигурации, доступной только в Databricks, см. в разделе Свойства конфигурации Spark в Azure Databricks. |
| SparkSession | Точка входа для чтения данных и выполнения запросов SQL в приложениях PySpark. |
| VariantVal | Представляет полуструктурированные данные с гибкой схемой, которая поддерживает динамические типы и вложенные структуры. |
| Окно | Функции окна для выполнения вычислений в наборе строк таблицы, связанных с текущей строкой. |
| WindowSpec | Функции окна для выполнения вычислений в наборе строк таблицы, связанных с текущей строкой. |
Функции
Полный список доступных встроенных функций см. в разделе "Функции PySpark".