Запись данных из Центров событий в формате Parquet

В этой статье объясняется, как использовать редактор без кода для автоматического захвата потоковых данных в Event Hubs в учетной записи Azure Data Lake Storage поколения Gen2 в формате Parquet.

Требования

  • Пространство имен Центры событий Azure с концентратором событий и учетной записью Azure Data Lake Storage 2-го поколения с контейнером для хранения данных. Эти ресурсы должны быть общедоступными и не могут находиться за брандмауэром или защищены в виртуальной сети Azure.

    Если у вас нет концентратора событий, создайте его, следуя инструкциям из Краткое руководство: Создание концентратора событий.

    Если у вас нет учетной записи Data Lake Storage 2-го поколения, создайте ее, следуя инструкциям из руководства по созданию учетной записи хранения.

  • Данные в экземпляре вашего Event Hubs (концентратор событий) должны быть сериализованы в формате JSON, CSV или Avro. На странице экземпляра Event Hubs вашего концентратора событий выполните следующие действия.

    1. В меню слева выберите Обозреватель данных.

    2. В средней области выберите "Отправить события".

    3. В области "Отправить события" для выбора набора данных выберите "Акции".

    4. Выберите Отправить.

      Снимок экрана — страница генерации данных для создания примеров данных акций.

Настройка задания для записи данных

Чтобы настроить задание Stream Analytics для записи данных в Azure Data Lake Storage 2-го поколения, выполните следующие действия.

  1. На портале Azure перейдите в центр событий.

  2. В меню слева в разделе "Компоненты" выберите "Обработка данных". Затем выберите «Пуск» на карточке Захват данных в ADLS Gen2 в формате Parquet.

    Снимок экрана с картами начала обработки данных Event Hubs.

  3. Введите имя задания Stream Analytics и нажмите кнопку "Создать".

    Снимок экрана: окно

  4. Укажите тип сериализации данных в центрах событий и метод проверки подлинности, который задание использует для подключения к Центрам событий. В этом руководстве оставьте параметры по умолчанию. В этом случае выберите Подключиться.

    Снимок экрана: конфигурация подключения Центров событий.

  5. После успешной установки подключения вы увидите:

    • Наличие полей в входных данных. Вы можете нажать кнопку Добавить поле или выбрать символ с тремя точками рядом с каждым полем, чтобы при необходимости удалить, переименовать его или изменить его имя.

    • Прямой образец входящих данных в таблице Предварительный просмотр данных в диаграммном виде. Он периодически обновляется. Вы можете выбрать Приостановить предварительный просмотр потоковой передачи, чтобы просмотреть статическое представление примера входных данных.

      Снимок экрана: пример данных на вкладке

  6. Выберите плитку Azure Data Lake Storage 2-го поколения, чтобы изменить конфигурацию.

  7. На странице настройки Azure Data Lake Storage 2-го поколения сделайте следующее:

    1. В раскрывающемся меню выберите подписку, имя учетной записи хранения и контейнер.

    2. После выбора подписки метод проверки подлинности и ключ учетной записи хранения автоматически заполняются.

    3. Выберите Parquet для формата сериализации .

      Снимок экрана: страница конфигурации Data Lake Storage 2-го поколения.

    4. Для транслируемых двоичных блоков путь к каталогу является динамическим. Дата должна быть частью пути к файлу для BLOB, на который ссылается {date}. Дополнительные сведения о шаблонах пользовательских путей см. в разделе " Секционирование выходных данных BLOB-объектов Azure Stream Analytics".

      Первый снимок экрана, показывающий окно Blob, где вы редактируете конфигурацию подключения блоба.

    5. Выберите Подключиться.

  8. Когда соединение установлено, отображаются поля, которые присутствуют в выходных данных.

  9. Выберите команду Сохранить на панели команд, чтобы сохранить конфигурацию.

    Снимок экрана: кнопка

  10. Выберите команду Запустить на панели команд, чтобы запустить потоковую передачу для записи данных. Затем в окне задания Start Stream Analytics выполните следующие действия:

    1. Выберите время начала выходных данных.

    2. Выберите тарифный план.

    3. Выберите число единиц потоковой передачи, с которыми выполняется задание. SU обозначает вычислительные ресурсы, выделенные для выполнения задания в Stream Analytics. Дополнительные сведения см. в разделе Единицы потоковой передачи в Azure Stream Analytics.

      Снимок экрана: окно

  11. Выберите X в правом верхнем углу, чтобы закрыть окно с Stream Analytics job.

  12. Задание Stream Analytics отображается на вкладке Задания Stream Analytics на странице Обработка данных для концентратора событий.

    Снимок экрана: задание Stream Analytics на странице данных обработки.

Проверка выходных данных

  1. На странице экземпляра Event Hubs для вашего концентратора выполните следующие действия.

    1. В меню слева выберите Обозреватель данных.
    2. В средней области выберите "Отправить события".
    3. В области "Отправить события" для выбора набора данных выберите "Акции".
    4. Выберите Отправить.
  2. Убедитесь, что файлы Parquet создаются в контейнере Azure Data Lake Storage.

    Снимок экрана: созданные файлы Parquet в контейнере Azure Data Lake Storage.

  3. Теперь на странице экземпляра Центров событий выберите «Обработка данных» на левой панели меню. Перейдите на вкладку заданий Stream Analytics. Выберите "Открыть метрики " для мониторинга. Добавьте входные метрики на диаграмму с помощью Добавить метрику на панели инструментов. Если в диаграмме не отображаются метрики, подождите несколько минут и обновите страницу.

    Снимок экрана: выделенная ссылка

    Ниже приведен пример снимка экрана метрик с событиями ввода и вывода.

    Снимок экрана: метрики задания Stream Analytics.

Рекомендации при использовании функции георепликации Центров событий

Центры событий Azure недавно запустили Функция георепликации в общедоступной предварительной версии. Эта функция отличается от функции гео-аварийного восстановления в Центры событий Azure.

Если тип отказоустойчивости принудительный, а согласованность репликации асинхронная, задание Stream Analytics не гарантирует вывод данных в Центры событий Azure точно один раз.

Azure Stream Analytics, выполняющий роль производителя с концентратором событий в качестве выхода, может наблюдать задержку временной метки в задании в периоды переключения на резервный канал и при ограничении со стороны центров событий, если задержка репликации между основными и резервными компонентами достигает максимальной настроенной величины.

Azure Stream Analytics, как потребитель с Центрами событий в качестве источника данных, может наблюдать задержку отслеживания прогресса в задании во время отработки отказа и может пропустить данные или найти дублирующиеся данные после завершения отработки отказа.

Из-за этих оговорок перезапустите задание Stream Analytics с соответствующим временем начала сразу после завершения переключения Центров событий. Кроме того, так как функция георепликации Центров событий находится в общедоступной предварительной версии, не используйте этот шаблон для рабочих заданий Stream Analytics на данный момент. Текущее поведение Stream Analytics улучшится, прежде чем функция георепликации Центров событий общедоступна и может использоваться в рабочих заданиях Stream Analytics.

Теперь вы знаете, как использовать бескодовый редактор Stream Analytics для создания задания, которое записывает данные Центров событий в Azure Data Lake Storage 2-го поколения в формате Parquet. Теперь вы можете ознакомиться с более подробной информацией о Azure Stream Analytics и о том, как выполнять мониторинг созданного задания.