Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
ПРИМЕНИМО К:
Фабрика данных Azure
Azure Synapse Analytics
Совет
Data Factory в Microsoft Fabric — это следующее поколение Фабрика данных Azure с более простой архитектурой, встроенным ИИ и новыми функциями. Если вы не знакомы с интеграцией данных, начните с Fabric Data Factory. Существующие рабочие нагрузки ADF могут обновляться до Fabric для доступа к новым возможностям в области обработки и анализа данных, аналитики в режиме реального времени и отчетов.
В этом руководстве вы создадите фабрику данных с помощью пользовательского интерфейса Фабрика данных Azure. Конвейер этой фабрики данных копирует данные безопасно из хранилища BLOB-объектов Azure в базу данных Azure SQL, при этом обе системы разрешают доступ только к выбранным сетям, используя частные конечные точки в Управляемой виртуальной сети Фабрика данных Azure. Шаблон конфигурации в этом руководстве применяется к копированию из файлового в реляционное хранилище данных. Список хранилищ данных, которые поддерживаются в качестве источников и приемников, см. в таблице Поддерживаемые хранилища данных и форматы. Функция частных конечных точек доступна во всех уровнях Фабрика данных Azure, поэтому для их использования не требуется никакого конкретного уровня. Дополнительные сведения о ценах и категориях см. на странице цен Фабрика данных Azure.
Примечание.
Если вы не знакомы с фабрикой данных, см. статью Introduction to Фабрика данных Azure.
В этом руководстве вы выполните следующие шаги:
- Создали фабрику данных.
- Создайте конвейер с операцией копирования.
Предварительные требования
- подписка Azure. Если у вас нет подписки Azure, создайте учетную запись free Azure перед началом работы.
- Azure учетная запись хранения. Вы используете хранилище Blob в качестве источника данных. Если у вас нет учетной записи хранения, ознакомьтесь с Создание учетной записи хранения Azure, чтобы создать ее. Убедитесь, что получить доступ к учетной записи хранения можно только из выбранных сетей.
- База данных SQL Azure. Используйте базу данных как хранилище данных-приемник. Если у вас нет базы данных Azure SQL, ознакомьтесь с инструкциями по созданию базы данных SQL . Убедитесь, что получить доступ к службе "База данных SQL" можно только из выбранных сетей.
Создание BLOB и таблицы SQL
Теперь подготовьте хранилище BLOB и базу данных SQL для этого учебного пособия, выполнив следующие действия.
Создание исходного BLOB
Откройте Блокнот. Скопируйте следующий текст и сохраните его в файл emp.txt на диске.
FirstName,LastName John,Doe Jane,DoeСоздайте контейнер с именем adftutorial в хранилище BLOB-объектов. Создайте папку input в этом контейнере. Затем отправьте файл emp.txt в папку input. Для выполнения этих задач используйте портал Azure или такие средства, как Обозреватель службы хранилища Azure.
Создание таблицы-приемника SQL
Используйте следующий скрипт SQL, чтобы создать таблицу dbo.emp в базе данных SQL.
CREATE TABLE dbo.emp
(
ID int IDENTITY(1,1) NOT NULL,
FirstName varchar(50),
LastName varchar(50)
)
GO
CREATE CLUSTERED INDEX IX_emp_ID ON dbo.emp (ID);
Создание фабрики данных
На этом этапе вы создадите фабрику данных и запустите пользовательский интерфейс службы "Фабрика данных" для создания конвейера в фабрике данных.
Откройте Microsoft Edge или Google Chrome. В настоящее время только Microsoft Edge и веб-браузеры Google Chrome поддерживают пользовательский интерфейс фабрики данных.
В меню слева выберите Создать ресурс>Аналитика>Фабрика данных.
На странице Новая фабрика данных в поле Имя введите ADFTutorialDataFactory.
Имя фабрики данных Azure должно быть уникальным в мире. Если вы получите сообщение об ошибке о значении имени, укажите другое имя для фабрики данных (например, yournameADFTutorialDataFactory). Дополнительные сведения о правилах именования артефактов фабрики данных см. в статье Правила именования Data Factory.
Выберите подписку Azure, в которой требуется создать фабрику данных.
Для группы ресурсов выполните одно из следующих действий:
- Выберите Использовать существующуюи укажите существующую группу ресурсов в раскрывающемся списке.
- Выберите Создать новуюи укажите имя группы ресурсов.
Дополнительные сведения о группах ресурсов см. в статье Использовать группы ресурсов для управления ресурсами Azure.
В качестве версии выберите V2.
В поле Расположение выберите расположение фабрики данных. В раскрывающемся списке отображаются только поддерживаемые расположения. Хранилища данных (например, служба хранилища Azure и база данных SQL) и вычислительные ресурсы (например, Azure HDInsight), используемые фабрикой данных, могут находиться в других регионах.
Нажмите кнопку создания.
После завершения создания вы увидите уведомление в центре уведомлений. Выберите Перейти к ресурсу, чтобы открыть страницу фабрики данных.
Выберите Open на плитке Open Фабрика данных Azure Studio, чтобы запустить пользовательский интерфейс фабрики данных на отдельной вкладке.
Создание интеграционной среды выполнения Azure в управляемой фабрикой данных виртуальной сети.
На этом шаге вы создадите интеграционную среду выполнения Azure и включите виртуальную сеть, управляемую Data Factory.
На портале фабрики данных перейдите к Manage и выберите New, чтобы создать новую среду выполнения интеграции Azure.
На странице Integration runtime setup (Настройка среды выполнения интеграции) выберите, какую среду выполнения интеграции следует создать на основе требуемых возможностей. В этом руководстве выберите Azure, Self-Hosted и щелкните Continue.
Выберите Azure и щелкните Continue для создания среды выполнения интеграции Azure.
В разделе Virtual network configuration (Preview) (Конфигурация виртуальной сети (предварительная версия)) выберите Включить.
Нажмите кнопку создания.
Создание конвейера
На этом шаге вы создадите в фабрике данных конвейер с действием копирования. Действие копирования переносит данные из облачного хранилища в SQL базу данных. В учебнике Quickstart вы создавали пайплайн, следуя этим шагам:
- Создайте связанную службу.
- Создание входных и выходных наборов данных.
- Создание конвейера.
В этом учебнике вы сразу приступите к созданию конвейера, Затем вы создаете связанные службы и наборы данных по мере необходимости для настройки конвейера.
На домашней странице выберите Orchestrate.
На панели свойств для конвейера введите CopyPipeline в поле имени конвейера.
На панели элементов Действия разверните категорию Move and Transform (Переместить и преобразовать) и перетащите действие Копирование данных из панели элементов в область конструктора конвейера. В качестве имени введите CopyFromBlobToSql.
Настройка источника
Совет
В этом руководстве вы используете ключ учетной записи в качестве типа аутентификации для вашего исходного хранилища данных. При необходимости вы также можете выбрать другие поддерживаемые способы проверки подлинности, такие как универсальный код ресурса SAS, субъект-службу и управляемое удостоверение. Для получения дополнительной информации см. соответствующие разделы в копировании и преобразовании данных в хранилище BLOB-объектов Azure с помощью Фабрика данных Azure.
Для безопасного хранения секретов для хранилищ данных рекомендуется использовать Azure Key Vault. Дополнительные сведения и иллюстрации см. в разделе Store credentials in Azure Key Vault.
Создание исходного набора данных и связанной службы
Перейдите на вкладку "Источник ". Нажмите +Создать , чтобы создать исходный набор данных.
В диалоговом окне New Dataset выберите Хранилище BLOB-объектов Azure и выберите Continue. Важно: исходные данные находятся в хранилище объектов Blob, поэтому для исходного набора данных выберите Хранилище BLOB-объектов Azure.
В диалоговом окне Выбор формата выберите тип формата ваших данных, а затем нажмите кнопку Продолжить.
В диалоговом окне Установка свойств введите SourceBlobDataset в качестве имени. Установите флажок Использовать первую строку в качестве заголовка. В текстовом поле Связанная служба выберите + Создать.
В диалоговом окне Новая связанная служба (Хранилище BLOB-объектов Azure) введите AzureStorageLinkedService в качестве Имя и выберите учетную запись хранилища из списка Имя учетной записи хранилища.
Обязательно включите режим Интерактивная разработка. Его включение может занять около одной минуты.
Выберите Test connection (Проверить подключение). Эта операция должна завершиться сбоем, если получить доступ к учетной записи хранения можно только из выбранной сети. Это означает, что Фабрике данных нужно создать частную конечную точку и получить для нее утверждение, прежде чем использовать ее. В сообщении об ошибке должна присутствовать ссылка, по которой вы можете перейти, чтобы создать управляемую частную конечную точку. Кроме того, можно сразу открыть вкладку Управление и выполнить инструкции из следующего раздела, чтобы создать управляемую частную конечную точку.
Примечание.
Вкладка Управление может быть доступна не для всех экземпляров Data Factory. Если она не отображается, вы можете получить доступ к частным конечным точкам, выбрав Создание>Подключения>Частная конечная точка.
Не закрывая это диалоговое окно, перейдите к учетной записи хранения.
Следуйте инструкциям в этом разделе, чтобы утвердить частную ссылку.
Вернитесь к диалоговому окну. Выберите Проверить соединение, а затем нажмите кнопку Создать, чтобы развернуть связанную службу.
После создания связанной службы снова откроется страница Установка свойств. Рядом с полем Путь к файлу выберите Обзор.
Перейдите к папке adftutorial/input, выберите файл emp.txt и нажмите кнопку OK.
Нажмите ОК. Автоматически переходит на страницу конвейера. Убедитесь, что на вкладке Источник выбрано значение SourceBlobDataset. Чтобы просмотреть данные на этой странице, выберите Просмотр данных.
Создание управляемой частной конечной точки
Если вы не переходили по гиперссылке при проверке подключения, перейдите по указанному пути. Здесь вам нужно создать управляемую частную конечную точку, которая будет подключаться к созданной связанной службе.
Перейдите на вкладку Управление.
Примечание.
Вкладка Управление может быть доступна не для всех экземпляров Data Factory. Если она не отображается, вы можете получить доступ к частным конечным точкам, выбрав Создание>Подключения>Частная конечная точка.
Перейдите в раздел Managed private endpoints (Управляемые частные конечные точки).
В разделе Managed private endpoints (Управляемые частные конечные точки) выберите + Создать.
Выберите плитку Хранилище BLOB-объектов Azure из списка и выберите Continue.
Введите имя созданной учетной записи хранения.
Нажмите кнопку создания.
Через несколько секунд для созданной частной ссылки отобразится состояние ожидания утверждения.
Выберите созданную частную конечную точку. Вы можете увидеть гиперссылку, которая позволит вам утвердить частную конечную точку на уровне учетной записи хранения.
Утверждение частной ссылки в учетной записи хранения
В разделе Параметры для учетной записи хранения выберите Подключения частных конечных точек.
Установите флажок для созданной частной конечной точки и выберите Утвердить.
Добавьте описание и выберите Да.
Вернитесь к разделу Managed private endpoints (Управляемые частные конечные точки) на вкладке Управление для Фабрики данных.
Через одну-две минуты в пользовательском интерфейсе Data Factory отобразится утверждение вашей частной конечной точки.
Настройка приемника
Совет
В этом руководстве в качестве типа аутентификации хранилища данных приемника используется аутентификация SQL. При необходимости вы также можете выбрать другие поддерживаемые способы проверки подлинности, такие как уполномоченная служба и управляемая идентичность. Дополнительные сведения см. в соответствующих разделах в Копирование и преобразование данных в базе данных Azure SQL с помощью Фабрика данных Azure.
Для безопасного хранения секретов для хранилищ данных рекомендуется использовать Azure Key Vault. Дополнительные сведения и иллюстрации см. в разделе Store credentials in Azure Key Vault.
Создание набора данных-приемника и связанной службы
Перейдите на вкладку Приёмник и выберите + Новый, чтобы создать набор данных приёмника.
В диалоговом окне Новый набор данных в поле поиска введите SQL, чтобы отфильтровать соединители. Выберите База данных SQL Azure и выберите Continue. В этом руководстве вы будете копировать данные в базу данных SQL.
В диалоговом окне Установка свойств введите OutputSqlDataset в качестве имени. В раскрывающемся списке Связанная служба выберите + Создать. Набор данных должен быть связан с связанной службой. Связанная служба имеет строку подключения, которую Data Factory использует для подключения к базе данных SQL во время выполнения. Набор данных определяет контейнер, папку и (необязательно) файл, куда копируются данные.
В диалоговом окне Связанная служба (База данных SQL Azure) выполните следующие действия:
- В поле Имя введите AzureSqlDatabaseLinkedService.
- В разделе Server name выберите экземпляр SQL Server.
- Обязательно включите режим Интерактивная разработка.
- В списке Имя базы данных выберите базу данных SQL.
- В поле Имя пользователя введите имя пользователя.
- В поле Пароль введите пароль для этого пользователя.
- Выберите Test connection (Проверить подключение). Операция должна завершиться сбоем, так как получить доступ к серверу SQL можно только из выбранных сетей. Это означает, что Фабрике данных нужно создать частную конечную точку и получить для нее утверждение, прежде чем использовать ее. В сообщении об ошибке должна присутствовать ссылка, по которой вы можете перейти, чтобы создать управляемую частную конечную точку. Кроме того, можно сразу открыть вкладку Управление и выполнить инструкции из следующего раздела, чтобы создать управляемую частную конечную точку.
- Не закрывая это диалоговое окно, перейдите к выбранному серверу SQL.
- Следуйте инструкциям в этом разделе, чтобы утвердить частную ссылку.
- Вернитесь к диалоговому окну. Выберите Проверить соединение, а затем нажмите кнопку Создать, чтобы развернуть связанную службу.
Автоматически откроется диалоговое окно Установка свойств. В поле Таблица выберите [dbo].[emp]. Затем выберите OK.
Перейдите на вкладку с конвейером и убедитесь, что в Sink Dataset выбрано значение OutputSqlDataset.
При необходимости вы можете сопоставить схему источника с соответствующей схемой назначения, выполнив действия в статье Сопоставление схемы в действии копирования.
Создание управляемой частной конечной точки
Если вы не переходили по гиперссылке при проверке подключения, перейдите по указанному пути. Здесь вам нужно создать управляемую частную конечную точку, которая будет подключаться к созданной связанной службе.
Перейдите на вкладку Управление.
Перейдите в раздел Managed private endpoints (Управляемые частные конечные точки).
В разделе Managed private endpoints (Управляемые частные конечные точки) выберите + Создать.
Выберите плитку База данных SQL Azure из списка и выберите Continue.
Введите имя выбранного SQL Server.
Нажмите кнопку создания.
Через несколько секунд для созданной частной ссылки отобразится состояние ожидания утверждения.
Выберите созданную частную конечную точку. Вы увидите гиперссылку, которая позволит вам утвердить частную конечную точку на уровне сервера SQL.
Утверждение приватного канала в SQL Server
- В SQL Server перейдите к Подключения частных конечных точек в разделе Параметры.
- Установите флажок для созданной частной конечной точки и выберите Утвердить.
- Добавьте описание и выберите Да.
- Вернитесь к разделу Managed private endpoints (Управляемые частные конечные точки) на вкладке Управление для Фабрики данных.
- На утверждение для вашей частной конечной точки потребуется одна-две минуты.
Отладка и публикация конвейера
Перед публикацией артефактов (связанных служб, наборов данных и конвейера) можно выполнить отладку конвейера в Data Factory или в собственном репозитории Azure Repos Git.
- Чтобы выполнить отладку конвейера, на панели инструментов щелкните Отладка. Состояние выполнения конвейера вы можете найти на вкладке Выходные данные в нижней части окна.
- После успешного запуска конвейера в верхней панели инструментов выберите Опубликовать все. Это действие опубликует созданные сущности (наборы данных и конвейеры) в фабрике данных.
- Дождитесь появления сообщения Успешно опубликовано. Чтобы отобразить сообщения с уведомлениями, выберите Показывать уведомления в правом верхнем углу (кнопка в виде колокольчика).
Итоги
Конвейер в этом примере копирует данные из Blob-хранилища в базу данных SQL, используя частные конечные точки в управляемой виртуальной сети Data Factory. Вы научились выполнять следующие задачи:
- Создали фабрику данных.
- Создайте конвейер с операцией копирования.