Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Распространенный сценарий при подключении к Azure Data Explorer — прием исторических данных, иногда называемый обратным заполнением. Процесс включает прием данных из существующей системы хранения в таблицу, которая представляет собой коллекцию экстентов.
Прием исторических данных с помощью свойства приема данных creationTime для задания времени создания экстентов на момент, когда данные были созданы. Использование времени создания в качестве критерия разбиения может упорядочить данные по времени в соответствии с вашими политиками кэша и хранения, а также повысить эффективность временных фильтров.
По умолчанию время создания экстентов устанавливается на время загрузки данных, что может вести себя не так, как вы ожидаете. Например, предположим, что у вас есть таблица с периодом кэша 30 дней и сроком хранения в два года. В обычном потоке данные, поступающие по мере их создания, кэшируются в течение 30 дней, а затем перемещаются в холодное хранилище. Через два года, основываясь на времени создания, старые данные удаляются постепенно, по одному дню за раз. Однако, если вы загружаете два года исторических данных, где по умолчанию данные помечаются временем создания, являющимся временем поглощения данных. Это поведение может не привести к желаемому результату, так как:
- Все данные находятся в кэше и остаются там в течение 30 дней, используя больше кэша, чем ожидалось.
- Старые данные не удаляются один день за один день; поэтому данные сохраняются в кластере дольше, чем необходимо, и после двух лет все удаляются одновременно.
- Данные, ранее сгруппированные по дате в исходной системе, теперь могут быть объединены в один и тот же сегмент, что приводит к неэффективным запросам.
Из этой статьи вы узнаете, как секционировать исторические данные:
creationTimeИспользуйте свойство приема во время приема (рекомендуется)Когда это возможно, загружайте исторические данные с помощью свойства загрузки, которое можно использовать для установки времени создания объёмов данных, извлекая его из файла или пути к блобу. Если структура папок не использует шаблон даты создания, переструктурируйте файл или путь к BLOB-объектам, чтобы отразить время создания. Используя этот метод, вы отправляете данные в таблицу с правильным временем создания, а периоды кэша и хранения применяются правильно.
Примечание.
По умолчанию экстенты секционируются по времени создания (приема), и в большинстве случаев не требуется устанавливать политику секционирования данных.
Использование политики секционирования после загрузки
Если вы не можете использовать свойство приема
, например, если данные вставляются с помощью соединителя Azure Cosmos DB, где нельзя управлять временем создания или не удается переструктурировать структуру каталогов, вы можете перераспределить таблицу после вставки, чтобы добиться того же эффекта с помощью политики разбиения . Однако этот метод может потребовать некоторых пробных и ошибок для оптимизации свойств политики и является менее эффективным, чем использование creationTimeсвойства приема. Используйте этот метод, только если невозможно использовать свойствоcreationTimeдля приема данных.
Предварительные требования
- Учетная запись Microsoft или идентификатор пользователя Microsoft Entra. Вам не нужна Azure подписка.
- Кластер Azure Data Explorer и база данных. Создайте кластер и базу данных.
- Учетная запись хранения.
- Для рекомендуемого
creationTimeметода использования свойства приема во время приема установите LightIngest.
Загрузка исторических данных
Секционирование исторических данных с помощью свойства загрузки creationTime во время загрузки. Если вы не можете использовать этот метод, вы можете повторно разделить таблицу после приема с помощью политики разбивки на разделы.
LightIngest полезна для загрузки исторических данных из существующей системы хранения в Azure Data Explorer. Хотя вы можете создать собственную команду с помощью списка аргументов командной строки, в этой статье показано, как автоматически создать эту команду с помощью мастера приема. Помимо создания команды, вы можете использовать этот процесс для создания новой таблицы и создания сопоставления схем. Это средство определяет сопоставление схем из вашего набора данных.
Назначение
В веб-интерфейсе Azure Data Explorer выберите Query в меню слева.
Щелкните правой кнопкой мыши по базе данных, куда нужно загрузить данные, а затем выберите LightIngest.
Откроется окно приема данных с выбранной вкладкой "Назначение ". Поля кластера и базы данных заполняются автоматически.
Выберите целевую таблицу. Чтобы получить данные в новую таблицу, выберите "Создать таблицу" и введите имя таблицы.
Примечание.
Имена таблиц могут составлять до 1024 символов, включая пробелы, буквенно-цифровые символы, дефисы и символы подчеркивания. Специальные символы не поддерживаются.
Выберите Далее: Источник.
Источник
В разделе "Выбор источника" выберите "Добавить URL-адрес " или "Выбрать контейнер".
При добавлении URL-адреса в разделе "Ссылка на источник" укажите ключ учетной записи или URL-адрес SAS для контейнера. URL-адрес SAS можно создать вручную или автоматически.
При выборе контейнера из учетной записи хранения выберите подписку хранилища, учетную запись хранения и контейнер из раскрывающихся меню.
Примечание.
Максимальный размер принимаемого файла составляет 6 ГБ. Рекомендуется загружать файлы размером от 100 МБ до 1 ГБ.
Выберите дополнительные параметры , чтобы определить дополнительные параметры для процесса приема с помощью LightIngest.
В области расширенной конфигурации определите параметры LightIngest в соответствии со следующей таблицей.
Свойство Описание Шаблон времени создания Укажите шаблон, чтобы переопределить свойство времени загрузки для созданного экстента, например, определяя дату по структуре папок в контейнере. См. также шаблон времени создания. Шаблон имени BLOB-объекта Укажите шаблон, используемый для идентификации файлов для импорта. Будут загружены все файлы в указанном контейнере, имена которых соответствуют шаблону имен блобов. Поддерживает подстановочные знаки. Заключите шаблон в двойные кавычки. Тег Тег, назначенный принятым данным. Значением тега может быть любая строка. Ограничение количества файлов Укажите количество файлов для загрузки. Будут поглощаться первые nфайлов, соответствующих шаблону имен блобов, до указанного количества.Не дождитесь завершения приема Если установлен, BLOB-объекты помещаются в очередь для обработки без мониторинга процесса. Если параметр не установлен, LightIngest продолжает опрашивать статус приема, пока процесс не будет завершен. Отображение только выбранных элементов Файлы в контейнере будут перечислены, но не будут импортированы. Нажмите кнопку "Готово", чтобы вернуться на вкладку "Источник ".
При необходимости выберите фильтры файлов, чтобы отфильтровать данные для приема только файлов в определенном пути к папке или с определенным расширением файла.
По умолчанию один из файлов в контейнере выбирается случайным образом и используется для создания схемы для таблицы.
При необходимости в разделе "Определение схемы" укажите используемый файл.
Выберите Далее: Схема, чтобы просмотреть и изменить конфигурацию столбца таблицы.
Схема
Вкладка схемы предоставляет предварительный просмотр данных.
Чтобы создать команду LightIngest, выберите Next: Start Ingestion.
При необходимости можно:
- Измените автоматически выведенный формат данных, выбрав нужный формат в раскрывающемся меню.
- Измените автоматически выведенное имя сопоставления. Вы можете использовать буквенно-цифровые символы и символы подчеркивания. Пробелы, специальные символы и дефисы не поддерживаются.
- При использовании существующей таблицы вы можете Сохранить текущую схему таблицы, если она соответствует выбранному формату.
- Выберите средство просмотра команд, чтобы просмотреть и скопировать автоматические команды, созданные из входных данных.
- Изменение столбцов. В разделе "Частичный просмотр данных" выберите раскрывающееся меню столбца, чтобы изменить различные аспекты таблицы.
Изменения, которые вы можете внести в таблицу, зависят от следующих параметров:
- Тип таблицы — новая или существующая.
- Тип сопоставления — новое или существующее.
| Тип таблицы | Тип сопоставления | Доступные корректировки |
|---|---|---|
| Новая таблица | Новое сопоставление | "Изменить тип данных", "Переименовать столбец", "Создать столбец", "Удалить столбец", "Обновить столбец", "Сортировать по возрастанию", "Сортировать по убыванию" |
| Существующая таблица | Новое сопоставление | Новый столбец (на котором можно изменить тип данных, переименовать и обновить), "Обновить столбец", "Сортировать по возрастанию", "Сортировать по убыванию" |
| Существующее сопоставление | "Сортировать по возрастанию", "Сортировать по убыванию" |
Примечание.
При добавлении нового столбца или обновлении существующего столбца можно изменить преобразования сопоставления. Дополнительную информацию см. в разделе Преобразование сопоставлений.
Прием
Когда таблица, сопоставление и команда LightIngest отображают зеленые галочки, выберите значок копирования в правом верхнем углу окна Созданная команда, чтобы скопировать созданную команду LightIngest.
Примечание.
При необходимости можно скачать средство LightIngest, выбрав "Скачать LightIngest".
Чтобы завершить процесс приема, необходимо запустить LightIngest с помощью скопированной команды.