Indexes - Create Or Update
Создает новый индекс поиска или обновляет индекс, если он уже существует.
PUT {endpoint}/indexes('{indexName}')?api-version=2026-04-01
PUT {endpoint}/indexes('{indexName}')?api-version=2026-04-01&allowIndexDowntime={allowIndexDowntime}
Параметры URI
| Имя | В | Обязательно | Тип | Описание |
|---|---|---|---|---|
|
endpoint
|
path | True |
string (uri) |
URL-адрес конечной точки службы поиска. |
|
index
|
path | True |
string |
Имя индекса. |
|
api-version
|
query | True |
string minLength: 1 |
Версия API, используемая для данной операции. |
|
allow
|
query |
boolean |
Позволяет добавлять новые анализаторы, маркеризаторы, фильтры маркеров или фильтры символов в индекс, принимая индекс в автономный режим по крайней мере через несколько секунд. Это временно приводит к сбою индексирования и запросов. Производительность и доступность индекса записи могут быть нарушены в течение нескольких минут после обновления индекса или длиннее для очень больших индексов. |
Заголовок запроса
| Имя | Обязательно | Тип | Описание |
|---|---|---|---|
| Accept |
Заголовок Accept. |
||
| If-Match |
string |
Определяет условие If-Match. Операция будет выполнена только в том случае, если ETag на сервере соответствует этому значению. |
|
| If-None-Match |
string |
Определяет условие If-None-Match. Операция будет выполнена только в том случае, если ETag на сервере не соответствует этому значению. |
|
| Prefer | True |
Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении. |
|
| x-ms-client-request-id |
string (uuid) |
Непрозрачный, глобально уникальный, созданный клиентом идентификатор строки для запроса. |
Текст запроса
| Имя | Обязательно | Тип | Описание |
|---|---|---|---|
| fields | True |
Поля индекса. |
|
| name | True |
string |
Имя индекса. |
| @odata.etag |
string |
ETag индекса. |
|
| analyzers | LexicalAnalyzer[]: |
Анализаторы индекса. |
|
| charFilters | CharFilter[]: |
Фильтры символов для индекса. |
|
| corsOptions |
Параметры управления общим доступом к ресурсам между источниками (CORS) для индекса. |
||
| defaultScoringProfile |
string |
Имя профиля оценки, используемого, если ни один из них не указан в запросе. Если это свойство не задано, а профиль оценки не указан в запросе, будет использоваться оценка по умолчанию (tf-idf). |
|
| description |
string |
Описание индекса. |
|
| encryptionKey |
Описание ключа шифрования, созданного в Azure Key Vault. Этот ключ используется для дополнительного уровня шифрования в состоянии покоя для ваших данных, когда вы хотите быть полностью уверены, что никто, даже Microsoft, не сможет расшифровать ваши данные. После шифрования данных он всегда будет оставаться зашифрованным. Служба поиска будет игнорировать попытки установить для этого свойства значение null. Это свойство можно изменить по мере необходимости, если вы хотите повернуть ключ шифрования; Ваши данные не будут затронуты. Шифрование с помощью ключей, управляемых клиентом, недоступно для бесплатных служб поиска и доступно только для платных служб, созданных 1 января 2019 г. |
||
| normalizers | LexicalNormalizer[]: |
Нормализаторы индекса. |
|
| scoringProfiles |
Профили оценки для индекса. |
||
| semantic |
Определяет параметры индекса поиска, влияющего на семантические возможности. |
||
| similarity | SimilarityAlgorithm: |
Тип алгоритма сходства, используемый при оценке и ранжировании документов, соответствующих поисковому запросу. Алгоритм сходства может быть определен только во время создания индекса и не может быть изменен на существующих индексах. Если значение NULL, используется алгоритм ClassicSimilarity. |
|
| suggesters |
Предложения для индекса. |
||
| tokenFilters |
TokenFilter[]:
|
Маркер фильтрует индекс. |
|
| tokenizers | LexicalTokenizer[]: |
Маркеризаторы индекса. |
|
| vectorSearch |
Содержит параметры конфигурации, связанные с векторным поиском. |
Ответы
| Имя | Тип | Описание |
|---|---|---|
| 200 OK |
Запрос выполнен успешно. |
|
| 201 Created |
Запрос успешно выполнен, и в результате был создан новый ресурс. |
|
| Other Status Codes |
Непредвиденное сообщение об ошибке. |
Безопасность
api-key
Тип:
apiKey
В:
header
OAuth2Auth
Тип:
oauth2
Flow:
implicit
URL-адрес авторизации:
https://login.microsoftonline.com/common/oauth2/v2.0/authorize
Области
| Имя | Описание |
|---|---|
| https://search.azure.com/.default |
Примеры
SearchServiceCreateOrUpdateIndex
Образец запроса
PUT https://exampleservice.search.windows.net/indexes('temp-example-index')?api-version=2026-04-01&allowIndexDowntime=
{
"name": "temp-example-index",
"description": "description",
"fields": [
{
"name": "id",
"type": "Edm.String",
"key": true,
"sortable": true
},
{
"name": "vector1",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 20,
"vectorSearchProfile": "config1"
},
{
"name": "vector1b",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 10,
"vectorSearchProfile": "config2"
},
{
"name": "vector2",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 5,
"vectorSearchProfile": "config3"
},
{
"name": "vector3",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 5,
"vectorSearchProfile": "config3"
},
{
"name": "vector22",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 10,
"vectorSearchProfile": "config2"
},
{
"name": "vector4",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 32,
"vectorSearchProfile": "config4"
},
{
"name": "name",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "description",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "standard.lucene"
},
{
"name": "category",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "ownerId",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "price",
"type": "Edm.Double",
"retrievable": true,
"filterable": true,
"sortable": true,
"facetable": true
}
],
"scoringProfiles": [
{
"name": "stringFieldBoost",
"text": {
"weights": {
"name": 3,
"description": 1,
"category": 2,
"ownerId": 1
}
},
"functions": [
{
"tag": {
"tagsParameter": "categoryTag"
},
"type": "tag",
"fieldName": "category",
"boost": 2
}
]
}
],
"defaultScoringProfile": "stringFieldBoost",
"corsOptions": {
"allowedOrigins": [
"https://www.example.com/foo"
],
"maxAgeInSeconds": 10
},
"suggesters": [
{
"name": "sg",
"searchMode": "analyzingInfixMatching",
"sourceFields": [
"category",
"ownerId"
]
}
],
"analyzers": [
{
"tokenizer": "standard_v2",
"tokenFilters": [
"common_grams"
],
"charFilters": [
"html_strip"
],
"@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
"name": "tagsAnalyzer"
}
],
"tokenizers": [
{
"maxTokenLength": 100,
"@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
"name": "my_tokenizer"
}
],
"tokenFilters": [
{
"preserveOriginal": false,
"@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
"name": "my_tokenFilter"
}
],
"charFilters": [
{
"mappings": [
".=>,",
"_=>-"
],
"@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
"name": "my_mapping"
}
],
"normalizers": [
{
"tokenFilters": [
"my_tokenFilter"
],
"charFilters": [
"my_mapping"
],
"@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
"name": "my_normalizer"
}
],
"similarity": {
"k1": 10,
"b": 0.1,
"@odata.type": "#Microsoft.Azure.Search.BM25Similarity"
},
"semantic": {
"defaultConfiguration": "testconfig",
"configurations": [
{
"name": "testconfig",
"prioritizedFields": {
"titleField": {
"fieldName": "category"
},
"prioritizedContentFields": [
{
"fieldName": "description"
}
],
"prioritizedKeywordsFields": [
{
"fieldName": "ownerId"
}
]
},
"rankingOrder": "BoostedRerankerScore"
}
]
},
"vectorSearch": {
"profiles": [
{
"name": "config1",
"algorithm": "cosine",
"vectorizer": "openai",
"compression": "mySQ8"
},
{
"name": "config2",
"algorithm": "euclidean",
"vectorizer": "custom-web-api",
"compression": "mySQ8"
},
{
"name": "config3",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQC"
},
{
"name": "config4",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQWithoutOriginals"
}
],
"algorithms": [
{
"hnswParameters": {
"metric": "cosine"
},
"name": "cosine",
"kind": "hnsw"
},
{
"hnswParameters": {
"metric": "euclidean"
},
"name": "euclidean",
"kind": "hnsw"
},
{
"hnswParameters": {
"metric": "dotProduct"
},
"name": "dotProduct",
"kind": "hnsw"
}
],
"vectorizers": [
{
"azureOpenAIParameters": {
"resourceUri": "https://test-sample.openai.azure.com/",
"deploymentId": "model",
"apiKey": "api-key",
"modelName": "text-embedding-3-large"
},
"name": "openai",
"kind": "azureOpenAI"
},
{
"customWebApiParameters": {
"uri": "https://my-custom-endpoint.org/",
"httpHeaders": {
"header1": "value1",
"header2": "value2"
},
"httpMethod": "POST",
"timeout": "PT1M",
"authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
"authIdentity": {
"@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
}
},
"name": "custom-web-api",
"kind": "customWebApi"
},
{
"amlParameters": {
"uri": "https://my-custom-endpoint.org/",
"resourceId": "aml resource id",
"timeout": "PT1M",
"region": "aml region",
"modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
},
"name": "aml",
"kind": "aml"
},
{
"amlParameters": {
"uri": "https://my-custom-endpoint.org/",
"resourceId": "aml resource id",
"timeout": "PT1M",
"region": "aml region",
"modelName": "Cohere-embed-v4"
},
"name": "aml-cohere",
"kind": "aml"
}
],
"compressions": [
{
"scalarQuantizationParameters": {
"quantizedDataType": "int8"
},
"name": "mySQ8",
"kind": "scalarQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
},
"truncationDimension": 2
},
{
"name": "myBQC",
"kind": "binaryQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
},
"truncationDimension": 2
},
{
"name": "myBQWithoutOriginals",
"kind": "binaryQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "discardOriginals"
},
"truncationDimension": 2
}
]
},
"@odata.etag": "0x1234568AE7E58A1"
}
Пример ответа
{
"name": "temp-example-index",
"description": "description",
"defaultScoringProfile": "stringFieldBoost",
"fields": [
{
"name": "id",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": true,
"synonymMaps": []
},
{
"name": "vector1",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 20,
"vectorSearchProfile": "config1",
"synonymMaps": []
},
{
"name": "vector1b",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector2",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector3",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector22",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector4",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 32,
"vectorSearchProfile": "config4",
"synonymMaps": []
},
{
"name": "name",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "description",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "standard.lucene",
"synonymMaps": []
},
{
"name": "category",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "ownerId",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "price",
"type": "Edm.Double",
"searchable": false,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"synonymMaps": []
}
],
"scoringProfiles": [
{
"name": "stringFieldBoost",
"functionAggregation": "sum",
"text": {
"weights": {
"name": 3,
"description": 1,
"category": 2,
"ownerId": 1
}
},
"functions": [
{
"fieldName": "category",
"interpolation": "linear",
"type": "tag",
"boost": 2,
"tag": {
"tagsParameter": "categoryTag"
}
}
]
}
],
"corsOptions": {
"allowedOrigins": [
"https://www.example.com/foo"
],
"maxAgeInSeconds": 10
},
"suggesters": [
{
"name": "sg",
"searchMode": "analyzingInfixMatching",
"sourceFields": [
"category",
"ownerId"
]
}
],
"analyzers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
"name": "tagsAnalyzer",
"tokenizer": "standard_v2",
"tokenFilters": [
"common_grams"
],
"charFilters": [
"html_strip"
]
}
],
"normalizers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
"name": "my_normalizer",
"tokenFilters": [
"my_tokenFilter"
],
"charFilters": [
"my_mapping"
]
}
],
"tokenizers": [
{
"@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
"name": "my_tokenizer",
"maxTokenLength": 100
}
],
"tokenFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
"name": "my_tokenFilter",
"preserveOriginal": false
}
],
"charFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
"name": "my_mapping",
"mappings": [
".=>,",
"_=>-"
]
}
],
"similarity": {
"@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
"k1": 10,
"b": 0.1
},
"semantic": {
"defaultConfiguration": "testconfig",
"configurations": [
{
"name": "testconfig",
"rankingOrder": "BoostedRerankerScore",
"prioritizedFields": {
"titleField": {
"fieldName": "category"
},
"prioritizedContentFields": [
{
"fieldName": "description"
}
],
"prioritizedKeywordsFields": [
{
"fieldName": "ownerId"
}
]
}
}
]
},
"vectorSearch": {
"algorithms": [
{
"name": "cosine",
"kind": "hnsw",
"hnswParameters": {
"metric": "cosine",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "euclidean",
"kind": "hnsw",
"hnswParameters": {
"metric": "euclidean",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "dotProduct",
"kind": "hnsw",
"hnswParameters": {
"metric": "dotProduct",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
}
],
"profiles": [
{
"name": "config1",
"algorithm": "cosine",
"vectorizer": "openai",
"compression": "mySQ8"
},
{
"name": "config2",
"algorithm": "euclidean",
"vectorizer": "custom-web-api",
"compression": "mySQ8"
},
{
"name": "config3",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQC"
},
{
"name": "config4",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQWithoutOriginals"
}
],
"vectorizers": [
{
"name": "openai",
"kind": "azureOpenAI",
"azureOpenAIParameters": {
"resourceUri": "https://test-sample.openai.azure.com",
"deploymentId": "model",
"apiKey": "api-key",
"modelName": "text-embedding-3-large"
}
},
{
"name": "custom-web-api",
"kind": "customWebApi",
"customWebApiParameters": {
"httpMethod": "POST",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
"httpHeaders": {
"header1": "value1",
"header2": "value2"
},
"authIdentity": {
"@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
}
}
},
{
"name": "aml",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
}
},
{
"name": "aml-cohere",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "Cohere-embed-v4"
}
}
],
"compressions": [
{
"name": "mySQ8",
"kind": "scalarQuantization",
"truncationDimension": 2,
"scalarQuantizationParameters": {
"quantizedDataType": "int8"
},
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQC",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQWithoutOriginals",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "discardOriginals"
}
}
]
}
}
{
"name": "temp-example-index",
"description": "description",
"defaultScoringProfile": "stringFieldBoost",
"fields": [
{
"name": "id",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": true,
"synonymMaps": []
},
{
"name": "vector1",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 20,
"vectorSearchProfile": "config1",
"synonymMaps": []
},
{
"name": "vector1b",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector2",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector3",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector22",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector4",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 32,
"vectorSearchProfile": "config4",
"synonymMaps": []
},
{
"name": "name",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "description",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "standard.lucene",
"synonymMaps": []
},
{
"name": "category",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "ownerId",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "price",
"type": "Edm.Double",
"searchable": false,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"synonymMaps": []
}
],
"scoringProfiles": [
{
"name": "stringFieldBoost",
"functionAggregation": "sum",
"text": {
"weights": {
"name": 3,
"description": 1,
"category": 2,
"ownerId": 1
}
},
"functions": [
{
"fieldName": "category",
"interpolation": "linear",
"type": "tag",
"boost": 2,
"tag": {
"tagsParameter": "categoryTag"
}
}
]
}
],
"corsOptions": {
"allowedOrigins": [
"https://www.example.com/foo"
],
"maxAgeInSeconds": 10
},
"suggesters": [
{
"name": "sg",
"searchMode": "analyzingInfixMatching",
"sourceFields": [
"category",
"ownerId"
]
}
],
"analyzers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
"name": "tagsAnalyzer",
"tokenizer": "standard_v2",
"tokenFilters": [
"common_grams"
],
"charFilters": [
"html_strip"
]
}
],
"normalizers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
"name": "my_normalizer",
"tokenFilters": [
"my_tokenFilter"
],
"charFilters": [
"my_mapping"
]
}
],
"tokenizers": [
{
"@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
"name": "my_tokenizer",
"maxTokenLength": 100
}
],
"tokenFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
"name": "my_tokenFilter",
"preserveOriginal": false
}
],
"charFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
"name": "my_mapping",
"mappings": [
".=>,",
"_=>-"
]
}
],
"similarity": {
"@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
"k1": 10,
"b": 0.1
},
"semantic": {
"defaultConfiguration": "testconfig",
"configurations": [
{
"name": "testconfig",
"rankingOrder": "BoostedRerankerScore",
"prioritizedFields": {
"titleField": {
"fieldName": "category"
},
"prioritizedContentFields": [
{
"fieldName": "description"
}
],
"prioritizedKeywordsFields": [
{
"fieldName": "ownerId"
}
]
}
}
]
},
"vectorSearch": {
"algorithms": [
{
"name": "cosine",
"kind": "hnsw",
"hnswParameters": {
"metric": "cosine",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "euclidean",
"kind": "hnsw",
"hnswParameters": {
"metric": "euclidean",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "dotProduct",
"kind": "hnsw",
"hnswParameters": {
"metric": "dotProduct",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
}
],
"profiles": [
{
"name": "config1",
"algorithm": "cosine",
"vectorizer": "openai",
"compression": "mySQ8"
},
{
"name": "config2",
"algorithm": "euclidean",
"vectorizer": "custom-web-api",
"compression": "mySQ8"
},
{
"name": "config3",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQC"
},
{
"name": "config4",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQWithoutOriginals"
}
],
"vectorizers": [
{
"name": "openai",
"kind": "azureOpenAI",
"azureOpenAIParameters": {
"resourceUri": "https://test-sample.openai.azure.com",
"deploymentId": "model",
"apiKey": "api-key",
"modelName": "text-embedding-3-large"
}
},
{
"name": "custom-web-api",
"kind": "customWebApi",
"customWebApiParameters": {
"httpMethod": "POST",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
"httpHeaders": {
"header1": "value1",
"header2": "value2"
},
"authIdentity": {
"@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
}
}
},
{
"name": "aml",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
}
},
{
"name": "aml-cohere",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "Cohere-embed-v4"
}
}
],
"compressions": [
{
"name": "mySQ8",
"kind": "scalarQuantization",
"truncationDimension": 2,
"scalarQuantizationParameters": {
"quantizedDataType": "int8"
},
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQC",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQWithoutOriginals",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "discardOriginals"
}
}
]
}
}
Определения
| Имя | Описание |
|---|---|
| Accept |
Заголовок Accept. |
|
AIFoundry |
Название модели вложения из каталога Azure AI Foundry, который будет называться. |
| AMLParameters |
Задает свойства для подключения к векторизатору AML. |
| AMLVectorizer |
Задаёт Машинное обучение Azure endpoint, развернутый через Azure AI Foundry Model Catalog для генерации векторного вложения строки запроса. |
|
Ascii |
Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Azure |
Имя модели Azure Open AI, которое будет вызываться. |
|
Azure |
Указывает ресурс Azure OpenAI, используемый для векторизации строки запроса. |
|
Azure |
Задает параметры для подключения к ресурсу Azure OpenAI. |
|
Binary |
Содержит параметры конфигурации, относящиеся к методу сжатия двоичной квантизации, используемому во время индексирования и запроса. |
|
BM25Similarity |
Функция ранжирования на основе алгоритма сходства Okapi BM25. BM25 — это алгоритм TF-IDF, включающий нормализацию длины (контролируемый параметром B), а также насыщенность терминов (контролируемый параметром k1). |
|
Char |
Определяет имена всех фильтров символов, поддерживаемых поисковой системой. |
|
Cjk |
Формирует большие кадры терминов CJK, созданных из стандартного токенизатора. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Cjk |
Скрипты, которые могут быть проигнорированы CjkBigramTokenFilter. |
|
Classic |
Устаревший алгоритм сходства, использующий реализацию TF-IDF Lucene TFIDFSimilarity. Этот вариант TF-IDF представляет нормализацию статического длины документа, а также координирующие факторы, которые наказывают документы, которые частично соответствуют поисковым запросам. |
|
Classic |
Токенизатор на основе грамматики, подходящий для обработки большинства европейских языковых документов. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Common |
Создает биграммы для часто встречающихся терминов при индексировании. Отдельные термины также индексируются с наложением биграмм. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Cors |
Определяет параметры управления общим доступом к ресурсам между источниками (CORS) для индекса. |
|
Custom |
Позволяет контролировать процесс преобразования текста в индексируемые и поисковые маркеры. Это определяемая пользователем конфигурация, состоящая из одного предопределенного токенизатора и одного или нескольких фильтров. Маркеризатор отвечает за разбиение текста в маркеры и фильтры для изменения маркеров, создаваемых токенизатором. |
|
Custom |
Позволяет настроить нормализацию для полей с возможностью фильтрации, сортировки и фасетной таблицы, которые по умолчанию работают со строгим сопоставлением. Это определяемая пользователем конфигурация, состоящая по крайней мере из одного или нескольких фильтров, которые изменяют сохраненный маркер. |
|
Dictionary |
Разбивает составные слова, распространенные во многих германских языках. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Distance |
Определяет функцию, которая повышает оценки на основе расстояния от географического расположения. |
|
Distance |
Предоставляет значения параметров функции оценки расстояния. |
|
Edge |
Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Edge |
Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма. |
|
Edge |
Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Edge |
Маркеризирует входные данные из края в n-граммы заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Elision |
Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Error |
Дополнительные сведения об ошибке управления ресурсами. |
|
Error |
Сведения об ошибке. |
|
Error |
Распространенный ответ об ошибке для всех API Azure Resource Manager для возврата сведений об ошибке для неудачных операций. (Это также следует формату ответа об ошибках OData.). |
|
Exhaustive |
Содержит параметры конфигурации, относящиеся к исчерпывающим алгоритму KNN, используемому во время запроса, который будет выполнять поиск методом подбора по всему векторному индексу. |
|
Exhaustive |
Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN. |
|
Freshness |
Определяет функцию, которая повышает оценки на основе значения поля даты и времени. |
|
Freshness |
Предоставляет значения параметров функции оценки свежести. |
|
Hnsw |
Содержит параметры конфигурации, специфичные для алгоритма приближенных ближайших соседей HNSW, используемого во время индексирования и запросов. Алгоритм HNSW предлагает настраиваемый компромисс между скоростью и точностью поиска. |
|
Hnsw |
Содержит параметры, специфичные для алгоритма HNSW. |
|
Keep |
Фильтр маркеров, который сохраняет только маркеры с текстом, содержащимся в указанном списке слов. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Keyword |
Помечает термины как ключевые слова. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Keyword |
Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Keyword |
Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Length |
Удаляет слишком длинные или слишком короткие слова. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Lexical |
Определяет имена всех текстовых анализаторов, поддерживаемых поисковой системой. |
|
Lexical |
Определяет имена всех нормализаторов текста, поддерживаемых поисковой системой. |
|
Lexical |
Определяет имена всех токенизаторов, поддерживаемых поисковой системой. |
|
Limit |
Ограничивает количество маркеров при индексировании. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Lucene |
Стандартный анализатор Apache Lucene; Состоит из стандартного токенизатора, нижнего регистра фильтра и фильтра остановки. |
|
Lucene |
Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Lucene |
Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Magnitude |
Определяет функцию, которая повышает оценки на основе величины числового поля. |
|
Magnitude |
Предоставляет значения параметров функции оценки величины. |
|
Mapping |
Фильтр символов, который применяет сопоставления, определенные с параметром сопоставления. Сопоставление является жадным (самое длинное сопоставление шаблона в заданной точке выигрывает). Замена может быть пустой строкой. Этот фильтр символов реализуется с помощью Apache Lucene. |
|
Microsoft |
Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам. |
|
Microsoft |
Разбивает текст на основе правил определенного языка. |
|
Microsoft |
Перечисляется языки, поддерживаемые токенайзером языка Microsoft для стемминга. |
|
Microsoft |
Перечисляется языки, поддерживаемые токенайзером языка Microsoft. |
|
NGram |
Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
NGram |
Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
NGram |
Маркеризирует входные данные в n-граммах заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Path |
Токенизатор для путьоподобных иерархий. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Pattern |
Гибко разделяет текст на термины с помощью шаблона регулярного выражения. Этот анализатор реализуется с помощью Apache Lucene. |
|
Pattern |
Использует регрессии Java для выдачи нескольких маркеров — по одному для каждой группы захвата в одном или нескольких шаблонах. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Pattern |
Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр символов реализуется с помощью Apache Lucene. |
|
Pattern |
Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Pattern |
Токенизатор, использующий сопоставление шаблонов regex для создания уникальных маркеров. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Phonetic |
Определяет тип фонетического кодировщика, используемого с PhoneticTokenFilter. |
|
Phonetic |
Создайте маркеры для фонетических совпадений. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
| Prefer |
Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении. |
|
Ranking |
Представляет оценку, используемую для сортировки документов. |
|
Rescoring |
Содержит параметры для перезаписи. |
|
Scalar |
Содержит параметры конфигурации, относящиеся к методу сжатия скалярной квантизации, используемому во время индексирования и запроса. |
|
Scalar |
Содержит параметры, относящиеся к скалярной квантизации. |
|
Scoring |
Определяет функцию агрегирования, используемую для объединения результатов всех функций оценки в профиле оценки. |
|
Scoring |
Определяет функцию, используемую для интерполяции повышения балла по ряду документов. |
|
Scoring |
Определяет параметры индекса поиска, влияющего на оценку в поисковых запросах. |
|
Search |
Представляет поле в определении индекса, описывающее имя, тип данных и поведение поиска поля. |
|
Search |
Определяет тип данных поля в индексе поиска. |
|
Search |
Представляет определение индекса поиска, описывающее поля и поведение поиска индекса. |
|
Search |
Очищает свойство удостоверения источника данных. |
|
Search |
Указывает удостоверение для используемого источника данных. |
|
Search |
Ключ шифрования, управляемый клиентом, в Azure Key Vault. Ключи, которые вы создаете и которыми управляете, можно использовать для шифрования или расшифровки хранимых данных, таких как индексы и сопоставления синонимов. |
|
Search |
Определяет, как API предложения должен применяться к группе полей в индексе. |
|
Semantic |
Определяет определенную конфигурацию, используемую в контексте семантических возможностей. |
|
Semantic |
Поле, используемое в рамках семантической конфигурации. |
|
Semantic |
Описывает поля заголовка, содержимого и ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделений и ответов. |
|
Semantic |
Определяет параметры индекса поиска, влияющего на семантические возможности. |
|
Shingle |
Создает сочетания токенов в виде одного токена. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Snowball |
Фильтр, который стебляет слова с помощью созданного сноубола стебля. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Snowball |
Язык, используемый для фильтра маркеров Snowball. |
|
Stemmer |
Предоставляет возможность переопределить другие фильтры с использованием пользовательских фильтров на основе словаря. Все термины, связанные с словарем, будут помечены как ключевые слова, чтобы они не были стеблированы с помощью стволовых модулей вниз по цепочке. Следует разместить перед всеми стемминговыми фильтрами. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html |
|
Stemmer |
Фильтр для конкретного языка. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters |
|
Stemmer |
Язык, используемый для фильтра маркеров парадигматического модуля. |
|
Stop |
Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. Этот анализатор реализуется с помощью Apache Lucene. |
|
Stopwords |
Определяет предопределенный список стоп-слов для конкретного языка. |
|
Stopwords |
Удаляет стоп-слова из потока токенов. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html |
|
Synonym |
Соответствует синонимам одного или нескольких слов в потоке маркеров. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Tag |
Определяет функцию, которая повышает оценку документов со строковыми значениями, соответствующими заданному списку тегов. |
|
Tag |
Предоставляет значения параметров функции оценки тегов. |
|
Text |
Определяет весы в полях индекса, для которых совпадения должны повысить оценку в поисковых запросах. |
|
Token |
Представляет классы символов, над которыми может работать фильтр маркеров. |
|
Token |
Определяет имена всех фильтров токенов, поддерживаемых поисковой системой. |
|
Truncate |
Усечение терминов до определенной длины. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Uax |
Разбивает URL-адреса и сообщения электронной почты на один токен. Этот токенизатор реализуется с помощью Apache Lucene. |
|
Unique |
Отфильтровывает маркеры с тем же текстом, что и в предыдущем маркере. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
|
Vector |
Формат кодировки для интерпретации содержимого векторных полей. |
|
Vector |
Содержит параметры конфигурации, связанные с векторным поиском. |
|
Vector |
Алгоритм, используемый для индексирования и запросов. |
|
Vector |
Метрика сходства, используемая для векторных сравнений. Рекомендуется выбрать ту же метрику подобия, на которой обучалась модель встраивания. |
|
Vector |
Метод сжатия, используемый для индексирования и запросов. |
|
Vector |
Квантованный тип данных сжатых векторных значений. |
|
Vector |
Определяет сочетание конфигураций для использования с векторным поиском. |
|
Vector |
Метод векторизации, который будет использоваться во время запроса. |
|
Web |
Задает определяемый пользователем векторизатор для создания векторного внедрения строки запроса. Интеграция внешнего векторизатора достигается с помощью пользовательского интерфейса веб-API набора навыков. |
|
Web |
Задает свойства для подключения к определяемой пользователем векторизаторе. |
|
Word |
Разделяет слова на подслова и выполняет необязательные преобразования в группах подслов. Этот фильтр маркеров реализуется с помощью Apache Lucene. |
Accept
Заголовок Accept.
| Значение | Описание |
|---|---|
| application/json;odata.metadata=minimal |
AIFoundryModelCatalogName
Название модели вложения из каталога Azure AI Foundry, который будет называться.
| Значение | Описание |
|---|---|
| OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32 |
OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32 |
| OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336 |
OpenAI-CLIP-Image-Text-Embeddings-ViT-large-Patch14-336 |
| Facebook-DinoV2-Image-Embeddings-ViT-Base |
Встраивания изображений Facebook-DinoV2-ViT-Base |
| Facebook-DinoV2-Image-Embeddings-ViT-Giant |
Facebook-DinoV2-Image-Embeddings-ViT-Giant |
| Cohere-embed-v3-english |
Cohere-embed-v3-english |
| Cohere-embed-v3-multilingual |
Cohere-embed-v3-многоязычный |
| Cohere-embed-v4 |
Модель Cohere Embed v4 для создания встраиваемых объектов как из текста, так и из изображений. |
AMLParameters
Задает свойства для подключения к векторизатору AML.
| Имя | Тип | Описание |
|---|---|---|
| key |
string |
(Требуется для проверки подлинности ключа) Ключ службы AML. |
| modelName |
Название модели вложения из каталога Azure AI Foundry, который развёртывается на предоставленной конечной точке. |
|
| region |
string |
(Необязательно для проверки подлинности маркера). Регион, в который развертывается служба AML. |
| resourceId |
string |
(Требуется для проверки подлинности маркера). Идентификатор ресурса Azure Resource Manager сервиса AML. Он должен быть в формате subscriptions/{guid}/resourceGroups/{resource-group-name}/Microsoft. MachineLearningServices/workspaces/{workspace-name}/services/{service_name}. |
| timeout |
string (duration) |
(Необязательно.) Если указано, означает время ожидания вызова API HTTP-клиента. |
| uri |
string (uri) |
(Требуется для проверки подлинности или проверки подлинности ключа) URI оценки службы AML, в которую будут отправляться полезные данные JSON. Допускается только схема URI https. |
AMLVectorizer
Задаёт Машинное обучение Azure endpoint, развернутый через Azure AI Foundry Model Catalog для генерации векторного вложения строки запроса.
| Имя | Тип | Описание |
|---|---|---|
| amlParameters |
Задает свойства векторизатора AML. |
|
| kind |
string:
aml |
Тип VectorSearchVectorizer. |
| name |
string |
Имя, сопоставленное с этим конкретным методом векторизации. |
AsciiFoldingTokenFilter
Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| preserveOriginal |
boolean |
False |
Значение, указывающее, будет ли храниться исходный токен. По умолчанию — false. |
AzureOpenAIModelName
Имя модели Azure Open AI, которое будет вызываться.
| Значение | Описание |
|---|---|
| text-embedding-ada-002 |
TextEmbeddingAda002 модель. |
| text-embedding-3-large |
TextEmbedding3Большая модель. |
| text-embedding-3-small |
TextEmbedding3Малая модель. |
| gpt-5-mini |
Модель Gpt5Mini. |
| gpt-5-nano |
Модель Gpt5Nano. |
| gpt-5.4-mini |
Модель GPT54Mini. |
| gpt-5.4-nano |
Модель Gpt54Nano. |
AzureOpenAIVectorizer
Указывает ресурс Azure OpenAI, используемый для векторизации строки запроса.
| Имя | Тип | Описание |
|---|---|---|
| azureOpenAIParameters |
Содержит параметры, относящиеся к векторизации внедрения Azure OpenAI. |
|
| kind |
string:
azure |
Тип VectorSearchVectorizer. |
| name |
string |
Имя, сопоставленное с этим конкретным методом векторизации. |
AzureOpenAIVectorizerParameters
Задает параметры для подключения к ресурсу Azure OpenAI.
| Имя | Тип | Описание |
|---|---|---|
| apiKey |
string |
Ключ API указанного ресурса Azure OpenAI. |
| authIdentity | SearchIndexerDataIdentity: |
Назначаемое пользователем управляемое удостоверение, используемое для исходящих подключений. |
| deploymentId |
string |
Идентификатор развертывания модели Azure OpenAI в указанном ресурсе. |
| modelName |
Имя модели внедрения, развернутой по указанному пути deploymentId. |
|
| resourceUri |
string (uri) |
URI ресурса ресурса Azure OpenAI. |
BinaryQuantizationCompression
Содержит параметры конфигурации, относящиеся к методу сжатия двоичной квантизации, используемому во время индексирования и запроса.
| Имя | Тип | Описание |
|---|---|---|
| kind |
string:
binary |
Тип VectorSearchCompression. |
| name |
string |
Имя, сопоставленное с этой конкретной конфигурацией. |
| rescoringOptions |
Содержит параметры для перезаписи. |
|
| truncationDimension |
integer (int32) |
Число измерений для усечения векторов. Усечение векторов уменьшает размер векторов и объем данных, которые необходимо передать во время поиска. Это позволяет сэкономить затраты на хранение и повысить производительность поиска за счет отзыва. Он должен использоваться только для внедрения обученных с помощью Matryoshka Representation Learning (MRL), таких как OpenAI text-embedding-3-large (small). Значение по умолчанию равно NULL, что означает отсутствие усечения. |
BM25SimilarityAlgorithm
Функция ранжирования на основе алгоритма сходства Okapi BM25. BM25 — это алгоритм TF-IDF, включающий нормализацию длины (контролируемый параметром B), а также насыщенность терминов (контролируемый параметром k1).
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| b |
number (double) |
Это свойство определяет, как длина документа влияет на оценку релевантности. По умолчанию используется значение 0,75. Значение 0,0 означает, что нормализация длины не применяется, а значение 1,0 означает, что оценка полностью нормализуется длиной документа. |
| k1 |
number (double) |
Это свойство управляет функцией масштабирования между частотой терминов каждого соответствующего термина и конечной оценкой релевантности пары document-query. По умолчанию используется значение 1.2. Значение 0,0 означает, что оценка не масштабируется с увеличением частоты термина. |
CharFilterName
Определяет имена всех фильтров символов, поддерживаемых поисковой системой.
| Значение | Описание |
|---|---|
| html_strip |
Фильтр символов, который пытается удалить конструкции HTML. См. https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html |
CjkBigramTokenFilter
Формирует большие кадры терминов CJK, созданных из стандартного токенизатора. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| ignoreScripts |
Скрипты, которые следует игнорировать. |
||
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| outputUnigrams |
boolean |
False |
Значение, указывающее, следует ли выводить юниграммы и bigrams (если значение true), или просто bigrams (если значение false). По умолчанию — false. |
CjkBigramTokenFilterScripts
Скрипты, которые могут быть проигнорированы CjkBigramTokenFilter.
| Значение | Описание |
|---|---|
| han |
Игнорируйте письмо Хань при формировании биграмм терминов ККК. |
| hiragana |
Игнорируйте хираганский шрифт при формировании биграмм терминов ККЯ. |
| katakana |
Игнорируйте шрифт катакана при формировании биграмм терминов ККЯ. |
| hangul |
Игнорируйте письменность хангыль при формировании биграмм терминов ККЯ. |
ClassicSimilarityAlgorithm
Устаревший алгоритм сходства, использующий реализацию TF-IDF Lucene TFIDFSimilarity. Этот вариант TF-IDF представляет нормализацию статического длины документа, а также координирующие факторы, которые наказывают документы, которые частично соответствуют поисковым запросам.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
ClassicTokenizer
Токенизатор на основе грамматики, подходящий для обработки большинства европейских языковых документов. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
CommonGramTokenFilter
Создает биграммы для часто встречающихся терминов при индексировании. Отдельные термины также индексируются с наложением биграмм. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| commonWords |
string[] |
Набор общих слов. |
|
| ignoreCase |
boolean |
False |
Значение, указывающее, не учитывается ли совпадение распространенных слов. По умолчанию — false. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| queryMode |
boolean |
False |
Значение, указывающее, находится ли фильтр маркеров в режиме запроса. При использовании режима запроса фильтр маркеров создает большие кадры, а затем удаляет общие слова и отдельные термины, за которым следует общее слово. По умолчанию — false. |
CorsOptions
Определяет параметры управления общим доступом к ресурсам между источниками (CORS) для индекса.
| Имя | Тип | Описание |
|---|---|---|
| allowedOrigins |
string[] |
Список источников, из которых коду JavaScript будет предоставлен доступ к вашему индексу. Может содержать список хостов вида {protocol}://{fully-qualified-domain-name}[:{port#}], или один '*' для разрешения всех источников (не рекомендуется). |
| maxAgeInSeconds |
integer (int64) |
Продолжительность, в течение которой браузеры должны кэшировать ответы CORS перед проверкой. По умолчанию 5 минут. |
CustomAnalyzer
Позволяет контролировать процесс преобразования текста в индексируемые и поисковые маркеры. Это определяемая пользователем конфигурация, состоящая из одного предопределенного токенизатора и одного или нескольких фильтров. Маркеризатор отвечает за разбиение текста в маркеры и фильтры для изменения маркеров, создаваемых токенизатором.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| charFilters |
Список фильтров символов, используемых для подготовки входного текста перед его обработкой генератором маркеров. Например, они могут заменить определенные символы или символы. Фильтры выполняются в том порядке, в котором они перечислены. |
|
| name |
string |
Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| tokenFilters |
Список фильтров маркеров, используемых для фильтрации или изменения маркеров, созданных генератором маркеров. Например, вы можете указать специальный фильтр, который преобразует все символы в нижний регистр. Фильтры выполняются в том порядке, в котором они перечислены. |
|
| tokenizer |
Имя маркеризатора, используемого для разделения непрерывного текста на последовательность маркеров, например для разбиения предложения на слова. |
CustomNormalizer
Позволяет настроить нормализацию для полей с возможностью фильтрации, сортировки и фасетной таблицы, которые по умолчанию работают со строгим сопоставлением. Это определяемая пользователем конфигурация, состоящая по крайней мере из одного или нескольких фильтров, которые изменяют сохраненный маркер.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| charFilters |
Список фильтров символов, используемых для подготовки входного текста перед обработкой. Например, они могут заменить определенные символы или символы. Фильтры выполняются в том порядке, в котором они перечислены. |
|
| name |
string |
Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| tokenFilters |
Список фильтров маркеров, используемых для фильтрации или изменения входного маркера. Например, вы можете указать специальный фильтр, который преобразует все символы в нижний регистр. Фильтры выполняются в том порядке, в котором они перечислены. |
DictionaryDecompounderTokenFilter
Разбивает составные слова, распространенные во многих германских языках. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxSubwordSize |
integer (int32) maximum: 300 |
15 |
Максимальный размер подслугов. Только вложенные слова короче, чем это выводится. Значение по умолчанию — 15. Максимальное значение — 300. |
| minSubwordSize |
integer (int32) maximum: 300 |
2 |
Минимальный размер подслогов. Выводятся только вложенные слова, превышающие это значение. По умолчанию используется значение 2. Максимальное значение — 300. |
| minWordSize |
integer (int32) maximum: 300 |
5 |
Минимальный размер слова. Только слова дольше, чем это обрабатывается. Значение по умолчанию — 5. Максимальное значение — 300. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| onlyLongestMatch |
boolean |
False |
Значение, указывающее, следует ли добавлять в выходные данные только самый длинный соответствующий подсловь. По умолчанию — false. |
| wordList |
string[] |
Список слов, которые нужно сопоставить. |
DistanceScoringFunction
Определяет функцию, которая повышает оценки на основе расстояния от географического расположения.
| Имя | Тип | Описание |
|---|---|---|
| boost |
number (double) |
Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0. |
| distance |
Значения параметров для функции оценки расстояния. |
|
| fieldName |
string |
Имя поля, используемого в качестве входных данных для функции оценки. |
| interpolation |
Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear". |
|
| type |
string:
distance |
Тип функции скоринга. |
DistanceScoringParameters
Предоставляет значения параметров функции оценки расстояния.
| Имя | Тип | Описание |
|---|---|---|
| boostingDistance |
number (double) |
Расстояние в километрах от опорного места, где заканчивается дальность наддува. |
| referencePointParameter |
string |
Название параметра, передаваемого в поисковых запросах для указания местоположения ссылки. |
EdgeNGramTokenFilter
Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. |
| minGram |
integer (int32) |
1 |
Минимальная длина n-грамма. По умолчанию 1. Должно быть меньше значения maxGram. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| side | front |
Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма. По умолчанию используется значение "front". |
EdgeNGramTokenFilterSide
Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма.
| Значение | Описание |
|---|---|
| front |
Указывает, что n-грамма должна создаваться с лицевой стороны входных данных. |
| back |
Указывает, что n-грамма должна быть сгенерирована из обратной стороны входных данных. |
EdgeNGramTokenFilterV2
Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300. |
| minGram |
integer (int32) maximum: 300 |
1 |
Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| side | front |
Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма. По умолчанию используется значение "front". |
EdgeNGramTokenizer
Маркеризирует входные данные из края в n-граммы заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300. |
| minGram |
integer (int32) maximum: 300 |
1 |
Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| tokenChars |
Классы символов, которые хранятся в маркерах. |
ElisionTokenFilter
Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| articles |
string[] |
Набор статей для удаления. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
ErrorAdditionalInfo
Дополнительные сведения об ошибке управления ресурсами.
| Имя | Тип | Описание |
|---|---|---|
| info |
Дополнительные сведения. |
|
| type |
string |
Дополнительный тип сведений. |
ErrorDetail
Сведения об ошибке.
| Имя | Тип | Описание |
|---|---|---|
| additionalInfo |
Дополнительные сведения об ошибке. |
|
| code |
string |
Код ошибки. |
| details |
Сведения об ошибке. |
|
| message |
string |
Сообщение об ошибке. |
| target |
string |
Целевой объект ошибки. |
ErrorResponse
Распространенный ответ об ошибке для всех API Azure Resource Manager для возврата сведений об ошибке для неудачных операций. (Это также следует формату ответа об ошибках OData.).
| Имя | Тип | Описание |
|---|---|---|
| error |
Объект ошибки. |
ExhaustiveKnnAlgorithmConfiguration
Содержит параметры конфигурации, относящиеся к исчерпывающим алгоритму KNN, используемому во время запроса, который будет выполнять поиск методом подбора по всему векторному индексу.
| Имя | Тип | Описание |
|---|---|---|
| exhaustiveKnnParameters |
Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN. |
|
| kind |
string:
exhaustive |
Тип VectorSearchAlgorithmConfiguration. |
| name |
string |
Имя, сопоставленное с этой конкретной конфигурацией. |
ExhaustiveKnnParameters
Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN.
| Имя | Тип | Описание |
|---|---|---|
| metric |
Метрика сходства, используемая для векторных сравнений. |
FreshnessScoringFunction
Определяет функцию, которая повышает оценки на основе значения поля даты и времени.
| Имя | Тип | Описание |
|---|---|---|
| boost |
number (double) |
Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0. |
| fieldName |
string |
Имя поля, используемого в качестве входных данных для функции оценки. |
| freshness |
Значения параметров для функции оценки свежести. |
|
| interpolation |
Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear". |
|
| type |
string:
freshness |
Тип функции скоринга. |
FreshnessScoringParameters
Предоставляет значения параметров функции оценки свежести.
| Имя | Тип | Описание |
|---|---|---|
| boostingDuration |
string (duration) |
Срок действия, по истечении которого бустинг прекратится для конкретного документа. |
HnswAlgorithmConfiguration
Содержит параметры конфигурации, специфичные для алгоритма приближенных ближайших соседей HNSW, используемого во время индексирования и запросов. Алгоритм HNSW предлагает настраиваемый компромисс между скоростью и точностью поиска.
| Имя | Тип | Описание |
|---|---|---|
| hnswParameters |
Содержит параметры, специфичные для алгоритма HNSW. |
|
| kind |
string:
hnsw |
Тип VectorSearchAlgorithmConfiguration. |
| name |
string |
Имя, сопоставленное с этой конкретной конфигурацией. |
HnswParameters
Содержит параметры, специфичные для алгоритма HNSW.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| efConstruction |
integer (int32) minimum: 100maximum: 1000 |
400 |
Размер динамического списка, содержащего ближайших соседей, который используется во время индексирования. Увеличение этого параметра может улучшить качество индекса за счет увеличения времени индексации. В определенный момент увеличение этого параметра приводит к уменьшению отдачи. |
| efSearch |
integer (int32) minimum: 100maximum: 1000 |
500 |
Размер динамического списка, содержащего ближайших соседей, который используется во время поиска. Увеличение этого параметра может улучшить результаты поиска, за счет более медленного поиска. В определенный момент увеличение этого параметра приводит к уменьшению отдачи. |
| m |
integer (int32) minimum: 4maximum: 10 |
4 |
Количество двунаправленных связей, создаваемых для каждого нового элемента во время построения. Увеличение значения этого параметра может улучшить запоминаемость и сократить время извлечения для наборов данных с высокой внутренней размерностью за счет увеличения потребления памяти и увеличения времени индексирования. |
| metric |
Метрика сходства, используемая для векторных сравнений. |
KeepTokenFilter
Фильтр маркеров, который сохраняет только маркеры с текстом, содержащимся в указанном списке слов. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| keepWords |
string[] |
Список слов, которые нужно сохранить. |
|
| keepWordsCase |
boolean |
False |
Значение, указывающее, следует ли сначала ввести все слова в нижний регистр. По умолчанию — false. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
KeywordMarkerTokenFilter
Помечает термины как ключевые слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| ignoreCase |
boolean |
False |
Значение, указывающее, следует ли игнорировать регистр. Если значение true, все слова преобразуются в нижний регистр. По умолчанию — false. |
| keywords |
string[] |
Список слов, которые нужно пометить как ключевые слова. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
KeywordTokenizer
Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| bufferSize |
integer (int32) |
256 |
Размер буфера чтения в байтах. Значение по умолчанию — 256. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
KeywordTokenizerV2
Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) maximum: 300 |
256 |
Максимальная длина маркера. Значение по умолчанию — 256. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
LengthTokenFilter
Удаляет слишком длинные или слишком короткие слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| max |
integer (int32) maximum: 300 |
300 |
Максимальная длина символов. Значение по умолчанию и максимальное значение — 300. |
| min |
integer (int32) maximum: 300 |
0 |
Минимальная длина символов. Значение по умолчанию — 0. Максимальное значение — 300. Должно быть меньше значения максимального значения. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
LexicalAnalyzerName
Определяет имена всех текстовых анализаторов, поддерживаемых поисковой системой.
| Значение | Описание |
|---|---|
| ar.microsoft |
Microsoft Analyzer для арабского языка. |
| ar.lucene |
Анализатор Lucene для арабского языка. |
| hy.lucene |
Анализатор Lucene для армянского языка. |
| bn.microsoft |
Microsoft Analyzer для бенгальского языка. |
| eu.lucene |
Анализатор Lucene для баскского языка. |
| bg.microsoft |
Microsoft Analyzer для болгарского языка. |
| bg.lucene |
Анализатор люцин для болгарского языка. |
| ca.microsoft |
Microsoft analyzer для каталонского. |
| ca.lucene |
Анализатор Lucene для каталанского языка. |
| zh-Hans.microsoft |
Microsoft Analyzer для китайского языка (упрощённый). |
| zh-Hans.lucene |
Анализатор Lucene для китайского языка (упрощенный). |
| zh-Hant.microsoft |
Microsoft Analyzer для китайского (традиционный). |
| zh-Hant.lucene |
Анализатор люцин для китайского языка (традиционный). |
| hr.microsoft |
Microsoft analyzer для хорватского языка. |
| cs.microsoft |
Microsoft analyzer для чешского языка. |
| cs.lucene |
Анализатор Lucene для чешского языка. |
| da.microsoft |
Microsoft Analyzer для датского языка. |
| da.lucene |
Анализатор Lucene для датского языка. |
| nl.microsoft |
Microsoft Analyzer для голландского языка. |
| nl.lucene |
Анализатор Lucene для голландского языка. |
| en.microsoft |
Microsoft Analyzer для английского языка. |
| en.lucene |
Анализатор Lucene для английского языка. |
| et.microsoft |
Microsoft analyzer для эстонского. |
| fi.microsoft |
Microsoft analyzer для финского языка. |
| fi.lucene |
Анализатор Lucene для финского языка. |
| fr.microsoft |
Microsoft Analyzer для французского. |
| fr.lucene |
Анализатор Lucene для французского языка. |
| gl.lucene |
Анализатор Lucene для галисийского языка. |
| de.microsoft |
Microsoft Analyzer для немецкого языка. |
| de.lucene |
Анализатор Lucene для немецкого языка. |
| el.microsoft |
Microsoft Analyzer для греческого. |
| el.lucene |
Анализатор Lucene для греческого языка. |
| gu.microsoft |
Microsoft Analyzer для гуджарати. |
| he.microsoft |
Microsoft Analyzer для иврита. |
| hi.microsoft |
Microsoft Analyzer для хинди. |
| hi.lucene |
Анализатор Lucene для хинди. |
| hu.microsoft |
Microsoft Analyzer для венгерского языка. |
| hu.lucene |
Анализатор Lucene для венгерского языка. |
| is.microsoft |
Microsoft Analyzer для исландского. |
| id.microsoft |
Microsoft analyzer для индонезийского языка (Bahasa). |
| id.lucene |
Анализатор Lucene для индонезийского языка. |
| ga.lucene |
Анализатор Lucene для ирландцев. |
| it.microsoft |
Microsoft Analyzer для итальянского. |
| it.lucene |
Анализатор Lucene для итальянского языка. |
| ja.microsoft |
Microsoft Analyzer для японского языка. |
| ja.lucene |
Анализатор Lucene для японского языка. |
| kn.microsoft |
Microsoft analyzer для каннада. |
| ko.microsoft |
Microsoft Analyzer для корейского языка. |
| ko.lucene |
Анализатор Lucene для корейского языка. |
| lv.microsoft |
Microsoft analyzer для латвийского языка. |
| lv.lucene |
Анализатор Lucene для латышского языка. |
| lt.microsoft |
Microsoft analyzer для литовского языка. |
| ml.microsoft |
Microsoft analyzer для малаялам. |
| ms.microsoft |
Microsoft analyzer для малайского языка (латинский). |
| mr.microsoft |
Microsoft Analyzer для маратхи. |
| nb.microsoft |
Microsoft analyzer for Norwegian (Bokmål). |
| no.lucene |
Анализатор Lucene для норвежского языка. |
| fa.lucene |
Анализатор Lucene для персидского языка. |
| pl.microsoft |
Microsoft Analyzer для польского языка. |
| pl.lucene |
Анализатор Lucene для польского языка. |
| pt-BR.microsoft |
Microsoft Analyzer для португальского (Бразилия). |
| pt-BR.lucene |
Анализатор Lucene для португальского языка (Бразилия). |
| pt-PT.microsoft |
Microsoft analyzer для португальского языка (Португалия). |
| pt-PT.lucene |
Анализатор Lucene для португальского языка (Португалия). |
| pa.microsoft |
Microsoft analyzer for Punjabi. |
| ro.microsoft |
Microsoft Analyzer для румынского. |
| ro.lucene |
Анализатор Lucene для румынского языка. |
| ru.microsoft |
Microsoft Analyzer для русского языка. |
| ru.lucene |
Анализатор люцин для русского языка. |
| sr-cyrillic.microsoft |
Microsoft analyzer для сербского языка (кириллица). |
| sr-latin.microsoft |
Microsoft analyzer для сербского (латинского). |
| sk.microsoft |
Microsoft analyzer для словацкого. |
| sl.microsoft |
Microsoft analyzer for Slovenian. |
| es.microsoft |
Microsoft Analyzer для испанского. |
| es.lucene |
Анализатор Lucene для испанского языка. |
| sv.microsoft |
Microsoft Analyzer для шведского языка. |
| sv.lucene |
Анализатор Lucene для шведского языка. |
| ta.microsoft |
Microsoft Analyzer для тамильского языка. |
| te.microsoft |
Microsoft analyzer для телугу. |
| th.microsoft |
Microsoft analyzer для тайского языка. |
| th.lucene |
Анализатор Lucene для тайского языка. |
| tr.microsoft |
Microsoft Analyzer для турецкого языка. |
| tr.lucene |
Анализатор Lucene для турецкого языка. |
| uk.microsoft |
Microsoft Analyzer для украинского языка. |
| ur.microsoft |
Microsoft analyzer для урду. |
| vi.microsoft |
Microsoft Analyzer для вьетнамского языка. |
| standard.lucene |
Стандартный анализатор люцина. |
| standardasciifolding.lucene |
Стандартный ASCII Folding Lucene analyzer. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers |
| keyword |
Обрабатывает все содержимое поля как один маркер. Это полезно для таких данных, как zip-коды, идентификаторы и некоторые имена продуктов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html |
| pattern |
Гибко разделяет текст на термины с помощью шаблона регулярного выражения. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html |
| simple |
Разбивает текст по небуквенным знакам и преобразует его в нижний регистр. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html |
| stop |
Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html |
| whitespace |
Анализатор, использующий токенизатор пробелов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html |
LexicalNormalizerName
Определяет имена всех нормализаторов текста, поддерживаемых поисковой системой.
LexicalTokenizerName
Определяет имена всех токенизаторов, поддерживаемых поисковой системой.
LimitTokenFilter
Ограничивает количество маркеров при индексировании. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| consumeAllTokens |
boolean |
False |
Значение, указывающее, должны ли все маркеры из входных данных использоваться, даже если достигается maxTokenCount. По умолчанию — false. |
| maxTokenCount |
integer (int32) |
1 |
Максимальное количество маркеров для создания. По умолчанию 1. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
LuceneStandardAnalyzer
Стандартный анализатор Apache Lucene; Состоит из стандартного токенизатора, нижнего регистра фильтра и фильтра остановки.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов. |
| name |
string |
Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| stopwords |
string[] |
Список стоп-слов. |
LuceneStandardTokenizer
Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) |
255 |
Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
LuceneStandardTokenizerV2
Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
MagnitudeScoringFunction
Определяет функцию, которая повышает оценки на основе величины числового поля.
| Имя | Тип | Описание |
|---|---|---|
| boost |
number (double) |
Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0. |
| fieldName |
string |
Имя поля, используемого в качестве входных данных для функции оценки. |
| interpolation |
Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear". |
|
| magnitude |
Значения параметров для функции оценки величины. |
|
| type |
string:
magnitude |
Тип функции скоринга. |
MagnitudeScoringParameters
Предоставляет значения параметров функции оценки величины.
| Имя | Тип | Описание |
|---|---|---|
| boostingRangeEnd |
number (double) |
Значение поля, на котором заканчивается форсирование. |
| boostingRangeStart |
number (double) |
Значение поля, с которого начинается бустинг. |
| constantBoostBeyondRange |
boolean |
Значение, указывающее, следует ли применять постоянное повышение для значений поля, выходящих за пределы конечного значения диапазона; Значение по умолчанию — false. |
MappingCharFilter
Фильтр символов, который применяет сопоставления, определенные с параметром сопоставления. Сопоставление является жадным (самое длинное сопоставление шаблона в заданной точке выигрывает). Замена может быть пустой строкой. Этот фильтр символов реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| mappings |
string[] |
Список сопоставлений следующего формата: "a=>b" (все вхождения символа "a" будут заменены символом "b"). |
| name |
string |
Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
MicrosoftLanguageStemmingTokenizer
Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| isSearchTokenizer |
boolean |
False |
Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. По умолчанию — false. |
| language |
Используемый язык. По умолчанию используется английский язык. |
||
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Токены, размер которых превышает максимальную длину, разделяются. Максимальная допустимая длина маркера — 300 знаков. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
MicrosoftLanguageTokenizer
Разбивает текст на основе правил определенного языка.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| isSearchTokenizer |
boolean |
False |
Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. По умолчанию — false. |
| language |
Используемый язык. По умолчанию используется английский язык. |
||
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Токены, размер которых превышает максимальную длину, разделяются. Максимальная допустимая длина маркера — 300 знаков. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
MicrosoftStemmingTokenizerLanguage
Перечисляется языки, поддерживаемые токенайзером языка Microsoft для стемминга.
| Значение | Описание |
|---|---|
| arabic |
Выбирает Microsoft stemming tokenizer для арабского языка. |
| bangla |
Выбирает Microsoft stemming tokenizer для Bangla. |
| bulgarian |
Выбирает Microsoft stemming tokenizer для болгарского языка. |
| catalan |
Выбирает Microsoft stemming tokenizer для каталанского. |
| croatian |
Выбирает Microsoft stemming tokenizer для хорватского языка. |
| czech |
Выбирает Microsoft stemming tokenizer для чешского языка. |
| danish |
Выбирает Microsoft stemming tokenizer для датского языка. |
| dutch |
Выбирает Microsoft stemming tokenizer для голландского языка. |
| english |
Выбирает Microsoft stemming tokenizer для английского языка. |
| estonian |
Выбирает Microsoft stemming tokenizer для эстонского языка. |
| finnish |
Выбирает Microsoft stemming tokenizer для финского языка. |
| french |
Выбирает Microsoft stemming tokenizer для французского языка. |
| german |
Выбирает токенайзер Microsoft stemming для немецкого. |
| greek |
Выбирает Microsoft stemming tokenizer для греческого языка. |
| gujarati |
Выбирает Microsoft stemming tokenizer для гуджарати. |
| hebrew |
Выбирает токенайзер Microsoft stemming для иврита. |
| hindi |
Выбирает Microsoft stemming tokenizer для хинди. |
| hungarian |
Выбирает Microsoft stemming tokenizer для венгерского языка. |
| icelandic |
Выбирает токенайзер Microsoft stemming для исландского. |
| indonesian |
Выбирает Microsoft stemming tokenizer для индонезийского. |
| italian |
Выбирает Microsoft stemming tokenizer для итальянского языка. |
| kannada |
Выбирает Microsoft stemming tokenizer для Kannada. |
| latvian |
Выбирает Microsoft stemming tokenizer для латвийского языка. |
| lithuanian |
Выбирает Microsoft stemming tokenizer для литовского языка. |
| malay |
Выбирает Microsoft stemming tokenizer для малайского. |
| malayalam |
Выбирает токенайзер Microsoft stemming для малаялам. |
| marathi |
Выбирает Microsoft stemming tokenizer для маратхи. |
| norwegianBokmaal |
Выбирает Microsoft stemming tokenizer для норвежского (BokmÃ¥l). |
| polish |
Выбирает Microsoft stemming tokenizer для польского языка. |
| portuguese |
Выбирает Microsoft stemming tokenizer для португальского языка. |
| portugueseBrazilian |
Выбирает Microsoft stemming tokenizer для португальского (Бразилия). |
| punjabi |
Выбирает Microsoft stemming tokenizer для пенджаби. |
| romanian |
Выбирает Microsoft stemming tokenizer для румынского языка. |
| russian |
Выбирает Microsoft stemming tokenizer для русского языка. |
| serbianCyrillic |
Выбирает Microsoft stemming tokenizer для сербского языка (кириллица). |
| serbianLatin |
Выбирает Microsoft stemming tokenizer для сербского (латинский). |
| slovak |
Выбирает Microsoft stemming tokenizer для словацкого. |
| slovenian |
Выбирает Microsoft stemming tokenizer for Slovenian. |
| spanish |
Выбирает Microsoft stemming tokenizer для испанского языка. |
| swedish |
Выбирает токенайзер Microsoft stemming для шведского языка. |
| tamil |
Выбирает Microsoft stemming tokenizer для тамильского языка. |
| telugu |
Выбирает Microsoft stemming tokenizer для телугу. |
| turkish |
Выбирает Microsoft stemming tokenizer для турецкого языка. |
| ukrainian |
Выбирает токенайзер Microsoft stemming для украинского языка. |
| urdu |
Выбирает Microsoft stemming tokenizer для урду. |
MicrosoftTokenizerLanguage
Перечисляется языки, поддерживаемые токенайзером языка Microsoft.
| Значение | Описание |
|---|---|
| bangla |
Выбирает токенайзер Microsoft для бенгальского языка. |
| bulgarian |
Выбирает токенайзер Microsoft для болгарского. |
| catalan |
Выбирает токенайзер Microsoft для каталанского. |
| chineseSimplified |
Выбирает токенайзер Microsoft для китайского языка (упрощённый). |
| chineseTraditional |
Выбирает токенайзер Microsoft для традиционного китайского языка. |
| croatian |
Выбирает токенайзер Microsoft для хорватского языка. |
| czech |
Выбирает токенайзер Microsoft для чешского языка. |
| danish |
Выбирает токенайзер Microsoft для датского языка. |
| dutch |
Выбирает токенайзер Microsoft для голландского языка. |
| english |
Выбирает токенайзер Microsoft для английского языка. |
| french |
Выбирает токенайзер Microsoft для французского. |
| german |
Выбирает токенайзер Microsoft для немецкого. |
| greek |
Выбирает токенайзер Microsoft для греческого языка. |
| gujarati |
Выбирает токенайзер Microsoft для гуджарати. |
| hindi |
Выбирает токенайзер Microsoft для хинди. |
| icelandic |
Выбирает токенайзер Microsoft для исландского. |
| indonesian |
Выбирает токенайзер Microsoft для индонезийского. |
| italian |
Выбирает токенайзер Microsoft для итальянского. |
| japanese |
Выбирает токенайзер Microsoft для японского. |
| kannada |
Выбирает токенайзер Microsoft для Kannada. |
| korean |
Выбирает токенайзер Microsoft для корейского языка. |
| malay |
Выбирает токенайзер Microsoft для малайского. |
| malayalam |
Выбирает токенайзер Microsoft для малаялам. |
| marathi |
Выбирает токенайзер Microsoft для маратхи. |
| norwegianBokmaal |
Выбирает токенайзер Microsoft для норвежского (BokmÃ¥l). |
| polish |
Выбирает токенайзер Microsoft для польского языка. |
| portuguese |
Выбирает токенайзер Microsoft для португальского. |
| portugueseBrazilian |
Выбирает токенайзер Microsoft для португальского (Бразилия). |
| punjabi |
Выбирает токенайзер Microsoft для пенджаби. |
| romanian |
Выбирает токенайзер Microsoft для румынского. |
| russian |
Выбирает токенайзер Microsoft для русского. |
| serbianCyrillic |
Выбирает токенайзер Microsoft для сербского (кириллица). |
| serbianLatin |
Выбирает токенайзер Microsoft для сербского (латинский). |
| slovenian |
Выбирает Microsoft tokenizer for Slovenian. |
| spanish |
Выбирает токенайзер Microsoft для испанского. |
| swedish |
Выбирает токенайзер Microsoft для шведского языка. |
| tamil |
Выбирает токенайзер Microsoft для тамильского. |
| telugu |
Выбирает токенайзер Microsoft для телугу. |
| thai |
Выбирает токенайзер Microsoft для тайского языка. |
| ukrainian |
Выбирает токенайзер Microsoft для украинского языка. |
| urdu |
Выбирает токенайзер Microsoft для урду. |
| vietnamese |
Выбирает токенайзер Microsoft для вьетнамского языка. |
NGramTokenFilter
Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. |
| minGram |
integer (int32) |
1 |
Минимальная длина n-грамма. По умолчанию 1. Должно быть меньше значения maxGram. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
NGramTokenFilterV2
Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300. |
| minGram |
integer (int32) maximum: 300 |
1 |
Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
NGramTokenizer
Маркеризирует входные данные в n-граммах заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300. |
| minGram |
integer (int32) maximum: 300 |
1 |
Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| tokenChars |
Классы символов, которые хранятся в маркерах. |
PathHierarchyTokenizerV2
Токенизатор для путьоподобных иерархий. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| delimiter |
string maxLength: 1 |
/ |
Используемый символ разделителя. Значение по умолчанию — "/". |
| maxTokenLength |
integer (int32) maximum: 300 |
300 |
Максимальная длина маркера. Значение по умолчанию и максимальное значение — 300. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| replacement |
string maxLength: 1 |
/ |
Значение, которое, если задано, заменяет символ разделителя. Значение по умолчанию — "/". |
| reverse |
boolean |
False |
Значение, указывающее, следует ли создавать маркеры в обратном порядке. По умолчанию — false. |
| skip |
integer (int32) |
0 |
Количество пропустить начальных маркеров. Значение по умолчанию — 0. |
PatternAnalyzer
Гибко разделяет текст на термины с помощью шаблона регулярного выражения. Этот анализатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| flags |
string |
Флаги регулярного выражения, заданные как отдельная строка значений RegexFlags с выделением '|'. |
|
| lowercase |
boolean |
True |
Значение, указывающее, следует ли писать термины в нижнем регистре. Значение по умолчанию: true. |
| name |
string |
Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| pattern |
string |
\W+ |
Шаблон регулярного выражения для сопоставления разделителей маркеров. Default — это выражение, которое соответствует одному или нескольким символам, не являющимся словами. |
| stopwords |
string[] |
Список стоп-слов. |
PatternCaptureTokenFilter
Использует регрессии Java для выдачи нескольких маркеров — по одному для каждой группы захвата в одном или нескольких шаблонах. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| patterns |
string[] |
Список шаблонов для сопоставления с каждым маркером. |
|
| preserveOriginal |
boolean |
True |
Значение, указывающее, следует ли возвращать исходный маркер, даже если один из шаблонов соответствует. Значение по умолчанию: true. |
PatternReplaceCharFilter
Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр символов реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| name |
string |
Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| pattern |
string |
Шаблон регулярного выражения. |
| replacement |
string |
Замещающий текст. |
PatternReplaceTokenFilter
Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| pattern |
string |
Шаблон регулярного выражения. |
| replacement |
string |
Замещающий текст. |
PatternTokenizer
Токенизатор, использующий сопоставление шаблонов regex для создания уникальных маркеров. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| flags |
string |
Флаги регулярного выражения, заданные как отдельная строка значений RegexFlags с выделением '|'. |
|
| group |
integer (int32) |
-1 |
Порядковый номер совпадающей группы в шаблоне регулярного выражения, отсчитываемый от нуля, для извлечения в лексемы. Используйте -1, если вы хотите использовать весь шаблон для разделения входных данных на лексемы, независимо от совпадающих групп. Значение по умолчанию — -1. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| pattern |
string |
\W+ |
Шаблон регулярного выражения для сопоставления разделителей маркеров. Default — это выражение, которое соответствует одному или нескольким символам, не являющимся словами. |
PhoneticEncoder
Определяет тип фонетического кодировщика, используемого с PhoneticTokenFilter.
| Значение | Описание |
|---|---|
| metaphone |
Кодирует маркер в значение Metaphone. |
| doubleMetaphone |
Кодирует токен в двойное значение метафона. |
| soundex |
Кодирует токен в значение Soundex. |
| refinedSoundex |
Кодирует токен в значение Refined Soundex. |
| caverphone1 |
Кодирует маркер в значение Caverphone 1.0. |
| caverphone2 |
Кодирует маркер в значение Caverphone 2.0. |
| cologne |
Кодирует лексему в кёльнское фонетическое значение. |
| nysiis |
Кодирует токен в значение NYSIIS. |
| koelnerPhonetik |
Кодирует токен с помощью алгоритма Kölner Phonetik. |
| haasePhonetik |
Кодирует лексему с помощью уточнения Хаазе алгоритма Kölner Phonetik. |
| beiderMorse |
Кодирует лексему в Beider-Morse значение. |
PhoneticTokenFilter
Создайте маркеры для фонетических совпадений. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| encoder | metaphone |
Используемый фонетический кодировщик. По умолчанию используется метафон. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| replace |
boolean |
True |
Значение, указывающее, должны ли кодированные маркеры заменить исходные маркеры. Если значение false, закодированные маркеры добавляются в качестве синонимов. Значение по умолчанию: true. |
Prefer
Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении.
| Значение | Описание |
|---|---|
| return=representation |
RankingOrder
Представляет оценку, используемую для сортировки документов.
| Значение | Описание |
|---|---|
| BoostedRerankerScore |
Устанавливает порядок сортировки как BoostedRerankerScore |
| RerankerScore |
Устанавливает порядок сортировки как ReRankerScore |
RescoringOptions
Содержит параметры для перезаписи.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| defaultOversampling |
number (double) |
Коэффициент превышения по умолчанию. Избыточная дискретизация позволяет получить больший набор потенциальных документов, чтобы компенсировать потерю разрешения из-за квантования. Это увеличивает набор результатов, которые будут переоцениваться на векторах полной точности. Минимальное значение равно 1, то есть без превышения (1x). Этот параметр может быть установлен только в том случае, если 'enableRescoring' имеет значение true. Более высокие значения улучшают отзыв за счет задержки. |
|
| enableRescoring |
boolean |
True |
Если задано значение true, то после первоначального поиска по сжатым векторам оценки сходства пересчитываются с использованием векторов полной точности. Это улучшит отзыв за счет задержки. |
| rescoreStorageMethod |
enum:
|
preserveOriginals |
Управляет методом хранения исходных векторов. Эта настройка является неизменяемой. |
ScalarQuantizationCompression
Содержит параметры конфигурации, относящиеся к методу сжатия скалярной квантизации, используемому во время индексирования и запроса.
| Имя | Тип | Описание |
|---|---|---|
| kind |
string:
scalar |
Тип VectorSearchCompression. |
| name |
string |
Имя, сопоставленное с этой конкретной конфигурацией. |
| rescoringOptions |
Содержит параметры для перезаписи. |
|
| scalarQuantizationParameters |
Содержит параметры, относящиеся к скалярной квантизации. |
|
| truncationDimension |
integer (int32) |
Число измерений для усечения векторов. Усечение векторов уменьшает размер векторов и объем данных, которые необходимо передать во время поиска. Это позволяет сэкономить затраты на хранение и повысить производительность поиска за счет отзыва. Он должен использоваться только для внедрения обученных с помощью Matryoshka Representation Learning (MRL), таких как OpenAI text-embedding-3-large (small). Значение по умолчанию равно NULL, что означает отсутствие усечения. |
ScalarQuantizationParameters
Содержит параметры, относящиеся к скалярной квантизации.
| Имя | Тип | Описание |
|---|---|---|
| quantizedDataType |
Квантованный тип данных сжатых векторных значений. |
ScoringFunctionAggregation
Определяет функцию агрегирования, используемую для объединения результатов всех функций оценки в профиле оценки.
| Значение | Описание |
|---|---|
| sum |
Увеличьте баллы по сумме всех результатов функции оценки. |
| average |
Увеличьте баллы на среднее значение всех результатов функции оценки. |
| minimum |
Увеличьте баллы по минимуму всех результатов функции подсчета баллов. |
| maximum |
Увеличьте баллы по максимальному количеству всех результатов функции подсчета баллов. |
| firstMatching |
Увеличьте счет с помощью первой применимой функции подсчета очков в профиле подсчета очков. |
| product |
Увеличьте баллы на произведение всех результатов функции оценки. |
ScoringFunctionInterpolation
Определяет функцию, используемую для интерполяции повышения балла по ряду документов.
| Значение | Описание |
|---|---|
| linear |
Увеличивает количество очков на линейно уменьшающуюся величину. Это интерполяция по умолчанию для функций оценки. |
| constant |
Увеличивает очки на постоянный коэффициент. |
| quadratic |
Увеличивает количество очков на величину, которая уменьшается квадратически. Ускорения уменьшаются медленно при увеличении очков и быстрее при уменьшении очков. Этот параметр интерполяции не допускается в функциях оценки тегов. |
| logarithmic |
Увеличивает количество очков на величину, которая уменьшается логарифмически Ускорения быстро уменьшаются при увеличении количества очков и медленнее при уменьшении очков. Этот параметр интерполяции не допускается в функциях оценки тегов. |
ScoringProfile
Определяет параметры индекса поиска, влияющего на оценку в поисковых запросах.
| Имя | Тип | Описание |
|---|---|---|
| functionAggregation |
Значение, указывающее, как должны быть объединены результаты отдельных функций оценки. По умолчанию "Сумма". Игнорируется, если нет функций подсчета очков. |
|
| functions | ScoringFunction[]: |
Набор функций, влияющих на оценку документов. |
| name |
string |
Имя профиля скоринга. |
| text |
Параметры, повышающие оценку на основе совпадений текста в определенных полях индекса. |
SearchField
Представляет поле в определении индекса, описывающее имя, тип данных и поведение поиска поля.
| Имя | Тип | Описание |
|---|---|---|
| analyzer |
Имя анализатора, используемого для поля. Этот параметр можно использовать только с полями, доступными для поиска, и его нельзя задать вместе с searchAnalyzer или indexAnalyzer. После выбора анализатора его нельзя изменить для поля. Должно быть null для сложных полей. |
|
| dimensions |
integer (int32) minimum: 2maximum: 4096 |
Размерность поля вектора. |
| facetable |
boolean |
Значение, указывающее, следует ли указывать поле в запросах аспектов. Обычно используется в презентации результатов поиска, включающих количество результатов по категориям (например, поиск цифровых камер с просмотром результатов по бренду, мегапикселям, цене и т. д.). Это свойство должно иметь значение null для сложных полей. Поля типа Edm.GeographyPoint или Collection(Edm.GeographyPoint) не могут быть аспектируемыми. Значение по умолчанию справедливо для всех остальных простых полей. |
| fields |
Список подполей, если это поле типа Edm.ComplexType или Collection(Edm.ComplexType). Должно быть null или empty для простых полей. |
|
| filterable |
boolean |
Значение, указывающее, следует ли указывать поле в $filter запросах. Фильтрация отличается от способа обработки строк поиска. Поля типа Edm.String или Collection(Edm.String), которые можно фильтровать, не проходят разбиение слов, поэтому сравнения предназначены только для точных совпадений. Например, если задать такое поле f на "солнечный день", $filter=fq "солнечный" не будет найти совпадений, но $filter=fq "солнечный день". Это свойство должно иметь значение null для сложных полей. Значение по умолчанию равно true для простых полей и null для сложных полей. |
| indexAnalyzer |
Имя анализатора, используемого во время индексирования поля. Этот параметр можно использовать только с полями, доступными для поиска. Он должен быть установлен вместе с searchAnalyzer, и его нельзя задать вместе с параметром анализатора. Это свойство нельзя задать для имени анализатора языка; используйте свойство анализатора вместо этого, если вам нужен анализатор языка. После выбора анализатора его нельзя изменить для поля. Должно быть null для сложных полей. |
|
| key |
boolean |
Значение, указывающее, однозначно ли поле идентифицирует документы в индексе. В качестве ключевого поля необходимо выбрать ровно одно поле верхнего уровня в каждом индексе, и оно должно иметь тип Edm.String. Ключевые поля можно использовать для поиска документов напрямую и обновления или удаления определенных документов. Значение по умолчанию равно false для простых полей и null для сложных полей. |
| name |
string |
Имя поля, которое должно быть уникальным в коллекции полей индекса или родительского поля. |
| normalizer |
Имя нормализатора, используемого для поля. Эту опцию можно использовать только с полями с включенными фильтруемыми, сортируемыми или фасетными таблицами. После выбора нормализатора его нельзя изменить для поля. Должно быть null для сложных полей. |
|
| retrievable |
boolean |
Значение, указывающее, можно ли возвращать поле в результатах поиска. Этот параметр можно отключить, если вы хотите использовать поле (например, поле) в качестве фильтра, сортировки или механизма оценки, но не хотите, чтобы поле отображалось для конечного пользователя. Это свойство должно иметь значение true для ключевых полей, а для сложных полей оно должно быть равно null. Это свойство можно изменить в существующих полях. Включение этого свойства не приводит к увеличению требований к хранилищу индексов. Значение по умолчанию — true для простых полей, false — для векторных полей и null — для сложных полей. |
| searchAnalyzer |
Имя анализатора, используемого во время поиска поля. Этот параметр можно использовать только с полями, доступными для поиска. Он должен быть установлен вместе с indexAnalyzer и не может быть установлен вместе с опцией analyzer. Это свойство нельзя задать для имени анализатора языка; используйте свойство анализатора вместо этого, если вам нужен анализатор языка. Этот анализатор можно обновить в существующем поле. Должно быть null для сложных полей. |
|
| searchable |
boolean |
Значение, указывающее, доступно ли поле для полнотекстового поиска. Это означает, что он будет проходить анализ, например критические слова во время индексирования. Если вы устанавливаете для поиска значение, например "солнечный день", внутренне оно будет разделено на отдельные токены "солнечный" и "день". Это позволяет этим словам участвовать в полнотекстовом поиске. Поля типа Edm.String или Collection(Edm.String) доступны для поиска по умолчанию. Это свойство должно быть равно false для простых полей других нестроковых типов данных, а для сложных полей оно должно быть равно null. Примечание. Поля, доступные для поиска, используют дополнительное пространство в индексе для размещения дополнительных маркеризованных версий значения поля для полнотекстового поиска. Если вы хотите сэкономить место в индексе и не требуется, чтобы поле было включено в поиск, задайте для поиска значение false. |
| sortable |
boolean |
Значение, указывающее, следует ли ссылаться на поле в выражениях $orderby. По умолчанию поисковая система сортирует результаты по оценке, но во многих интерфейсах пользователи хотят отсортировать поля в документах. Простое поле может быть сортировано только в том случае, если оно имеет одно значение в области родительского документа. Простые поля коллекции не могут быть сортируемыми, так как они имеют многозначное значение. Простые вложенные поля сложных коллекций также являются многозначными и поэтому не могут быть сортируемыми. Это верно как для прямого родительского поля, так и для поля предка, если это сложная коллекция. Сложные поля не могут быть сортируемыми, и свойство sortable должно иметь значение null для таких полей. Значение по умолчанию для sortable — true для простых полей с однозначным значением, false для простых полей с несколькими значениями и null для сложных полей. |
| stored |
boolean |
Неизменяемое значение, указывающее, будет ли поле сохраняться отдельно на диске, возвращаемое в результатах поиска. Этот параметр можно отключить, если вы не планируете возвращать содержимое поля в ответе поиска, чтобы сэкономить на затратах на хранение. Это можно задать только во время создания индекса и только для полей векторов. Это свойство нельзя изменить для существующих полей или задать значение false для новых полей. Если для этого свойства задано значение false, свойство retrievable также должно быть установлено в значение false. Это свойство должно быть true или не задано для ключевых полей, для новых полей, а также для полей, не являющихся векторными, и оно должно иметь значение NULL для сложных полей. Отключение этого свойства приведет к снижению требований к хранилищу индексов. Значение по умолчанию имеет значение true для полей векторов. |
| synonymMaps |
string[] |
Список названий карт синонимов, которые можно связать с этим полем. Этот параметр можно использовать только с полями, доступными для поиска. В настоящее время поддерживается только одна карта синонимов на поле. Назначение карты синонимов полю гарантирует, что условия запроса, предназначенные для этого поля, расширяются при выполнении запроса с использованием правил из словаря синонимов. Этот атрибут можно изменить в существующих полях. Должен быть null или пустой коллекцией для сложных полей. |
| type |
Тип данных поля. |
|
| vectorEncoding |
Формат кодирования для интерпретации содержимого поля. |
|
| vectorSearchProfile |
string |
Имя профиля векторного поиска, указывающего алгоритм и векторизатор для использования при поиске поля вектора. |
SearchFieldDataType
Определяет тип данных поля в индексе поиска.
| Значение | Описание |
|---|---|
| Edm.String |
Указывает, что поле содержит строку. |
| Edm.Int32 |
Указывает, что поле содержит 32-разрядное целое число со знаком. |
| Edm.Int64 |
Указывает, что поле содержит 64-разрядное целое число со знаком. |
| Edm.Double |
Указывает, что поле содержит число с плавающей запятой с двойной точностью IEEE. |
| Edm.Boolean |
Указывает, что поле содержит логическое значение (true или false). |
| Edm.DateTimeOffset |
Указывает, что поле содержит значение даты и времени, включая сведения о часовом поясе. |
| Edm.GeographyPoint |
Указывает, что поле содержит географическое расположение с точки зрения долготы и широты. |
| Edm.ComplexType |
Указывает, что поле содержит один или несколько сложных объектов, которые, в свою очередь, имеют под поля других типов. |
| Edm.Single |
Указывает, что поле содержит число с плавающей запятой с одной точностью. Это допустимо только при использовании с collection(Edm.Single). |
| Edm.Half |
Указывает, что поле содержит число с плавающей запятой половины точности. Это допустимо только при использовании с коллекцией (Edm.Half). |
| Edm.Int16 |
Указывает, что поле содержит 16-разрядное целое число со знаком. Это допустимо только при использовании с collection(Edm.Int16). |
| Edm.SByte |
Указывает, что поле содержит 8-разрядное целое число со знаком. Это допустимо только при использовании с Collection(Edm.SByte). |
| Edm.Byte |
Указывает, что поле содержит 8-разрядное целое число без знака. Это допустимо только при использовании с collection(Edm.Byte). |
SearchIndex
Представляет определение индекса поиска, описывающее поля и поведение поиска индекса.
| Имя | Тип | Описание |
|---|---|---|
| @odata.etag |
string |
ETag индекса. |
| analyzers | LexicalAnalyzer[]: |
Анализаторы индекса. |
| charFilters | CharFilter[]: |
Фильтры символов для индекса. |
| corsOptions |
Параметры управления общим доступом к ресурсам между источниками (CORS) для индекса. |
|
| defaultScoringProfile |
string |
Имя профиля оценки, используемого, если ни один из них не указан в запросе. Если это свойство не задано, а профиль оценки не указан в запросе, будет использоваться оценка по умолчанию (tf-idf). |
| description |
string |
Описание индекса. |
| encryptionKey |
Описание ключа шифрования, созданного в Azure Key Vault. Этот ключ используется для дополнительного уровня шифрования в состоянии покоя для ваших данных, когда вы хотите быть полностью уверены, что никто, даже Microsoft, не сможет расшифровать ваши данные. После шифрования данных он всегда будет оставаться зашифрованным. Служба поиска будет игнорировать попытки установить для этого свойства значение null. Это свойство можно изменить по мере необходимости, если вы хотите повернуть ключ шифрования; Ваши данные не будут затронуты. Шифрование с помощью ключей, управляемых клиентом, недоступно для бесплатных служб поиска и доступно только для платных служб, созданных 1 января 2019 г. |
|
| fields |
Поля индекса. |
|
| name |
string |
Имя индекса. |
| normalizers | LexicalNormalizer[]: |
Нормализаторы индекса. |
| scoringProfiles |
Профили оценки для индекса. |
|
| semantic |
Определяет параметры индекса поиска, влияющего на семантические возможности. |
|
| similarity | SimilarityAlgorithm: |
Тип алгоритма сходства, используемый при оценке и ранжировании документов, соответствующих поисковому запросу. Алгоритм сходства может быть определен только во время создания индекса и не может быть изменен на существующих индексах. Если значение NULL, используется алгоритм ClassicSimilarity. |
| suggesters |
Предложения для индекса. |
|
| tokenFilters |
TokenFilter[]:
|
Маркер фильтрует индекс. |
| tokenizers | LexicalTokenizer[]: |
Маркеризаторы индекса. |
| vectorSearch |
Содержит параметры конфигурации, связанные с векторным поиском. |
SearchIndexerDataNoneIdentity
Очищает свойство удостоверения источника данных.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Фрагмент URI, указывающий тип удостоверения. |
SearchIndexerDataUserAssignedIdentity
Указывает удостоверение для используемого источника данных.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Фрагмент URI, указывающий тип удостоверения. |
| userAssignedIdentity |
string |
Полный идентификатор ресурса Azure назначаемого пользователем управляемого удостоверения обычно в форме "/subscriptions/12345678-1234-1234-1234-1234567890ab/resourceGroups/rg/providers/Microsoft.ManagedIdentity/userAssignedIdentities/myId", который должен быть назначен службе поиска. |
SearchResourceEncryptionKey
Ключ шифрования, управляемый клиентом, в Azure Key Vault. Ключи, которые вы создаете и которыми управляете, можно использовать для шифрования или расшифровки хранимых данных, таких как индексы и сопоставления синонимов.
| Имя | Тип | Описание |
|---|---|---|
| accessCredentials.applicationId |
string |
Идентификатор приложения AAD, которому было предоставлено необходимые разрешения на доступ к Azure Key Vault, который будет использоваться при шифровании неактивных данных. Идентификатор приложения не следует путать с идентификатором объекта для приложения AAD. |
| accessCredentials.applicationSecret |
string |
Ключ проверки подлинности указанного приложения AAD. |
| identity | SearchIndexerDataIdentity: |
Явное управляемое удостоверение, используемое для этого ключа шифрования. Если не указано, а свойство учетных данных доступа равно NULL, используется управляемое удостоверение, назначаемое системой. При обновлении ресурса, если явное удостоверение не указано, оно остается неизменным. Если задано значение none, то значение этого свойства очищается. |
| keyVaultKeyName |
string |
Имя ключа Azure Key Vault, используемого для шифрования неактивных данных. |
| keyVaultKeyVersion |
string |
Версия ключа Azure Key Vault, используемая для шифрования неактивных данных. |
| keyVaultUri |
string |
Универсальный код ресурса (URI) Хранилища ключей Azure, который также называется DNS-именем, который содержит ключ, используемый для шифрования неактивных данных. Пример URI может быть |
SearchSuggester
Определяет, как API предложения должен применяться к группе полей в индексе.
| Имя | Тип | Описание |
|---|---|---|
| name |
string |
Имя автора предложения. |
| searchMode |
enum:
analyzing |
Значение, указывающее на возможности средства подбора. |
| sourceFields |
string[] |
Список имен полей, к которым применяется средство подбора. Каждое поле должно быть доступно для поиска. |
SemanticConfiguration
Определяет определенную конфигурацию, используемую в контексте семантических возможностей.
| Имя | Тип | Описание |
|---|---|---|
| name |
string |
Имя семантической конфигурации. |
| prioritizedFields |
Описание полей заголовка, содержимого и ключевых слов, используемых для семантического ранжирования, подписей, выделений и ответов. Необходимо задать по крайней мере один из трех вложенных свойств (titleField, приоритетыKeywordsFields и приоритетыContentFields). |
|
| rankingOrder |
Указывает тип оценки, который будет использоваться для сортировки результатов поиска. |
SemanticField
Поле, используемое в рамках семантической конфигурации.
| Имя | Тип | Описание |
|---|---|---|
| fieldName |
string |
Имя файла |
SemanticPrioritizedFields
Описывает поля заголовка, содержимого и ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделений и ответов.
| Имя | Тип | Описание |
|---|---|---|
| prioritizedContentFields |
Определяет поля содержимого, которые будут использоваться для семантического ранжирования, подписей, выделения и ответов. Для достижения наилучшего результата выбранные поля должны содержать текст в виде естественного языка. Порядок полей в массиве отражает их приоритет. Поля с более низким приоритетом могут быть усечены, если содержимое длинное. |
|
| prioritizedKeywordsFields |
Определяет поля ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделения и ответов. Для достижения наилучшего результата выбранные поля должны содержать список ключевых слов. Порядок полей в массиве отражает их приоритет. Поля с более низким приоритетом могут быть усечены, если содержимое длинное. |
|
| titleField |
Определяет поле заголовка, которое будет использоваться для семантического ранжирования, подписей, выделения и ответов. Если в индексе нет поля заголовка, оставьте его пустым. |
SemanticSearch
Определяет параметры индекса поиска, влияющего на семантические возможности.
| Имя | Тип | Описание |
|---|---|---|
| configurations |
Семантические конфигурации для индекса. |
|
| defaultConfiguration |
string |
Позволяет задать имя семантической конфигурации по умолчанию в индексе, что делает его необязательным для каждой передачи в качестве параметра запроса. |
ShingleTokenFilter
Создает сочетания токенов в виде одного токена. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| filterToken |
string |
_ |
Строка для вставки для каждой позиции, в которой нет маркера. По умолчанию используется символ подчеркивания ("_"). |
| maxShingleSize |
integer (int32) minimum: 2 |
2 |
Максимальный размер голени. Значение по умолчанию и минимальное значение — 2. |
| minShingleSize |
integer (int32) minimum: 2 |
2 |
Минимальный размер голени. Значение по умолчанию и минимальное значение — 2. Должно быть меньше значения maxShingleSize. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| outputUnigrams |
boolean |
True |
Значение, указывающее, будет ли выходной поток содержать входные маркеры (юниграммы), а также мешки. Значение по умолчанию: true. |
| outputUnigramsIfNoShingles |
boolean |
False |
Значение, указывающее, следует ли выводить юниграммы в те времена, когда не доступны мешки. Это свойство имеет приоритет, если outputUnigrams имеет значение false. По умолчанию — false. |
| tokenSeparator |
string |
Строка, используемая при присоединении смежных маркеров для формирования голени. По умолчанию используется одно пространство (" "). |
SnowballTokenFilter
Фильтр, который стебляет слова с помощью созданного сноубола стебля. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| language |
Используемый язык. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
SnowballTokenFilterLanguage
Язык, используемый для фильтра маркеров Snowball.
| Значение | Описание |
|---|---|
| armenian |
Выбирает токенизатор стемминга Lucene Snowball для армянского языка. |
| basque |
Выбирает маркеризатор стеблей Lucene Snowball для Basque. |
| catalan |
Выбирает токенизатор стемминга Lucene Snowball для каталанского языка. |
| danish |
Выбирает маркеризатор стемминга Lucene Snowball для датского языка. |
| dutch |
Выбирает маркеризатор стемминга Lucene Snowball для голландского языка. |
| english |
Выбирает маркеризатор стемминга Lucene Snowball для английского языка. |
| finnish |
Выбирает токенизатор стемминга Lucene Snowball для финского языка. |
| french |
Выбирает маркеризатор стемминга Lucene Snowball для французского языка. |
| german |
Выбирает маркеризатор стемминга Lucene Snowball для немецкого языка. |
| german2 |
Выбирает маркеризатор стемминга Lucene Snowball, использующий немецкий вариант алгоритма. |
| hungarian |
Выбирает маркеризатор стемминга Lucene Snowball для венгерского языка. |
| italian |
Выбирает токенизатор стемминга Lucene Snowball для итальянского языка. |
| kp |
Выбирает маркеризатор стемминга Lucene Snowball для голландского языка, использующий алгоритм Kraaij-Pohlmann стемминга. |
| lovins |
Выбирает маркеризатор стемминга Lucene Snowball для английского языка, использующий алгоритм выделения корней Lovins. |
| norwegian |
Выбирает маркеризатор стемминга Lucene Snowball для норвежского языка. |
| porter |
Выбирает маркеризатор стемминга Lucene Snowball для английского языка, использующий алгоритм выделения корней Портера. |
| portuguese |
Выбирает токенизатор стемминга Lucene Snowball для португальского языка. |
| romanian |
Выбирает токенизатор стеблей Lucene Snowball для румынского языка. |
| russian |
Выбирает стемминг-токенизатор Lucene Snowball для русского языка. |
| spanish |
Выбирает маркеризатор стемминга Lucene Snowball для испанского языка. |
| swedish |
Выбирает маркеризатор стемминга Lucene Snowball для шведского языка. |
| turkish |
Выбирает маркеризатор стемминга Lucene Snowball для турецкого языка. |
StemmerOverrideTokenFilter
Предоставляет возможность переопределить другие фильтры с использованием пользовательских фильтров на основе словаря. Все термины, связанные с словарем, будут помечены как ключевые слова, чтобы они не были стеблированы с помощью стволовых модулей вниз по цепочке. Следует разместить перед всеми стемминговыми фильтрами. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| rules |
string[] |
Список правил стека в следующем формате: "word => stem", например "run => run". |
StemmerTokenFilter
Фильтр для конкретного языка. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| language |
Используемый язык. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
StemmerTokenFilterLanguage
Язык, используемый для фильтра маркеров парадигматического модуля.
| Значение | Описание |
|---|---|
| arabic |
Выбирает маркеризатор выделения корней Lucene для арабского языка. |
| armenian |
Выбирает токенизатор выделения корней Lucene для армянского языка. |
| basque |
Выбирает разметчик корневых маркеров Lucene для баскского языка. |
| brazilian |
Выбирает токенизатор выделения корней Lucene для португальского языка (Бразилия). |
| bulgarian |
Выбирает токенизатор ценового стемминга для болгарского языка. |
| catalan |
Выбирает токенизатор выделения стволов Lucene для каталанского языка. |
| czech |
Выбирает токенизатор корневых токенов Lucene для чешского языка. |
| danish |
Выбирает разметчик корневых маркеров Lucene для датского языка. |
| dutch |
Выбирает разметчик выделения корней Lucene для голландского языка. |
| dutchKp |
Выбирает маркеризатор выделения корней Lucene для голландского языка, использующий алгоритм Kraaij-Pohlmann стемминга. |
| english |
Выбирает маркеризатор корневых маркеров Lucene для английского языка. |
| lightEnglish |
Выбирает маркеризатор выделения корней Lucene для английского языка, который выполняет выделение светлых стеммингов. |
| minimalEnglish |
Выбирает маркеризатор выделения корней Lucene для английского языка, который выполняет минимальное выделение корней. |
| possessiveEnglish |
Выбирает маркеризатор корневых слов Lucene для английского языка, который удаляет завершающие притяжательные падежи из слов. |
| porter2 |
Выбирает разметчик выделения корней Lucene для английского языка, использующий алгоритм стемминга Porter2. |
| lovins |
Выбирает маркеризатор корней Lucene для английского языка, использующий алгоритм выделения корней Lovins. |
| finnish |
Выбирает маркеризатор выделения корней Lucene для финского языка. |
| lightFinnish |
Выбирает токенизатор стемминга Lucene для финского языка, который выполняет светлый стемминг. |
| french |
Выбирает маркеризатор выделения корней Lucene для французского языка. |
| lightFrench |
Выбирает маркеризатор выделения корней Lucene для французского языка, который выполняет легкое выделение стеблей. |
| minimalFrench |
Выбирает разметчик выделения корней Lucene для французского языка, который выполняет минимальное выделение корней. |
| galician |
Выбирает маркеризатор корневых токенов Lucene для галисийского языка. |
| minimalGalician |
Выбирает разметчик стемминга Lucene для Galician, который выполняет минимальное стеммирование. |
| german |
Выбирает маркеризатор корневых маркеров Lucene для немецкого языка. |
| german2 |
Выбирает маркеризатор выделения корней Lucene, использующий немецкий вариант алгоритма. |
| lightGerman |
Выбирает маркеризатор выделения корней Lucene для немецкого языка, который выполняет легкое выделение корней. |
| minimalGerman |
Выбирает разметчик выделения корней Lucene для немецкого языка, который выполняет минимальное выделение корней. |
| greek |
Выбирает маркеризатор корней Lucene для греческого языка. |
| hindi |
Выбирает маркеризатор выделения корней Lucene для хинди. |
| hungarian |
Выбирает маркеризатор корневых маркеров Lucene для венгерского языка. |
| lightHungarian |
Выбирает токенизатор выделения стеблей Lucene для венгерского языка, который выполняет светлый стемминг. |
| indonesian |
Выбирает маркеризатор выделения корней Lucene для индонезийского языка. |
| irish |
Выбирает маркеризатор корневых маркеров Lucene для ирландского языка. |
| italian |
Выбирает токенизатор выделения корней Lucene для итальянского языка. |
| lightItalian |
Выбирает токенизатор Lucene для итальянского языка, который выполняет светлый стемминг. |
| sorani |
Выбирает маркеризатор корней Lucene для Sorani. |
| latvian |
Выбирает стемминг-токенизатор Lucene для латышского языка. |
| norwegian |
Выбирает токенизатор Lucene stemming для норвежского языка (BokmÃ¥l). |
| lightNorwegian |
Выбирает токенайзер Lucene stemming для норвежского (BokmÃ¥l), который выполняет лёгкое стемирование. |
| minimalNorwegian |
Выбирает токенайзер Lucene stemming для норвежского (BokmÃ¥l), который выполняет минимальное стемминг. |
| lightNynorsk |
Выбирает маркеризатор выделения корней Lucene для норвежского языка (Nynorsk), который выполняет выделение светлых стеммингов. |
| minimalNynorsk |
Выбирает разметчик выделения корней Lucene для норвежского языка (Nynorsk), который выполняет минимальное выделение корней. |
| portuguese |
Выбирает маркеризатор выделения корней Lucene для португальского языка. |
| lightPortuguese |
Выбирает маркеризатор выделения корней Lucene для португальского языка, который выполняет светлый стемминг. |
| minimalPortuguese |
Выбирает токенизатор выделения корней Lucene для португальского языка, который выполняет минимальное выделение корней. |
| portugueseRslp |
Выбирает разметчик выделения корней Lucene для португальского языка, использующий алгоритм выделения корней RSLP. |
| romanian |
Выбирает токенизатор выделения корней Lucene для румынского языка. |
| russian |
Выбирает стемминг-токенизатор Lucene для русского языка. |
| lightRussian |
Выбирает токенизатор ценового стемминга для русского языка, который выполняет светлый стемминг. |
| spanish |
Выбирает разметчик выделения корней Lucene для испанского языка. |
| lightSpanish |
Выбирает маркеризатор стемминга Lucene для испанского языка, который выполняет светлый стемминг. |
| swedish |
Выбирает разметчик корневых маркеров Lucene для шведского языка. |
| lightSwedish |
Выбирает разметчик выделения стемминга Lucene для шведского языка, который выполняет светлый стемминг. |
| turkish |
Выбирает маркеризатор корневых токенов Lucene для турецкого языка. |
StopAnalyzer
Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. Этот анализатор реализуется с помощью Apache Lucene.
| Имя | Тип | Описание |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
| name |
string |
Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
| stopwords |
string[] |
Список стоп-слов. |
StopwordsList
Определяет предопределенный список стоп-слов для конкретного языка.
| Значение | Описание |
|---|---|
| arabic |
Выбор списка стоп-слов для арабского языка. |
| armenian |
Выбор списка стоп-слов для армянского языка. |
| basque |
Выбирает список стоп-слов для баскского языка. |
| brazilian |
Выбор списка стоп-слов для португальского языка (Бразилия). |
| bulgarian |
Выбирает список стоп-слов для болгарского языка. |
| catalan |
Выбирает список стоп-слов для каталанского языка. |
| czech |
Выбор списка стоп-слов для чешского языка. |
| danish |
Выбор списка стоп-слов для датского языка. |
| dutch |
Выбор списка стоп-слов для голландского языка. |
| english |
Выбор списка стоп-слов для английского языка. |
| finnish |
Выбор списка стоп-слов для финского языка. |
| french |
Выбор списка стоп-слов для французского языка. |
| galician |
Выбирает список стоп-слов для галисийского языка. |
| german |
Выбор списка стоп-слов для немецкого языка. |
| greek |
Выбор списка стоп-слов для греческого языка. |
| hindi |
Выбор списка стоп-слов для хинди. |
| hungarian |
Выбирает список стоп-слов для венгерского языка. |
| indonesian |
Выбор списка стоп-слов для индонезийского языка. |
| irish |
Выбор списка стоп-слов для ирландского языка. |
| italian |
Выбор списка стоп-слов для итальянского языка. |
| latvian |
Выбирает список стоп-слов для латышского языка. |
| norwegian |
Выбор списка стоп-слов для норвежского языка. |
| persian |
Выбор списка стоп-слов для персидского языка. |
| portuguese |
Выбор списка стоп-слов для португальского языка. |
| romanian |
Выбирает список стоп-слов для румынского языка. |
| russian |
Выбирает список стоп-слов для русского языка. |
| sorani |
Выбор списка стоп-слов для Sorani. |
| spanish |
Выбор списка стоп-слов для испанского языка. |
| swedish |
Выбор списка стоп-слов для шведского языка. |
| thai |
Выбирает список стоп-слов для тайского языка. |
| turkish |
Выбирает список стоп-слов для турецкого языка. |
StopwordsTokenFilter
Удаляет стоп-слова из потока токенов. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| ignoreCase |
boolean |
False |
Значение, указывающее, следует ли игнорировать регистр. Если значение true, все слова преобразуются в нижний регистр. По умолчанию — false. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| removeTrailing |
boolean |
True |
Значение, указывающее, следует ли игнорировать последний поисковый термин, если это стоп-слово. Значение по умолчанию: true. |
| stopwords |
string[] |
Список стоп-слов. Это свойство и свойство списка стоп-слов не могут быть заданы. |
|
| stopwordsList | english |
Предопределенный список стоп-слов для использования. Это свойство и свойство stopwords не могут быть заданы. По умолчанию используется английский язык. |
SynonymTokenFilter
Соответствует синонимам одного или нескольких слов в потоке маркеров. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| expand |
boolean |
True |
Значение, указывающее, будут ли все слова в списке синонимов (если => нотация не используется) сопоставляться друг с другом. Если значение true, все слова в списке синонимов (если => нотация не используется) будут сопоставляться друг с другом. Следующий список: невероятный, невероятный, сказочный, удивительный эквивалент: невероятный, невероятный, сказочный, удивительный => невероятные, сказочные, удивительные, удивительные. Если ложь, следующий список: невероятный, невероятный, сказочный, удивительный будет эквивалентно: невероятным, невероятным, сказочным, удивительным => невероятным. Значение по умолчанию: true. |
| ignoreCase |
boolean |
False |
Значение, указывающее, следует ли регистрировать входные данные для сопоставления. По умолчанию — false. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| synonyms |
string[] |
Список синонимов в одном из двух форматов: 1. невероятные, невероятные, сказочные => удивительные - все термины слева от => символ будет заменен всеми условиями на правой стороне; 2. невероятный, невероятный, сказочный, удивительный - запятая разделил список эквивалентных слов. Установите параметр expand, чтобы изменить способ интерпретации этого списка. |
TagScoringFunction
Определяет функцию, которая повышает оценку документов со строковыми значениями, соответствующими заданному списку тегов.
| Имя | Тип | Описание |
|---|---|---|
| boost |
number (double) |
Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0. |
| fieldName |
string |
Имя поля, используемого в качестве входных данных для функции оценки. |
| interpolation |
Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear". |
|
| tag |
Значения параметров для функции оценки тегов. |
|
| type |
string:
tag |
Тип функции скоринга. |
TagScoringParameters
Предоставляет значения параметров функции оценки тегов.
| Имя | Тип | Описание |
|---|---|---|
| tagsParameter |
string |
Имя параметра, передаваемого в поисковых запросах для указания списка тегов для сравнения с целевым полем. |
TextWeights
Определяет весы в полях индекса, для которых совпадения должны повысить оценку в поисковых запросах.
| Имя | Тип | Описание |
|---|---|---|
| weights |
object |
Словарь весовых коэффициентов для каждого поля для повышения оценки документа. Ключи — это имена полей, а значения — веса для каждого поля. |
TokenCharacterKind
Представляет классы символов, над которыми может работать фильтр маркеров.
| Значение | Описание |
|---|---|
| letter |
Хранит буквы в токенах. |
| digit |
Хранит цифры в токенах. |
| whitespace |
Сохраняет пробелы в токенах. |
| punctuation |
Сохраняет знаки препинания в токенах. |
| symbol |
Хранит символы в токенах. |
TokenFilterName
Определяет имена всех фильтров токенов, поддерживаемых поисковой системой.
TruncateTokenFilter
Усечение терминов до определенной длины. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| length |
integer (int32) maximum: 300 |
300 |
Длина усечения терминов. Значение по умолчанию и максимальное значение — 300. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
UaxUrlEmailTokenizer
Разбивает URL-адреса и сообщения электронной почты на один токен. Этот токенизатор реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов. |
| name |
string |
Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
UniqueTokenFilter
Отфильтровывает маркеры с тем же текстом, что и в предыдущем маркере. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| onlyOnSamePosition |
boolean |
False |
Значение, указывающее, следует ли удалять дубликаты только в той же позиции. По умолчанию — false. |
VectorEncodingFormat
Формат кодировки для интерпретации содержимого векторных полей.
| Значение | Описание |
|---|---|
| packedBit |
Формат кодирования, представляющий биты, упакованные в более широкий тип данных. |
VectorSearch
Содержит параметры конфигурации, связанные с векторным поиском.
| Имя | Тип | Описание |
|---|---|---|
| algorithms | VectorSearchAlgorithmConfiguration[]: |
Содержит параметры конфигурации, относящиеся к алгоритму, используемому во время индексирования или запроса. |
| compressions | VectorSearchCompression[]: |
Содержит параметры конфигурации, относящиеся к методу сжатия, используемому во время индексирования или запроса. |
| profiles |
Определяет сочетания конфигураций для использования с векторным поиском. |
|
| vectorizers | VectorSearchVectorizer[]: |
Содержит параметры конфигурации по векторным запросам вектора текста. |
VectorSearchAlgorithmKind
Алгоритм, используемый для индексирования и запросов.
| Значение | Описание |
|---|---|
| hnsw |
HNSW (иерархический навигации small world), тип приблизительного ближайшего алгоритма соседей. |
| exhaustiveKnn |
Исчерпывающий алгоритм KNN, который будет выполнять поиск методом подбора. |
VectorSearchAlgorithmMetric
Метрика сходства, используемая для векторных сравнений. Рекомендуется выбрать ту же метрику подобия, на которой обучалась модель встраивания.
| Значение | Описание |
|---|---|
| cosine |
Измеряет угол между векторами, чтобы квалифицировать их сходство, игнорируя величину. Чем меньше угол, тем ближе сходство. |
| euclidean |
Вычисляет расстояние прямой линии между векторами в многомерном пространстве. Чем меньше расстояние, тем ближе сходство. |
| dotProduct |
Вычисляет сумму продуктов, мудрых элементами, чтобы оценить выравнивание и сходство величины. Чем больше, тем ближе сходство. |
| hamming |
Применимо только к типам двоичных данных с битовой упаковкой. Определяет непохожесть путем подсчета разных позиций в двоичных векторах. Чем меньше различий, тем ближе сходство. |
VectorSearchCompressionKind
Метод сжатия, используемый для индексирования и запросов.
| Значение | Описание |
|---|---|
| scalarQuantization |
Скалярная квантизация, тип метода сжатия. В скалярной квантизации исходные значения векторов сжимаются до более узкого типа путем дискретизации и представления каждого компонента вектора с помощью сокращенного набора квантизованных значений, тем самым уменьшая общий размер данных. |
| binaryQuantization |
Двоичная квантизация— тип метода сжатия. В двоичном квантизации исходные значения векторов сжимаются до более узкого двоичного типа путем дискретизации и представления каждого компонента вектора с использованием двоичных значений, тем самым уменьшая общий размер данных. |
VectorSearchCompressionTarget
Квантованный тип данных сжатых векторных значений.
| Значение | Описание |
|---|---|
| int8 |
8-разрядное целое число со знаком. |
VectorSearchProfile
Определяет сочетание конфигураций для использования с векторным поиском.
| Имя | Тип | Описание |
|---|---|---|
| algorithm |
string |
Имя конфигурации алгоритма векторного поиска, которая определяет алгоритм и необязательные параметры. |
| compression |
string |
Имя конфигурации метода сжатия, указывающей метод сжатия и необязательные параметры. |
| name |
string |
Имя, которое будет связано с этим конкретным профилем векторного поиска. |
| vectorizer |
string |
Имя векторизации, настраиваемой для использования с векторным поиском. |
VectorSearchVectorizerKind
Метод векторизации, который будет использоваться во время запроса.
| Значение | Описание |
|---|---|
| azureOpenAI |
Создайте внедрение с помощью ресурса Azure OpenAI во время запроса. |
| customWebApi |
Создание внедрения с помощью пользовательской веб-конечной точки во время запроса. |
| aiServicesVision |
Создайте внедрения для ввода изображения или текста во время запроса с помощью API векторизации визуального распознавания служб ИСКУССТВЕННОго интеллекта Azure. |
| aml |
Создавайте внедрения с помощью конечной точки Машинного обучения Azure, развернутой с помощью каталога моделей Azure AI Foundry во время запроса. |
WebApiVectorizer
Задает определяемый пользователем векторизатор для создания векторного внедрения строки запроса. Интеграция внешнего векторизатора достигается с помощью пользовательского интерфейса веб-API набора навыков.
| Имя | Тип | Описание |
|---|---|---|
| customWebApiParameters |
Задает свойства определяемого пользователем векторизатора. |
|
| kind |
string:
custom |
Тип VectorSearchVectorizer. |
| name |
string |
Имя, сопоставленное с этим конкретным методом векторизации. |
WebApiVectorizerParameters
Задает свойства для подключения к определяемой пользователем векторизаторе.
| Имя | Тип | Описание |
|---|---|---|
| authIdentity | SearchIndexerDataIdentity: |
Назначаемое пользователем управляемое удостоверение, используемое для исходящих подключений. Если указан идентификатор authResourceId и он не указан, используется управляемое удостоверение, назначаемое системой. При обновлении индексатора, если удостоверение не указано, значение остается неизменным. Если установлено значение "none", значение этого свойства очищается. |
| authResourceId |
string |
Применяется к пользовательским конечным точкам, которые подключаются к внешнему коду в функции Azure или другом приложении, предоставляющем трансформации. Это значение должно быть идентификатором приложения, созданным для функции или приложения при регистрации в Azure Active Directory. Если указано, векторизация подключается к функции или приложению с помощью управляемого идентификатора (системного или назначаемого пользователем) службы поиска и маркера доступа функции или приложения, используя это значение в качестве идентификатора ресурса для создания области маркера доступа. |
| httpHeaders |
object |
Заголовки, необходимые для выполнения HTTP-запроса. |
| httpMethod |
string |
Метод для HTTP-запроса. |
| timeout |
string (duration) |
Требуемое время ожидания запроса. Значение по умолчанию — 30 секунд. |
| uri |
string (uri) |
URI веб-API, предоставляющего векторизатор. |
WordDelimiterTokenFilter
Разделяет слова на подслова и выполняет необязательные преобразования в группах подслов. Этот фильтр маркеров реализуется с помощью Apache Lucene.
| Имя | Тип | Default value | Описание |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
Дискриминатор производных типов. |
|
| catenateAll |
boolean |
False |
Значение, указывающее, будут ли все части подсловных элементов катенироваться. Например, если задано значение true, "Azure-Search-1" становится "AzureSearch1". По умолчанию — false. |
| catenateNumbers |
boolean |
False |
Значение, указывающее, будет ли выполняться максимальное число частей. Например, если задано значение true, значение "1–2" становится "12". По умолчанию — false. |
| catenateWords |
boolean |
False |
Значение, указывающее, будет ли выполняться максимальное количество слов. Например, если для этого задано значение true, "Azure-Search" становится "AzureSearch". По умолчанию — false. |
| generateNumberParts |
boolean |
True |
Значение, указывающее, следует ли создавать подзадачки чисел. Значение по умолчанию: true. |
| generateWordParts |
boolean |
True |
Значение, указывающее, следует ли создавать слова частей. Если задано, создается часть слов; Например, AzureSearch становится "Azure" "Поиск". Значение по умолчанию: true. |
| name |
string |
Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами. |
|
| preserveOriginal |
boolean |
False |
Значение, указывающее, будут ли сохранены исходные слова и добавлены в список подслугов. По умолчанию — false. |
| protectedWords |
string[] |
Список маркеров для защиты от разделителя. |
|
| splitOnCaseChange |
boolean |
True |
Значение, указывающее, следует ли разделять слова на caseChange. Например, если задано значение true, AzureSearch становится "Azure" "Поиск". Значение по умолчанию: true. |
| splitOnNumerics |
boolean |
True |
Значение, указывающее, следует ли разделять числа. Например, если задано значение true, "Azure1Search" становится "Azure" "1" "Поиск". Значение по умолчанию: true. |
| stemEnglishPossessive |
boolean |
True |
Значение, указывающее, следует ли удалять конечные "s" для каждого подсловия. Значение по умолчанию: true. |