Indexes - Create Or Update

Создает новый индекс поиска или обновляет индекс, если он уже существует.

PUT {endpoint}/indexes('{indexName}')?api-version=2026-04-01
PUT {endpoint}/indexes('{indexName}')?api-version=2026-04-01&allowIndexDowntime={allowIndexDowntime}

Параметры URI

Имя В Обязательно Тип Описание
endpoint
path True

string (uri)

URL-адрес конечной точки службы поиска.

indexName
path True

string

Имя индекса.

api-version
query True

string

minLength: 1

Версия API, используемая для данной операции.

allowIndexDowntime
query

boolean

Позволяет добавлять новые анализаторы, маркеризаторы, фильтры маркеров или фильтры символов в индекс, принимая индекс в автономный режим по крайней мере через несколько секунд. Это временно приводит к сбою индексирования и запросов. Производительность и доступность индекса записи могут быть нарушены в течение нескольких минут после обновления индекса или длиннее для очень больших индексов.

Заголовок запроса

Имя Обязательно Тип Описание
Accept

Accept

Заголовок Accept.

If-Match

string

Определяет условие If-Match. Операция будет выполнена только в том случае, если ETag на сервере соответствует этому значению.

If-None-Match

string

Определяет условие If-None-Match. Операция будет выполнена только в том случае, если ETag на сервере не соответствует этому значению.

Prefer True

Prefer

Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении.

x-ms-client-request-id

string (uuid)

Непрозрачный, глобально уникальный, созданный клиентом идентификатор строки для запроса.

Текст запроса

Имя Обязательно Тип Описание
fields True

SearchField[]

Поля индекса.

name True

string

Имя индекса.

@odata.etag

string

ETag индекса.

analyzers LexicalAnalyzer[]:

Анализаторы индекса.

charFilters CharFilter[]:

Фильтры символов для индекса.

corsOptions

CorsOptions

Параметры управления общим доступом к ресурсам между источниками (CORS) для индекса.

defaultScoringProfile

string

Имя профиля оценки, используемого, если ни один из них не указан в запросе. Если это свойство не задано, а профиль оценки не указан в запросе, будет использоваться оценка по умолчанию (tf-idf).

description

string

Описание индекса.

encryptionKey

SearchResourceEncryptionKey

Описание ключа шифрования, созданного в Azure Key Vault. Этот ключ используется для дополнительного уровня шифрования в состоянии покоя для ваших данных, когда вы хотите быть полностью уверены, что никто, даже Microsoft, не сможет расшифровать ваши данные. После шифрования данных он всегда будет оставаться зашифрованным. Служба поиска будет игнорировать попытки установить для этого свойства значение null. Это свойство можно изменить по мере необходимости, если вы хотите повернуть ключ шифрования; Ваши данные не будут затронуты. Шифрование с помощью ключей, управляемых клиентом, недоступно для бесплатных служб поиска и доступно только для платных служб, созданных 1 января 2019 г.

normalizers LexicalNormalizer[]:

CustomNormalizer[]

Нормализаторы индекса.

scoringProfiles

ScoringProfile[]

Профили оценки для индекса.

semantic

SemanticSearch

Определяет параметры индекса поиска, влияющего на семантические возможности.

similarity SimilarityAlgorithm:

Тип алгоритма сходства, используемый при оценке и ранжировании документов, соответствующих поисковому запросу. Алгоритм сходства может быть определен только во время создания индекса и не может быть изменен на существующих индексах. Если значение NULL, используется алгоритм ClassicSimilarity.

suggesters

SearchSuggester[]

Предложения для индекса.

tokenFilters TokenFilter[]:

Маркер фильтрует индекс.

tokenizers LexicalTokenizer[]:

Маркеризаторы индекса.

vectorSearch

VectorSearch

Содержит параметры конфигурации, связанные с векторным поиском.

Ответы

Имя Тип Описание
200 OK

SearchIndex

Запрос выполнен успешно.

201 Created

SearchIndex

Запрос успешно выполнен, и в результате был создан новый ресурс.

Other Status Codes

ErrorResponse

Непредвиденное сообщение об ошибке.

Безопасность

api-key

Тип: apiKey
В: header

OAuth2Auth

Тип: oauth2
Flow: implicit
URL-адрес авторизации: https://login.microsoftonline.com/common/oauth2/v2.0/authorize

Области

Имя Описание
https://search.azure.com/.default

Примеры

SearchServiceCreateOrUpdateIndex

Образец запроса

PUT https://exampleservice.search.windows.net/indexes('temp-example-index')?api-version=2026-04-01&allowIndexDowntime=





{
  "name": "temp-example-index",
  "description": "description",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "key": true,
      "sortable": true
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 20,
      "vectorSearchProfile": "config1"
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 32,
      "vectorSearchProfile": "config4"
    },
    {
      "name": "name",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "description",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "standard.lucene"
    },
    {
      "name": "category",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "retrievable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "tag": {
            "tagsParameter": "categoryTag"
          },
          "type": "tag",
          "fieldName": "category",
          "boost": 2
        }
      ]
    }
  ],
  "defaultScoringProfile": "stringFieldBoost",
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer"
    }
  ],
  "tokenizers": [
    {
      "maxTokenLength": 100,
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer"
    }
  ],
  "tokenFilters": [
    {
      "preserveOriginal": false,
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter"
    }
  ],
  "charFilters": [
    {
      "mappings": [
        ".=>,",
        "_=>-"
      ],
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping"
    }
  ],
  "normalizers": [
    {
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer"
    }
  ],
  "similarity": {
    "k1": 10,
    "b": 0.1,
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity"
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        },
        "rankingOrder": "BoostedRerankerScore"
      }
    ]
  },
  "vectorSearch": {
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "algorithms": [
      {
        "hnswParameters": {
          "metric": "cosine"
        },
        "name": "cosine",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "euclidean"
        },
        "name": "euclidean",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "dotProduct"
        },
        "name": "dotProduct",
        "kind": "hnsw"
      }
    ],
    "vectorizers": [
      {
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com/",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        },
        "name": "openai",
        "kind": "azureOpenAI"
      },
      {
        "customWebApiParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "httpMethod": "POST",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        },
        "name": "custom-web-api",
        "kind": "customWebApi"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        },
        "name": "aml",
        "kind": "aml"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "Cohere-embed-v4"
        },
        "name": "aml-cohere",
        "kind": "aml"
      }
    ],
    "compressions": [
      {
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        },
        "truncationDimension": 2
      }
    ]
  },
  "@odata.etag": "0x1234568AE7E58A1"
}

Пример ответа

{
  "name": "temp-example-index",
  "description": "description",
  "defaultScoringProfile": "stringFieldBoost",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": true,
      "synonymMaps": []
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 20,
      "vectorSearchProfile": "config1",
      "synonymMaps": []
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 32,
      "vectorSearchProfile": "config4",
      "synonymMaps": []
    },
    {
      "name": "name",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "description",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "standard.lucene",
      "synonymMaps": []
    },
    {
      "name": "category",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "searchable": false,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "synonymMaps": []
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "functionAggregation": "sum",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "fieldName": "category",
          "interpolation": "linear",
          "type": "tag",
          "boost": 2,
          "tag": {
            "tagsParameter": "categoryTag"
          }
        }
      ]
    }
  ],
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer",
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ]
    }
  ],
  "normalizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer",
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ]
    }
  ],
  "tokenizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer",
      "maxTokenLength": 100
    }
  ],
  "tokenFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter",
      "preserveOriginal": false
    }
  ],
  "charFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping",
      "mappings": [
        ".=>,",
        "_=>-"
      ]
    }
  ],
  "similarity": {
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
    "k1": 10,
    "b": 0.1
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "rankingOrder": "BoostedRerankerScore",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        }
      }
    ]
  },
  "vectorSearch": {
    "algorithms": [
      {
        "name": "cosine",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "cosine",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "euclidean",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "euclidean",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "dotProduct",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "dotProduct",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      }
    ],
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "vectorizers": [
      {
        "name": "openai",
        "kind": "azureOpenAI",
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        }
      },
      {
        "name": "custom-web-api",
        "kind": "customWebApi",
        "customWebApiParameters": {
          "httpMethod": "POST",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        }
      },
      {
        "name": "aml",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        }
      },
      {
        "name": "aml-cohere",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "Cohere-embed-v4"
        }
      }
    ],
    "compressions": [
      {
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "truncationDimension": 2,
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        }
      }
    ]
  }
}
{
  "name": "temp-example-index",
  "description": "description",
  "defaultScoringProfile": "stringFieldBoost",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": true,
      "synonymMaps": []
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 20,
      "vectorSearchProfile": "config1",
      "synonymMaps": []
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 32,
      "vectorSearchProfile": "config4",
      "synonymMaps": []
    },
    {
      "name": "name",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "description",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "standard.lucene",
      "synonymMaps": []
    },
    {
      "name": "category",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "searchable": false,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "synonymMaps": []
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "functionAggregation": "sum",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "fieldName": "category",
          "interpolation": "linear",
          "type": "tag",
          "boost": 2,
          "tag": {
            "tagsParameter": "categoryTag"
          }
        }
      ]
    }
  ],
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer",
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ]
    }
  ],
  "normalizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer",
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ]
    }
  ],
  "tokenizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer",
      "maxTokenLength": 100
    }
  ],
  "tokenFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter",
      "preserveOriginal": false
    }
  ],
  "charFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping",
      "mappings": [
        ".=>,",
        "_=>-"
      ]
    }
  ],
  "similarity": {
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
    "k1": 10,
    "b": 0.1
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "rankingOrder": "BoostedRerankerScore",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        }
      }
    ]
  },
  "vectorSearch": {
    "algorithms": [
      {
        "name": "cosine",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "cosine",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "euclidean",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "euclidean",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "dotProduct",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "dotProduct",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      }
    ],
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "vectorizers": [
      {
        "name": "openai",
        "kind": "azureOpenAI",
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        }
      },
      {
        "name": "custom-web-api",
        "kind": "customWebApi",
        "customWebApiParameters": {
          "httpMethod": "POST",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        }
      },
      {
        "name": "aml",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        }
      },
      {
        "name": "aml-cohere",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "Cohere-embed-v4"
        }
      }
    ],
    "compressions": [
      {
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "truncationDimension": 2,
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        }
      }
    ]
  }
}

Определения

Имя Описание
Accept

Заголовок Accept.

AIFoundryModelCatalogName

Название модели вложения из каталога Azure AI Foundry, который будет называться.

AMLParameters

Задает свойства для подключения к векторизатору AML.

AMLVectorizer

Задаёт Машинное обучение Azure endpoint, развернутый через Azure AI Foundry Model Catalog для генерации векторного вложения строки запроса.

AsciiFoldingTokenFilter

Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. Этот фильтр маркеров реализуется с помощью Apache Lucene.

AzureOpenAIModelName

Имя модели Azure Open AI, которое будет вызываться.

AzureOpenAIVectorizer

Указывает ресурс Azure OpenAI, используемый для векторизации строки запроса.

AzureOpenAIVectorizerParameters

Задает параметры для подключения к ресурсу Azure OpenAI.

BinaryQuantizationCompression

Содержит параметры конфигурации, относящиеся к методу сжатия двоичной квантизации, используемому во время индексирования и запроса.

BM25SimilarityAlgorithm

Функция ранжирования на основе алгоритма сходства Okapi BM25. BM25 — это алгоритм TF-IDF, включающий нормализацию длины (контролируемый параметром B), а также насыщенность терминов (контролируемый параметром k1).

CharFilterName

Определяет имена всех фильтров символов, поддерживаемых поисковой системой.

CjkBigramTokenFilter

Формирует большие кадры терминов CJK, созданных из стандартного токенизатора. Этот фильтр маркеров реализуется с помощью Apache Lucene.

CjkBigramTokenFilterScripts

Скрипты, которые могут быть проигнорированы CjkBigramTokenFilter.

ClassicSimilarityAlgorithm

Устаревший алгоритм сходства, использующий реализацию TF-IDF Lucene TFIDFSimilarity. Этот вариант TF-IDF представляет нормализацию статического длины документа, а также координирующие факторы, которые наказывают документы, которые частично соответствуют поисковым запросам.

ClassicTokenizer

Токенизатор на основе грамматики, подходящий для обработки большинства европейских языковых документов. Этот токенизатор реализуется с помощью Apache Lucene.

CommonGramTokenFilter

Создает биграммы для часто встречающихся терминов при индексировании. Отдельные термины также индексируются с наложением биграмм. Этот фильтр маркеров реализуется с помощью Apache Lucene.

CorsOptions

Определяет параметры управления общим доступом к ресурсам между источниками (CORS) для индекса.

CustomAnalyzer

Позволяет контролировать процесс преобразования текста в индексируемые и поисковые маркеры. Это определяемая пользователем конфигурация, состоящая из одного предопределенного токенизатора и одного или нескольких фильтров. Маркеризатор отвечает за разбиение текста в маркеры и фильтры для изменения маркеров, создаваемых токенизатором.

CustomNormalizer

Позволяет настроить нормализацию для полей с возможностью фильтрации, сортировки и фасетной таблицы, которые по умолчанию работают со строгим сопоставлением. Это определяемая пользователем конфигурация, состоящая по крайней мере из одного или нескольких фильтров, которые изменяют сохраненный маркер.

DictionaryDecompounderTokenFilter

Разбивает составные слова, распространенные во многих германских языках. Этот фильтр маркеров реализуется с помощью Apache Lucene.

DistanceScoringFunction

Определяет функцию, которая повышает оценки на основе расстояния от географического расположения.

DistanceScoringParameters

Предоставляет значения параметров функции оценки расстояния.

EdgeNGramTokenFilter

Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

EdgeNGramTokenFilterSide

Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма.

EdgeNGramTokenFilterV2

Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

EdgeNGramTokenizer

Маркеризирует входные данные из края в n-граммы заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.

ElisionTokenFilter

Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). Этот фильтр маркеров реализуется с помощью Apache Lucene.

ErrorAdditionalInfo

Дополнительные сведения об ошибке управления ресурсами.

ErrorDetail

Сведения об ошибке.

ErrorResponse

Распространенный ответ об ошибке для всех API Azure Resource Manager для возврата сведений об ошибке для неудачных операций. (Это также следует формату ответа об ошибках OData.).

ExhaustiveKnnAlgorithmConfiguration

Содержит параметры конфигурации, относящиеся к исчерпывающим алгоритму KNN, используемому во время запроса, который будет выполнять поиск методом подбора по всему векторному индексу.

ExhaustiveKnnParameters

Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN.

FreshnessScoringFunction

Определяет функцию, которая повышает оценки на основе значения поля даты и времени.

FreshnessScoringParameters

Предоставляет значения параметров функции оценки свежести.

HnswAlgorithmConfiguration

Содержит параметры конфигурации, специфичные для алгоритма приближенных ближайших соседей HNSW, используемого во время индексирования и запросов. Алгоритм HNSW предлагает настраиваемый компромисс между скоростью и точностью поиска.

HnswParameters

Содержит параметры, специфичные для алгоритма HNSW.

KeepTokenFilter

Фильтр маркеров, который сохраняет только маркеры с текстом, содержащимся в указанном списке слов. Этот фильтр маркеров реализуется с помощью Apache Lucene.

KeywordMarkerTokenFilter

Помечает термины как ключевые слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.

KeywordTokenizer

Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.

KeywordTokenizerV2

Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.

LengthTokenFilter

Удаляет слишком длинные или слишком короткие слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.

LexicalAnalyzerName

Определяет имена всех текстовых анализаторов, поддерживаемых поисковой системой.

LexicalNormalizerName

Определяет имена всех нормализаторов текста, поддерживаемых поисковой системой.

LexicalTokenizerName

Определяет имена всех токенизаторов, поддерживаемых поисковой системой.

LimitTokenFilter

Ограничивает количество маркеров при индексировании. Этот фильтр маркеров реализуется с помощью Apache Lucene.

LuceneStandardAnalyzer

Стандартный анализатор Apache Lucene; Состоит из стандартного токенизатора, нижнего регистра фильтра и фильтра остановки.

LuceneStandardTokenizer

Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.

LuceneStandardTokenizerV2

Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.

MagnitudeScoringFunction

Определяет функцию, которая повышает оценки на основе величины числового поля.

MagnitudeScoringParameters

Предоставляет значения параметров функции оценки величины.

MappingCharFilter

Фильтр символов, который применяет сопоставления, определенные с параметром сопоставления. Сопоставление является жадным (самое длинное сопоставление шаблона в заданной точке выигрывает). Замена может быть пустой строкой. Этот фильтр символов реализуется с помощью Apache Lucene.

MicrosoftLanguageStemmingTokenizer

Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам.

MicrosoftLanguageTokenizer

Разбивает текст на основе правил определенного языка.

MicrosoftStemmingTokenizerLanguage

Перечисляется языки, поддерживаемые токенайзером языка Microsoft для стемминга.

MicrosoftTokenizerLanguage

Перечисляется языки, поддерживаемые токенайзером языка Microsoft.

NGramTokenFilter

Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

NGramTokenFilterV2

Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

NGramTokenizer

Маркеризирует входные данные в n-граммах заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.

PathHierarchyTokenizerV2

Токенизатор для путьоподобных иерархий. Этот токенизатор реализуется с помощью Apache Lucene.

PatternAnalyzer

Гибко разделяет текст на термины с помощью шаблона регулярного выражения. Этот анализатор реализуется с помощью Apache Lucene.

PatternCaptureTokenFilter

Использует регрессии Java для выдачи нескольких маркеров — по одному для каждой группы захвата в одном или нескольких шаблонах. Этот фильтр маркеров реализуется с помощью Apache Lucene.

PatternReplaceCharFilter

Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр символов реализуется с помощью Apache Lucene.

PatternReplaceTokenFilter

Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр маркеров реализуется с помощью Apache Lucene.

PatternTokenizer

Токенизатор, использующий сопоставление шаблонов regex для создания уникальных маркеров. Этот токенизатор реализуется с помощью Apache Lucene.

PhoneticEncoder

Определяет тип фонетического кодировщика, используемого с PhoneticTokenFilter.

PhoneticTokenFilter

Создайте маркеры для фонетических совпадений. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Prefer

Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении.

RankingOrder

Представляет оценку, используемую для сортировки документов.

RescoringOptions

Содержит параметры для перезаписи.

ScalarQuantizationCompression

Содержит параметры конфигурации, относящиеся к методу сжатия скалярной квантизации, используемому во время индексирования и запроса.

ScalarQuantizationParameters

Содержит параметры, относящиеся к скалярной квантизации.

ScoringFunctionAggregation

Определяет функцию агрегирования, используемую для объединения результатов всех функций оценки в профиле оценки.

ScoringFunctionInterpolation

Определяет функцию, используемую для интерполяции повышения балла по ряду документов.

ScoringProfile

Определяет параметры индекса поиска, влияющего на оценку в поисковых запросах.

SearchField

Представляет поле в определении индекса, описывающее имя, тип данных и поведение поиска поля.

SearchFieldDataType

Определяет тип данных поля в индексе поиска.

SearchIndex

Представляет определение индекса поиска, описывающее поля и поведение поиска индекса.

SearchIndexerDataNoneIdentity

Очищает свойство удостоверения источника данных.

SearchIndexerDataUserAssignedIdentity

Указывает удостоверение для используемого источника данных.

SearchResourceEncryptionKey

Ключ шифрования, управляемый клиентом, в Azure Key Vault. Ключи, которые вы создаете и которыми управляете, можно использовать для шифрования или расшифровки хранимых данных, таких как индексы и сопоставления синонимов.

SearchSuggester

Определяет, как API предложения должен применяться к группе полей в индексе.

SemanticConfiguration

Определяет определенную конфигурацию, используемую в контексте семантических возможностей.

SemanticField

Поле, используемое в рамках семантической конфигурации.

SemanticPrioritizedFields

Описывает поля заголовка, содержимого и ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделений и ответов.

SemanticSearch

Определяет параметры индекса поиска, влияющего на семантические возможности.

ShingleTokenFilter

Создает сочетания токенов в виде одного токена. Этот фильтр маркеров реализуется с помощью Apache Lucene.

SnowballTokenFilter

Фильтр, который стебляет слова с помощью созданного сноубола стебля. Этот фильтр маркеров реализуется с помощью Apache Lucene.

SnowballTokenFilterLanguage

Язык, используемый для фильтра маркеров Snowball.

StemmerOverrideTokenFilter

Предоставляет возможность переопределить другие фильтры с использованием пользовательских фильтров на основе словаря. Все термины, связанные с словарем, будут помечены как ключевые слова, чтобы они не были стеблированы с помощью стволовых модулей вниз по цепочке. Следует разместить перед всеми стемминговыми фильтрами. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

StemmerTokenFilter

Фильтр для конкретного языка. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

StemmerTokenFilterLanguage

Язык, используемый для фильтра маркеров парадигматического модуля.

StopAnalyzer

Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. Этот анализатор реализуется с помощью Apache Lucene.

StopwordsList

Определяет предопределенный список стоп-слов для конкретного языка.

StopwordsTokenFilter

Удаляет стоп-слова из потока токенов. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

SynonymTokenFilter

Соответствует синонимам одного или нескольких слов в потоке маркеров. Этот фильтр маркеров реализуется с помощью Apache Lucene.

TagScoringFunction

Определяет функцию, которая повышает оценку документов со строковыми значениями, соответствующими заданному списку тегов.

TagScoringParameters

Предоставляет значения параметров функции оценки тегов.

TextWeights

Определяет весы в полях индекса, для которых совпадения должны повысить оценку в поисковых запросах.

TokenCharacterKind

Представляет классы символов, над которыми может работать фильтр маркеров.

TokenFilterName

Определяет имена всех фильтров токенов, поддерживаемых поисковой системой.

TruncateTokenFilter

Усечение терминов до определенной длины. Этот фильтр маркеров реализуется с помощью Apache Lucene.

UaxUrlEmailTokenizer

Разбивает URL-адреса и сообщения электронной почты на один токен. Этот токенизатор реализуется с помощью Apache Lucene.

UniqueTokenFilter

Отфильтровывает маркеры с тем же текстом, что и в предыдущем маркере. Этот фильтр маркеров реализуется с помощью Apache Lucene.

VectorEncodingFormat

Формат кодировки для интерпретации содержимого векторных полей.

VectorSearch

Содержит параметры конфигурации, связанные с векторным поиском.

VectorSearchAlgorithmKind

Алгоритм, используемый для индексирования и запросов.

VectorSearchAlgorithmMetric

Метрика сходства, используемая для векторных сравнений. Рекомендуется выбрать ту же метрику подобия, на которой обучалась модель встраивания.

VectorSearchCompressionKind

Метод сжатия, используемый для индексирования и запросов.

VectorSearchCompressionTarget

Квантованный тип данных сжатых векторных значений.

VectorSearchProfile

Определяет сочетание конфигураций для использования с векторным поиском.

VectorSearchVectorizerKind

Метод векторизации, который будет использоваться во время запроса.

WebApiVectorizer

Задает определяемый пользователем векторизатор для создания векторного внедрения строки запроса. Интеграция внешнего векторизатора достигается с помощью пользовательского интерфейса веб-API набора навыков.

WebApiVectorizerParameters

Задает свойства для подключения к определяемой пользователем векторизаторе.

WordDelimiterTokenFilter

Разделяет слова на подслова и выполняет необязательные преобразования в группах подслов. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Accept

Заголовок Accept.

Значение Описание
application/json;odata.metadata=minimal

AIFoundryModelCatalogName

Название модели вложения из каталога Azure AI Foundry, который будет называться.

Значение Описание
OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32

OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32

OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336

OpenAI-CLIP-Image-Text-Embeddings-ViT-large-Patch14-336

Facebook-DinoV2-Image-Embeddings-ViT-Base

Встраивания изображений Facebook-DinoV2-ViT-Base

Facebook-DinoV2-Image-Embeddings-ViT-Giant

Facebook-DinoV2-Image-Embeddings-ViT-Giant

Cohere-embed-v3-english

Cohere-embed-v3-english

Cohere-embed-v3-multilingual

Cohere-embed-v3-многоязычный

Cohere-embed-v4

Модель Cohere Embed v4 для создания встраиваемых объектов как из текста, так и из изображений.

AMLParameters

Задает свойства для подключения к векторизатору AML.

Имя Тип Описание
key

string

(Требуется для проверки подлинности ключа) Ключ службы AML.

modelName

AIFoundryModelCatalogName

Название модели вложения из каталога Azure AI Foundry, который развёртывается на предоставленной конечной точке.

region

string

(Необязательно для проверки подлинности маркера). Регион, в который развертывается служба AML.

resourceId

string

(Требуется для проверки подлинности маркера). Идентификатор ресурса Azure Resource Manager сервиса AML. Он должен быть в формате subscriptions/{guid}/resourceGroups/{resource-group-name}/Microsoft. MachineLearningServices/workspaces/{workspace-name}/services/{service_name}.

timeout

string (duration)

(Необязательно.) Если указано, означает время ожидания вызова API HTTP-клиента.

uri

string (uri)

(Требуется для проверки подлинности или проверки подлинности ключа) URI оценки службы AML, в которую будут отправляться полезные данные JSON. Допускается только схема URI https.

AMLVectorizer

Задаёт Машинное обучение Azure endpoint, развернутый через Azure AI Foundry Model Catalog для генерации векторного вложения строки запроса.

Имя Тип Описание
amlParameters

AMLParameters

Задает свойства векторизатора AML.

kind string:

aml

Тип VectorSearchVectorizer.

name

string

Имя, сопоставленное с этим конкретным методом векторизации.

AsciiFoldingTokenFilter

Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.AsciiFoldingTokenFilter

Дискриминатор производных типов.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

preserveOriginal

boolean

False

Значение, указывающее, будет ли храниться исходный токен. По умолчанию — false.

AzureOpenAIModelName

Имя модели Azure Open AI, которое будет вызываться.

Значение Описание
text-embedding-ada-002

TextEmbeddingAda002 модель.

text-embedding-3-large

TextEmbedding3Большая модель.

text-embedding-3-small

TextEmbedding3Малая модель.

gpt-5-mini

Модель Gpt5Mini.

gpt-5-nano

Модель Gpt5Nano.

gpt-5.4-mini

Модель GPT54Mini.

gpt-5.4-nano

Модель Gpt54Nano.

AzureOpenAIVectorizer

Указывает ресурс Azure OpenAI, используемый для векторизации строки запроса.

Имя Тип Описание
azureOpenAIParameters

AzureOpenAIVectorizerParameters

Содержит параметры, относящиеся к векторизации внедрения Azure OpenAI.

kind string:

azureOpenAI

Тип VectorSearchVectorizer.

name

string

Имя, сопоставленное с этим конкретным методом векторизации.

AzureOpenAIVectorizerParameters

Задает параметры для подключения к ресурсу Azure OpenAI.

Имя Тип Описание
apiKey

string

Ключ API указанного ресурса Azure OpenAI.

authIdentity SearchIndexerDataIdentity:

Назначаемое пользователем управляемое удостоверение, используемое для исходящих подключений.

deploymentId

string

Идентификатор развертывания модели Azure OpenAI в указанном ресурсе.

modelName

AzureOpenAIModelName

Имя модели внедрения, развернутой по указанному пути deploymentId.

resourceUri

string (uri)

URI ресурса ресурса Azure OpenAI.

BinaryQuantizationCompression

Содержит параметры конфигурации, относящиеся к методу сжатия двоичной квантизации, используемому во время индексирования и запроса.

Имя Тип Описание
kind string:

binaryQuantization

Тип VectorSearchCompression.

name

string

Имя, сопоставленное с этой конкретной конфигурацией.

rescoringOptions

RescoringOptions

Содержит параметры для перезаписи.

truncationDimension

integer (int32)

Число измерений для усечения векторов. Усечение векторов уменьшает размер векторов и объем данных, которые необходимо передать во время поиска. Это позволяет сэкономить затраты на хранение и повысить производительность поиска за счет отзыва. Он должен использоваться только для внедрения обученных с помощью Matryoshka Representation Learning (MRL), таких как OpenAI text-embedding-3-large (small). Значение по умолчанию равно NULL, что означает отсутствие усечения.

BM25SimilarityAlgorithm

Функция ранжирования на основе алгоритма сходства Okapi BM25. BM25 — это алгоритм TF-IDF, включающий нормализацию длины (контролируемый параметром B), а также насыщенность терминов (контролируемый параметром k1).

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.BM25Similarity

Дискриминатор производных типов.

b

number (double)

Это свойство определяет, как длина документа влияет на оценку релевантности. По умолчанию используется значение 0,75. Значение 0,0 означает, что нормализация длины не применяется, а значение 1,0 означает, что оценка полностью нормализуется длиной документа.

k1

number (double)

Это свойство управляет функцией масштабирования между частотой терминов каждого соответствующего термина и конечной оценкой релевантности пары document-query. По умолчанию используется значение 1.2. Значение 0,0 означает, что оценка не масштабируется с увеличением частоты термина.

CharFilterName

Определяет имена всех фильтров символов, поддерживаемых поисковой системой.

Значение Описание
html_strip

Фильтр символов, который пытается удалить конструкции HTML. См. https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html

CjkBigramTokenFilter

Формирует большие кадры терминов CJK, созданных из стандартного токенизатора. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.CjkBigramTokenFilter

Дискриминатор производных типов.

ignoreScripts

CjkBigramTokenFilterScripts[]

Скрипты, которые следует игнорировать.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

outputUnigrams

boolean

False

Значение, указывающее, следует ли выводить юниграммы и bigrams (если значение true), или просто bigrams (если значение false). По умолчанию — false.

CjkBigramTokenFilterScripts

Скрипты, которые могут быть проигнорированы CjkBigramTokenFilter.

Значение Описание
han

Игнорируйте письмо Хань при формировании биграмм терминов ККК.

hiragana

Игнорируйте хираганский шрифт при формировании биграмм терминов ККЯ.

katakana

Игнорируйте шрифт катакана при формировании биграмм терминов ККЯ.

hangul

Игнорируйте письменность хангыль при формировании биграмм терминов ККЯ.

ClassicSimilarityAlgorithm

Устаревший алгоритм сходства, использующий реализацию TF-IDF Lucene TFIDFSimilarity. Этот вариант TF-IDF представляет нормализацию статического длины документа, а также координирующие факторы, которые наказывают документы, которые частично соответствуют поисковым запросам.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.ClassicSimilarity

Дискриминатор производных типов.

ClassicTokenizer

Токенизатор на основе грамматики, подходящий для обработки большинства европейских языковых документов. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.ClassicTokenizer

Дискриминатор производных типов.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

CommonGramTokenFilter

Создает биграммы для часто встречающихся терминов при индексировании. Отдельные термины также индексируются с наложением биграмм. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.CommonGramTokenFilter

Дискриминатор производных типов.

commonWords

string[]

Набор общих слов.

ignoreCase

boolean

False

Значение, указывающее, не учитывается ли совпадение распространенных слов. По умолчанию — false.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

queryMode

boolean

False

Значение, указывающее, находится ли фильтр маркеров в режиме запроса. При использовании режима запроса фильтр маркеров создает большие кадры, а затем удаляет общие слова и отдельные термины, за которым следует общее слово. По умолчанию — false.

CorsOptions

Определяет параметры управления общим доступом к ресурсам между источниками (CORS) для индекса.

Имя Тип Описание
allowedOrigins

string[]

Список источников, из которых коду JavaScript будет предоставлен доступ к вашему индексу. Может содержать список хостов вида {protocol}://{fully-qualified-domain-name}[:{port#}], или один '*' для разрешения всех источников (не рекомендуется).

maxAgeInSeconds

integer (int64)

Продолжительность, в течение которой браузеры должны кэшировать ответы CORS перед проверкой. По умолчанию 5 минут.

CustomAnalyzer

Позволяет контролировать процесс преобразования текста в индексируемые и поисковые маркеры. Это определяемая пользователем конфигурация, состоящая из одного предопределенного токенизатора и одного или нескольких фильтров. Маркеризатор отвечает за разбиение текста в маркеры и фильтры для изменения маркеров, создаваемых токенизатором.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.CustomAnalyzer

Дискриминатор производных типов.

charFilters

CharFilterName[]

Список фильтров символов, используемых для подготовки входного текста перед его обработкой генератором маркеров. Например, они могут заменить определенные символы или символы. Фильтры выполняются в том порядке, в котором они перечислены.

name

string

Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

tokenFilters

TokenFilterName[]

Список фильтров маркеров, используемых для фильтрации или изменения маркеров, созданных генератором маркеров. Например, вы можете указать специальный фильтр, который преобразует все символы в нижний регистр. Фильтры выполняются в том порядке, в котором они перечислены.

tokenizer

LexicalTokenizerName

Имя маркеризатора, используемого для разделения непрерывного текста на последовательность маркеров, например для разбиения предложения на слова.

CustomNormalizer

Позволяет настроить нормализацию для полей с возможностью фильтрации, сортировки и фасетной таблицы, которые по умолчанию работают со строгим сопоставлением. Это определяемая пользователем конфигурация, состоящая по крайней мере из одного или нескольких фильтров, которые изменяют сохраненный маркер.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.CustomNormalizer

Дискриминатор производных типов.

charFilters

CharFilterName[]

Список фильтров символов, используемых для подготовки входного текста перед обработкой. Например, они могут заменить определенные символы или символы. Фильтры выполняются в том порядке, в котором они перечислены.

name

string

Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

tokenFilters

TokenFilterName[]

Список фильтров маркеров, используемых для фильтрации или изменения входного маркера. Например, вы можете указать специальный фильтр, который преобразует все символы в нижний регистр. Фильтры выполняются в том порядке, в котором они перечислены.

DictionaryDecompounderTokenFilter

Разбивает составные слова, распространенные во многих германских языках. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.DictionaryDecompounderTokenFilter

Дискриминатор производных типов.

maxSubwordSize

integer (int32)

maximum: 300
15

Максимальный размер подслугов. Только вложенные слова короче, чем это выводится. Значение по умолчанию — 15. Максимальное значение — 300.

minSubwordSize

integer (int32)

maximum: 300
2

Минимальный размер подслогов. Выводятся только вложенные слова, превышающие это значение. По умолчанию используется значение 2. Максимальное значение — 300.

minWordSize

integer (int32)

maximum: 300
5

Минимальный размер слова. Только слова дольше, чем это обрабатывается. Значение по умолчанию — 5. Максимальное значение — 300.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

onlyLongestMatch

boolean

False

Значение, указывающее, следует ли добавлять в выходные данные только самый длинный соответствующий подсловь. По умолчанию — false.

wordList

string[]

Список слов, которые нужно сопоставить.

DistanceScoringFunction

Определяет функцию, которая повышает оценки на основе расстояния от географического расположения.

Имя Тип Описание
boost

number (double)

Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0.

distance

DistanceScoringParameters

Значения параметров для функции оценки расстояния.

fieldName

string

Имя поля, используемого в качестве входных данных для функции оценки.

interpolation

ScoringFunctionInterpolation

Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear".

type string:

distance

Тип функции скоринга.

DistanceScoringParameters

Предоставляет значения параметров функции оценки расстояния.

Имя Тип Описание
boostingDistance

number (double)

Расстояние в километрах от опорного места, где заканчивается дальность наддува.

referencePointParameter

string

Название параметра, передаваемого в поисковых запросах для указания местоположения ссылки.

EdgeNGramTokenFilter

Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilter

Дискриминатор производных типов.

maxGram

integer (int32)

2

Максимальная длина n-грамма. По умолчанию используется значение 2.

minGram

integer (int32)

1

Минимальная длина n-грамма. По умолчанию 1. Должно быть меньше значения maxGram.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

side

EdgeNGramTokenFilterSide

front

Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма. По умолчанию используется значение "front".

EdgeNGramTokenFilterSide

Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма.

Значение Описание
front

Указывает, что n-грамма должна создаваться с лицевой стороны входных данных.

back

Указывает, что n-грамма должна быть сгенерирована из обратной стороны входных данных.

EdgeNGramTokenFilterV2

Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilterV2

Дискриминатор производных типов.

maxGram

integer (int32)

maximum: 300
2

Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300.

minGram

integer (int32)

maximum: 300
1

Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

side

EdgeNGramTokenFilterSide

front

Указывает, с какой стороны входных данных должна быть сгенерирована n-грамма. По умолчанию используется значение "front".

EdgeNGramTokenizer

Маркеризирует входные данные из края в n-граммы заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenizer

Дискриминатор производных типов.

maxGram

integer (int32)

maximum: 300
2

Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300.

minGram

integer (int32)

maximum: 300
1

Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

tokenChars

TokenCharacterKind[]

Классы символов, которые хранятся в маркерах.

ElisionTokenFilter

Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.ElisionTokenFilter

Дискриминатор производных типов.

articles

string[]

Набор статей для удаления.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

ErrorAdditionalInfo

Дополнительные сведения об ошибке управления ресурсами.

Имя Тип Описание
info

Дополнительные сведения.

type

string

Дополнительный тип сведений.

ErrorDetail

Сведения об ошибке.

Имя Тип Описание
additionalInfo

ErrorAdditionalInfo[]

Дополнительные сведения об ошибке.

code

string

Код ошибки.

details

ErrorDetail[]

Сведения об ошибке.

message

string

Сообщение об ошибке.

target

string

Целевой объект ошибки.

ErrorResponse

Распространенный ответ об ошибке для всех API Azure Resource Manager для возврата сведений об ошибке для неудачных операций. (Это также следует формату ответа об ошибках OData.).

Имя Тип Описание
error

ErrorDetail

Объект ошибки.

ExhaustiveKnnAlgorithmConfiguration

Содержит параметры конфигурации, относящиеся к исчерпывающим алгоритму KNN, используемому во время запроса, который будет выполнять поиск методом подбора по всему векторному индексу.

Имя Тип Описание
exhaustiveKnnParameters

ExhaustiveKnnParameters

Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN.

kind string:

exhaustiveKnn

Тип VectorSearchAlgorithmConfiguration.

name

string

Имя, сопоставленное с этой конкретной конфигурацией.

ExhaustiveKnnParameters

Содержит параметры, относящиеся к исчерпывающим алгоритмам KNN.

Имя Тип Описание
metric

VectorSearchAlgorithmMetric

Метрика сходства, используемая для векторных сравнений.

FreshnessScoringFunction

Определяет функцию, которая повышает оценки на основе значения поля даты и времени.

Имя Тип Описание
boost

number (double)

Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0.

fieldName

string

Имя поля, используемого в качестве входных данных для функции оценки.

freshness

FreshnessScoringParameters

Значения параметров для функции оценки свежести.

interpolation

ScoringFunctionInterpolation

Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear".

type string:

freshness

Тип функции скоринга.

FreshnessScoringParameters

Предоставляет значения параметров функции оценки свежести.

Имя Тип Описание
boostingDuration

string (duration)

Срок действия, по истечении которого бустинг прекратится для конкретного документа.

HnswAlgorithmConfiguration

Содержит параметры конфигурации, специфичные для алгоритма приближенных ближайших соседей HNSW, используемого во время индексирования и запросов. Алгоритм HNSW предлагает настраиваемый компромисс между скоростью и точностью поиска.

Имя Тип Описание
hnswParameters

HnswParameters

Содержит параметры, специфичные для алгоритма HNSW.

kind string:

hnsw

Тип VectorSearchAlgorithmConfiguration.

name

string

Имя, сопоставленное с этой конкретной конфигурацией.

HnswParameters

Содержит параметры, специфичные для алгоритма HNSW.

Имя Тип Default value Описание
efConstruction

integer (int32)

minimum: 100
maximum: 1000
400

Размер динамического списка, содержащего ближайших соседей, который используется во время индексирования. Увеличение этого параметра может улучшить качество индекса за счет увеличения времени индексации. В определенный момент увеличение этого параметра приводит к уменьшению отдачи.

efSearch

integer (int32)

minimum: 100
maximum: 1000
500

Размер динамического списка, содержащего ближайших соседей, который используется во время поиска. Увеличение этого параметра может улучшить результаты поиска, за счет более медленного поиска. В определенный момент увеличение этого параметра приводит к уменьшению отдачи.

m

integer (int32)

minimum: 4
maximum: 10
4

Количество двунаправленных связей, создаваемых для каждого нового элемента во время построения. Увеличение значения этого параметра может улучшить запоминаемость и сократить время извлечения для наборов данных с высокой внутренней размерностью за счет увеличения потребления памяти и увеличения времени индексирования.

metric

VectorSearchAlgorithmMetric

Метрика сходства, используемая для векторных сравнений.

KeepTokenFilter

Фильтр маркеров, который сохраняет только маркеры с текстом, содержащимся в указанном списке слов. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.KeepTokenFilter

Дискриминатор производных типов.

keepWords

string[]

Список слов, которые нужно сохранить.

keepWordsCase

boolean

False

Значение, указывающее, следует ли сначала ввести все слова в нижний регистр. По умолчанию — false.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

KeywordMarkerTokenFilter

Помечает термины как ключевые слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.KeywordMarkerTokenFilter

Дискриминатор производных типов.

ignoreCase

boolean

False

Значение, указывающее, следует ли игнорировать регистр. Если значение true, все слова преобразуются в нижний регистр. По умолчанию — false.

keywords

string[]

Список слов, которые нужно пометить как ключевые слова.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

KeywordTokenizer

Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizer

Дискриминатор производных типов.

bufferSize

integer (int32)

256

Размер буфера чтения в байтах. Значение по умолчанию — 256.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

KeywordTokenizerV2

Выводит все входные данные в виде одного маркера. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizerV2

Дискриминатор производных типов.

maxTokenLength

integer (int32)

maximum: 300
256

Максимальная длина маркера. Значение по умолчанию — 256. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

LengthTokenFilter

Удаляет слишком длинные или слишком короткие слова. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.LengthTokenFilter

Дискриминатор производных типов.

max

integer (int32)

maximum: 300
300

Максимальная длина символов. Значение по умолчанию и максимальное значение — 300.

min

integer (int32)

maximum: 300
0

Минимальная длина символов. Значение по умолчанию — 0. Максимальное значение — 300. Должно быть меньше значения максимального значения.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

LexicalAnalyzerName

Определяет имена всех текстовых анализаторов, поддерживаемых поисковой системой.

Значение Описание
ar.microsoft

Microsoft Analyzer для арабского языка.

ar.lucene

Анализатор Lucene для арабского языка.

hy.lucene

Анализатор Lucene для армянского языка.

bn.microsoft

Microsoft Analyzer для бенгальского языка.

eu.lucene

Анализатор Lucene для баскского языка.

bg.microsoft

Microsoft Analyzer для болгарского языка.

bg.lucene

Анализатор люцин для болгарского языка.

ca.microsoft

Microsoft analyzer для каталонского.

ca.lucene

Анализатор Lucene для каталанского языка.

zh-Hans.microsoft

Microsoft Analyzer для китайского языка (упрощённый).

zh-Hans.lucene

Анализатор Lucene для китайского языка (упрощенный).

zh-Hant.microsoft

Microsoft Analyzer для китайского (традиционный).

zh-Hant.lucene

Анализатор люцин для китайского языка (традиционный).

hr.microsoft

Microsoft analyzer для хорватского языка.

cs.microsoft

Microsoft analyzer для чешского языка.

cs.lucene

Анализатор Lucene для чешского языка.

da.microsoft

Microsoft Analyzer для датского языка.

da.lucene

Анализатор Lucene для датского языка.

nl.microsoft

Microsoft Analyzer для голландского языка.

nl.lucene

Анализатор Lucene для голландского языка.

en.microsoft

Microsoft Analyzer для английского языка.

en.lucene

Анализатор Lucene для английского языка.

et.microsoft

Microsoft analyzer для эстонского.

fi.microsoft

Microsoft analyzer для финского языка.

fi.lucene

Анализатор Lucene для финского языка.

fr.microsoft

Microsoft Analyzer для французского.

fr.lucene

Анализатор Lucene для французского языка.

gl.lucene

Анализатор Lucene для галисийского языка.

de.microsoft

Microsoft Analyzer для немецкого языка.

de.lucene

Анализатор Lucene для немецкого языка.

el.microsoft

Microsoft Analyzer для греческого.

el.lucene

Анализатор Lucene для греческого языка.

gu.microsoft

Microsoft Analyzer для гуджарати.

he.microsoft

Microsoft Analyzer для иврита.

hi.microsoft

Microsoft Analyzer для хинди.

hi.lucene

Анализатор Lucene для хинди.

hu.microsoft

Microsoft Analyzer для венгерского языка.

hu.lucene

Анализатор Lucene для венгерского языка.

is.microsoft

Microsoft Analyzer для исландского.

id.microsoft

Microsoft analyzer для индонезийского языка (Bahasa).

id.lucene

Анализатор Lucene для индонезийского языка.

ga.lucene

Анализатор Lucene для ирландцев.

it.microsoft

Microsoft Analyzer для итальянского.

it.lucene

Анализатор Lucene для итальянского языка.

ja.microsoft

Microsoft Analyzer для японского языка.

ja.lucene

Анализатор Lucene для японского языка.

kn.microsoft

Microsoft analyzer для каннада.

ko.microsoft

Microsoft Analyzer для корейского языка.

ko.lucene

Анализатор Lucene для корейского языка.

lv.microsoft

Microsoft analyzer для латвийского языка.

lv.lucene

Анализатор Lucene для латышского языка.

lt.microsoft

Microsoft analyzer для литовского языка.

ml.microsoft

Microsoft analyzer для малаялам.

ms.microsoft

Microsoft analyzer для малайского языка (латинский).

mr.microsoft

Microsoft Analyzer для маратхи.

nb.microsoft

Microsoft analyzer for Norwegian (Bokmål).

no.lucene

Анализатор Lucene для норвежского языка.

fa.lucene

Анализатор Lucene для персидского языка.

pl.microsoft

Microsoft Analyzer для польского языка.

pl.lucene

Анализатор Lucene для польского языка.

pt-BR.microsoft

Microsoft Analyzer для португальского (Бразилия).

pt-BR.lucene

Анализатор Lucene для португальского языка (Бразилия).

pt-PT.microsoft

Microsoft analyzer для португальского языка (Португалия).

pt-PT.lucene

Анализатор Lucene для португальского языка (Португалия).

pa.microsoft

Microsoft analyzer for Punjabi.

ro.microsoft

Microsoft Analyzer для румынского.

ro.lucene

Анализатор Lucene для румынского языка.

ru.microsoft

Microsoft Analyzer для русского языка.

ru.lucene

Анализатор люцин для русского языка.

sr-cyrillic.microsoft

Microsoft analyzer для сербского языка (кириллица).

sr-latin.microsoft

Microsoft analyzer для сербского (латинского).

sk.microsoft

Microsoft analyzer для словацкого.

sl.microsoft

Microsoft analyzer for Slovenian.

es.microsoft

Microsoft Analyzer для испанского.

es.lucene

Анализатор Lucene для испанского языка.

sv.microsoft

Microsoft Analyzer для шведского языка.

sv.lucene

Анализатор Lucene для шведского языка.

ta.microsoft

Microsoft Analyzer для тамильского языка.

te.microsoft

Microsoft analyzer для телугу.

th.microsoft

Microsoft analyzer для тайского языка.

th.lucene

Анализатор Lucene для тайского языка.

tr.microsoft

Microsoft Analyzer для турецкого языка.

tr.lucene

Анализатор Lucene для турецкого языка.

uk.microsoft

Microsoft Analyzer для украинского языка.

ur.microsoft

Microsoft analyzer для урду.

vi.microsoft

Microsoft Analyzer для вьетнамского языка.

standard.lucene

Стандартный анализатор люцина.

standardasciifolding.lucene

Стандартный ASCII Folding Lucene analyzer. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers

keyword

Обрабатывает все содержимое поля как один маркер. Это полезно для таких данных, как zip-коды, идентификаторы и некоторые имена продуктов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html

pattern

Гибко разделяет текст на термины с помощью шаблона регулярного выражения. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html

simple

Разбивает текст по небуквенным знакам и преобразует его в нижний регистр. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html

stop

Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html

whitespace

Анализатор, использующий токенизатор пробелов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html

LexicalNormalizerName

Определяет имена всех нормализаторов текста, поддерживаемых поисковой системой.

Значение Описание
asciifolding

Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

elision

Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

lowercase

Нормализует текст лексемы в нижний регистр. См. https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

standard

Стандартный нормализатор, который состоит из строчных и асцифульдных. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

uppercase

Нормализует текст токена в верхний регистр. См. https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

LexicalTokenizerName

Определяет имена всех токенизаторов, поддерживаемых поисковой системой.

Значение Описание
classic

Токенизатор на основе грамматики, подходящий для обработки большинства европейских языковых документов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html

edgeNGram

Маркеризирует входные данные из края в n-граммы заданных размеров. См. https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html

keyword_v2

Выводит все входные данные в виде одного маркера. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html

letter

Разбивает текст по небуквенным символам. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html

lowercase

Разбивает текст по небуквенным знакам и преобразует его в нижний регистр. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html

microsoft_language_tokenizer

Разбивает текст на основе правил определенного языка.

microsoft_language_stemming_tokenizer

Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам.

nGram

Маркеризирует входные данные в n-граммах заданных размеров. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html

path_hierarchy_v2

Токенизатор для путьоподобных иерархий. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html

pattern

Токенизатор, использующий сопоставление шаблонов regex для создания уникальных маркеров. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html

standard_v2

Стандартный анализатор Lucene; Состоит из стандартного токенизатора, нижнего регистра фильтра и фильтра остановки. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html

uax_url_email

Разбивает URL-адреса и сообщения электронной почты на один токен. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html

whitespace

Разбивает текст по пробелам. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html

LimitTokenFilter

Ограничивает количество маркеров при индексировании. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.LimitTokenFilter

Дискриминатор производных типов.

consumeAllTokens

boolean

False

Значение, указывающее, должны ли все маркеры из входных данных использоваться, даже если достигается maxTokenCount. По умолчанию — false.

maxTokenCount

integer (int32)

1

Максимальное количество маркеров для создания. По умолчанию 1.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

LuceneStandardAnalyzer

Стандартный анализатор Apache Lucene; Состоит из стандартного токенизатора, нижнего регистра фильтра и фильтра остановки.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.StandardAnalyzer

Дискриминатор производных типов.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов.

name

string

Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

stopwords

string[]

Список стоп-слов.

LuceneStandardTokenizer

Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizer

Дискриминатор производных типов.

maxTokenLength

integer (int32)

255

Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

LuceneStandardTokenizerV2

Разбивает текст в соответствии с правилами сегментации текста Юникода. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizerV2

Дискриминатор производных типов.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

MagnitudeScoringFunction

Определяет функцию, которая повышает оценки на основе величины числового поля.

Имя Тип Описание
boost

number (double)

Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0.

fieldName

string

Имя поля, используемого в качестве входных данных для функции оценки.

interpolation

ScoringFunctionInterpolation

Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear".

magnitude

MagnitudeScoringParameters

Значения параметров для функции оценки величины.

type string:

magnitude

Тип функции скоринга.

MagnitudeScoringParameters

Предоставляет значения параметров функции оценки величины.

Имя Тип Описание
boostingRangeEnd

number (double)

Значение поля, на котором заканчивается форсирование.

boostingRangeStart

number (double)

Значение поля, с которого начинается бустинг.

constantBoostBeyondRange

boolean

Значение, указывающее, следует ли применять постоянное повышение для значений поля, выходящих за пределы конечного значения диапазона; Значение по умолчанию — false.

MappingCharFilter

Фильтр символов, который применяет сопоставления, определенные с параметром сопоставления. Сопоставление является жадным (самое длинное сопоставление шаблона в заданной точке выигрывает). Замена может быть пустой строкой. Этот фильтр символов реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.MappingCharFilter

Дискриминатор производных типов.

mappings

string[]

Список сопоставлений следующего формата: "a=>b" (все вхождения символа "a" будут заменены символом "b").

name

string

Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

MicrosoftLanguageStemmingTokenizer

Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageStemmingTokenizer

Дискриминатор производных типов.

isSearchTokenizer

boolean

False

Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. По умолчанию — false.

language

MicrosoftStemmingTokenizerLanguage

Используемый язык. По умолчанию используется английский язык.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Токены, размер которых превышает максимальную длину, разделяются. Максимальная допустимая длина маркера — 300 знаков. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

MicrosoftLanguageTokenizer

Разбивает текст на основе правил определенного языка.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageTokenizer

Дискриминатор производных типов.

isSearchTokenizer

boolean

False

Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. По умолчанию — false.

language

MicrosoftTokenizerLanguage

Используемый язык. По умолчанию используется английский язык.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Токены, размер которых превышает максимальную длину, разделяются. Максимальная допустимая длина маркера — 300 знаков. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

MicrosoftStemmingTokenizerLanguage

Перечисляется языки, поддерживаемые токенайзером языка Microsoft для стемминга.

Значение Описание
arabic

Выбирает Microsoft stemming tokenizer для арабского языка.

bangla

Выбирает Microsoft stemming tokenizer для Bangla.

bulgarian

Выбирает Microsoft stemming tokenizer для болгарского языка.

catalan

Выбирает Microsoft stemming tokenizer для каталанского.

croatian

Выбирает Microsoft stemming tokenizer для хорватского языка.

czech

Выбирает Microsoft stemming tokenizer для чешского языка.

danish

Выбирает Microsoft stemming tokenizer для датского языка.

dutch

Выбирает Microsoft stemming tokenizer для голландского языка.

english

Выбирает Microsoft stemming tokenizer для английского языка.

estonian

Выбирает Microsoft stemming tokenizer для эстонского языка.

finnish

Выбирает Microsoft stemming tokenizer для финского языка.

french

Выбирает Microsoft stemming tokenizer для французского языка.

german

Выбирает токенайзер Microsoft stemming для немецкого.

greek

Выбирает Microsoft stemming tokenizer для греческого языка.

gujarati

Выбирает Microsoft stemming tokenizer для гуджарати.

hebrew

Выбирает токенайзер Microsoft stemming для иврита.

hindi

Выбирает Microsoft stemming tokenizer для хинди.

hungarian

Выбирает Microsoft stemming tokenizer для венгерского языка.

icelandic

Выбирает токенайзер Microsoft stemming для исландского.

indonesian

Выбирает Microsoft stemming tokenizer для индонезийского.

italian

Выбирает Microsoft stemming tokenizer для итальянского языка.

kannada

Выбирает Microsoft stemming tokenizer для Kannada.

latvian

Выбирает Microsoft stemming tokenizer для латвийского языка.

lithuanian

Выбирает Microsoft stemming tokenizer для литовского языка.

malay

Выбирает Microsoft stemming tokenizer для малайского.

malayalam

Выбирает токенайзер Microsoft stemming для малаялам.

marathi

Выбирает Microsoft stemming tokenizer для маратхи.

norwegianBokmaal

Выбирает Microsoft stemming tokenizer для норвежского (BokmÃ¥l).

polish

Выбирает Microsoft stemming tokenizer для польского языка.

portuguese

Выбирает Microsoft stemming tokenizer для португальского языка.

portugueseBrazilian

Выбирает Microsoft stemming tokenizer для португальского (Бразилия).

punjabi

Выбирает Microsoft stemming tokenizer для пенджаби.

romanian

Выбирает Microsoft stemming tokenizer для румынского языка.

russian

Выбирает Microsoft stemming tokenizer для русского языка.

serbianCyrillic

Выбирает Microsoft stemming tokenizer для сербского языка (кириллица).

serbianLatin

Выбирает Microsoft stemming tokenizer для сербского (латинский).

slovak

Выбирает Microsoft stemming tokenizer для словацкого.

slovenian

Выбирает Microsoft stemming tokenizer for Slovenian.

spanish

Выбирает Microsoft stemming tokenizer для испанского языка.

swedish

Выбирает токенайзер Microsoft stemming для шведского языка.

tamil

Выбирает Microsoft stemming tokenizer для тамильского языка.

telugu

Выбирает Microsoft stemming tokenizer для телугу.

turkish

Выбирает Microsoft stemming tokenizer для турецкого языка.

ukrainian

Выбирает токенайзер Microsoft stemming для украинского языка.

urdu

Выбирает Microsoft stemming tokenizer для урду.

MicrosoftTokenizerLanguage

Перечисляется языки, поддерживаемые токенайзером языка Microsoft.

Значение Описание
bangla

Выбирает токенайзер Microsoft для бенгальского языка.

bulgarian

Выбирает токенайзер Microsoft для болгарского.

catalan

Выбирает токенайзер Microsoft для каталанского.

chineseSimplified

Выбирает токенайзер Microsoft для китайского языка (упрощённый).

chineseTraditional

Выбирает токенайзер Microsoft для традиционного китайского языка.

croatian

Выбирает токенайзер Microsoft для хорватского языка.

czech

Выбирает токенайзер Microsoft для чешского языка.

danish

Выбирает токенайзер Microsoft для датского языка.

dutch

Выбирает токенайзер Microsoft для голландского языка.

english

Выбирает токенайзер Microsoft для английского языка.

french

Выбирает токенайзер Microsoft для французского.

german

Выбирает токенайзер Microsoft для немецкого.

greek

Выбирает токенайзер Microsoft для греческого языка.

gujarati

Выбирает токенайзер Microsoft для гуджарати.

hindi

Выбирает токенайзер Microsoft для хинди.

icelandic

Выбирает токенайзер Microsoft для исландского.

indonesian

Выбирает токенайзер Microsoft для индонезийского.

italian

Выбирает токенайзер Microsoft для итальянского.

japanese

Выбирает токенайзер Microsoft для японского.

kannada

Выбирает токенайзер Microsoft для Kannada.

korean

Выбирает токенайзер Microsoft для корейского языка.

malay

Выбирает токенайзер Microsoft для малайского.

malayalam

Выбирает токенайзер Microsoft для малаялам.

marathi

Выбирает токенайзер Microsoft для маратхи.

norwegianBokmaal

Выбирает токенайзер Microsoft для норвежского (BokmÃ¥l).

polish

Выбирает токенайзер Microsoft для польского языка.

portuguese

Выбирает токенайзер Microsoft для португальского.

portugueseBrazilian

Выбирает токенайзер Microsoft для португальского (Бразилия).

punjabi

Выбирает токенайзер Microsoft для пенджаби.

romanian

Выбирает токенайзер Microsoft для румынского.

russian

Выбирает токенайзер Microsoft для русского.

serbianCyrillic

Выбирает токенайзер Microsoft для сербского (кириллица).

serbianLatin

Выбирает токенайзер Microsoft для сербского (латинский).

slovenian

Выбирает Microsoft tokenizer for Slovenian.

spanish

Выбирает токенайзер Microsoft для испанского.

swedish

Выбирает токенайзер Microsoft для шведского языка.

tamil

Выбирает токенайзер Microsoft для тамильского.

telugu

Выбирает токенайзер Microsoft для телугу.

thai

Выбирает токенайзер Microsoft для тайского языка.

ukrainian

Выбирает токенайзер Microsoft для украинского языка.

urdu

Выбирает токенайзер Microsoft для урду.

vietnamese

Выбирает токенайзер Microsoft для вьетнамского языка.

NGramTokenFilter

Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilter

Дискриминатор производных типов.

maxGram

integer (int32)

2

Максимальная длина n-грамма. По умолчанию используется значение 2.

minGram

integer (int32)

1

Минимальная длина n-грамма. По умолчанию 1. Должно быть меньше значения maxGram.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

NGramTokenFilterV2

Создает n-граммы заданного размера. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilterV2

Дискриминатор производных типов.

maxGram

integer (int32)

maximum: 300
2

Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300.

minGram

integer (int32)

maximum: 300
1

Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

NGramTokenizer

Маркеризирует входные данные в n-граммах заданных размеров. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.NGramTokenizer

Дискриминатор производных типов.

maxGram

integer (int32)

maximum: 300
2

Максимальная длина n-грамма. По умолчанию используется значение 2. Максимальное значение — 300.

minGram

integer (int32)

maximum: 300
1

Минимальная длина n-грамма. По умолчанию 1. Максимальное значение — 300. Должно быть меньше значения maxGram.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

tokenChars

TokenCharacterKind[]

Классы символов, которые хранятся в маркерах.

PathHierarchyTokenizerV2

Токенизатор для путьоподобных иерархий. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.PathHierarchyTokenizerV2

Дискриминатор производных типов.

delimiter

string

maxLength: 1
/

Используемый символ разделителя. Значение по умолчанию — "/".

maxTokenLength

integer (int32)

maximum: 300
300

Максимальная длина маркера. Значение по умолчанию и максимальное значение — 300.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

replacement

string

maxLength: 1
/

Значение, которое, если задано, заменяет символ разделителя. Значение по умолчанию — "/".

reverse

boolean

False

Значение, указывающее, следует ли создавать маркеры в обратном порядке. По умолчанию — false.

skip

integer (int32)

0

Количество пропустить начальных маркеров. Значение по умолчанию — 0.

PatternAnalyzer

Гибко разделяет текст на термины с помощью шаблона регулярного выражения. Этот анализатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.PatternAnalyzer

Дискриминатор производных типов.

flags

string

Флаги регулярного выражения, заданные как отдельная строка значений RegexFlags с выделением '|'.

lowercase

boolean

True

Значение, указывающее, следует ли писать термины в нижнем регистре. Значение по умолчанию: true.

name

string

Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

pattern

string

\W+

Шаблон регулярного выражения для сопоставления разделителей маркеров. Default — это выражение, которое соответствует одному или нескольким символам, не являющимся словами.

stopwords

string[]

Список стоп-слов.

PatternCaptureTokenFilter

Использует регрессии Java для выдачи нескольких маркеров — по одному для каждой группы захвата в одном или нескольких шаблонах. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.PatternCaptureTokenFilter

Дискриминатор производных типов.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

patterns

string[]

Список шаблонов для сопоставления с каждым маркером.

preserveOriginal

boolean

True

Значение, указывающее, следует ли возвращать исходный маркер, даже если один из шаблонов соответствует. Значение по умолчанию: true.

PatternReplaceCharFilter

Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр символов реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceCharFilter

Дискриминатор производных типов.

name

string

Имя фильтра char. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

pattern

string

Шаблон регулярного выражения.

replacement

string

Замещающий текст.

PatternReplaceTokenFilter

Фильтр символов, заменяющий символы во входной строке. Он использует регулярное выражение, чтобы определить последовательности знаков, которые нужно сохранить, и шаблон замены, чтобы определить знаки для замены. Например, учитывая входной текст "aa bb aa bb", шаблон "(aa)\s+(bb)" и замену "$1#2", результатом будет "aa#bb aa#bb". Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceTokenFilter

Дискриминатор производных типов.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

pattern

string

Шаблон регулярного выражения.

replacement

string

Замещающий текст.

PatternTokenizer

Токенизатор, использующий сопоставление шаблонов regex для создания уникальных маркеров. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.PatternTokenizer

Дискриминатор производных типов.

flags

string

Флаги регулярного выражения, заданные как отдельная строка значений RegexFlags с выделением '|'.

group

integer (int32)

-1

Порядковый номер совпадающей группы в шаблоне регулярного выражения, отсчитываемый от нуля, для извлечения в лексемы. Используйте -1, если вы хотите использовать весь шаблон для разделения входных данных на лексемы, независимо от совпадающих групп. Значение по умолчанию — -1.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

pattern

string

\W+

Шаблон регулярного выражения для сопоставления разделителей маркеров. Default — это выражение, которое соответствует одному или нескольким символам, не являющимся словами.

PhoneticEncoder

Определяет тип фонетического кодировщика, используемого с PhoneticTokenFilter.

Значение Описание
metaphone

Кодирует маркер в значение Metaphone.

doubleMetaphone

Кодирует токен в двойное значение метафона.

soundex

Кодирует токен в значение Soundex.

refinedSoundex

Кодирует токен в значение Refined Soundex.

caverphone1

Кодирует маркер в значение Caverphone 1.0.

caverphone2

Кодирует маркер в значение Caverphone 2.0.

cologne

Кодирует лексему в кёльнское фонетическое значение.

nysiis

Кодирует токен в значение NYSIIS.

koelnerPhonetik

Кодирует токен с помощью алгоритма Kölner Phonetik.

haasePhonetik

Кодирует лексему с помощью уточнения Хаазе алгоритма Kölner Phonetik.

beiderMorse

Кодирует лексему в Beider-Morse значение.

PhoneticTokenFilter

Создайте маркеры для фонетических совпадений. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.PhoneticTokenFilter

Дискриминатор производных типов.

encoder

PhoneticEncoder

metaphone

Используемый фонетический кодировщик. По умолчанию используется метафон.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

replace

boolean

True

Значение, указывающее, должны ли кодированные маркеры заменить исходные маркеры. Если значение false, закодированные маркеры добавляются в качестве синонимов. Значение по умолчанию: true.

Prefer

Для запросов HTTP PUT указывает службе вернуть созданный или обновленный ресурс при успешном выполнении.

Значение Описание
return=representation

RankingOrder

Представляет оценку, используемую для сортировки документов.

Значение Описание
BoostedRerankerScore

Устанавливает порядок сортировки как BoostedRerankerScore

RerankerScore

Устанавливает порядок сортировки как ReRankerScore

RescoringOptions

Содержит параметры для перезаписи.

Имя Тип Default value Описание
defaultOversampling

number (double)

Коэффициент превышения по умолчанию. Избыточная дискретизация позволяет получить больший набор потенциальных документов, чтобы компенсировать потерю разрешения из-за квантования. Это увеличивает набор результатов, которые будут переоцениваться на векторах полной точности. Минимальное значение равно 1, то есть без превышения (1x). Этот параметр может быть установлен только в том случае, если 'enableRescoring' имеет значение true. Более высокие значения улучшают отзыв за счет задержки.

enableRescoring

boolean

True

Если задано значение true, то после первоначального поиска по сжатым векторам оценки сходства пересчитываются с использованием векторов полной точности. Это улучшит отзыв за счет задержки.

rescoreStorageMethod enum:
  • discardOriginals
  • preserveOriginals
preserveOriginals

Управляет методом хранения исходных векторов. Эта настройка является неизменяемой.

ScalarQuantizationCompression

Содержит параметры конфигурации, относящиеся к методу сжатия скалярной квантизации, используемому во время индексирования и запроса.

Имя Тип Описание
kind string:

scalarQuantization

Тип VectorSearchCompression.

name

string

Имя, сопоставленное с этой конкретной конфигурацией.

rescoringOptions

RescoringOptions

Содержит параметры для перезаписи.

scalarQuantizationParameters

ScalarQuantizationParameters

Содержит параметры, относящиеся к скалярной квантизации.

truncationDimension

integer (int32)

Число измерений для усечения векторов. Усечение векторов уменьшает размер векторов и объем данных, которые необходимо передать во время поиска. Это позволяет сэкономить затраты на хранение и повысить производительность поиска за счет отзыва. Он должен использоваться только для внедрения обученных с помощью Matryoshka Representation Learning (MRL), таких как OpenAI text-embedding-3-large (small). Значение по умолчанию равно NULL, что означает отсутствие усечения.

ScalarQuantizationParameters

Содержит параметры, относящиеся к скалярной квантизации.

Имя Тип Описание
quantizedDataType

VectorSearchCompressionTarget

Квантованный тип данных сжатых векторных значений.

ScoringFunctionAggregation

Определяет функцию агрегирования, используемую для объединения результатов всех функций оценки в профиле оценки.

Значение Описание
sum

Увеличьте баллы по сумме всех результатов функции оценки.

average

Увеличьте баллы на среднее значение всех результатов функции оценки.

minimum

Увеличьте баллы по минимуму всех результатов функции подсчета баллов.

maximum

Увеличьте баллы по максимальному количеству всех результатов функции подсчета баллов.

firstMatching

Увеличьте счет с помощью первой применимой функции подсчета очков в профиле подсчета очков.

product

Увеличьте баллы на произведение всех результатов функции оценки.

ScoringFunctionInterpolation

Определяет функцию, используемую для интерполяции повышения балла по ряду документов.

Значение Описание
linear

Увеличивает количество очков на линейно уменьшающуюся величину. Это интерполяция по умолчанию для функций оценки.

constant

Увеличивает очки на постоянный коэффициент.

quadratic

Увеличивает количество очков на величину, которая уменьшается квадратически. Ускорения уменьшаются медленно при увеличении очков и быстрее при уменьшении очков. Этот параметр интерполяции не допускается в функциях оценки тегов.

logarithmic

Увеличивает количество очков на величину, которая уменьшается логарифмически Ускорения быстро уменьшаются при увеличении количества очков и медленнее при уменьшении очков. Этот параметр интерполяции не допускается в функциях оценки тегов.

ScoringProfile

Определяет параметры индекса поиска, влияющего на оценку в поисковых запросах.

Имя Тип Описание
functionAggregation

ScoringFunctionAggregation

Значение, указывающее, как должны быть объединены результаты отдельных функций оценки. По умолчанию "Сумма". Игнорируется, если нет функций подсчета очков.

functions ScoringFunction[]:

Набор функций, влияющих на оценку документов.

name

string

Имя профиля скоринга.

text

TextWeights

Параметры, повышающие оценку на основе совпадений текста в определенных полях индекса.

SearchField

Представляет поле в определении индекса, описывающее имя, тип данных и поведение поиска поля.

Имя Тип Описание
analyzer

LexicalAnalyzerName

Имя анализатора, используемого для поля. Этот параметр можно использовать только с полями, доступными для поиска, и его нельзя задать вместе с searchAnalyzer или indexAnalyzer. После выбора анализатора его нельзя изменить для поля. Должно быть null для сложных полей.

dimensions

integer (int32)

minimum: 2
maximum: 4096

Размерность поля вектора.

facetable

boolean

Значение, указывающее, следует ли указывать поле в запросах аспектов. Обычно используется в презентации результатов поиска, включающих количество результатов по категориям (например, поиск цифровых камер с просмотром результатов по бренду, мегапикселям, цене и т. д.). Это свойство должно иметь значение null для сложных полей. Поля типа Edm.GeographyPoint или Collection(Edm.GeographyPoint) не могут быть аспектируемыми. Значение по умолчанию справедливо для всех остальных простых полей.

fields

SearchField[]

Список подполей, если это поле типа Edm.ComplexType или Collection(Edm.ComplexType). Должно быть null или empty для простых полей.

filterable

boolean

Значение, указывающее, следует ли указывать поле в $filter запросах. Фильтрация отличается от способа обработки строк поиска. Поля типа Edm.String или Collection(Edm.String), которые можно фильтровать, не проходят разбиение слов, поэтому сравнения предназначены только для точных совпадений. Например, если задать такое поле f на "солнечный день", $filter=fq "солнечный" не будет найти совпадений, но $filter=fq "солнечный день". Это свойство должно иметь значение null для сложных полей. Значение по умолчанию равно true для простых полей и null для сложных полей.

indexAnalyzer

LexicalAnalyzerName

Имя анализатора, используемого во время индексирования поля. Этот параметр можно использовать только с полями, доступными для поиска. Он должен быть установлен вместе с searchAnalyzer, и его нельзя задать вместе с параметром анализатора. Это свойство нельзя задать для имени анализатора языка; используйте свойство анализатора вместо этого, если вам нужен анализатор языка. После выбора анализатора его нельзя изменить для поля. Должно быть null для сложных полей.

key

boolean

Значение, указывающее, однозначно ли поле идентифицирует документы в индексе. В качестве ключевого поля необходимо выбрать ровно одно поле верхнего уровня в каждом индексе, и оно должно иметь тип Edm.String. Ключевые поля можно использовать для поиска документов напрямую и обновления или удаления определенных документов. Значение по умолчанию равно false для простых полей и null для сложных полей.

name

string

Имя поля, которое должно быть уникальным в коллекции полей индекса или родительского поля.

normalizer

LexicalNormalizerName

Имя нормализатора, используемого для поля. Эту опцию можно использовать только с полями с включенными фильтруемыми, сортируемыми или фасетными таблицами. После выбора нормализатора его нельзя изменить для поля. Должно быть null для сложных полей.

retrievable

boolean

Значение, указывающее, можно ли возвращать поле в результатах поиска. Этот параметр можно отключить, если вы хотите использовать поле (например, поле) в качестве фильтра, сортировки или механизма оценки, но не хотите, чтобы поле отображалось для конечного пользователя. Это свойство должно иметь значение true для ключевых полей, а для сложных полей оно должно быть равно null. Это свойство можно изменить в существующих полях. Включение этого свойства не приводит к увеличению требований к хранилищу индексов. Значение по умолчанию — true для простых полей, false — для векторных полей и null — для сложных полей.

searchAnalyzer

LexicalAnalyzerName

Имя анализатора, используемого во время поиска поля. Этот параметр можно использовать только с полями, доступными для поиска. Он должен быть установлен вместе с indexAnalyzer и не может быть установлен вместе с опцией analyzer. Это свойство нельзя задать для имени анализатора языка; используйте свойство анализатора вместо этого, если вам нужен анализатор языка. Этот анализатор можно обновить в существующем поле. Должно быть null для сложных полей.

searchable

boolean

Значение, указывающее, доступно ли поле для полнотекстового поиска. Это означает, что он будет проходить анализ, например критические слова во время индексирования. Если вы устанавливаете для поиска значение, например "солнечный день", внутренне оно будет разделено на отдельные токены "солнечный" и "день". Это позволяет этим словам участвовать в полнотекстовом поиске. Поля типа Edm.String или Collection(Edm.String) доступны для поиска по умолчанию. Это свойство должно быть равно false для простых полей других нестроковых типов данных, а для сложных полей оно должно быть равно null. Примечание. Поля, доступные для поиска, используют дополнительное пространство в индексе для размещения дополнительных маркеризованных версий значения поля для полнотекстового поиска. Если вы хотите сэкономить место в индексе и не требуется, чтобы поле было включено в поиск, задайте для поиска значение false.

sortable

boolean

Значение, указывающее, следует ли ссылаться на поле в выражениях $orderby. По умолчанию поисковая система сортирует результаты по оценке, но во многих интерфейсах пользователи хотят отсортировать поля в документах. Простое поле может быть сортировано только в том случае, если оно имеет одно значение в области родительского документа. Простые поля коллекции не могут быть сортируемыми, так как они имеют многозначное значение. Простые вложенные поля сложных коллекций также являются многозначными и поэтому не могут быть сортируемыми. Это верно как для прямого родительского поля, так и для поля предка, если это сложная коллекция. Сложные поля не могут быть сортируемыми, и свойство sortable должно иметь значение null для таких полей. Значение по умолчанию для sortable — true для простых полей с однозначным значением, false для простых полей с несколькими значениями и null для сложных полей.

stored

boolean

Неизменяемое значение, указывающее, будет ли поле сохраняться отдельно на диске, возвращаемое в результатах поиска. Этот параметр можно отключить, если вы не планируете возвращать содержимое поля в ответе поиска, чтобы сэкономить на затратах на хранение. Это можно задать только во время создания индекса и только для полей векторов. Это свойство нельзя изменить для существующих полей или задать значение false для новых полей. Если для этого свойства задано значение false, свойство retrievable также должно быть установлено в значение false. Это свойство должно быть true или не задано для ключевых полей, для новых полей, а также для полей, не являющихся векторными, и оно должно иметь значение NULL для сложных полей. Отключение этого свойства приведет к снижению требований к хранилищу индексов. Значение по умолчанию имеет значение true для полей векторов.

synonymMaps

string[]

Список названий карт синонимов, которые можно связать с этим полем. Этот параметр можно использовать только с полями, доступными для поиска. В настоящее время поддерживается только одна карта синонимов на поле. Назначение карты синонимов полю гарантирует, что условия запроса, предназначенные для этого поля, расширяются при выполнении запроса с использованием правил из словаря синонимов. Этот атрибут можно изменить в существующих полях. Должен быть null или пустой коллекцией для сложных полей.

type

SearchFieldDataType

Тип данных поля.

vectorEncoding

VectorEncodingFormat

Формат кодирования для интерпретации содержимого поля.

vectorSearchProfile

string

Имя профиля векторного поиска, указывающего алгоритм и векторизатор для использования при поиске поля вектора.

SearchFieldDataType

Определяет тип данных поля в индексе поиска.

Значение Описание
Edm.String

Указывает, что поле содержит строку.

Edm.Int32

Указывает, что поле содержит 32-разрядное целое число со знаком.

Edm.Int64

Указывает, что поле содержит 64-разрядное целое число со знаком.

Edm.Double

Указывает, что поле содержит число с плавающей запятой с двойной точностью IEEE.

Edm.Boolean

Указывает, что поле содержит логическое значение (true или false).

Edm.DateTimeOffset

Указывает, что поле содержит значение даты и времени, включая сведения о часовом поясе.

Edm.GeographyPoint

Указывает, что поле содержит географическое расположение с точки зрения долготы и широты.

Edm.ComplexType

Указывает, что поле содержит один или несколько сложных объектов, которые, в свою очередь, имеют под поля других типов.

Edm.Single

Указывает, что поле содержит число с плавающей запятой с одной точностью. Это допустимо только при использовании с collection(Edm.Single).

Edm.Half

Указывает, что поле содержит число с плавающей запятой половины точности. Это допустимо только при использовании с коллекцией (Edm.Half).

Edm.Int16

Указывает, что поле содержит 16-разрядное целое число со знаком. Это допустимо только при использовании с collection(Edm.Int16).

Edm.SByte

Указывает, что поле содержит 8-разрядное целое число со знаком. Это допустимо только при использовании с Collection(Edm.SByte).

Edm.Byte

Указывает, что поле содержит 8-разрядное целое число без знака. Это допустимо только при использовании с collection(Edm.Byte).

SearchIndex

Представляет определение индекса поиска, описывающее поля и поведение поиска индекса.

Имя Тип Описание
@odata.etag

string

ETag индекса.

analyzers LexicalAnalyzer[]:

Анализаторы индекса.

charFilters CharFilter[]:

Фильтры символов для индекса.

corsOptions

CorsOptions

Параметры управления общим доступом к ресурсам между источниками (CORS) для индекса.

defaultScoringProfile

string

Имя профиля оценки, используемого, если ни один из них не указан в запросе. Если это свойство не задано, а профиль оценки не указан в запросе, будет использоваться оценка по умолчанию (tf-idf).

description

string

Описание индекса.

encryptionKey

SearchResourceEncryptionKey

Описание ключа шифрования, созданного в Azure Key Vault. Этот ключ используется для дополнительного уровня шифрования в состоянии покоя для ваших данных, когда вы хотите быть полностью уверены, что никто, даже Microsoft, не сможет расшифровать ваши данные. После шифрования данных он всегда будет оставаться зашифрованным. Служба поиска будет игнорировать попытки установить для этого свойства значение null. Это свойство можно изменить по мере необходимости, если вы хотите повернуть ключ шифрования; Ваши данные не будут затронуты. Шифрование с помощью ключей, управляемых клиентом, недоступно для бесплатных служб поиска и доступно только для платных служб, созданных 1 января 2019 г.

fields

SearchField[]

Поля индекса.

name

string

Имя индекса.

normalizers LexicalNormalizer[]:

CustomNormalizer[]

Нормализаторы индекса.

scoringProfiles

ScoringProfile[]

Профили оценки для индекса.

semantic

SemanticSearch

Определяет параметры индекса поиска, влияющего на семантические возможности.

similarity SimilarityAlgorithm:

Тип алгоритма сходства, используемый при оценке и ранжировании документов, соответствующих поисковому запросу. Алгоритм сходства может быть определен только во время создания индекса и не может быть изменен на существующих индексах. Если значение NULL, используется алгоритм ClassicSimilarity.

suggesters

SearchSuggester[]

Предложения для индекса.

tokenFilters TokenFilter[]:

Маркер фильтрует индекс.

tokenizers LexicalTokenizer[]:

Маркеризаторы индекса.

vectorSearch

VectorSearch

Содержит параметры конфигурации, связанные с векторным поиском.

SearchIndexerDataNoneIdentity

Очищает свойство удостоверения источника данных.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.DataNoneIdentity

Фрагмент URI, указывающий тип удостоверения.

SearchIndexerDataUserAssignedIdentity

Указывает удостоверение для используемого источника данных.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.DataUserAssignedIdentity

Фрагмент URI, указывающий тип удостоверения.

userAssignedIdentity

string

Полный идентификатор ресурса Azure назначаемого пользователем управляемого удостоверения обычно в форме "/subscriptions/12345678-1234-1234-1234-1234567890ab/resourceGroups/rg/providers/Microsoft.ManagedIdentity/userAssignedIdentities/myId", который должен быть назначен службе поиска.

SearchResourceEncryptionKey

Ключ шифрования, управляемый клиентом, в Azure Key Vault. Ключи, которые вы создаете и которыми управляете, можно использовать для шифрования или расшифровки хранимых данных, таких как индексы и сопоставления синонимов.

Имя Тип Описание
accessCredentials.applicationId

string

Идентификатор приложения AAD, которому было предоставлено необходимые разрешения на доступ к Azure Key Vault, который будет использоваться при шифровании неактивных данных. Идентификатор приложения не следует путать с идентификатором объекта для приложения AAD.

accessCredentials.applicationSecret

string

Ключ проверки подлинности указанного приложения AAD.

identity SearchIndexerDataIdentity:

Явное управляемое удостоверение, используемое для этого ключа шифрования. Если не указано, а свойство учетных данных доступа равно NULL, используется управляемое удостоверение, назначаемое системой. При обновлении ресурса, если явное удостоверение не указано, оно остается неизменным. Если задано значение none, то значение этого свойства очищается.

keyVaultKeyName

string

Имя ключа Azure Key Vault, используемого для шифрования неактивных данных.

keyVaultKeyVersion

string

Версия ключа Azure Key Vault, используемая для шифрования неактивных данных.

keyVaultUri

string

Универсальный код ресурса (URI) Хранилища ключей Azure, который также называется DNS-именем, который содержит ключ, используемый для шифрования неактивных данных. Пример URI может быть https://my-keyvault-name.vault.azure.net.

SearchSuggester

Определяет, как API предложения должен применяться к группе полей в индексе.

Имя Тип Описание
name

string

Имя автора предложения.

searchMode enum:

analyzingInfixMatching

Значение, указывающее на возможности средства подбора.

sourceFields

string[]

Список имен полей, к которым применяется средство подбора. Каждое поле должно быть доступно для поиска.

SemanticConfiguration

Определяет определенную конфигурацию, используемую в контексте семантических возможностей.

Имя Тип Описание
name

string

Имя семантической конфигурации.

prioritizedFields

SemanticPrioritizedFields

Описание полей заголовка, содержимого и ключевых слов, используемых для семантического ранжирования, подписей, выделений и ответов. Необходимо задать по крайней мере один из трех вложенных свойств (titleField, приоритетыKeywordsFields и приоритетыContentFields).

rankingOrder

RankingOrder

Указывает тип оценки, который будет использоваться для сортировки результатов поиска.

SemanticField

Поле, используемое в рамках семантической конфигурации.

Имя Тип Описание
fieldName

string

Имя файла

SemanticPrioritizedFields

Описывает поля заголовка, содержимого и ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделений и ответов.

Имя Тип Описание
prioritizedContentFields

SemanticField[]

Определяет поля содержимого, которые будут использоваться для семантического ранжирования, подписей, выделения и ответов. Для достижения наилучшего результата выбранные поля должны содержать текст в виде естественного языка. Порядок полей в массиве отражает их приоритет. Поля с более низким приоритетом могут быть усечены, если содержимое длинное.

prioritizedKeywordsFields

SemanticField[]

Определяет поля ключевых слов, которые будут использоваться для семантического ранжирования, подписей, выделения и ответов. Для достижения наилучшего результата выбранные поля должны содержать список ключевых слов. Порядок полей в массиве отражает их приоритет. Поля с более низким приоритетом могут быть усечены, если содержимое длинное.

titleField

SemanticField

Определяет поле заголовка, которое будет использоваться для семантического ранжирования, подписей, выделения и ответов. Если в индексе нет поля заголовка, оставьте его пустым.

SemanticSearch

Определяет параметры индекса поиска, влияющего на семантические возможности.

Имя Тип Описание
configurations

SemanticConfiguration[]

Семантические конфигурации для индекса.

defaultConfiguration

string

Позволяет задать имя семантической конфигурации по умолчанию в индексе, что делает его необязательным для каждой передачи в качестве параметра запроса.

ShingleTokenFilter

Создает сочетания токенов в виде одного токена. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.ShingleTokenFilter

Дискриминатор производных типов.

filterToken

string

_

Строка для вставки для каждой позиции, в которой нет маркера. По умолчанию используется символ подчеркивания ("_").

maxShingleSize

integer (int32)

minimum: 2
2

Максимальный размер голени. Значение по умолчанию и минимальное значение — 2.

minShingleSize

integer (int32)

minimum: 2
2

Минимальный размер голени. Значение по умолчанию и минимальное значение — 2. Должно быть меньше значения maxShingleSize.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

outputUnigrams

boolean

True

Значение, указывающее, будет ли выходной поток содержать входные маркеры (юниграммы), а также мешки. Значение по умолчанию: true.

outputUnigramsIfNoShingles

boolean

False

Значение, указывающее, следует ли выводить юниграммы в те времена, когда не доступны мешки. Это свойство имеет приоритет, если outputUnigrams имеет значение false. По умолчанию — false.

tokenSeparator

string

Строка, используемая при присоединении смежных маркеров для формирования голени. По умолчанию используется одно пространство (" ").

SnowballTokenFilter

Фильтр, который стебляет слова с помощью созданного сноубола стебля. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.SnowballTokenFilter

Дискриминатор производных типов.

language

SnowballTokenFilterLanguage

Используемый язык.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

SnowballTokenFilterLanguage

Язык, используемый для фильтра маркеров Snowball.

Значение Описание
armenian

Выбирает токенизатор стемминга Lucene Snowball для армянского языка.

basque

Выбирает маркеризатор стеблей Lucene Snowball для Basque.

catalan

Выбирает токенизатор стемминга Lucene Snowball для каталанского языка.

danish

Выбирает маркеризатор стемминга Lucene Snowball для датского языка.

dutch

Выбирает маркеризатор стемминга Lucene Snowball для голландского языка.

english

Выбирает маркеризатор стемминга Lucene Snowball для английского языка.

finnish

Выбирает токенизатор стемминга Lucene Snowball для финского языка.

french

Выбирает маркеризатор стемминга Lucene Snowball для французского языка.

german

Выбирает маркеризатор стемминга Lucene Snowball для немецкого языка.

german2

Выбирает маркеризатор стемминга Lucene Snowball, использующий немецкий вариант алгоритма.

hungarian

Выбирает маркеризатор стемминга Lucene Snowball для венгерского языка.

italian

Выбирает токенизатор стемминга Lucene Snowball для итальянского языка.

kp

Выбирает маркеризатор стемминга Lucene Snowball для голландского языка, использующий алгоритм Kraaij-Pohlmann стемминга.

lovins

Выбирает маркеризатор стемминга Lucene Snowball для английского языка, использующий алгоритм выделения корней Lovins.

norwegian

Выбирает маркеризатор стемминга Lucene Snowball для норвежского языка.

porter

Выбирает маркеризатор стемминга Lucene Snowball для английского языка, использующий алгоритм выделения корней Портера.

portuguese

Выбирает токенизатор стемминга Lucene Snowball для португальского языка.

romanian

Выбирает токенизатор стеблей Lucene Snowball для румынского языка.

russian

Выбирает стемминг-токенизатор Lucene Snowball для русского языка.

spanish

Выбирает маркеризатор стемминга Lucene Snowball для испанского языка.

swedish

Выбирает маркеризатор стемминга Lucene Snowball для шведского языка.

turkish

Выбирает маркеризатор стемминга Lucene Snowball для турецкого языка.

StemmerOverrideTokenFilter

Предоставляет возможность переопределить другие фильтры с использованием пользовательских фильтров на основе словаря. Все термины, связанные с словарем, будут помечены как ключевые слова, чтобы они не были стеблированы с помощью стволовых модулей вниз по цепочке. Следует разместить перед всеми стемминговыми фильтрами. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.StemmerOverrideTokenFilter

Дискриминатор производных типов.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

rules

string[]

Список правил стека в следующем формате: "word => stem", например "run => run".

StemmerTokenFilter

Фильтр для конкретного языка. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.StemmerTokenFilter

Дискриминатор производных типов.

language

StemmerTokenFilterLanguage

Используемый язык.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

StemmerTokenFilterLanguage

Язык, используемый для фильтра маркеров парадигматического модуля.

Значение Описание
arabic

Выбирает маркеризатор выделения корней Lucene для арабского языка.

armenian

Выбирает токенизатор выделения корней Lucene для армянского языка.

basque

Выбирает разметчик корневых маркеров Lucene для баскского языка.

brazilian

Выбирает токенизатор выделения корней Lucene для португальского языка (Бразилия).

bulgarian

Выбирает токенизатор ценового стемминга для болгарского языка.

catalan

Выбирает токенизатор выделения стволов Lucene для каталанского языка.

czech

Выбирает токенизатор корневых токенов Lucene для чешского языка.

danish

Выбирает разметчик корневых маркеров Lucene для датского языка.

dutch

Выбирает разметчик выделения корней Lucene для голландского языка.

dutchKp

Выбирает маркеризатор выделения корней Lucene для голландского языка, использующий алгоритм Kraaij-Pohlmann стемминга.

english

Выбирает маркеризатор корневых маркеров Lucene для английского языка.

lightEnglish

Выбирает маркеризатор выделения корней Lucene для английского языка, который выполняет выделение светлых стеммингов.

minimalEnglish

Выбирает маркеризатор выделения корней Lucene для английского языка, который выполняет минимальное выделение корней.

possessiveEnglish

Выбирает маркеризатор корневых слов Lucene для английского языка, который удаляет завершающие притяжательные падежи из слов.

porter2

Выбирает разметчик выделения корней Lucene для английского языка, использующий алгоритм стемминга Porter2.

lovins

Выбирает маркеризатор корней Lucene для английского языка, использующий алгоритм выделения корней Lovins.

finnish

Выбирает маркеризатор выделения корней Lucene для финского языка.

lightFinnish

Выбирает токенизатор стемминга Lucene для финского языка, который выполняет светлый стемминг.

french

Выбирает маркеризатор выделения корней Lucene для французского языка.

lightFrench

Выбирает маркеризатор выделения корней Lucene для французского языка, который выполняет легкое выделение стеблей.

minimalFrench

Выбирает разметчик выделения корней Lucene для французского языка, который выполняет минимальное выделение корней.

galician

Выбирает маркеризатор корневых токенов Lucene для галисийского языка.

minimalGalician

Выбирает разметчик стемминга Lucene для Galician, который выполняет минимальное стеммирование.

german

Выбирает маркеризатор корневых маркеров Lucene для немецкого языка.

german2

Выбирает маркеризатор выделения корней Lucene, использующий немецкий вариант алгоритма.

lightGerman

Выбирает маркеризатор выделения корней Lucene для немецкого языка, который выполняет легкое выделение корней.

minimalGerman

Выбирает разметчик выделения корней Lucene для немецкого языка, который выполняет минимальное выделение корней.

greek

Выбирает маркеризатор корней Lucene для греческого языка.

hindi

Выбирает маркеризатор выделения корней Lucene для хинди.

hungarian

Выбирает маркеризатор корневых маркеров Lucene для венгерского языка.

lightHungarian

Выбирает токенизатор выделения стеблей Lucene для венгерского языка, который выполняет светлый стемминг.

indonesian

Выбирает маркеризатор выделения корней Lucene для индонезийского языка.

irish

Выбирает маркеризатор корневых маркеров Lucene для ирландского языка.

italian

Выбирает токенизатор выделения корней Lucene для итальянского языка.

lightItalian

Выбирает токенизатор Lucene для итальянского языка, который выполняет светлый стемминг.

sorani

Выбирает маркеризатор корней Lucene для Sorani.

latvian

Выбирает стемминг-токенизатор Lucene для латышского языка.

norwegian

Выбирает токенизатор Lucene stemming для норвежского языка (BokmÃ¥l).

lightNorwegian

Выбирает токенайзер Lucene stemming для норвежского (BokmÃ¥l), который выполняет лёгкое стемирование.

minimalNorwegian

Выбирает токенайзер Lucene stemming для норвежского (BokmÃ¥l), который выполняет минимальное стемминг.

lightNynorsk

Выбирает маркеризатор выделения корней Lucene для норвежского языка (Nynorsk), который выполняет выделение светлых стеммингов.

minimalNynorsk

Выбирает разметчик выделения корней Lucene для норвежского языка (Nynorsk), который выполняет минимальное выделение корней.

portuguese

Выбирает маркеризатор выделения корней Lucene для португальского языка.

lightPortuguese

Выбирает маркеризатор выделения корней Lucene для португальского языка, который выполняет светлый стемминг.

minimalPortuguese

Выбирает токенизатор выделения корней Lucene для португальского языка, который выполняет минимальное выделение корней.

portugueseRslp

Выбирает разметчик выделения корней Lucene для португальского языка, использующий алгоритм выделения корней RSLP.

romanian

Выбирает токенизатор выделения корней Lucene для румынского языка.

russian

Выбирает стемминг-токенизатор Lucene для русского языка.

lightRussian

Выбирает токенизатор ценового стемминга для русского языка, который выполняет светлый стемминг.

spanish

Выбирает разметчик выделения корней Lucene для испанского языка.

lightSpanish

Выбирает маркеризатор стемминга Lucene для испанского языка, который выполняет светлый стемминг.

swedish

Выбирает разметчик корневых маркеров Lucene для шведского языка.

lightSwedish

Выбирает разметчик выделения стемминга Lucene для шведского языка, который выполняет светлый стемминг.

turkish

Выбирает маркеризатор корневых токенов Lucene для турецкого языка.

StopAnalyzer

Делит текст на небуквенный; Применяет фильтры маркеров стоп-слов и строчных регистров. Этот анализатор реализуется с помощью Apache Lucene.

Имя Тип Описание
@odata.type string:

#Microsoft.Azure.Search.StopAnalyzer

Дискриминатор производных типов.

name

string

Имя анализатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

stopwords

string[]

Список стоп-слов.

StopwordsList

Определяет предопределенный список стоп-слов для конкретного языка.

Значение Описание
arabic

Выбор списка стоп-слов для арабского языка.

armenian

Выбор списка стоп-слов для армянского языка.

basque

Выбирает список стоп-слов для баскского языка.

brazilian

Выбор списка стоп-слов для португальского языка (Бразилия).

bulgarian

Выбирает список стоп-слов для болгарского языка.

catalan

Выбирает список стоп-слов для каталанского языка.

czech

Выбор списка стоп-слов для чешского языка.

danish

Выбор списка стоп-слов для датского языка.

dutch

Выбор списка стоп-слов для голландского языка.

english

Выбор списка стоп-слов для английского языка.

finnish

Выбор списка стоп-слов для финского языка.

french

Выбор списка стоп-слов для французского языка.

galician

Выбирает список стоп-слов для галисийского языка.

german

Выбор списка стоп-слов для немецкого языка.

greek

Выбор списка стоп-слов для греческого языка.

hindi

Выбор списка стоп-слов для хинди.

hungarian

Выбирает список стоп-слов для венгерского языка.

indonesian

Выбор списка стоп-слов для индонезийского языка.

irish

Выбор списка стоп-слов для ирландского языка.

italian

Выбор списка стоп-слов для итальянского языка.

latvian

Выбирает список стоп-слов для латышского языка.

norwegian

Выбор списка стоп-слов для норвежского языка.

persian

Выбор списка стоп-слов для персидского языка.

portuguese

Выбор списка стоп-слов для португальского языка.

romanian

Выбирает список стоп-слов для румынского языка.

russian

Выбирает список стоп-слов для русского языка.

sorani

Выбор списка стоп-слов для Sorani.

spanish

Выбор списка стоп-слов для испанского языка.

swedish

Выбор списка стоп-слов для шведского языка.

thai

Выбирает список стоп-слов для тайского языка.

turkish

Выбирает список стоп-слов для турецкого языка.

StopwordsTokenFilter

Удаляет стоп-слова из потока токенов. Этот фильтр маркеров реализуется с помощью Apache Lucene. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.StopwordsTokenFilter

Дискриминатор производных типов.

ignoreCase

boolean

False

Значение, указывающее, следует ли игнорировать регистр. Если значение true, все слова преобразуются в нижний регистр. По умолчанию — false.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

removeTrailing

boolean

True

Значение, указывающее, следует ли игнорировать последний поисковый термин, если это стоп-слово. Значение по умолчанию: true.

stopwords

string[]

Список стоп-слов. Это свойство и свойство списка стоп-слов не могут быть заданы.

stopwordsList

StopwordsList

english

Предопределенный список стоп-слов для использования. Это свойство и свойство stopwords не могут быть заданы. По умолчанию используется английский язык.

SynonymTokenFilter

Соответствует синонимам одного или нескольких слов в потоке маркеров. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.SynonymTokenFilter

Дискриминатор производных типов.

expand

boolean

True

Значение, указывающее, будут ли все слова в списке синонимов (если => нотация не используется) сопоставляться друг с другом. Если значение true, все слова в списке синонимов (если => нотация не используется) будут сопоставляться друг с другом. Следующий список: невероятный, невероятный, сказочный, удивительный эквивалент: невероятный, невероятный, сказочный, удивительный => невероятные, сказочные, удивительные, удивительные. Если ложь, следующий список: невероятный, невероятный, сказочный, удивительный будет эквивалентно: невероятным, невероятным, сказочным, удивительным => невероятным. Значение по умолчанию: true.

ignoreCase

boolean

False

Значение, указывающее, следует ли регистрировать входные данные для сопоставления. По умолчанию — false.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

synonyms

string[]

Список синонимов в одном из двух форматов: 1. невероятные, невероятные, сказочные => удивительные - все термины слева от => символ будет заменен всеми условиями на правой стороне; 2. невероятный, невероятный, сказочный, удивительный - запятая разделил список эквивалентных слов. Установите параметр expand, чтобы изменить способ интерпретации этого списка.

TagScoringFunction

Определяет функцию, которая повышает оценку документов со строковыми значениями, соответствующими заданному списку тегов.

Имя Тип Описание
boost

number (double)

Умножение для необработанной оценки. Должно быть положительным числом, не равным 1,0.

fieldName

string

Имя поля, используемого в качестве входных данных для функции оценки.

interpolation

ScoringFunctionInterpolation

Значение, указывающее, как повышение будет интерполировано по оценкам документов; По умолчанию используется значение "Linear".

tag

TagScoringParameters

Значения параметров для функции оценки тегов.

type string:

tag

Тип функции скоринга.

TagScoringParameters

Предоставляет значения параметров функции оценки тегов.

Имя Тип Описание
tagsParameter

string

Имя параметра, передаваемого в поисковых запросах для указания списка тегов для сравнения с целевым полем.

TextWeights

Определяет весы в полях индекса, для которых совпадения должны повысить оценку в поисковых запросах.

Имя Тип Описание
weights

object

Словарь весовых коэффициентов для каждого поля для повышения оценки документа. Ключи — это имена полей, а значения — веса для каждого поля.

TokenCharacterKind

Представляет классы символов, над которыми может работать фильтр маркеров.

Значение Описание
letter

Хранит буквы в токенах.

digit

Хранит цифры в токенах.

whitespace

Сохраняет пробелы в токенах.

punctuation

Сохраняет знаки препинания в токенах.

symbol

Хранит символы в токенах.

TokenFilterName

Определяет имена всех фильтров токенов, поддерживаемых поисковой системой.

Значение Описание
arabic_normalization

Фильтр маркеров, применяющий нормализатор арабского языка для нормализации орфографии. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ar/ArabicNormalizationFilter.html

apostrophe

Удаляет все знаки после апострофа (включая сам апостроф). См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/tr/ApostropheFilter.html

asciifolding

Преобразует алфавитные, числовые и символьные символы Юникода, которые не находятся в первых 127 символах ASCII (блок Юникода "Базовый латиница") в эквиваленты ASCII, если такие эквиваленты существуют. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

cjk_bigram

Формирует большие кадры терминов CJK, созданных из стандартного токенизатора. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKBigramFilter.html

cjk_width

Нормализует различия в ширине символов CJK. Складывает варианты ASCII полной ширины в эквивалентный базовый латинский язык, а полуширинные варианты катаканы — в эквивалентный кану. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKWidthFilter.html

classic

Удаляет англоязычные присяговы и точки из акронимов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicFilter.html

common_grams

Создает биграммы для часто встречающихся терминов при индексировании. Отдельные термины также индексируются с наложением биграмм. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/commongrams/CommonGramsFilter.html

edgeNGram_v2

Создает n-граммы заданных размеров, начиная с передней или задней части входного маркера. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenFilter.html

elision

Удаляет элизии. Например, "l'avion" (плоскость) преобразуется в "avion" (плоскость). См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

german_normalization

Нормализует немецкие символы в соответствии с эвристиками алгоритма снежного шара Германии 2. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/de/GermanNormalizationFilter.html

hindi_normalization

Нормализует текст на хинди, чтобы удалить некоторые различия в орфографических вариациях. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/hi/HindiNormalizationFilter.html

indic_normalization

Нормализует представление текста в Юникоде на индийских языках. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/in/IndicNormalizationFilter.html

keyword_repeat

Выводит каждый входящий токен дважды, один раз в качестве ключевого слова и один раз как не ключевое слово. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/KeywordRepeatFilter.html

kstem

Высокопроизводительный фильтр kstem для английского языка. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/en/KStemFilter.html

length

Удаляет слишком длинные или слишком короткие слова. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LengthFilter.html

limit

Ограничивает количество маркеров при индексировании. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LimitTokenCountFilter.html

lowercase

Нормализует токен текст в нижний регистр. См. https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

nGram_v2

Создает n-граммы заданного размера. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenFilter.html

persian_normalization

Применяет нормализацию для персидского языка. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/fa/PersianNormalizationFilter.html

phonetic

Создайте маркеры для фонетических совпадений. См. https://lucene.apache.org/core/4_10_3/analyzers-phonetic/org/apache/lucene/analysis/phonetic/package-tree.html

porter_stem

Для преобразования потока маркеров используется алгоритм стебля портера. См. http://tartarus.org/~martin/PorterStemmer

reverse

Переворачивает строку токенов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

scandinavian_normalization

Нормализует использование взаимозаменяемых скандинавских знаков. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianNormalizationFilter.html

scandinavian_folding

Складывает скандинавские иероглифы Ã¥Ã... äæÃ"Æa> и öÖã ̧à ̃-o>. Он также дискриминирует использование двойных гласных aa, ae, ao, oe и oo, оставляя только первый. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianFoldingFilter.html

shingle

Создает сочетания токенов в виде одного токена. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/shingle/ShingleFilter.html

snowball

Фильтр, который стебляет слова с помощью созданного сноубола стебля. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/snowball/SnowballFilter.html

sorani_normalization

Нормализует представление текста Sorani в Юникоде. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ckb/SoraniNormalizationFilter.html

stemmer

Фильтр для конкретного языка. См. https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

stopwords

Удаляет стоп-слова из потока токенов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

trim

Усекает пробелы в начале и конце токенов. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TrimFilter.html

truncate

Усечение терминов до определенной длины. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TruncateTokenFilter.html

unique

Отфильтровывает маркеры с тем же текстом, что и в предыдущем маркере. См. http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/RemoveDuplicatesTokenFilter.html

uppercase

Нормализует текст токена, переводя его в верхний регистр. См. https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

word_delimiter

Разделяет слова на подслова и выполняет необязательные преобразования в группах подслов.

TruncateTokenFilter

Усечение терминов до определенной длины. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.TruncateTokenFilter

Дискриминатор производных типов.

length

integer (int32)

maximum: 300
300

Длина усечения терминов. Значение по умолчанию и максимальное значение — 300.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

UaxUrlEmailTokenizer

Разбивает URL-адреса и сообщения электронной почты на один токен. Этот токенизатор реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.UaxUrlEmailTokenizer

Дискриминатор производных типов.

maxTokenLength

integer (int32)

maximum: 300
255

Максимальная длина маркера. Значение по умолчанию — 255. Токены, размер которых превышает максимальную длину, разделяются. Максимальная длина маркера, которую можно использовать, составляет 300 символов.

name

string

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

UniqueTokenFilter

Отфильтровывает маркеры с тем же текстом, что и в предыдущем маркере. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.UniqueTokenFilter

Дискриминатор производных типов.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

onlyOnSamePosition

boolean

False

Значение, указывающее, следует ли удалять дубликаты только в той же позиции. По умолчанию — false.

VectorEncodingFormat

Формат кодировки для интерпретации содержимого векторных полей.

Значение Описание
packedBit

Формат кодирования, представляющий биты, упакованные в более широкий тип данных.

VectorSearch

Содержит параметры конфигурации, связанные с векторным поиском.

Имя Тип Описание
algorithms VectorSearchAlgorithmConfiguration[]:

Содержит параметры конфигурации, относящиеся к алгоритму, используемому во время индексирования или запроса.

compressions VectorSearchCompression[]:

Содержит параметры конфигурации, относящиеся к методу сжатия, используемому во время индексирования или запроса.

profiles

VectorSearchProfile[]

Определяет сочетания конфигураций для использования с векторным поиском.

vectorizers VectorSearchVectorizer[]:

Содержит параметры конфигурации по векторным запросам вектора текста.

VectorSearchAlgorithmKind

Алгоритм, используемый для индексирования и запросов.

Значение Описание
hnsw

HNSW (иерархический навигации small world), тип приблизительного ближайшего алгоритма соседей.

exhaustiveKnn

Исчерпывающий алгоритм KNN, который будет выполнять поиск методом подбора.

VectorSearchAlgorithmMetric

Метрика сходства, используемая для векторных сравнений. Рекомендуется выбрать ту же метрику подобия, на которой обучалась модель встраивания.

Значение Описание
cosine

Измеряет угол между векторами, чтобы квалифицировать их сходство, игнорируя величину. Чем меньше угол, тем ближе сходство.

euclidean

Вычисляет расстояние прямой линии между векторами в многомерном пространстве. Чем меньше расстояние, тем ближе сходство.

dotProduct

Вычисляет сумму продуктов, мудрых элементами, чтобы оценить выравнивание и сходство величины. Чем больше, тем ближе сходство.

hamming

Применимо только к типам двоичных данных с битовой упаковкой. Определяет непохожесть путем подсчета разных позиций в двоичных векторах. Чем меньше различий, тем ближе сходство.

VectorSearchCompressionKind

Метод сжатия, используемый для индексирования и запросов.

Значение Описание
scalarQuantization

Скалярная квантизация, тип метода сжатия. В скалярной квантизации исходные значения векторов сжимаются до более узкого типа путем дискретизации и представления каждого компонента вектора с помощью сокращенного набора квантизованных значений, тем самым уменьшая общий размер данных.

binaryQuantization

Двоичная квантизация— тип метода сжатия. В двоичном квантизации исходные значения векторов сжимаются до более узкого двоичного типа путем дискретизации и представления каждого компонента вектора с использованием двоичных значений, тем самым уменьшая общий размер данных.

VectorSearchCompressionTarget

Квантованный тип данных сжатых векторных значений.

Значение Описание
int8

8-разрядное целое число со знаком.

VectorSearchProfile

Определяет сочетание конфигураций для использования с векторным поиском.

Имя Тип Описание
algorithm

string

Имя конфигурации алгоритма векторного поиска, которая определяет алгоритм и необязательные параметры.

compression

string

Имя конфигурации метода сжатия, указывающей метод сжатия и необязательные параметры.

name

string

Имя, которое будет связано с этим конкретным профилем векторного поиска.

vectorizer

string

Имя векторизации, настраиваемой для использования с векторным поиском.

VectorSearchVectorizerKind

Метод векторизации, который будет использоваться во время запроса.

Значение Описание
azureOpenAI

Создайте внедрение с помощью ресурса Azure OpenAI во время запроса.

customWebApi

Создание внедрения с помощью пользовательской веб-конечной точки во время запроса.

aiServicesVision

Создайте внедрения для ввода изображения или текста во время запроса с помощью API векторизации визуального распознавания служб ИСКУССТВЕННОго интеллекта Azure.

aml

Создавайте внедрения с помощью конечной точки Машинного обучения Azure, развернутой с помощью каталога моделей Azure AI Foundry во время запроса.

WebApiVectorizer

Задает определяемый пользователем векторизатор для создания векторного внедрения строки запроса. Интеграция внешнего векторизатора достигается с помощью пользовательского интерфейса веб-API набора навыков.

Имя Тип Описание
customWebApiParameters

WebApiVectorizerParameters

Задает свойства определяемого пользователем векторизатора.

kind string:

customWebApi

Тип VectorSearchVectorizer.

name

string

Имя, сопоставленное с этим конкретным методом векторизации.

WebApiVectorizerParameters

Задает свойства для подключения к определяемой пользователем векторизаторе.

Имя Тип Описание
authIdentity SearchIndexerDataIdentity:

Назначаемое пользователем управляемое удостоверение, используемое для исходящих подключений. Если указан идентификатор authResourceId и он не указан, используется управляемое удостоверение, назначаемое системой. При обновлении индексатора, если удостоверение не указано, значение остается неизменным. Если установлено значение "none", значение этого свойства очищается.

authResourceId

string

Применяется к пользовательским конечным точкам, которые подключаются к внешнему коду в функции Azure или другом приложении, предоставляющем трансформации. Это значение должно быть идентификатором приложения, созданным для функции или приложения при регистрации в Azure Active Directory. Если указано, векторизация подключается к функции или приложению с помощью управляемого идентификатора (системного или назначаемого пользователем) службы поиска и маркера доступа функции или приложения, используя это значение в качестве идентификатора ресурса для создания области маркера доступа.

httpHeaders

object

Заголовки, необходимые для выполнения HTTP-запроса.

httpMethod

string

Метод для HTTP-запроса.

timeout

string (duration)

Требуемое время ожидания запроса. Значение по умолчанию — 30 секунд.

uri

string (uri)

URI веб-API, предоставляющего векторизатор.

WordDelimiterTokenFilter

Разделяет слова на подслова и выполняет необязательные преобразования в группах подслов. Этот фильтр маркеров реализуется с помощью Apache Lucene.

Имя Тип Default value Описание
@odata.type string:

#Microsoft.Azure.Search.WordDelimiterTokenFilter

Дискриминатор производных типов.

catenateAll

boolean

False

Значение, указывающее, будут ли все части подсловных элементов катенироваться. Например, если задано значение true, "Azure-Search-1" становится "AzureSearch1". По умолчанию — false.

catenateNumbers

boolean

False

Значение, указывающее, будет ли выполняться максимальное число частей. Например, если задано значение true, значение "1–2" становится "12". По умолчанию — false.

catenateWords

boolean

False

Значение, указывающее, будет ли выполняться максимальное количество слов. Например, если для этого задано значение true, "Azure-Search" становится "AzureSearch". По умолчанию — false.

generateNumberParts

boolean

True

Значение, указывающее, следует ли создавать подзадачки чисел. Значение по умолчанию: true.

generateWordParts

boolean

True

Значение, указывающее, следует ли создавать слова частей. Если задано, создается часть слов; Например, AzureSearch становится "Azure" "Поиск". Значение по умолчанию: true.

name

string

Имя фильтра маркеров. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

preserveOriginal

boolean

False

Значение, указывающее, будут ли сохранены исходные слова и добавлены в список подслугов. По умолчанию — false.

protectedWords

string[]

Список маркеров для защиты от разделителя.

splitOnCaseChange

boolean

True

Значение, указывающее, следует ли разделять слова на caseChange. Например, если задано значение true, AzureSearch становится "Azure" "Поиск". Значение по умолчанию: true.

splitOnNumerics

boolean

True

Значение, указывающее, следует ли разделять числа. Например, если задано значение true, "Azure1Search" становится "Azure" "1" "Поиск". Значение по умолчанию: true.

stemEnglishPossessive

boolean

True

Значение, указывающее, следует ли удалять конечные "s" для каждого подсловия. Значение по умолчанию: true.