Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
В этой статье вы узнаете, как обучить пользовательскую модель для повышения точности распознавания из базовой модели Microsoft. Точность распознавания речи и качество пользовательской модели речи остается согласованной даже при выпуске новой базовой модели.
Примечание.
Вы оплачиваете использование пользовательской модели речи и хостинг конечных точек. С вас также будет взиматься плата за обучение пользовательской модели речи, если базовая модель была создана 1 октября 2023 г. или позже. Плата за обучение не взимается, если базовая модель была создана до октября 2023 года. Дополнительные сведения см. в разделе Azure Speech в разделе цен на средства Foundry и раздел "Стоимость адаптации" в руководстве по миграции для преобразования речи в текст 3.2.
Обучение модели обычно является итеративным процессом. Сначала вы выбираете базовую модель, которая является отправной точкой для новой модели. Вы обучаете модель с помощью наборов данных, которые могут включать текст и звук, а затем тестируете модель. Если качество или точность распознавания не соответствует вашим требованиям, можно создать новую модель с дополнительными или измененными данными обучения, а затем снова протестировать.
В течение ограниченного времени после обучения можно использовать пользовательскую модель. Вам придется периодически повторно создавать и адаптировать пользовательскую модель на основе последней версии базовой модели, чтобы пользоваться преимуществами более высокой точности и качества. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Внимание
Если вы обучаете пользовательскую модель с звуковыми данными, выберите ресурс службы в регионе с выделенным оборудованием для обучения звуковых данных. После обучения модели ее можно скопировать в ресурс Foundry для службы "Речь" в другом регионе по мере необходимости.
В регионах с выделенным оборудованием для обучения пользовательской речи, Служба распознавания речи может использовать до 100 часов ваших аудиоданных для обучения и обрабатывать около 10 часов данных в день. Дополнительные сведения см. в сносках к таблице регионы.
Создание модели
Подсказка
Перенесите ваши пользовательские модели речи из Speech Studio в Microsoft Foundry portal. На портале Microsoft Foundry вы можете продолжить с того места, на котором остановились, подключившись к вашему существующему ресурсу службы распознавания речи. Дополнительные сведения о подключении к существующему ресурсу службы "Речь" см. в разделе "Подключение к существующему ресурсу службы "Речь".
В новом портале Microsoft Foundry вы отправляете задание на тонкую настройку из мастера Fine-tune a model, который вы открыли, когда начали пользовательскую тонкую настройку речи.
- На панели "Проверка " просмотрите параметры и подтвердите расходы.
- Нажмите кнопку "Отправить ", чтобы запустить задание тонкой настройки.
- Дождитесь завершения обучения. После завершения обучения выберите пользовательскую модель, чтобы открыть страницу сведений.
После отправки наборов обучающих данных выполните следующие инструкции, чтобы начать обучение модели:
Войдите в службу Speech Studio.
Выберите "Настраиваемая речь> ", имя >проекта "Обучение пользовательских моделей".
Выберите Обучение новой модели.
На странице Выбор базовой модели выберите базовую модель и щелкните Далее. Если сомневаетесь, выберите последнюю модель в верхней части списка. Имя базовой модели соответствует дате ее выпуска в формате ГГГГММДД. Возможности настройки базовой модели перечислены в скобках после имени модели в Speech Studio.
Внимание
Запишите дату истечения срока действия адаптации. Это последняя дата, когда вы можете использовать базовую модель для обучения. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
На странице выбора данных выберите один или несколько наборов данных, которые будут использоваться для обучения. Если наборы данных недоступны, отмените процесс настройки, а затем перейдите в меню Наборы данных "Речь", чтобы загрузить наборы данных.
Введите имя и описание пользовательской модели, а затем щелкните Далее.
При необходимости установите флажок Добавить тест в следующем шаге. Этот шаг можно пропустить и выполнить тесты позднее. Дополнительные сведения см. в статьях Проверка качества распознавания речи и Количественная проверка модели.
Щелкните Сохранить и закрыть, чтобы запустить сборку пользовательской модели.
Вернитесь на страницу Обучение пользовательских моделей.
Внимание
Обратите внимание на дату окончания срока действия. Это последняя дата, когда пользовательскую модель можно использовать для распознавания речи. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Прежде чем продолжить, убедитесь, что у вас установлен и настроен Speech CLI.
Чтобы создать модель с наборами данных для обучения, используйте команду spx csr model create. Создайте параметры запроса в соответствии со следующими инструкциями:
-
projectЗадайте для свойства идентификатор существующего проекта. Свойствоprojectрекомендуется, чтобы можно было также управлять тонкой настройкой пользовательской речи на портале Microsoft Foundry. Чтобы получить идентификатор проекта, ознакомьтесь с идентификатором проекта для документации по REST API. - Задайте необходимое
datasetсвойство идентификатору набора данных, который вы хотите использовать для обучения. Чтобы указать несколько наборов данных, задайте параметрdatasets(несколько идентификаторов) и разделите идентификаторы точкой с запятой. - Задайте обязательное свойство
language. Локаль набора данных должна соответствовать локали проекта. Нельзя будет изменить локаль позже. Свойство командной строкиlanguageслужбы речевой обработки соответствует свойствуlocaleв запросе и ответе JSON. - Задайте обязательное свойство
name. Этот параметр — это имя, отображаемое на портале Microsoft Foundry. Свойство командной строкиnameслужбы речевой обработки соответствует свойствуdisplayNameв запросе и ответе JSON. - При необходимости можно задать свойство
base. Например:--base bbbbcccc-1111-dddd-2222-eeee3333ffff. Если не указатьbase, будет использоваться модель, используемая по умолчанию для локали. Свойство командной строкиbaseслужбы речевой обработки соответствует свойствуbaseModelв запросе и ответе JSON.
Ниже приведен пример команды CLI службы "Речь", которая создает модель с наборами данных для обучения:
spx csr model create --api-version v3.2 --project YourProjectId --name "My Model" --description "My Model Description" --dataset YourDatasetId --language "en-US"
Внимание
Необходимо задать --api-version v3.2. Интерфейс командной строки службы "Речь" использует REST API, но пока не поддерживает версии позже v3.2.
Вы должны получить ответ в следующем формате:
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/aaaabbbb-0000-cccc-1111-dddd2222eeee",
"baseModel": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/base/bbbbcccc-1111-dddd-2222-eeee3333ffff"
},
"datasets": [
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/ccccdddd-2222-eeee-3333-ffff4444aaaa"
}
],
"links": {
"manifest": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd/manifest",
"copy": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd:copy",
"files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd/files"
},
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
"properties": {
"deprecationDates": {
"transcriptionDateTime": "2026-07-15T00:00:00Z"
},
"customModelWeightPercent": 30,
"features": {
"supportsTranscriptions": true,
"supportsEndpoints": true,
"supportsTranscriptionsOnSpeechContainers": false,
"supportedOutputFormats": [
"Display",
"Lexical"
]
}
},
"lastActionDateTime": "2024-07-14T21:38:40Z",
"status": "Running",
"createdDateTime": "2024-07-14T21:38:40Z",
"locale": "en-US",
"displayName": "My Model",
"description": "My Model Description"
}
Внимание
Запишите дату, указанную в свойстве adaptationDateTime. Это последняя дата, когда вы можете использовать базовую модель для обучения. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Запишите дату, указанную в свойстве transcriptionDateTime. Это последняя дата, когда пользовательскую модель можно использовать для распознавания речи. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Свойство верхнего уровня self в тексте ответа представляет собой URI модели. Используйте этот URI для получения сведений о проекте модели, манифесте и датах устаревания. Этот URI также используется для обновления или удаления модели.
Для получения справки по командам CLI службы "Речь" для работы с моделями выполните следующую команду:
spx help csr model
Чтобы создать модель с наборами данных для обучения, используйте Models_Create операцию преобразования речи в текстовый REST API. Создайте текст запроса в соответствии со следующими инструкциями:
- Задайте для свойства
projectзначение URI существующего проекта. Это свойство рекомендуется, чтобы вы также могли просматривать и управлять моделью на портале Microsoft Foundry. Чтобы получить идентификатор проекта, ознакомьтесь с идентификатором проекта для документации по REST API. - В качестве значения обязательного свойства
datasetsукажите URI наборов данных, которые вы хотите использовать для обучения. - Задайте обязательное свойство
locale. Локаль модели должна соответствовать локали проекта и базовой модели. Нельзя будет изменить локаль позже. - Задайте обязательное свойство
displayName. Это свойство — имя, отображаемое на портале Microsoft Foundry. - При необходимости можно задать свойство
baseModel. Например:"baseModel": {"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/base/bbbbcccc-1111-dddd-2222-eeee3333ffff"}. Если не указатьbaseModel, будет использоваться модель, используемая по умолчанию для локали.
Выполните HTTP-запрос POST, используя URI, как показано в следующем примере. Замените YourSpeechResoureKey на ключ ресурса Speech, замените YourResourceName на имя ресурса Speech и задайте свойства тела запроса, как описано ранее.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourSpeechResoureKey" -H "Content-Type: application/json" -d '{
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
"displayName": "My Model",
"description": "My Model Description",
"baseModel": null,
"datasets": [
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/ccccdddd-2222-eeee-3333-ffff4444aaaa"
}
],
"locale": "en-US"
}' "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models"
Примечание.
В этом примере параметр baseModel не задан, поэтому используется базовая модель по умолчанию для языкового стандарта. В тексте ответа возвращается URI базовой модели.
Вы должны получить ответ в следующем формате:
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/aaaabbbb-0000-cccc-1111-dddd2222eeee",
"baseModel": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/base/bbbbcccc-1111-dddd-2222-eeee3333ffff"
},
"datasets": [
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/ccccdddd-2222-eeee-3333-ffff4444aaaa"
}
],
"links": {
"manifest": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd/manifest",
"copy": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd:copy",
"files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/9e240dc1-3d2d-4ac9-98ec-1be05ba0e9dd/files"
},
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
"properties": {
"deprecationDates": {
"transcriptionDateTime": "2026-07-15T00:00:00Z"
},
"customModelWeightPercent": 30,
"features": {
"supportsTranscriptions": true,
"supportsEndpoints": true,
"supportsTranscriptionsOnSpeechContainers": false,
"supportedOutputFormats": [
"Display",
"Lexical"
]
}
},
"lastActionDateTime": "2024-07-14T21:38:40Z",
"status": "Running",
"createdDateTime": "2024-07-14T21:38:40Z",
"locale": "en-US",
"displayName": "My Model",
"description": "My Model Description"
}
Внимание
Запишите дату, указанную в свойстве adaptationDateTime. Это последняя дата, когда вы можете использовать базовую модель для обучения. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Запишите дату, указанную в свойстве transcriptionDateTime. Это последняя дата, когда пользовательскую модель можно использовать для распознавания речи. Дополнительные сведения см. в разделе Жизненный цикл модели и конечной точки.
Свойство верхнего уровня self в тексте ответа представляет собой URI модели. Используйте этот URI для получения сведений о проекте, манифесте и датах окончания срока действия. Этот URI также используется для обновления или удаления модели.
Копирование модели
Модель можно скопировать в другой проект, использующий тот же языковой стандарт. Например, после того как модель обучена с аудиоданными в регионе с выделенным оборудованием для обучения, вы можете скопировать её в ресурс Foundry для работы с речью в другом регионе по мере необходимости.
Выполните следующие инструкции, чтобы скопировать модель в проект в другом регионе:
- Войдите в службу Speech Studio.
- Выберите "Настраиваемая речь> ", имя >проекта "Обучение пользовательских моделей".
- Выберите Копировать в.
- На странице Копирование модели речи выберите целевой регион, в который требуется скопировать модель.
- Выберите ресурс Foundry для службы речи в целевом регионе или создайте новый ресурс речи.
- Выберите проект, в который нужно скопировать модель, или создайте новый проект.
- Выберите Копировать.
После успешного копирования модели вы получите уведомление и сможете просмотреть модель в целевом проекте.
Прежде чем продолжить, убедитесь, что у вас установлен и настроен Speech CLI.
Интерфейс командной строки Speech CLI поддерживает команду spx csr model copy для копирования модели. Однако интерфейс командной строки еще не включает команду авторизации копирования. Чтобы выполнить полный поток копирования, используйте REST API для преобразования речи в текст или портал Microsoft Foundry.
Для помощи с копированием модели через интерфейс командной строки Speech выполните следующую команду:
spx help csr model copy
Для копирования модели в другой ресурс службы "Речь в текст" REST API в версии 3.2 требуется выполнить два шага:
- Авторизовать копиюцелевого ресурса службы "Речь".
- Скопируйте модель из исходного ресурса службы "Речь".
Шаг 1. Авторизация копии
Вызовите операцию Models_AuthorizeCopy на целевом ресурсе "Speech". В теле запроса задайте для свойства sourceResourceId идентификатор ресурса Azure для source речевого ресурса, где в настоящее время находится модель.
Замените YourTargetSpeechResourceKey ключом целевого ресурса и YourTargetResourceName именем целевого ресурса.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourTargetSpeechResourceKey" -H "Content-Type: application/json" -d '{
"sourceResourceId": "/subscriptions/YourSourceSubscriptionId/resourceGroups/YourSourceResourceGroup/providers/Microsoft.CognitiveServices/accounts/YourSourceSpeechResourceName"
}' "https://YourTargetResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models:authorizecopy"
Вы получите ModelCopyAuthorization ответ в следующем формате:
{
"targetResourceRegion": "westus2",
"targetResourceId": "/subscriptions/targetSubscriptionId/resourceGroups/targetResourceGroupName/providers/Microsoft.CognitiveServices/accounts/targetSpeechResourceName",
"targetResourceEndpoint": "https://YourTargetResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models",
"sourceResourceId": "/subscriptions/sourceSubscriptionId/resourceGroups/sourceResourceGroupName/providers/Microsoft.CognitiveServices/accounts/sourceSpeechResourceName",
"expirationDateTime": "2025-01-07T11:34:12Z",
"id": "d61573c6-788b-4eff-b3f5-38a1c7a9585b"
}
Сохраните весь текст ответа. Вы передаете его в качестве текста запроса на следующем шаге.
Шаг 2. Копирование модели
Вызовите операцию Models_Copy в ресурсе source "Речь". Передайте полный ModelCopyAuthorization ответ из шага 1 в качестве текста запроса.
Замените YourModelId идентификатором модели, YourSourceSpeechResourceKey ключом исходного ресурса и YourSourceResourceName именем исходного ресурса.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourSourceSpeechResourceKey" -H "Content-Type: application/json" -d '{
"targetResourceRegion": "westus2",
"targetResourceId": "/subscriptions/targetSubscriptionId/resourceGroups/targetResourceGroupName/providers/Microsoft.CognitiveServices/accounts/targetSpeechResourceName",
"targetResourceEndpoint": "https://YourTargetResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models",
"sourceResourceId": "/subscriptions/sourceSubscriptionId/resourceGroups/sourceResourceGroupName/providers/Microsoft.CognitiveServices/accounts/sourceSpeechResourceName",
"expirationDateTime": "2025-01-07T11:34:12Z",
"id": "d61573c6-788b-4eff-b3f5-38a1c7a9585b"
}' "https://YourSourceResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models/YourModelId:copy"
Вы получите ответ с заголовком 202 AcceptedOperation-Location , который можно использовать для отслеживания состояния копирования. Текст ответа содержит сведения об операции:
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/operations/models/copy/e30f6a27-82be-4cca-9258-0399c70489ff",
"createdDateTime": "2025-01-07T11:34:12Z",
"lastActionDateTime": "2025-01-07T11:34:12Z",
"status": "NotStarted",
"id": "e30f6a27-82be-4cca-9258-0399c70489ff"
}
Примечание.
Авторизация копирования действительна только до тех пор, пока не будет возвращена на expirationDateTime шаге 1. Запустите копию до истечения срока действия авторизации.
Подключение модели
Модели можно скопировать из одного проекта с помощью CLI службы "Речь" или REST API без подключения к другому проекту. Для подключения модели необходимо обновить её добавлением ссылки на проект.
Если появится запрос в Speech Studio, вы можете подключить их, нажав кнопку "Подключить ".
Прежде чем продолжить, убедитесь, что у вас установлен и настроен Speech CLI.
Чтобы подключить модель к проекту, используйте команду spx csr model update. Создайте параметры запроса в соответствии со следующими инструкциями:
-
projectЗадайте для свойства идентификатор существующего проекта. Свойствоprojectрекомендуется, чтобы можно было также управлять тонкой настройкой пользовательской речи на портале Microsoft Foundry. Чтобы получить идентификатор проекта, ознакомьтесь с идентификатором проекта для документации по REST API. - Задайте требуемое
modelIdсвойство идентификатору модели, которую требуется подключить к проекту.
Приведён пример команды интерфейса командной строки для распознавания речи, которая подключает модель к проекту.
spx csr model update --api-version v3.2 --model YourModelId --project YourProjectId
Внимание
Необходимо задать --api-version v3.2. Интерфейс командной строки службы "Речь" использует REST API, но пока не поддерживает версии позже v3.2.
Вы должны получить ответ в следующем формате:
{
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
}
Для получения справки по командам CLI службы "Речь" для работы с моделями выполните следующую команду:
spx help csr model
Чтобы подключить новую модель к проекту ресурса "Речь", в котором была скопирована модель, используйте Models_Update операцию преобразования речи в текстовый REST API. Создайте текст запроса в соответствии со следующими инструкциями:
- В качестве значения обязательного свойства
projectукажите URI существующего проекта. Это свойство рекомендуется, чтобы вы также могли просматривать и управлять моделью на портале Microsoft Foundry. Чтобы получить идентификатор проекта, ознакомьтесь с идентификатором проекта для документации по REST API.
Выполните HTTP-запрос PATCH с использованием URI, как показано в следующем примере. Используйте URI новой модели. Идентификатор новой модели можно получить из свойства self тела ответа Models_Copy. Замените YourSpeechResoureKey на ключ ресурса Speech, замените YourResourceName на имя ресурса Speech и задайте свойства тела запроса, как описано ранее.
curl -v -X PATCH -H "Ocp-Apim-Subscription-Key: YourSpeechResoureKey" -H "Content-Type: application/json" -d '{
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
}' "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/models"
Вы должны получить ответ в следующем формате:
{
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/ddddeeee-3333-ffff-4444-aaaa5555bbbb"
},
}