Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Речь в тексте REST API используется для быстрого транскрибирования, пакетного транскрибирования и пользовательской речи.
Внимание
Версия REST API 2025-10-15 преобразования речи в текст — это последняя версия, общедоступная.
-
API преобразования речи в текст REST версия
2024-05-15-previewбудет прекращена к дате, которая будет объявлена. - Распознавание речи в REST API
v3.0,3.2-preview.1, и3.2-preview.2были выведены из эксплуатации 31 марта 2026 года.
Дополнительные сведения об обновлении см. в руководствах по миграции службы "Речь" на текст REST API версии 3.0 до версии 3.1, версии 3.2до 2024-11-15 и 2024-11-15 до 2025-10-15 .
Для выполнения следующих действий используйте REST API преобразования речи в текст:
- Быстрое транскрибирование: транскрибирование аудиофайлов с возвратом результатов синхронно и гораздо быстрее, чем звук в режиме реального времени. Используйте API для быстрого транскрибирования (/speechtotext/transcriptions:transcribe) в сценариях, когда нужна расшифровка аудиозаписи, как можно быстрее и с предсказуемой задержкой, например, быстрая транскрипция аудио или видео.
- Пакетное транскрибирование: транскрибировать аудиофайлы пакетно из нескольких URL-адресов или контейнера Azure. Используйте API пакетного транскрибирования (/speechtotext/транскрибирование:submit) в сценариях, когда необходимо транскрибировать большое количество аудио из хранилища, например, большое количество файлов или один длинный звуковой файл.
- Настраиваемая речь: отправка собственных данных, тестирование и обучение пользовательской модели, сравнение точности между моделями и развертывание модели в пользовательской конечной точке. Копирование моделей в другие подписки в случае, если необходимо предоставить коллегам доступ к созданной вами модели, или когда требуется развернуть модель в нескольких регионах.
REST API преобразования речи в текст включает в себя такие функции, как:
- Запрос журналов для каждой конечной точки.
- Запрос манифеста создаваемых моделей для настройки локальных контейнеров.
- Загрузите данные из учетных записей хранения Azure, используя URI с общей подписью доступа (SAS).
- Принесите собственное хранилище. Используйте собственные учетные записи хранения для журналов, файлов транскрибирования и других данных.
- Некоторые операции поддерживают уведомления веб-перехватчика. Вы можете зарегистрировать свои веб-перехватчики в той точке, где отправляются уведомления.
Быстрое транскрибирование
Следующие группы операций применимы для быстрого транскрибирования.
| Группа операций | Описание |
|---|---|
| Транскрипции | Используйте Транскрипции - Транскрибировать для транскрибирования аудиофайлов. При использовании быстрого транскрибирования вы отправляете один файл на запрос. Примеры создания транскрибирования из одного звукового файла см. в статье "Создание транскрибирования ". |
Пакетное транскрибирование
Для пакетного транскрибирования применимы следующие группы операций.
| Группа операций | Описание |
|---|---|
| Модели | Используйте базовые модели или пользовательские модели для транскрибирования звуковых файлов. Модели можно использовать с пользовательской речью и пакетной транскрипцией. Например, можно использовать модель, обученную с определенным набором данных для транскрибирования звуковых файлов. Примеры обучения и управления пользовательскими моделями речи см. в статье "Обучение модели" и "Жизненный цикл пользовательской модели речи". |
| Транскрипции | Используйте Транскрипции - Отправить для транскрибирования большого количества хранимого аудио. При использовании транскрибирования batch вы отправляете несколько файлов на запрос или указываете на контейнер Хранилище BLOB-объектов Azure с звуковыми файлами для расшифровки. Примеры создания транскрибирования из нескольких звуковых файлов см. в статье "Создание транскрибирования ". |
| Веб-хуки | Используйте веб-перехватчики для получения уведомлений о создании, обработке, завершении и удалении событий. Вы можете использовать веб-хуки с пользовательской речью и пакетной транскрипцией. Веб-перехватчики применяются к наборам данных, конечным точкам, оценкам, моделям и транскрипциям. |
Настраиваемая речь
Для пользовательской речи применимы следующие группы операций.
| Группа операций | Описание |
|---|---|
| Наборы данных | Используйте наборы данных для обучения и тестирования пользовательских моделей речи. Например, можно сравнить производительность пользовательской речи, обученной с определенным набором данных, с производительностью базовой модели или пользовательской модели речи , обученной с другим набором данных. Примеры отправки наборов данных см. в статье "Отправка обучающих и тестовых наборов данных". |
| Конечные точки | Развертывание пользовательских моделей речи в конечных точках. Для использования пользовательской модели речи необходимо развернуть пользовательскую конечную точку. Примеры управления конечными точками развертывания см. в статье "Развертывание модели ". |
| Оценки | Используйте оценки для сравнения производительности различных моделей. Например, можно сравнить производительность пользовательской модели речи , обученную с определенным набором данных, с производительностью базовой модели или пользовательской модели, обученной с другим набором данных. Примеры, как тестировать и оценивать пользовательские модели распознавания речи, см. в разделах тестирование качества распознавания и точность тестирования. |
| Модели | Используйте базовые модели или пользовательские модели для транскрибирования звуковых файлов. Модели можно использовать с пользовательской речью и пакетной транскрипцией. Например, можно использовать модель, обученную с определенным набором данных для транскрибирования звуковых файлов. Примеры обучения и управления пользовательскими моделями речи см. в статье "Обучение модели" и "Жизненный цикл пользовательской модели речи". |
| Проекты | Используйте проекты для управления пользовательскими моделями речи, обучением и тестированием наборов данных и конечными точками развертывания. Пользовательские проекты речи содержат модели, обучающие и тестовые наборы данных, а также конечные точки развертывания. Каждый проект специфичен для региона. Например, можно создать проект для английского языка в Соединенных Штатах. Примеры создания проектов см. в статье "Создание проекта ". |
| Веб-хуки | Используйте веб-перехватчики для получения уведомлений о создании, обработке, завершении и удалении событий. Вы можете использовать веб-хуки с пользовательской речью и пакетной транскрипцией. Веб-перехватчики применяются к наборам данных, конечным точкам, оценкам, моделям и транскрипциям. |