Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Важно
Для удобства предоставляются только переводы, отличные от английского языка. Ознакомьтесь с EN-US версией этого документа для окончательной версии.
Примечание
Эта статья предоставляется только для информационных целей, а не для предоставления юридических консультаций. Мы настоятельно рекомендуем обратиться к специалистам по юридическим вопросам при реализации служб распознавания речи.
В этой статье приводятся высокоуровневые детали о том, как преобразование речи в текст обрабатывает данные, предоставляемые клиентами. Обратите внимание, что звуковые данные людей, говорящих и связанные текстовые расшифровки, могут считаться личными данными и /или конфиденциальными данными в соответствии с различными правилами конфиденциальности и законами, поскольку он содержит не только голос людей, но и содержимое звука может также содержать личную информацию в зависимости от контекста, в котором был собран звук. Звуковые данные и связанные расшифровки текста также могут регулироваться в соответствии с различными законами о связи или другими законами и нормативными положениями. Как важное напоминание, вы несете ответственность за внедрение этой технологии и должны получить все необходимые разрешения на обработку данных, а также любые лицензии, разрешения или другие имущественные права, необходимые для контента, который вы вводите в службу преобразования речи в текст. Вы несете ответственность за соблюдение всех применимых законов и положений в вашей юрисдикции.
Какие данные обрабатывает система преобразования речи в текст?
Речь в тексте обрабатывает следующие типы данных:
-
Аудиовход или голосовой аудио: Все функции преобразования речи в текст принимают голосовой аудиосигнал в качестве входа, который передается потоком через Speech SDK или REST API в конечную точку службы. В пакетной транскрипции аудиовход отправляется в место хранения, указанное клиентом, после чего служба "Речь" обращается к аудиовходу и обрабатывает его для предоставления запрошенных услуг транскрипции. Дополнительные сведения о том, как указать хранилище, см. в разделе "Использование пакетного транскрибирования" в
. - Текст транскрибирования ввода: При оценке произношения транскрибированные тексты отправляются вместе с входным голосовым звуком как правильный текст. Произношение оценивается на основе входных транскрипций.
- Транскрибирование для перевода речи: При использовании функции перевода речи транскрибированный текст, созданный системой распознавания речи, переводится на указанный язык с помощью службы перевода.
Служба перевода текста используется только для преобразования текста из одного языка в другой. Входные и выходные данные не сохраняются службой "Речь" после завершения запроса на перевод. Дополнительные сведения о службе перевода текста см. в разделе "Что такое служба переводчика ".
Если пользователям требуется транскрибированный или переведенный текст в звуковом формате, функция отправляет выходной текст в синтезатор речи. Данные снова не сохраняются в процессе обработки данных для преобразования текста в речь.
Важно
Если вы используете продукты или службы Майкрософт для обработки биометрических данных, вы несете ответственность за: (i) предоставление уведомления субъектам данных, в том числе в отношении периодов хранения и уничтожения; (ii) получение согласия от субъектов данных; и (iii) удаление биометрических данных в соответствии с требованиями к защите данных. "Биометрические данные" будут иметь значение, заданное в статье 4 GDPR, и, если применимо, эквивалентные термины в других требованиях к защите данных.
Как происходит обработка данных при преобразовании речи в текст?
Преобразование речи в текст в режиме реального времени
Когда клиентское приложение отправляет входные аудиоданные для преобразования речи в текст, модуль распознавания речи анализирует эти данные и преобразует их в текст. Опираясь на свои функции акустического и лингвистического или языкового анализа, система преобразования речи в текст выбирает кандидатные слова и фразы, которые могут быть произнесены в звуковом сигнале. Выходные данные транскрибирования представляют собой лучший вывод или прогноз в текстовом формате того, что было произнесено в звуковом вводе.
Для преобразования речи в текст в реальном времени входные аудиоданные обрабатываются только в памяти сервера Azure, и данные не сохраняются. Все передаваемые данные шифруются для защиты. Дополнительные сведения о всеобъемлющей защите и защите конфиденциальности Azure см. в Доверенное облако: безопасность, конфиденциальность, соответствие, устойчивость и интеллектуальная собственность (IP).
Пакетное транскрибирование
В пакетном транскрибировании клиенты указывают выбранное место хранения как входных, так и выходных текстовых файлов транскрибирования для службы "Речь" для доступа, обработки и предоставления выходных данных транскрибирования. Клиент управляет хранилищем этих данных, включая хранение таких данных. Клиенты могут задать время хранения для созданных текстовых файлов транскрибирования с помощью параметра timeToLive. Дополнительные сведения см. в статье "Свойства конфигурации пакетного транскрибирования".
См. потоки данных для каждой функции преобразования речи в текст:
Диаризация и разделение динамиков
Эта возможность доступна как для API в режиме реального времени, так и для пакетного API. Когда клиенты включают опцию разделения динамиков (диаризация) (отключено по умолчанию), механизм преобразования речи в текст анализирует и извлекает уникальные сигналы голосовых характеристик из звукового ввода, чтобы различать голоса различных динамиков. Эти сигналы характеристик голоса используются и временно сохраняются для единственной цели аннотирования результатов транскрипции с маркерами рядом с текстом для Спикера 1 (гость-1) или Спикера 2 (гость-2). По завершении процесса все данные сигнала, используемые для разделения динамиков, удаляются. Функция разделения динамиков поддерживает разделение двух или нескольких динамиков в одном звуковом файле. Разделение говорящих не поддерживает регистрацию распознавания личности говорящего или возможность отслеживать уникальных говорящих в нескольких звуковых файлах.
Обнаружение языка
Распознавание речи аналогично распознаванию речи, за исключением того, что модель вычисляет вероятности сопоставления между фонемами и языками. Каждый язык имеет определенные фонемы и сочетания фонем, которые характеризуют язык. Модель обнаружения языка определяет характеристики в фонемах для вычисления вероятности языков, используемых в входном голосе.
Перевод речи
Во-первых, при использовании перевода речи аудиовход используется для создания текста, машинно транскрибированного с помощью распознавания речи в текст. Затем машинный транскрибированные текст отправляется в службу перевода текста, чтобы преобразовать текст (на исходном языке) в другой язык. Если заказчикам нужен перевод текста в аудиоформат, эта функция может отправлять переведенный текст в текст в речь. У клиентов есть возможность создавать только переведенный текст или перевод голосовых выходных данных.
Контейнеры для обработки речи
С помощью контейнеров речи клиенты развертывают API-интерфейсы служб "Речь" в собственной среде с помощью контейнеров Docker. Так как все компоненты речи выполняются в управляемой среде клиентов, входные данные звука и выходные данные транскрибирования обрабатываются в контейнере клиентов и не отправляются в облачную службу "Речь". Дополнительные сведения см. в разделе "Установка и запуск контейнеров Docker" для API-интерфейсов службы "Речь ".
Безопасность данных клиентов в аудиоконтейнере
Безопасность данных клиента является общей ответственностью. Подробные сведения о модели безопасности контейнеров Azure ИИ, таких как контейнер распознавания речи, можно найти в Foundry Tools container security.
Вы несете ответственность за защиту и обслуживание оборудования и инфраструктуры, необходимых для работы контейнеров речи, расположенных в локальной среде, таких как пограничное устройство и сеть.
Дополнительные сведения о обязательствах по конфиденциальности и безопасности Microsoft см. в центре управления безопасностью Microsoft.
Хранение и сохранение данных
Нет трассировки данных
При выполнении речи в режиме реального времени с текстом, быстрой транскрибированием, оценкой произношения и переводом речи Microsoft не сохраняет данные, предоставляемые клиентами. В пакетном транскрибировании клиенты указывают собственные расположения хранилища для отправки входных данных звука. Созданный текст транскрипции может храниться либо в собственном хранилище клиента, либо в хранилище Microsoft, если хранилище не было указано. Если выходные транскрибирования хранятся в хранилище Microsoft, клиенты могут удалить данные либо путем вызова API удаления, либо настройки параметра timeToLive для автоматического удаления данных в заданное время. Дополнительные сведения см. в статье "Как использовать пакетное транскрибирование - Служба речи - Инструменты Foundry".
Дополнительные сведения о обязательствах по конфиденциальности и безопасности Microsoft см. в центре Microsoft Trust Center.