Данные, конфиденциальность и безопасность системы преобразования текста в речь

Важно

Для удобства предоставляются только переводы, отличные от английского языка. Ознакомьтесь с EN-US версией этого документа для окончательной версии.

В этой статье содержатся сведения о том, как данные, предоставляемые вами, обрабатываются, используются и хранятся в Azure Speech в текстовом синтезе речи Foundry Tools. Как важное напоминание, вы несете ответственность за использование и реализацию этой технологии и должны получить все необходимые разрешения, включая, если применимо, от таланта по голосам и аватарам (и, если применимо, от пользователей ваших персональных голосовых интеграций) для обработки их голоса, изображения, образа и/или других данных для разработки искусственных голосов и/или аватаров.

Вы также несете ответственность за получение лицензий, разрешений или других прав, необходимых для ввода содержимого в службу речи для создания аудио, изображения и /или видео. Некоторые юрисдикции могут предъявлять особые юридические требования к сбору, обработке и хранению определенных категорий данных, таких как биометрические данные, и обязать раскрытие использования синтетических голосов, изображений и/или видео пользователям. Прежде чем использовать текст для обработки и хранения данных любого вида и, если применимо, для создания пользовательского нейронного голоса, личного голоса или пользовательских моделей аватара, необходимо убедиться, что вы соответствуете всем юридическим требованиям, которые могут применяться к вам.

Важно

Если вы используете продукты или службы Майкрософт для обработки биометрических данных, вы несете ответственность за: (i) предоставление уведомления субъектам данных, в том числе в отношении периодов хранения и уничтожения; (ii) получение согласия от субъектов данных; и (iii) удаление биометрических данных в соответствии с требованиями к защите данных. "Биометрические данные" будут иметь значение, заданное в статье 4 GDPR, и, если применимо, эквивалентные термины в других требованиях к защите данных.

Какие данные обрабатывают службы преобразования текста в речь?

  • Ввод текста для синтеза речи. Это текст, который вы выбираете и отправляете в службу речи для создания звуковых выходных данных с помощью набора предварительно созданных нейронных голосов, или для создания предварительно созданного аватара, который произносит звук, созданный из предварительно созданных или пользовательских нейронных голосов.

Как сервисы синтеза текста в речь обрабатывают данные?

Предварительно созданный нейронный голос

На следующей схеме показано, как данные обрабатываются для синтеза с предварительно созданным нейронным голосом. Входные данные — текст, а выходные данные — звук. Ни входной текст, ни выходное звуковое содержимое не хранятся в журналах Microsoft.

схема предварительно созданной обработки нейронных голосовых данных.

Пользовательский нейронный голос

На следующей схеме показано, как данные обрабатываются для пользовательского нейронного голоса. На этой диаграмме рассматриваются три различных типа обработки: как Microsoft проверяет записанные файлы подтверждения от голосового исполнителя до тренировки пользовательской нейронной голосовой модели, как Microsoft создает пользовательскую нейронную голосовую модель с вашими данными для тренировки, и как текст преобразуется в аудио для создания звукового контента.

Как пользовательский нейронный голос обрабатывает данные

Аватар синтеза речи

На следующей схеме показано, как данные обрабатываются для синтеза с предварительно созданным текстом для аватара речи. В рабочем процессе создания содержимого аватара есть три компонента: текстовый анализатор, синтезатор звука TTS и синтезатор видео TTS. Чтобы создать видео аватара, текст сначала вводится в текстовый анализатор, который предоставляет выходные данные в виде последовательности фонема. Затем синтезатор звука TTS прогнозирует акустические функции входного текста и синтезирует голос. Эти две части предоставляются текстовыми моделями голосовой связи. Затем нейронная модель 'текст-в-речь' для аватара прогнозирует синхронизацию губ с акустическими признаками для генерации искусственного видео.

Схема потока данных аватара для преобразования текста в речь.

Перевод видео

На схеме ниже показано, как данные обрабатываются с помощью видеотрансляции. Клиент загружает видео в качестве исходных данных для перевода, звук диалога извлекается, а система распознавания речи преобразует аудио в текст. Затем текстовое содержимое будет переведено на целевой язык, и, используя возможности преобразования текста в речь, преобразованный звук будет объединен с исходным видеоконтентом в качестве видео-выхода.

Схема потока данных преобразования видео.

Для предварительно созданного голоса или аватара нет дополнительных разделов.

Хранение и сохранение данных

входные данные для синтеза речи: Microsoft не сохраняет и не хранит текст, который вы предоставляете с API синтеза речи в режиме реального времени. Скрипты, предоставляемые через Long Audio API для преобразования текста в речь или через пакетный API для создания аватара из текста в речь, хранятся в хранилище Azure для обработки запроса на пакетный синтез. Входной текст можно удалить через API удаления в любое время.

Воспроизведение аудио и видео контента: Microsoft не сохраняет аудио- или видеоконтент, созданный с помощью API синтеза в режиме реального времени. Если вы используете видеоперевод или API Long Audio для преобразования текста в речь для пакетного API с аватаром, выходной звуковой или видеоконтент сохраняется в облачном хранилище Azure. Эти звуки или видео можно удалить в любое время с помощью операции удаления .

Предотвращение злоупотреблений и вредного создания содержимого (предварительная версия)

Чтобы снизить риск вредного использования Azure службы аватаров для синтеза речи, Azure аватар для синтеза речи включает функции безопасности содержимого. Обеспечение безопасности содержимого происходит синхронно, когда служба обрабатывает текст для создания звука. Текст или созданные результаты не хранятся в моделях классификатора контента, а текст и результаты не используются для обучения, переобучения или улучшения моделей классификатора. Дополнительные сведения о категориях вреда функций безопасности содержимого см. в разделе " Категории вреда".

См. также