Что такое перевод речи?

В этой статье вы узнаете о преимуществах и возможностях перевода с помощью Azure Speech в инструментах Foundry. Служба "Речь" поддерживает перевод аудиопотоков в режиме реального времени с многоязычного голоса в голос и с голоса в текст.

С помощью пакета SDK службы "Речь" или интерфейса командной строки службы "Речь", вы можете предоставить приложениям, инструментам и устройствам доступ к исходным транскрипциям и выходным данным перевода для предоставленного звука. Промежуточные результаты транскрибирования и перевода предоставляются, как только происходит обнаружение речи, а окончательные результаты могут быть преобразованы в синтезированную речь.

Список языков, поддерживаемых для перевода речи, см. в статье Поддержка языков и голоса.

Совет

Перейдите в Speech Studio , чтобы быстро протестировать и перевести речь на другие языки с низкой задержкой.

Основные возможности

Основные функции перевода речи включают:

Перевод речи в режиме реального времени (стандартный)

Перевод речи использует один стандартный API для перевода текста в режиме реального времени, вывода звука или обоих.

Используйте стандартный API перевода речи, если вы хотите отправить входной звуковой поток на указанном исходном языке и вернуть переведенный текст, синтезированную речь или оба языка в указанном целевом языке.

Интерактивный интерпретатор

Динамический интерпретатор является частью перевода речи в режиме реального времени и предоставляет более полнофункциональный интерфейс, чем стандартный API для диалоговых сценариев. Система непрерывно определяет язык речи без необходимости заранее задавать входной язык и обеспечивает перевод речи в речь с низкой задержкой естественным голосом, сохраняя стиль и тон говорящего.

Динамический интерпретатор включает расширенные возможности, такие как:

  • Неопределенный язык ввода. Получение звука в широком диапазоне языков без установки ожидаемого языка ввода.
  • Переключение языков. Обработка нескольких речевых языков в одном сеансе без перезапуска.
  • Используйте свой голос (BYO voice). Используйте личный голос с динамическим интерпретатором для перевода речи в режиме реального времени.
  • Транскрибирование на целевом языке. Транскрибирование исходного языка пока недоступно.

Ниже приведены некоторые варианты использования динамического интерпретатора:

  • Дорожный переводчик Создавайте решения, которые позволяют клиентам переводить входной звук на локальные языки и с локальных языков во время путешествия.
  • Бизнес-собрания. Помогите участникам, которые говорят на разных языках, естественно взаимодействовать в одном сеансе.

Список поддерживаемых языков ввода (источника) см. в разделе "Речь на текстовых языках". Сведения о поддерживаемых выходных (целевых) языках см. в таблице Перевод на текстовый язык в разделе языки перевода речи.

Дополнительные сведения см. в руководстве по переводу речи, образце кода Live Interpreter и примерах перевода речи на GitHub.

Перевод нескольких целевых языков

В сценариях, где требуется вывод на нескольких языках, служба "Речь" напрямую обеспечивает возможность перевода языка ввода на два целевых языка. Это позволяет получать два выхода и делиться этими переводами с широкой аудиторией в одном вызове API. Если требуются дополнительные языки вывода, можно создать ресурс с несколькими службами или использовать отдельные службы перевода.

Если вам требуется перевод на более чем два целевых языка, вам необходимо либо создать ресурс Foundry, либо использовать отдельные службы перевода для большего количества языков помимо второго. Если вы вызываете службу перевода речи с мульти-сервисным ресурсом, обратите внимание, что плата за перевод применяется к каждому языку помимо второго, в зависимости от числа символов.

Чтобы вычислить примененную плату за перевод, см. Azure Translator в ценах на средства Foundry.

Цены на перевод на несколько целевых языков

Важно отметить, что служба перевода речи работает в режиме реального времени, а промежуточные результаты речи переводятся для создания промежуточных результатов перевода. Таким образом, объем переводимой информации превышает токены входного звука. Плата взимается за транскрипцию речи в текст и перевод текста на каждый целевой язык.

Например, предположим, что требуется перевод текста из одночасового аудиофайла на три целевых языка. Если исходная транскрипция речи в текст содержит 10 000 символов, может взиматься плата в размере $2,80.

Предупреждение

Цены в этом примере предназначены только для иллюстрационных целей. Смотрите цены на Azure Speech и цены на Translator для получения самой актуальной информации о ценах.

В предыдущем примере цена $ 2,80 была рассчитана путем комбинирования стоимости транскрибирования речи в текст и перевода текста. Вот как было выполнено вычисление:

  • Цена на перевод речи составляет $2,50 в час, охватывая до 2 целевых языков. Цена используется в качестве примера вычисления затрат. См. раздел Standard>Speech translation>Standard в таблице цен на Azure Speech для получения актуальной информации о ценах.
  • Стоимость перевода третьего языка составляет 30 центов в этом примере. Цена на перевод составляет $10 за миллион символов. Так как звуковой файл содержит 10 000 символов, стоимость перевода составляет $ 10 * 10 000 / 1000 000 * 3 = $ 0,3. Число "3" в этом уравнении представляет весовый коэффициент промежуточного трафика, который может отличаться в зависимости от языков, участвующих в этом уравнении. Цена используется в качестве примера вычисления затрат. См. раздел Standard>Стандартный перевод>Текстовый перевод в таблице цен Translator для получения самой актуальной информации о ценах.

Начать

В качестве первого шага попробуйте краткое руководство по быстрому переводу речи. Служба перевода речи доступна через пакет SDK "Речь", и Интерфейс командной строки "Речь".

Вы найдёте образцы преобразования речи в текст и перевода от Speech SDK на GitHub. В этих примерах рассматриваются сценарии общего характера, такие как чтение аудио из файла или потока, непрерывное и одиночное распознавание и перевод, а также работа с пользовательскими моделями.

Следующие шаги