Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
В этом обзоре вы узнаете о преимуществах и возможностях функции преобразования текста в речь службы "Речь", которая входит в состав средств Foundry.
Текст в речь позволяет вашим приложениям, инструментам или устройствам преобразовывать текст в человекоподобную синтезированную речь. Возможность преобразования текста в речь также называется синтезом речи. Используйте стандартные голоса по умолчанию или создайте особый голос, уникальный для вашего продукта или бренда. Полный список поддерживаемых голосов, языков и языковых стандартов см. статье Поддержка языков и голосов в службе "Речь".
Служба "Речь" предоставляет стандартные (нейронные) голоса и пользовательские параметры голоса:
- Стандартные голоса: высококачественные нейронные голоса, доступные без дополнительных настроек на более чем 100 языках и локалях.
- Пользовательские голоса: создание уникальных брендовых голосов с помощью профессиональной настройки голоса или личных голосовых настроек
Полный список доступных голосов и языков см. в разделе "Язык" и "Поддержка голосовой связи".
Начало работы
Дополнительные подробные руководства и примеры:
- Краткое руководство по преобразованию текста в речь - Полный пошаговый учебник с поддержкой нескольких языков
- Документация по SDK для распознавания речи — полный справочник и примеры
- Справочник по REST API — интеграция на основе HTTP
- Speech CLI — инструменты командной строки
Совет
Чтобы преобразовать текст в речь без кода, попробуйте использовать средство создания аудиоконтентов в Speech Studio.
Функции нейронного текста для речи
Текст для речи использует глубокие нейронные сети, чтобы сделать голос компьютера почти неотличимым от человеческих записей. С четкой артикуляцией, нейронный текст в речь уменьшает усталость от прослушивания во время взаимодействия с ИИ.
Ключевые особенности
| Функция | Итоги | Демонстрация |
|---|---|---|
| Стандартный голос (именуемый Neural на странице цен) | Очень естественные готовые голоса. Создайте подписку Azure и ресурс службы "Речь", а затем используйте пакет SDK службы "Речь " или перейдите на портал Speech Studio и выберите стандартные голоса для начала работы. Ознакомьтесь с данными на странице цен. | Проверьте коллекцию голосовых данных и определите правильный голос для ваших бизнес-потребностей. |
| Пользовательский голос | Простое в использовании средство самообслуживания для создания естественного голоса торговой марки с ограниченным доступом, призванным обеспечить ответственное использование. Создайте подписку Azure и ресурс Microsoft Foundry, а затем подайте заявку на использование пользовательского голоса. После предоставления доступа перейдите к документации по профессиональной настройке голосовой связи , чтобы приступить к работе. Ознакомьтесь с данными на странице цен. | Изучите образцы голоса. |
Расширенные функции
Синтез речи в режиме реального времени: используйте пакет SDK службы "Речь " или REST API для преобразования текста в речь с помощью стандартных голосов или пользовательских голосов.
Асинхронный синтез длинного звука: используйте API пакетного синтеза для асинхронного синтеза текста в файлы речи дольше 10 минут (например, аудиокниги или лекции). В отличие от синтеза речи, выполняемого с использованием Speech SDK или API преобразования речи в текст, ответы не возвращаются в режиме реального времени. Ожидается, что запросы отправляются асинхронно, ответы проверяются, и синтезированное аудио загружается, когда его предоставляет служба.
Стандартные голоса: Azure Speech в пакете инструментов Foundry использует глубокие нейронные сети для преодоления ограничений традиционного синтеза речи в отношении акцента и интонации в разговорной речи. Одновременно выполняется интонационное прогнозирование и синтез речи, что приводит к более гибкому и естественному звучанию итогового голоса. Каждая стандартная модель голосовой связи доступна в 24 кГц и высокой точности 48 кГц. Нейронные голоса можно использовать в следующих целях:
- Чтобы сделать взаимодействие с чат-ботами и голосовыми помощниками более естественным и интересным.
- Преобразовывать цифровые тексты, такие как электронные книги, в аудиокниги.
- Улучшите автомобильные навигационные системы.
Для получения полного списка стандартных нейросетевых голосов Azure Speech в Foundry Tools смотрите раздел Поддержка языков и голосов для службы речи.
Улучшение результатов преобразования текста в речь с помощью SSML: язык разметки синтеза речи (SSML) — это язык разметки на основе XML, используемый для настройки результатов преобразования текста в речь. С помощью SSML можно настроить тон, добавить паузы, улучшить произношение, изменить скорость речи, отрегулировать громкость, а также присвоить несколько голосов одному документу.
SSML можно использовать, чтобы определять собственные лексиконы или переключаться между разными стилями речи. Многоязыковые голоса также позволяют настраивать языки речи с помощью SSML. Чтобы улучшить голосовой вывод для вашего сценария, см. Улучшение синтеза с помощью языка разметки синтеза речи и синтез речи с помощью инструмента создания аудиоконтента.
Виземы. Виземы — ключевые позы в наблюдаемой речи, включая положение губ, челюсти и языка при создании определенной фонемы. Виземы имеют сильную корреляцию с голосами и фонемами.
С помощью событий визем в Speech SDK можно генерировать данные для анимации лиц. С их помощью можно анимировать лица для взаимодействия посредством чтения по губам, в образовательных и развлекательных целях, а также для обслуживания клиентов. Виземы в настоящее время поддерживаются только для
en-USнейронных голосов (английский, США).
Примечание.
Помимо нейронных (не HD) голосов Azure, вы также можете использовать голоса с высоким определением речи Azure (HD)и нейронные голоса Azure OpenAI (HD и не HD). Голоса HD обеспечивают более высокое качество для более универсальных сценариев.
Некоторые голоса не поддерживают все теги языка разметки синтеза речи (SSML ). Это включает нейронное преобразование текста в речь (HD голоса), личные голоса и встроенные голоса.
- Для голосов высокого разрешения (HD) в Azure Speech проверьте поддержку SSML здесь.
- Для личного голоса вы можете найти поддержку SSML здесь.
- Для внедренных голосов проверьте поддержку SSML здесь.
Пример кода
Пример кода для преобразования текста в речь доступен на сайте GitHub. Эти примеры охватывают преобразование текста в речь в большинстве популярных языков программирования:
Пользовательский голос
Помимо стандартных голосов, вы можете создавать пользовательские голоса, уникальные для вашего продукта или бренда. Пользовательский голос — это общий термин, который включает в себя профессиональную тонкую настройку голоса и личный голос. Чтобы начать работу, вам потребуется всего несколько звуковых файлов и связанных с ними расшифровок. Дополнительные сведения см. в документации по профессиональной настройке голоса.
Примечание о ценах
Оплачиваемые символы
При использовании функции преобразования текста в речь выставление счетов зависит от общего количества символов в каждом успешно обработанном запросе. Это число включает все символы, буквы, числа, пробелы и знаки препинания, независимо от того, производится ли аудиовыход. Плата применяется, даже если речь не создается из-за несоответствия между выбранным языком голоса и текстом ввода. Здесь приводится перечень того что оплачивается:
- Текст, переданный функции преобразования текста в речь в теле запроса SSML
- Вся разметка в текстовом поле тела запроса в формате SSML, за исключением тегов
<speak><voice> - Буквы, пунктуация, пробелы, табуляция, разметка и все пробельные символы
- Каждая кодовая точка, определенная в Юникоде.
Подробную информацию см. в разделе Стоимость услуг речевых сервисов.
Внимание
При выставлении счетов один китайский иероглиф считается за два символа, включая иероглифы кандзи (японский язык), ханча (корейский язык) и ханьцзы (другие языки).
Обучение модели и время развертывания для пользовательского голосового решения
Настройка и размещение пользовательских голосов рассчитываются по часам и оплачиваются за каждую секунду. Цены на единицу выставления счетов см. в ценах на службу "Речь".
Время настройки профессионального голоса измеряется в "вычислительных часах" (единица измерения для времени работы машины). Как правило, при обучении голосовой модели выполняются две вычислительные задачи параллельно. Таким образом, вычисляемые вычислительные часы длиннее фактического времени обучения. Для профессиональной настройки голоса обычно требуется от 20 до 40 вычислительных часов для обучения единого голоса, а около 90 часов вычислений для обучения многоуровневого голоса. Плата за профессиональное время настройки голосовой связи взимается с ограничением в 96 часов вычислений. Таким образом, в случае обучения голосовой модели за 98 машинных часов, с вас будет взиматься плата только за 96 машинных часов.
Размещение пользовательской голосовой конечной точки измеряется по фактическому времени (час). Время размещения (часы) для каждой конечной точки вычисляется в 00:00 UTC каждый день за предыдущие 24 часа. Например, если конечная точка была активна в течение 24 часов в первый день, плата взимается за 24 часа ровно в 00:00 по UTC на следующий день. Если конечная точка была недавно создана или приостановлена в течение дня, плата взимается за ее накопленное время работы до 00:00 UTC второго дня. Если конечная точка в настоящее время не размещена, за нее не взимается плата. В дополнение к ежедневному расчету в 00:00 UTC каждый день, биллинг также активируется именно в момент удаления или приостановки конечной точки. Например, для конечной точки, созданной в 08:00 UTC 1 декабря, время размещения будет составлять 16 часов в 00:00 UTC 2 декабря и 24 часа в 00:00 UTC 3 декабря. Если пользователь приостанавливает размещение конечной точки в 16:30 UTC 3 декабря, длительность (16,5 часа) от 00:00 до 16:30 UTC 3 декабря будет вычисляться для выставления счетов.
Личный голос
При использовании функции персонального голосового ассистента вы оплачиваете как хранение профилей, так и их синтез.
- Учет профилей: После создания личного голосового профиля его использование будет оплачиваться до тех пор, пока профиль не удален из системы. Единица расчёта - одна голосовая услуга в день. Если хранение голосовых данных длится менее 24 часов, оно все равно оплачивается как полный день.
- Синтез: Оплата за каждый символ. Для получения информации о символах, учитываемых для расчета стоимости, см. информацию о учитываемых для расчета стоимости символах.
Аватар синтеза речи
При использовании функции аватара текст-в-речь плата взимается за каждую секунду на основе длины видеовыхода. Однако для аватара в режиме реального времени плата взимается в секунду в зависимости от времени, когда аватар активен, независимо от того, говорит ли он или остается молчаливым. Чтобы оптимизировать затраты на использование аватара в режиме реального времени, см. советы по использованию локального видео для простоя, приведенные в примере кода чата аватара.
Пользовательское обучение текста для создания голосового аватара измеряется единицей "вычислительный час" (время работы машины) и оплачивается за каждую секунду. Длительность обучения зависит от того, сколько данных вы используете. Обычно для обучения пользовательского аватара в среднем требуется 20–40 вычислительных часов. Плата за обучение аватара взимается с ограничением в 96 часов вычислений. Таким образом, если модель аватара проходит обучение в течение 98 часов вычислительных операций, плата взимается только за 96 часов вычислительных операций.
Размещение аватара тарифицируется посекундно за каждую точку доступа. Вы можете приостановить конечную точку для сокращения расходов. Если вы хотите приостановить конечную точку, ее можно удалить непосредственно. Чтобы использовать его снова, повторно разверните точку доступа.
Photo Avatar, включая стандартные и пользовательские варианты, интегрируется с Voice Live для сценариев двустороннего общения с низкой задержкой.
Мониторинг метрик речи в тексте Azure
Мониторинг ключевых метрик, связанных с текстовыми службами речи, имеет решающее значение для управления использованием ресурсов и управления затратами. В этом разделе описано, как найти сведения об использовании на портале Azure и привести подробные определения ключевых метрик. Дополнительные сведения о метриках Azure Monitor см. в разделе «Обзор метрик Azure Monitor».
Как найти сведения об использовании в портале Azure
Чтобы эффективно управлять ресурсами Azure, важно регулярно получать доступ к данным об использовании и просматривать их. Вот как найти сведения об использовании:
Перейдите на портал Azure и войдите в систему с вашей учетной записью Azure.
Перейдите к ресурсам и выберите ресурс, который вы хотите отслеживать.
Выберите метрики в разделе "Мониторинг" в меню слева.
Настройка представлений метрик.
Данные можно фильтровать по типу ресурсов, типу метрик, диапазону времени и другим параметрам, чтобы создавать пользовательские представления, которые соответствуют потребностям мониторинга. Кроме того, можно сохранить представление метрик на панелях мониторинга, нажав кнопку "Сохранить на панель мониторинга ", чтобы легко получить доступ к часто используемым метрикам.
Настройка оповещений.
Чтобы эффективнее управлять использованием, настройте оповещения, перейдя на вкладку "Оповещения " в разделе "Мониторинг " в меню слева. Оповещения могут уведомлять вас о достижении определенных пороговых значений, что помогает предотвратить непредвиденные затраты.
Определение метрик
Ниже приведена таблица, в которую приведены ключевые метрики для преобразования текста в речь Azure.
| Имя метрики | Описание |
|---|---|
| Синтезированные символы | Отслеживает количество символов, преобразованных в речь, включая стандартный голос и пользовательский голос. Дополнительные сведения о платных символах см. в разделе "Оплачиваемые символы". |
| Синтезированные секунды видео | Измеряет общую длительность синтеза видео, включая синтез пакетного аватара, синтез аватара в режиме реального времени и пользовательский синтез аватара. |
| Секунды хостинга модели аватара | Отслеживает общее время в секундах, в течение которого размещена пользовательская модель аватара. |
| Часы размещения голосовой модели | Отслеживает общее количество времени в часах, в течение которого размещена ваша пользовательская голосовая модель. |
| Минут обучения модели голосовой связи | Измеряет общее время в минутах для обучения пользовательской голосовой модели. |
Справочная документация
Ответственное применение ИИ
Система ИИ включает не только технологию, но и людей, которые используют ее, людей, пострадавших от нее, и среды, в которой она развернута. Ознакомьтесь с заметками о прозрачности, чтобы узнать об использовании и развертывании ответственного искусственного интеллекта в системах.
- Заметка о прозрачности и варианты использования пользовательского голоса
- Характеристики и ограничения использования пользовательского голоса
- Ограниченный доступ к пользовательскому голосу
- Рекомендации по ответственному развертыванию искусственной голосовой технологии
- Раскрытие информации о голосовых талантах
- Рекомендации по проектированию раскрытия информации
- Шаблоны проектирования раскрытия информации
- Кодекс поведения для интеграции речи с текстом
- Данные, конфиденциальность и безопасность для пользовательского голоса