Перейти к содержанию

Генератор разметки SSML

Преобразуйте простой текст в валидные SSML-теги для синтеза речи: паузы, выделение, произношение и темп.

Входные данные
Выходные данные

Генератор разметки SSML

Вставьте простой текст, и этот инструмент оборачивает его в Speech Synthesis Markup Language (SSML) — XML-диалект, который Amazon Polly, Google Cloud Text-to-Speech и Azure Speech используют для управления чтением синтезированными голосами. Абзацы становятся элементами <p>, предложения становятся элементами <s>, и инструмент вставляет теги <break> между ними, чтобы темп был явным, а не оставался на усмотрение алгоритма движка.

Панель параметров контролирует объем добавляемой разметки. Установите длину паузы между предложениями и между абзацами в миллисекундах, выберите скорость речи и высоту голоса — значения, отличные от стандартных, оборачивают весь результат в тег <prosody>. Включите выделение, чтобы преобразовать *отмеченные* слова в <emphasis level="moderate">, и включите произнесение заглавных аббревиатур, чтобы обернуть прописные серии вроде "NASA" в <say-as interpret-as="characters">, чтобы их читали по буквам, а не как придуманное слово. Пользовательский словарь произношения позволяет сопоставить определенные слова с заменой, отображаемой как подстановка <sub alias="…"> или <phoneme alphabet="ipa" ph="…"> — полезно для имен, названий брендов или слов, которые голос произносит неправильно.

Параметр целевой платформы настраивает корневой элемент <speak>: Azure требует атрибуты версии, пространства имен и xml:lang, которые Amazon Polly и Google Cloud TTS не требуют, поэтому смена платформы меняет только эту оболочку. Разделение на предложения — это простой эвристический метод на основе ./!/? — он не распознает аббревиатуры вроде "Dr." как не-терминаторы, поэтому проверьте результат на текстах с большим количеством аббревиатур. Опция "проверить корректность XML" проверяет, что сгенерированная разметка синтаксически корректна (каждый тег закрывается правильно), прежде чем вы скопируете ее.

Все работает локально в вашем браузере — ваш скрипт никогда не загружается никуда. Когда разметка выглядит правильно, скопируйте ее, загрузите как файл .txt или отправьте результат на вход другого инструмента для дальнейшего редактирования.

FAQ

Какие движки синтеза речи поддерживают эту разметку?
Результат представляет собой стандартный SSML, понимаемый Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech и большинством других движков, которые реализуют спецификацию W3C SSML. Опция "целевая платформа" только меняет корневой элемент в соответствии с требованиями каждого сервиса.
Что именно меняет опция выделения?
Оберните слово в звездочки, например *никогда*, и при включенном выделении оно становится <emphasis level="moderate">никогда</emphasis> в результате — большинство движков делают выделенное слово немного громче и медленнее.
Почему 'Dr.' был интерпретирован как конец предложения?
Разделение на предложения проверяет точку, восклицательный знак или вопросительный знак, за которыми следует пробельный символ — у него нет списка аббревиатур для пропуска, поэтому "Dr. Smith" читается как два коротких предложения. Проверьте результат на текстах с большим количеством аббревиатур и при необходимости отредактируйте пунктуацию.
Для чего нужен словарь произношения?
Введите пары вроде бренд=название-бренда;NASA=Н-А-С-А, разделенные точками с запятой. Каждое совпадение (нечувствительное к регистру, целое слово) обворачивается в тег <sub> или <phoneme> в зависимости от выбранного режима тега, чтобы движок читал его так, как вы указали, а не угадывал.
Мой скрипт загружается куда-то?
Нет. Генератор разметки SSML работает полностью в вашем браузере — ваш текст никогда не покидает ваше устройство.