Ir para o conteúdo

Gerador de marcação SSML

Envolva texto simples em etiquetas SSML válidas para síntese de fala: pausas, ênfase, pronúncia e ritmo.

Entrada
Saída

Gerador de marcação SSML

Cole texto simples e esta ferramenta envolve-o em Speech Synthesis Markup Language (SSML) — o dialeto XML que Amazon Polly, Google Cloud Text-to-Speech e Azure Speech utilizam para controlar como as vozes sintetizadas leem um guião. Os parágrafos tornam-se elementos <p>, as frases tornam-se elementos <s>, e a ferramenta insere etiquetas <break> entre elas para que o ritmo seja explícito em vez de ficar ao critério do motor.

O painel de opções controla quanto marcado é adicionado. Defina o comprimento da pausa entre frases e entre parágrafos em milissegundos, e escolha uma velocidade de fala e um tom — valores não-predefinidos envolvem toda a saída numa etiqueta <prosody>. Ative a ênfase para converter palavras *marcadas com asterisco* em <emphasis level="moderate">, e ative a soletração de siglas para envolver sequências em MAIÚSCULAS como "NASA" em <say-as interpret-as="characters"> para que sejam lidas letra por letra em vez de como uma palavra inventada. Um dicionário de pronúncia personalizado permite-lhe mapear palavras específicas para uma substituição, apresentada como uma <sub alias="…"> substituição ou um <phoneme alphabet="ipa" ph="…"> — útil para nomes, termos de marca ou palavras que a voz predefinida pronuncia incorretamente.

A definição de plataforma de destino ajusta o elemento raiz <speak>: Azure necessita de um atributo de versão, namespace e xml:lang que Amazon Polly e Google Cloud TTS não requerem, portanto mudar de plataforma altera apenas esse wrapper. A divisão de frases é uma heurística simples baseada em ./!/? — não reconhece abreviações como "Dr." como não-terminadores, portanto verifique a saída em texto com muitas abreviações. A opção "verificar validade XML" verifica se o marcado gerado é estruturalmente bem-formado (cada etiqueta fecha corretamente) antes de copiar.

Tudo funciona localmente no seu navegador — seu guião nunca é carregado para qualquer lugar. Quando o marcado parece correto, copie-o, descarregue-o como ficheiro .txt, ou envie a saída para a entrada de outra ferramenta para continuar a editar.

FAQ

Quais motores de síntese de fala aceitam este marcado?
A saída é SSML padrão, compreendida por Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech e a maioria dos outros motores que implementam a especificação SSML do W3C. A opção "Plataforma de destino" apenas altera o elemento raiz para corresponder ao que cada serviço espera.
O que é que a opção de ênfase realmente muda?
Envolva uma palavra com asteriscos na sua entrada, como *nunca*, e com a ênfase ativada ela torna-se <emphasis level="moderate">nunca</emphasis> na saída — a maioria dos motores faz uma palavra enfatizada parecer ligeiramente mais alta e mais lenta.
Porque é que 'Dr.' foi tratado como o final de uma frase?
A divisão de frases procura um ponto, ponto de exclamação ou ponto de interrogação seguido de espaço em branco — não tem uma lista de abreviações a saltar, portanto "Dr. Smith" é lido como duas frases curtas. Verifique a saída em texto com muitas abreviações e ajuste a pontuação se necessário.
Para que serve o dicionário de pronúncia?
Introduza pares como marca=marca-nome;NASA=N-A-S-A separados por pontos e vírgulas. Cada correspondência (insensível a maiúsculas/minúsculas, palavra completa) é envolvida numa etiqueta <sub> ou <phoneme> dependendo do modo de etiqueta que escolher, para que o motor a leia como especificou em vez de adivinhar.
O meu guião é carregado em algum lugar?
Não. O gerador de marcação SSML funciona completamente no seu navegador — o seu texto nunca deixa o seu dispositivo.