Saltar al contenido

Generador de marcado SSML

Convierte texto plano en etiquetas SSML válidas para síntesis de voz: pausas, énfasis, pronunciación y cadencia.

Entrada
Salida

Generador de marcado SSML

Pega texto sin formato y esta herramienta lo envuelve en SSML (Speech Synthesis Markup Language), el dialecto XML que Amazon Polly, Google Cloud Text-to-Speech y Azure Speech utilizan para controlar cómo pronuncian los sintetizadores de voz. Los párrafos se convierten en elementos <p>, las frases en elementos <s>, y la herramienta inserta etiquetas <break> entre ellos para que la cadencia sea explícita en lugar de quedar a criterio del motor.

El panel de opciones controla la cantidad de marcado añadido. Establece la duración de la pausa entre frases y entre párrafos en milisegundos, y elige una velocidad de locución y un tono. Los valores no predeterminados envuelven la salida completa en una etiqueta <prosody>. Activa el énfasis para convertir palabras con *asteriscos* en <emphasis level="moderate">, y activa la lectura de acrónimos para envolver ejecutivos en MAYÚSCULAS como "NASA" en <say-as interpret-as="characters"> para que se deletreen letra por letra. Un diccionario personalizado de pronunciación te permite mapear palabras específicas a un reemplazo, representado como una sustitución <sub alias="…"> o un <phoneme alphabet="ipa" ph="…"> — útil para nombres, términos de marca o palabras que el sintetizador pronuncia mal.

La opción de plataforma destino ajusta el elemento raíz <speak>: Azure requiere atributos de versión, espacio de nombres y xml:lang que Amazon Polly y Google Cloud TTS no necesitan, por lo que cambiar plataformas solo cambia ese envoltorio. La división de frases es un simple heurístico basado en ./!/? — no reconoce abreviaturas como "Dr." como no-terminadoras, así que revisa la salida en textos con muchas abreviaturas. La opción "validar estructura XML" verifica que el marcado generado esté bien formado estructuralmente antes de copiarlo.

Todo funciona localmente en tu navegador — tu script nunca se carga en ningún lugar. Cuando el marcado se ve bien, cópialo, descárgalo como archivo .txt o envía la salida a la entrada de otra herramienta para seguir editando.

Preguntas frecuentes

¿Qué motores de síntesis de voz aceptan este marcado?
La salida es SSML estándar, entendida por Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech y la mayoría de otros motores que implementan la especificación W3C SSML. La opción "Plataforma destino" solo cambia el elemento raíz para coincidir con lo que espera cada servicio.
¿Qué cambia realmente la opción de énfasis?
Envuelve una palabra entre asteriscos en tu entrada, como *nunca*, y con énfasis activado se convierte en <emphasis level="moderate">nunca</emphasis> en la salida — la mayoría de motores hacen que una palabra enfatizada suene un poco más fuerte y lenta.
¿Por qué "Dr." se trató como el final de una frase?
La división de frases busca un punto, signo de exclamación o interrogación seguido de espacio en blanco — no tiene una lista de abreviaturas para omitir, así que "Dr. Smith" se lee como dos frases cortas. Revisa la salida en textos con muchas abreviaturas y ajusta la puntuación si es necesario.
¿Para qué sirve el diccionario de pronunciación?
Introduce pares como marca=nombre-de-marca;NASA=N-A-S-A separados por puntos y comas. Cada coincidencia (sin distinción de mayúsculas, palabra completa) se envuelve en una etiqueta <sub> o <phoneme> según el modo de etiqueta que elijas, para que el motor lo lea como especifiques en lugar de adivinarlo.
¿Se carga mi script en algún lugar?
No. El generador de marcado SSML funciona completamente en tu navegador — tu texto nunca abandona tu dispositivo.