Aller au contenu

Générateur de balisage SSML

Convertissez du texte brut en balises SSML valides pour la synthèse vocale : pauses, emphase, prononciation et débit.

Entrée
Sortie

Générateur de balisage SSML

Collez du texte brut et cet outil l'enveloppe dans SSML (Speech Synthesis Markup Language), le dialecte XML qu'Amazon Polly, Google Cloud Text-to-Speech et Azure Speech utilisent pour contrôler comment les synthétiseurs vocaux lisent un script. Les paragraphes deviennent des éléments <p>, les phrases deviennent des éléments <s>, et l'outil insère des balises <break> entre elles pour que le débit soit explicite au lieu d'être laissé à la discrétion du moteur.

Le panneau des options contrôle la quantité de balisage ajouté. Définissez la durée de la pause entre les phrases et entre les paragraphes en millisecondes, et choisissez un débit de parole et une intonation. Les valeurs non par défaut enveloppent l'ensemble de la sortie dans une balise <prosody>. Activez l'emphase pour convertir les mots *en astérisques* en <emphasis level="moderate">, et activez l'épellation d'acronymes pour envelopper les termes EN MAJUSCULES comme « NASA » dans <say-as interpret-as="characters"> pour qu'ils soient lus lettre par lettre. Un dictionnaire de prononciation personnalisé vous permet de mapper des mots spécifiques à un remplacement, rendu soit comme une substitution <sub alias="…"> soit comme un <phoneme alphabet="ipa" ph="…"> — utile pour les noms, les termes de marque ou les mots que la voix par défaut misprononce.

L'option de plateforme cible ajuste l'élément racine <speak> : Azure a besoin d'un attribut de version, d'espace de noms et xml:lang qu'Amazon Polly et Google Cloud TTS ne nécessitent pas, donc le changement de plateforme modifie uniquement ce wrapper. La segmentation des phrases est une simple heuristique basée sur ./!/? — elle ne reconnaît pas les abréviations comme « Dr. » comme des non-terminateurs, donc vérifiez la sortie sur du texte avec beaucoup d'abréviations. L'option « vérifier la validité du XML » vérifie que le balisage généré est structurellement bien formé avant de le copier.

Tout s'exécute localement dans votre navigateur — votre script n'est jamais téléchargé nulle part. Une fois le balisage correct, copiez-le, téléchargez-le en tant que fichier .txt ou envoyez la sortie à l'entrée d'un autre outil pour continuer l'édition.

FAQ

Quels moteurs de synthèse vocale acceptent ce balisage ?
La sortie est du SSML standard, compris par Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech et la plupart des autres moteurs qui implémentent la spécification W3C SSML. L'option « Plateforme cible » ne change que l'élément racine pour correspondre à ce que chaque service attend.
Qu'est-ce que l'option d'emphase change réellement ?
Enveloppez un mot entre astérisques dans votre entrée, comme *jamais*, et avec l'emphase activée, il devient <emphasis level="moderate">jamais</emphasis> dans la sortie — la plupart des moteurs font qu'un mot mis en avant semble légèrement plus fort et plus lent.
Pourquoi « Dr. » a-t-il été traité comme la fin d'une phrase ?
La segmentation des phrases recherche un point, un point d'exclamation ou un point d'interrogation suivi d'un espace — elle n'a pas de liste d'abréviations à ignorer, donc « Dr. Smith » est lu comme deux courtes phrases. Vérifiez la sortie pour du texte avec beaucoup d'abréviations et ajustez la ponctuation si nécessaire.
À quoi sert le dictionnaire de prononciation ?
Entrez des paires comme marque=nom-de-marque;NASA=N-A-S-A séparées par des points-virgules. Chaque correspondance (insensible à la casse, mot entier) est enveloppée dans une balise <sub> ou <phoneme> selon le mode de balise que vous choisissez, de sorte que le moteur la lise comme vous le spécifiez au lieu de deviner.
Mon script est-il téléchargé quelque part ?
Non. Le générateur de balisage SSML s'exécute entièrement dans votre navigateur — votre texte ne quitte jamais votre appareil.