Vai al contenuto

Generatore di markup SSML

Trasforma testo semplice in tag SSML validi per la sintesi vocale: pause, enfasi, pronuncia e cadenza.

Ingresso

Generatore di markup SSML

Incolla testo semplice e questo strumento lo avvolge in SSML (Speech Synthesis Markup Language), il dialetto XML che Amazon Polly, Google Cloud Text-to-Speech e Azure Speech utilizzano per controllare come le voci sintetizzate leggono uno script. I paragrafi diventano elementi <p>, le frasi diventano elementi <s>, e lo strumento inserisce tag <break> tra loro in modo che il ritmo sia esplicito anziché lasciato al motore.

Il pannello delle opzioni controlla la quantità di markup aggiunto. Imposta la durata della pausa tra le frasi e tra i paragrafi in millisecondi e scegli una velocità di pronuncia e un'intonazione. I valori non predefiniti avvolgono l'intera output in un tag <prosody>. Attiva l'enfasi per convertire le parole *marcate* in <emphasis level="moderate">, e attiva l'ortografia degli acronimi per avvolgere termini IN MAIUSCOLE come "NASA" in <say-as interpret-as="characters"> in modo che vengano letti lettera per lettera. Un dizionario di pronuncia personalizzato ti consente di mappare parole specifiche a una sostituzione, resa come una sostituzione <sub alias="…"> o un <phoneme alphabet="ipa" ph="…"> — utile per nomi, termini di marca o parole che la voce predefinita pronuncia male.

L'opzione della piattaforma di destinazione regola l'elemento radice <speak>: Azure richiede un attributo di versione, spazio dei nomi e xml:lang che Amazon Polly e Google Cloud TTS non richiedono, quindi il passaggio tra piattaforme cambia solo quel wrapper. La divisione delle frasi è un semplice algoritmo euristico basato su ./!/? — non riconosce abbreviazioni come "Dr." come non-terminatori, quindi rivedi l'output su testo con molte abbreviazioni. L'opzione "convalida la struttura XML" verifica che il markup generato sia strutturalmente corretto prima di copiarlo.

Tutto viene eseguito localmente nel tuo browser — il tuo script non viene mai caricato da nessuna parte. Una volta che il markup sembra giusto, copialo, scaricalo come file .txt o invia l'output all'input di un altro strumento per continuare la modifica.

FAQ

Quali motori di sintesi vocale accettano questo markup?
L'output è SSML standard, compreso da Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech e la maggior parte degli altri motori che implementano la specifica W3C SSML. L'opzione "Piattaforma di destinazione" cambia solo l'elemento radice per corrispondere a ciò che ogni servizio si aspetta.
Cosa cambia effettivamente l'opzione di enfasi?
Circonda una parola tra asterischi nel tuo input, come *mai*, e con l'enfasi attivata diventa <emphasis level="moderate">mai</emphasis> nell'output — la maggior parte dei motori rende una parola enfatizzata leggermente più forte e più lenta.
Perché "Dr." è stato trattato come la fine di una frase?
La divisione delle frasi cerca un punto, un punto esclamativo o un punto interrogativo seguito da uno spazio — non ha un elenco di abbreviazioni da saltare, quindi "Dr. Smith" viene letto come due frasi brevi. Controlla l'output per il testo con molte abbreviazioni e regola la punteggiatura se necessario.
A cosa serve il dizionario di pronuncia?
Inserisci coppie come marchio=nome-marchio;NASA=N-A-S-A separate da punti e virgola. Ogni corrispondenza (senza distinzione tra maiuscole e minuscole, parola intera) viene avvolta in un tag <sub> o <phoneme> a seconda della modalità di tag che scegli, così il motore la legge come specifichi invece di indovinare.
Il mio script viene caricato da qualche parte?
No. Il generatore di markup SSML viene eseguito interamente nel tuo browser — il tuo testo non lascia mai il tuo dispositivo.