Przejdź do treści

Generator znaczników SSML

Owin zwykły tekst w prawidłowe znaczniki SSML dla syntezy mowy: pauzy, emfazę, wymowę i tempo.

Wejście
Wynik

Generator znaczników SSML

Wklej zwykły tekst, a to narzędzie opatrzy go znacznikami Speech Synthesis Markup Language (SSML) — dialektem XML, którego używają Amazon Polly, Google Cloud Text-to-Speech i Azure Speech do sterowania sposobem, w jaki syntetyczne głosy odczytują skrypt. Akapity stają się elementami <p>, zdania stają się elementami <s>, a narzędzie wstawia znaczniki <break> między nimi, aby tempo było jawne zamiast pozostawianego uznaniu silnika.

Panel opcji kontroluje, ile znaczników zostanie dodanych. Ustaw długość pauzy między zdaniami i między akapitami w milisekundach, a wybierz tempo mowy i wysokość tonu — wartości inne niż domyślne zawijają całe wyjście w znacznik <prosody>. Włącz emfazę, aby przekonwertować słowa oznaczone gwiazdką *słowo* na <emphasis level="moderate">, i włącz literowanie akronimów, aby zawinąć DUŻE sekwencje takie jak "NASA" w <say-as interpret-as="characters">, aby były czytane litera po literze zamiast jako wymyślonego słowa. Niestandardowy słownik wymowy pozwala mapować określone słowa na zamianę, renderowane jako <sub alias="…"> lub <phoneme alphabet="ipa" ph="…"> — przydatne dla imion, znaków towarowych lub słów, które domyślny głos mówi niepoprawnie.

Ustawienie platformy docelowej dostosowuje element główny <speak>: Azure potrzebuje atrybutów version, namespace i xml:lang, których Amazon Polly i Google Cloud TTS nie wymagają, więc przełączanie platform zmienia tylko ten wrapper. Dzielenie zdań to prosta heurystyka oparta na ./!/? — nie rozpoznaje skrótów takich jak "Dr." jako nie-terminatory, więc sprawdź wyjście na tekście zawierającym wiele skrótów. Opcja "Sprawdź poprawność XML" weryfikuje, że wygenerowane znaczniki są strukturalnie dobrze sformułowane (każdy znacznik zostaje poprawnie zamknięty) przed skopiowaniem.

Wszystko działa lokalnie w twojej przeglądarce — twój skrypt nigdy nigdzie się nie przesyła. Gdy znaczniki wyglądają dobrze, skopiuj je, pobierz jako plik .txt, lub prześlij wyjście na wejście innego narzędzia, aby kontynuować edycję.

Częste pytania

Które silniki text-to-speech akceptują te znaczniki?
Wyjście to standardowy SSML, rozumiany przez Amazon Polly, Google Cloud Text-to-Speech, Microsoft Azure Speech i większość innych silników, które implementują specyfikację W3C SSML. Ustawienie "Platforma docelowa" jedynie zmienia element główny, aby pasował do tego, czego każda usługa oczekuje.
Co dokładnie zmienia opcja emfazy?
Otocz słowo gwiazdkami w twoim wejściu, jak *nigdy*, a z włączoną emfazą stanie się to <emphasis level="moderate">nigdy</emphasis> na wyjściu — większość silników czyni podkreślone słowo nieco głośniejszym i wolniejszym.
Dlaczego 'Dr.' był traktowany jako koniec zdania?
Dzielenie zdań szuka kropki, znaku wykrzyknika lub znaku zapytania, po którym następuje spacja — nie ma listy skrótów do pominięcia, więc "Dr. Smith" jest czytane jako dwa krótkie zdania. Sprawdź wyjście na tekście z wieloma skrótami i w razie potrzeby dostosuj interpunkcję.
Do czego służy słownik wymowy?
Wpisz pary takie jak brand=brand-name;NASA=N-A-S-A oddzielone średnikami. Każde dopasowanie (bez rozróżniania wielkości liter, całe słowo) będzie owinięte w znacznik <sub> lub <phoneme> w zależności od trybu znacznika, który wybierzesz, aby silnik czytał go w określony sposób zamiast zgadywania.
Czy mój skrypt jest gdzieś przesyłany?
Nie. Generator znaczników SSML działa całkowicie w twojej przeglądarce — twój tekst nigdy nie opuszcza twojego urządzenia.