Sări la conținut
Complet local

Curățător de transcriere vocală

Curățați transcrierile brute din vorbire în text eliminând cuvintele de completare, bâlbâiile și adnotările.

Intrare

Curățător de transcriere vocală

Lipiți o transcriere brută exportată din Whisper, Otter, recunoașterea vorbirii de la Google sau orice alt motor de conversie a vorbirii în text, iar acest instrument transformă rezultatul brut al mașinii în text care poate fi citit. Îndepărtează sunetele de ezitare și cuvintele de completare — „um”, „uh”, „hmm”, „hmm”, „cum ar fi”, „știi”, „adică”, „un fel de” — împreună cu echivalentele care apar în dictarea slovacă, cehă, germană, poloneză și maghiară, astfel încât o înregistrare mixtă sau non-engleză primește aceeași curățare.

De asemenea, dispozitivele de recunoaștere a vorbirii au tendința de a transcrie bâlbâielile la propriu — „planul”, „Voi-voi” – și plasează marcatori între paranteze acolo unde au pierdut audio, cum ar fi [inaudibil], [muzică] sau (râde). Ambele sunt gestionate automat: cuvintele repetate se prăbușesc într-o singură apariție, iar adnotările între paranteze dispar împreună cu spațierea suplimentară pe care o lasă în urmă. O trecere finală recapitaliza prima literă a textului și prima literă după fiecare punct, semn de întrebare și semn de exclamare, deoarece transcrierile revin adesea într-o singură serie de cuvinte minuscule.

Fiecare dintre cei cinci pași de curățare — eliminarea elementelor de umplere, remedierea majusculelor, restrângerea repetărilor, eliminarea adnotărilor între paranteze și îmbinarea liniilor separate în paragrafe care curge — poate fi activat sau dezactivat, astfel încât să puteți păstra pauzele de linie inițiale ale unei transcriere pentru lucrul cu subtitrare sau să îmbinați totul în proză pentru un articol sau rezumatul întâlnirii. Numărul de sub rezultat numără câte cuvinte de completare și câte cuvinte repetate au fost eliminate, astfel încât să puteți vedea dintr-o privire cât de dur a fost înregistrarea originală.

Totul rulează local în browserul dvs. Transcrierea nu părăsește niciodată dispozitivul dvs., ceea ce contează pentru înregistrările întâlnirilor, interviuri sau orice altceva care nu a fost destinat unui server terță parte. Deoarece curățarea funcționează pe liste de cuvinte și modele fixe, mai degrabă decât pe o înțelegere autentică a limbajului, treceți întotdeauna cu ușurință la rezultat înainte de a-l publica - un „like” sau „bine” legitim în mijlocul unei propoziții poate fi ocazional împins de elementele de umplere.

FAQ

Ce cuvinte de umplere elimină?
Setul englezesc este „um”, „uh”, „erm”, „hmm”, „cum ar fi”, „știi”, „vreau să spun” și „un fel de”/”un fel de”, plus echivalente comune din dictarea slovacă, cehă, germană, poloneză și maghiară, cum ar fi „ehm”, „hm”, „nu”, „teda”, „proste”, „ako”, „halt”, „tso” și „hat”. Dezactivați opțiunea pentru a lăsa fiecare cuvânt exact așa cum a fost transcris.
Cum se ocupă de bâlbâieli de genul „Eu-I-Voi pleca”?
Un cuvânt repetat imediat - cu sau fără cratimă sau virgulă între repetări - este prăbușit într-o singură apariție, așa că „eu-eu-voi merge” devine „voi merge” și „planul” devine „planul”.
Ce contează ca o adnotare între paranteze?
Orice între paranteze pătrate sau paranteze, cum ar fi [inaudible], [muzică] sau (râde) - genul de marcare pe care un motor de vorbire în text îl inserează atunci când nu a putut transcrie o parte a sunetului. Dezactivarea opțiunii le păstrează în ieșire neatinse.
Ce face „combinarea liniilor în paragrafe”?
Exporturile Speech-to-text plasează adesea fiecare segment scurt pe propria linie. Activarea acestei unește rândurile din fiecare paragraf existent în propoziții fluide, în timp ce o linie goală în transcrierea originală începe totuși un nou paragraf în rezultat.
Este transcriptul meu încărcat undeva?
Nu. Curățarea rulează în întregime în browserul dvs. folosind liste de cuvinte încorporate - transcrierea nu este niciodată trimisă la un server.