Hoppa till innehåll
100% lokalt

Renare för röstavskrift

Rensa upp obearbetade tal-till-text-transkriptioner genom att ta bort utfyllnadsord, stammar och anteckningar.

Inmatning
Utmatning

Renare för röstavskrift

Klistra in en rå transkription som exporterats från Whisper, Otter, Googles taligenkänning eller någon annan tal-till-text-motor, och det här verktyget förvandlar den grova maskinutdata till läsbar text. Det tar bort tveksamhetsljud och utfyllnadsord - "um", "uh", "ehm", "hmm", "gillar", "du vet", "jag menar", "typ av" - tillsammans med motsvarigheterna som dyker upp i slovakiska, tjeckiska, tyska, polska och ungerska dikteringen, så en blandad eller icke-engelsk inspelning får samma upprensning.

Taligenkännare tenderar också att transkribera stamningar bokstavligen - "planen", "jag-jag-jag ska" - och släppa parenteser där de tappade ljudet, som [ohörbart], [musik] eller (skrattar). Båda hanteras automatiskt: upprepade ord kollapsar till en enda förekomst och anteckningar inom parentes försvinner tillsammans med det extra avstånd de lämnar efter sig. Ett sista pass rekapitaliserar den första bokstaven i texten och den första bokstaven efter varje punkt, frågetecken och utropstecken, eftersom avskrifter ofta kommer tillbaka i en enda serie med små ord.

Vart och ett av de fem rensningsstegen – ta bort fyllmedel, fixa versaler, kollapsa upprepningar, ta bort kommentarer inom parentes och slå samman separata rader till flytande stycken – kan slås på eller av, så att du kan behålla en transkriptions ursprungliga radbrytningar för undertextarbete eller slå ihop allt till prosa för en artikel eller mötessammanfattning. Siffran under utgången räknar hur många utfyllnadsord och hur många upprepade ord som togs bort, så att du med en blick kan se hur grov den ursprungliga inspelningen var.

Allt körs lokalt i din webbläsare. Avskriften lämnar aldrig din enhet, vilket har betydelse för mötesinspelningar, intervjuer eller annat som inte var avsett för en tredjepartsserver. Eftersom rensningen fungerar på fasta ordlistor och mönster snarare än genuin språkförståelse, ska du alltid skumma igenom resultatet innan du publicerar det - ett legitimt "gilla" eller "ja" mitt i en mening kan ibland svepas upp med fyllnadsämnena.

FAQ

Vilka utfyllnadsord tar det bort?
Den engelska uppsättningen är "um", "uh", "erm", "hmm", "gillar", "du vet", "jag menar" och "typ av"/"typ", plus vanliga motsvarigheter från slovakiska, tjeckiska, tyska, polska och ungerska diktat som "ehm", "hm", "nej", "teda", "proste", "ako", "halt", "också"". Stäng av alternativet för att lämna varje ord exakt som transkriberat.
Hur hanterar den stamningar som "jag-jag-jag ska gå"?
Ett omedelbart upprepat ord - med eller utan bindestreck eller komma mellan upprepningarna - komprimeras till en enda förekomst, så "jag-jag-jag går" blir "jag ska gå" och "planen" blir "planen".
Vad räknas som en kommentar inom parentes?
Allt inom hakparenteser eller parenteser, som [ohörbart], [musik] eller (skrattar) — den typ av markör som en tal-till-text-motor sätter in när den inte kunde transkribera en del av ljudet. Om du stänger av alternativet förblir de i utgången orörda.
Vad gör "slå samman rader till stycken"?
Tal-till-text-export placerar ofta varje kort segment på sin egen rad. Om du aktiverar detta förenas raderna inom varje befintligt stycke till flytande meningar, medan en tom rad i originalavskriften fortfarande startar ett nytt stycke i resultatet.
Är min utskrift laddad upp någonstans?
Nej. Cleanup körs helt och hållet i din webbläsare med hjälp av inbyggda ordlistor – transkriptionen skickas aldrig till en server.