Ga naar inhoud
100% lokaal

Spraaktranscriptie-reiniger

Ruim onbewerkte spraak-naar-tekst-transcripties op door opvulwoorden, stotteringen en annotaties te verwijderen.

Invoer
Uitvoer

Spraaktranscriptie-reiniger

Plak een onbewerkt transcript dat is geëxporteerd vanuit Whisper, Otter, de spraakherkenning van Google of een andere spraak-naar-tekst-engine, en deze tool zet de ruwe machine-uitvoer om in leesbare tekst. Het verwijdert aarzelende geluiden en opvulwoorden - "eh", "uh", "eh", "hmm", "like", "je weet wel", "ik bedoel", "soort van" - samen met de equivalenten die voorkomen in Slowaaks, Tsjechisch, Duits, Pools en Hongaars dictaat, zodat een gemengde of niet-Engelse opname dezelfde opruiming krijgt.

Spraakherkenners hebben ook de neiging om stotteringen letterlijk te transcriberen – “het plan”, “Ik-ik-ik zal” – en zet markeringen tussen haakjes neer waar de audio verloren is gegaan, zoals [onhoorbaar], [muziek] of (lacht). Beide worden automatisch afgehandeld: herhaalde woorden vallen samen tot één enkele gebeurtenis, en annotaties tussen haakjes verdwijnen samen met de extra ruimte die ze achterlaten. Een laatste passage herkapitaliseert de eerste letter van de tekst en de eerste letter na elke punt, vraagteken en uitroepteken, aangezien transcripties vaak terugkomen in een enkele reeks kleine letters.

Elk van de vijf opschoonstappen (vullers verwijderen, hoofdlettergebruik corrigeren, herhalingen samenvouwen, annotaties tussen haakjes laten vallen en afzonderlijke regels samenvoegen tot vloeiende alinea's) kan worden in- of uitgeschakeld, zodat u de oorspronkelijke regeleinden van een transcript kunt behouden voor ondertitelwerk of alles kunt samenvoegen tot proza voor een artikel of samenvatting van een vergadering. De telling onder de uitvoer telt hoeveel opvulwoorden en hoeveel herhaalde woorden zijn verwijderd, zodat je in één oogopslag kunt zien hoe ruw de originele opname was.

Alles draait lokaal in uw browser. Het transcript verlaat nooit uw apparaat, wat van belang is voor opnames van vergaderingen, interviews of iets anders dat niet bedoeld was voor een server van derden. Omdat het opschonen werkt op basis van vaste woordenlijsten en patronen in plaats van op echt taalbegrip, moet u altijd eerst het resultaat doornemen voordat u het publiceert; een legitieme 'like' of 'well' in het midden van een zin kan af en toe worden meegesleurd door de vullers.

FAQ

Welke opvulwoorden worden verwijderd?
De Engelse set is "um", "uh", "eh", "hmm", "like", "je weet wel", "ik bedoel" en "soort van"/"soort van", plus gebruikelijke equivalenten uit Slowaaks, Tsjechisch, Duits, Pools en Hongaars dictaat zoals "ehm", "hm", "no", "teda", "proste", "ako", "halt", "ook" en "hat". Schakel de optie uit om elk woord precies zo te laten als getranscribeerd.
Hoe gaat het om met stotteren als 'Ik-ik-ik ga'?
Een onmiddellijk herhaald woord – met of zonder een koppelteken of komma tussen de herhalingen – wordt samengevoegd tot één enkele gebeurtenis, dus ‘ik-ik-ik zal gaan’ wordt ‘ik zal gaan’ en ‘het plan’ wordt ‘het plan’.
Wat telt als een annotatie tussen haakjes?
Alles tussen vierkante haakjes of haakjes, zoals [onhoorbaar], [muziek] of (lacht) — het soort markering dat een spraak-naar-tekst-engine invoegt wanneer deze een stuk audio niet kan transcriberen. Als u de optie uitschakelt, blijven ze onaangeroerd in de uitvoer.
Wat doet 'regels samenvoegen tot alinea's'?
Bij spraak-naar-tekst-export wordt vaak elk kort segment op een eigen regel geplaatst. Als u dit inschakelt, worden de regels binnen elke bestaande alinea samengevoegd tot vloeiende zinnen, terwijl een lege regel in het oorspronkelijke transcript nog steeds een nieuwe alinea in het resultaat begint.
Wordt mijn transcript ergens geüpload?
Nee. Het opschonen wordt volledig in uw browser uitgevoerd met behulp van ingebouwde woordenlijsten; het transcript wordt nooit naar een server verzonden.