Spraaktranscriptie-reiniger
Ruim onbewerkte spraak-naar-tekst-transcripties op door opvulwoorden, stotteringen en annotaties te verwijderen.
Spraaktranscriptie-reiniger
Plak een onbewerkt transcript dat is geëxporteerd vanuit Whisper, Otter, de spraakherkenning van Google of een andere spraak-naar-tekst-engine, en deze tool zet de ruwe machine-uitvoer om in leesbare tekst. Het verwijdert aarzelende geluiden en opvulwoorden - "eh", "uh", "eh", "hmm", "like", "je weet wel", "ik bedoel", "soort van" - samen met de equivalenten die voorkomen in Slowaaks, Tsjechisch, Duits, Pools en Hongaars dictaat, zodat een gemengde of niet-Engelse opname dezelfde opruiming krijgt.
Spraakherkenners hebben ook de neiging om stotteringen letterlijk te transcriberen – “het plan”, “Ik-ik-ik zal” – en zet markeringen tussen haakjes neer waar de audio verloren is gegaan, zoals [onhoorbaar], [muziek] of (lacht). Beide worden automatisch afgehandeld: herhaalde woorden vallen samen tot één enkele gebeurtenis, en annotaties tussen haakjes verdwijnen samen met de extra ruimte die ze achterlaten. Een laatste passage herkapitaliseert de eerste letter van de tekst en de eerste letter na elke punt, vraagteken en uitroepteken, aangezien transcripties vaak terugkomen in een enkele reeks kleine letters.
Elk van de vijf opschoonstappen (vullers verwijderen, hoofdlettergebruik corrigeren, herhalingen samenvouwen, annotaties tussen haakjes laten vallen en afzonderlijke regels samenvoegen tot vloeiende alinea's) kan worden in- of uitgeschakeld, zodat u de oorspronkelijke regeleinden van een transcript kunt behouden voor ondertitelwerk of alles kunt samenvoegen tot proza voor een artikel of samenvatting van een vergadering. De telling onder de uitvoer telt hoeveel opvulwoorden en hoeveel herhaalde woorden zijn verwijderd, zodat je in één oogopslag kunt zien hoe ruw de originele opname was.
Alles draait lokaal in uw browser. Het transcript verlaat nooit uw apparaat, wat van belang is voor opnames van vergaderingen, interviews of iets anders dat niet bedoeld was voor een server van derden. Omdat het opschonen werkt op basis van vaste woordenlijsten en patronen in plaats van op echt taalbegrip, moet u altijd eerst het resultaat doornemen voordat u het publiceert; een legitieme 'like' of 'well' in het midden van een zin kan af en toe worden meegesleurd door de vullers.