Очиститель голосовой расшифровки
Очистите необработанные расшифровки речи в текст, удалив слова-вставки, заикания и аннотации.
Очиститель голосовой расшифровки
Вставьте необработанную расшифровку, экспортированную из Whisper, Otter, системы распознавания речи Google или любого другого механизма преобразования речи в текст, и этот инструмент превратит черновой машинный вывод в читаемый текст. Он удаляет звуки колебаний и слова-паразиты — «хм», «ух», «хм», «хм», «как», «вы знаете», «я имею в виду», «вроде как» — наряду с эквивалентами, которые встречаются в словацкой, чешской, немецкой, польской и венгерской диктовке, поэтому смешанная или неанглийская запись подвергается такой же очистке.
Распознаватели речи также склонны расшифровывать заикающиеся слова буквально — «план», «Я-я-я» — и оставлять в скобках маркеры там, где пропал звук, например [неразборчиво], [музыка] или (смеется). Оба обрабатываются автоматически: повторяющиеся слова сворачиваются в одно место, а аннотации в квадратных скобках исчезают вместе с оставленными ими лишними пробелами. На последнем проходе первая буква текста и первая буква после каждой точки, вопросительного и восклицательного знака рекапитализируются, поскольку расшифровки часто возвращаются в виде одной серии строчных слов.
Каждый из пяти этапов очистки — удаление заполнителей, исправление заглавных букв, свертывание повторов, удаление аннотаций в квадратных скобках и объединение отдельных строк в плавные абзацы — можно включить или отключить, чтобы вы могли сохранить исходные разрывы строк стенограммы для работы с субтитрами или объединить все в прозу для статьи или резюме встречи. Подсчет результатов подсчитывает, сколько слов-вставок и сколько повторяющихся слов было удалено, поэтому вы можете сразу увидеть, насколько грубой была исходная запись.
Все работает локально в вашем браузере. Стенограмма никогда не покидает ваше устройство, что важно для записей встреч, интервью или чего-либо еще, что не предназначено для стороннего сервера. Поскольку очистка работает с фиксированными списками слов и шаблонами, а не с реальным пониманием языка, всегда просматривайте результат перед его публикацией — законные «лайки» или «ну» в середине предложения иногда могут быть затерты заполнителями.