Перейти к содержанию
100% локально

Очиститель голосовой расшифровки

Очистите необработанные расшифровки речи в текст, удалив слова-вставки, заикания и аннотации.

Входные данные
Выходные данные

Очиститель голосовой расшифровки

Вставьте необработанную расшифровку, экспортированную из Whisper, Otter, системы распознавания речи Google или любого другого механизма преобразования речи в текст, и этот инструмент превратит черновой машинный вывод в читаемый текст. Он удаляет звуки колебаний и слова-паразиты — «хм», «ух», «хм», «хм», «как», «вы знаете», «я имею в виду», «вроде как» — наряду с эквивалентами, которые встречаются в словацкой, чешской, немецкой, польской и венгерской диктовке, поэтому смешанная или неанглийская запись подвергается такой же очистке.

Распознаватели речи также склонны расшифровывать заикающиеся слова буквально — «план», «Я-я-я» — и оставлять в скобках маркеры там, где пропал звук, например [неразборчиво], [музыка] или (смеется). Оба обрабатываются автоматически: повторяющиеся слова сворачиваются в одно место, а аннотации в квадратных скобках исчезают вместе с оставленными ими лишними пробелами. На последнем проходе первая буква текста и первая буква после каждой точки, вопросительного и восклицательного знака рекапитализируются, поскольку расшифровки часто возвращаются в виде одной серии строчных слов.

Каждый из пяти этапов очистки — удаление заполнителей, исправление заглавных букв, свертывание повторов, удаление аннотаций в квадратных скобках и объединение отдельных строк в плавные абзацы — можно включить или отключить, чтобы вы могли сохранить исходные разрывы строк стенограммы для работы с субтитрами или объединить все в прозу для статьи или резюме встречи. Подсчет результатов подсчитывает, сколько слов-вставок и сколько повторяющихся слов было удалено, поэтому вы можете сразу увидеть, насколько грубой была исходная запись.

Все работает локально в вашем браузере. Стенограмма никогда не покидает ваше устройство, что важно для записей встреч, интервью или чего-либо еще, что не предназначено для стороннего сервера. Поскольку очистка работает с фиксированными списками слов и шаблонами, а не с реальным пониманием языка, всегда просматривайте результат перед его публикацией — законные «лайки» или «ну» в середине предложения иногда могут быть затерты заполнителями.

FAQ

Какие слова-паразиты он удаляет?
Английский набор - это «хм», «э-э», «хм», «хм», «как», «вы знаете», «я имею в виду» и «вроде как» / «вроде того», а также общие эквиваленты из словацкой, чешской, немецкой, польской и венгерской диктовки, такие как «хм», «хм», «нет», «теда», «просте», «ако», «остановка», «также» и «шляпа». Отключите эту опцию, чтобы каждое слово оставалось в точности так, как записано.
Как он справляется с заиканиями типа «Я-я-я пойду»?
Сразу повторяющееся слово — с дефисом или запятой между повторениями или без них — сворачивается до одного повторения, поэтому «Я-я-я пойду» становится «Я пойду», а «план» становится «планом».
Что считается аннотацией в квадратных скобках?
Все, что находится внутри квадратных скобок или круглых скобок, например [неразборчиво], [музыка] или (смеется) — тип маркера, который движок преобразования речи в текст вставляет, когда он не может расшифровать фрагмент аудио. Отключение этой опции сохраняет их в выводе нетронутыми.
Что делает «объединить строки в абзацы»?
При экспорте речи в текст каждый короткий сегмент часто помещается на отдельную строку. Включение этого параметра объединяет строки внутри каждого существующего абзаца в плавные предложения, в то время как пустая строка в исходной расшифровке по-прежнему начинает новый абзац в результате.
Загружен ли где-нибудь мой стенограмма?
Нет. Очистка полностью выполняется в вашем браузере с использованием встроенных списков слов — расшифровка никогда не отправляется на сервер.