Удалить HTML-теги
Удалите все теги HTML и XML и сохраните читаемый текст.
Удалить HTML-теги
Вставьте кусок HTML и получите обратно читаемый текст. Инструмент удаляет все теги — элементы div, диапазоны, ссылки, таблицы, целые документы — и оставляет то, что на самом деле увидит читатель. Это самый быстрый способ извлечь статью из исходного кода страницы, очистить экспорт CMS или информационного бюллетеня, получить достоверное количество слов для копии, которая все еще заключена в разметку, или превратить очищенный фрагмент в простой список.
Четыре варианта охватывают случаи, когда «очистить все» слишком резко. Декодирование HTML-объектов превращается и обратно в амперсанд, в пробел и — в длинное тире, поэтому текст читается правильно, а не показывает управляющие коды. Сохранение разрывов строк приводит к тому, что <br> и теги уровня блока, такие как <p>, <li> и <h1>, переходят на новую строку каждый, поэтому абзацы остаются абзацами, а не сворачиваются в одну продолжающуюся строку; выключите его, и оставшийся текст будет объединен точно так, как он был. В белом списке сохраняются теги, которые вы называете — введите «b, i, a», и это форматирование сохраняется, пока все остальное сохраняется. При удалении содержимого скриптов и стилей эти элементы удаляются целиком, поэтому правила CSS и JavaScript никогда не попадают в ваш текст. Он включен по умолчанию, потому что это почти всегда то, что вам нужно.
Удаление выполняется с помощью рукописного сканера, а не путем помещения HTML-кода на страницу, поэтому ничто из разметки не может работать. Текст обрабатывается так же, как браузер: «5 < 10» остается, комментарии и типы документов исчезают, а неработающий тег удаляется, а не печатается наполовину.
Все происходит в вашем браузере и ничего не загружается, поэтому внутренние страницы, работу клиента и неопубликованные черновики можно безопасно вставлять. Скопируйте результат, загрузите его в виде файла .txt или переместите обратно на вход для следующего прохода очистки.