Перейти к содержанию
TextArray
100% локально

Экстрактор URL-адресов

Извлеките каждую ссылку из текста или HTML и получите чистый список URL-адресов.

Входные данные
Выходные данные

Экстрактор URL-адресов

Вставьте страницу текста, исходный HTML-код или экспортированный файл, и этот инструмент выведет список всех содержащихся в нем ссылок. Он считывает значения href и src из якорей, изображений, скриптов и таблиц стилей, а также распознает голые URL-адреса, написанные бегущей прозой, включая хосты www без схемы. Полезно, когда вы проверяете исходящие ссылки, извлекаете пути к ресурсам из шаблона или превращаете стену скопированного текста в список, с которым действительно можно работать.

Дубликаты удаляются по умолчанию. Схема и хост сравниваются без учета регистра, поэтому HTTPS://Example.com/a и https://example.com/a объединяются в одну запись, а путь и запрос остаются чувствительными к регистру, поскольку серверы обрабатывают их таким образом. Сортируйте по алфавиту, чтобы сгруппировать длинный список по хостам. Фильтр протоколов сужает результат до https или http, удаляя ftp-ссылки и бессхемные www-хосты. Фильтр домена соответствует подстроке хоста, а не пути, поэтому example.com не будет соответствовать ссылке на другой.org, которая просто упоминает его в сегменте пути. Домены заменяют каждый URL-адрес только пустым хостом, именем пользователя и портом — быстрый способ увидеть, на какие сайты ссылается страница.

URL-адреса возвращаются точно так, как они появляются в источнике; ничего не перекодируется и не нормализуется, кроме преобразования амперсанда, экранированного HTML, обратно в простой в строках запроса. Пунктуация предложения, приклеенная к концу, обрезается, а закрывающие скобки сбалансированы, поэтому ссылка на Википедию, оканчивающаяся на _(bar), сохраняется неповрежденной. Значения без хоста — относительные пути, привязки, URI mailto, tel, javascript и данных — пропускаются. Подсчет показывает общее количество вхождений, уникальные URL-адреса и отдельные домены.

Все работает в вашем браузере. HTML-код, который вы вставляете, будь то с клиентского сайта или внутренней страницы, никогда не загружается.

FAQ

Находит ли он ссылки внутри атрибутов HTML?
Да. Значения href и src считываются из якорей, изображений, скриптов и таблиц стилей наряду с простыми URL-адресами в виде обычного текста. Значение атрибута считывается один раз и никогда не сканируется повторно как чистый текст; если та же ссылка также отображается как видимый текст, это происходит во второй раз, и удаление дубликатов сворачивается.
Могу ли я перечислить только домены?
Включите только извлечение доменов. Каждый URL-адрес заменяется своим хостом, написанным строчными буквами, при этом все имя пользователя и порт удаляются. Объедините это с удалением дубликатов, чтобы получить чистый список сайтов.
Как работает фильтр доменов?
Он соответствует подстроке хоста без учета регистра, а не пути. При вводе example.com сохраняются shop.example.com и cdn.example.com и пропускается ссылка на другой.org, в пути которой упоминается только example.com.
Почему отсутствуют mailto и относительные ссылки?
Инструмент перечисляет URL-адреса, у которых есть хост. Якоря, относительные пути, URI mailto, tel, javascript и данных не содержат никаких данных, поэтому они исключаются, а не добавляются как шум.
Мой текст где-нибудь загружен?
Нет. Извлечение выполняется полностью в вашем браузере, поэтому вставляемый вами HTML-код или текст никогда не покидает ваше устройство.