Екстрактор URL
Витягніть кожне посилання з тексту чи HTML і отримайте чистий список URL-адрес.
Екстрактор URL
Вставте сторінку з текстом, необроблений джерело HTML або експорт, і цей інструмент перерахує кожне посилання, яке містить. Він зчитує значення href і src із прив’язок, зображень, сценаріїв і таблиць стилів, а також вибирає голі URL-адреси, написані запущеною прозою, включаючи хости www без схеми. Корисно, коли ви перевіряєте вихідні посилання, збираєте шляхи активів із шаблону або перетворюєте стіну скопійованого тексту на список, з яким можна справді працювати.
Дублікати видаляються за замовчуванням. Схема та хост порівнюються без урахування регістру, тому HTTPS://Example.com/a та https://example.com/a згортаються в один запис, тоді як шлях і запит залишаються чутливими до регістру, оскільки сервери обробляють їх таким чином. Сортуйте за алфавітом, щоб згрупувати довгий список за хостом. Фільтр протоколу звужує результат до https або http, видаляючи ftp-посилання та хости www без схеми. Фільтр домену відповідає підрядку хосту, а не шляху, тому example.com не відповідатиме посиланню на other.org, яке лише згадує його в сегменті шляху. Домени лише замінюють кожну URL-адресу голим хостом, іменем користувача та портом — це швидкий спосіб побачити, на які сайти посилається сторінка.
URL-адреси повертаються точно так, як вони відображаються в джерелі; нічого не перекодовано чи нормалізовано, окрім перетворення екранованого амперсанда HTML назад на звичайний у рядках запиту. Пунктуація, приклеєна до кінця речення, обрізається, а дужки, що закриваються, збалансовані, тож посилання у Вікіпедії, яке закінчується на _(бар), зберігається без змін. Значення без хоста — відносні шляхи, прив’язки, mailto, tel, javascript і URI даних — пропускаються. Підрахунок показує загальну кількість випадків, унікальні URL-адреси та окремі домени.
Все працює у вашому браузері. HTML-код, який ви вставляєте, із сайту клієнта чи внутрішньої сторінки, ніколи не завантажується.