Перейти до вмісту
TextArray
100% локально

Екстрактор URL

Витягніть кожне посилання з тексту чи HTML і отримайте чистий список URL-адрес.

Введення
Вихід

Екстрактор URL

Вставте сторінку з текстом, необроблений джерело HTML або експорт, і цей інструмент перерахує кожне посилання, яке містить. Він зчитує значення href і src із прив’язок, зображень, сценаріїв і таблиць стилів, а також вибирає голі URL-адреси, написані запущеною прозою, включаючи хости www без схеми. Корисно, коли ви перевіряєте вихідні посилання, збираєте шляхи активів із шаблону або перетворюєте стіну скопійованого тексту на список, з яким можна справді працювати.

Дублікати видаляються за замовчуванням. Схема та хост порівнюються без урахування регістру, тому HTTPS://Example.com/a та https://example.com/a згортаються в один запис, тоді як шлях і запит залишаються чутливими до регістру, оскільки сервери обробляють їх таким чином. Сортуйте за алфавітом, щоб згрупувати довгий список за хостом. Фільтр протоколу звужує результат до https або http, видаляючи ftp-посилання та хости www без схеми. Фільтр домену відповідає підрядку хосту, а не шляху, тому example.com не відповідатиме посиланню на other.org, яке лише згадує його в сегменті шляху. Домени лише замінюють кожну URL-адресу голим хостом, іменем користувача та портом — це швидкий спосіб побачити, на які сайти посилається сторінка.

URL-адреси повертаються точно так, як вони відображаються в джерелі; нічого не перекодовано чи нормалізовано, окрім перетворення екранованого амперсанда HTML назад на звичайний у рядках запиту. Пунктуація, приклеєна до кінця речення, обрізається, а дужки, що закриваються, збалансовані, тож посилання у Вікіпедії, яке закінчується на _(бар), зберігається без змін. Значення без хоста — відносні шляхи, прив’язки, mailto, tel, javascript і URI даних — пропускаються. Підрахунок показує загальну кількість випадків, унікальні URL-адреси та окремі домени.

Все працює у вашому браузері. HTML-код, який ви вставляєте, із сайту клієнта чи внутрішньої сторінки, ніколи не завантажується.

FAQ

Чи знаходить він посилання в атрибутах HTML?
так Значення href і src зчитуються з прив’язок, зображень, сценаріїв і таблиць стилів, а також із простими URL-адресами у звичайному тексті. Значення атрибута читається один раз і ніколи не сканується повторно як чистий текст; якщо те саме посилання також відображається як видимий текст, це є другим випадком, який видаляє дублікати згортається.
Чи можна перерахувати лише домени?
Увімкніть лише вилучення доменів. Кожна URL-адреса замінюється своїм хостом у нижньому регістрі, а ім’я користувача та порт видаляються. Поєднайте це з видаленням дублікатів для чистого списку сайтів.
Як працює фільтр домену?
Він відповідає підрядку хоста без урахування регістру, а не шляху. Введення example.com зберігає shop.example.com і cdn.example.com і пропускає посилання на other.org, у якому згадується лише example.com.
Чому відсутні mailto та відносні посилання?
Інструмент містить список URL-адрес, які мають хост. Прив’язки, відносні шляхи, mailto, tel, javascript і URI даних не містять нічого, тому їх не додають, а пропускають як шум.
Мій текст десь завантажено?
Ні. Видобуток повністю виконується у вашому браузері, тому HTML або текст, який ви вставляєте, ніколи не залишає ваш пристрій.