Saltar al contenido
TextArray
Totalmente local

Extractor de URL

Extraiga todos los enlaces de texto o HTML y obtenga una lista limpia de URL.

Entrada

Extractor de URL

Pegue una página de texto, una fuente HTML sin formato o una exportación y esta herramienta enumerará todos los enlaces que contiene. Lee valores href y src de anclajes, imágenes, scripts y hojas de estilo, y también recoge URL desnudas escritas en prosa corriente, incluidos servidores www sin esquema. Útil cuando audita enlaces salientes, recopila rutas de activos de una plantilla o convierte un muro de texto copiado en una lista con la que realmente puede trabajar.

Los duplicados se eliminan de forma predeterminada. El esquema y el host se comparan sin tener en cuenta las mayúsculas y minúsculas, por lo que HTTPS://Example.com/a y https://example.com/a colapsan en una sola entrada, mientras que la ruta y la consulta distinguen entre mayúsculas y minúsculas porque los servidores las tratan de esa manera. Ordene alfabéticamente para agrupar una lista larga por host. El filtro de protocolo limita el resultado a https o http, descartando enlaces ftp y hosts www sin esquema. El filtro de dominio coincide con una subcadena del host y nunca con la ruta, por lo que ejemplo.com no coincidirá con un enlace a other.org que simplemente lo mencione en un segmento de ruta. Los dominios solo reemplazan cada URL con su host simple, nombre de usuario y puerto eliminados, una forma rápida de ver a qué sitios enlaza una página.

Las URL aparecen exactamente como aparecen en la fuente; nada se vuelve a codificar ni normalizar, aparte de convertir un signo de escape HTML en uno simple en las cadenas de consulta. La puntuación de la oración pegada al final se recorta y los corchetes de cierre se equilibran, por lo que un enlace de Wikipedia que termina en _(barra) sobrevive intacto. Los valores sin host (rutas relativas, anclajes, mailto, tel, javascript y URI de datos) se omiten. El recuento muestra el total de apariciones, URL únicas y dominios distintos.

Todo se ejecuta en su navegador. El HTML que pega, ya sea del sitio de un cliente o de una página interna, nunca se carga.

Preguntas frecuentes

¿Encuentra enlaces dentro de los atributos HTML?
Sí. Los valores href y src se leen desde anclajes, imágenes, scripts y hojas de estilo, junto con URL simples en texto sin formato. El valor de un atributo se lee una vez y nunca se vuelve a escanear como texto sin formato; Si el mismo enlace también aparece como texto visible, se trata de una segunda aparición, cuya eliminación de duplicados se contrae.
¿Puedo enumerar solo los dominios?
Active extraer dominios únicamente. Cada URL se reemplaza por su host, en minúsculas, y se eliminan todos los nombres de usuario y puertos. Combínelo con eliminar duplicados para obtener una lista limpia de sitios.
¿Cómo funciona el filtro de dominio?
Coincide con una subcadena del host sin tener en cuenta el caso, no la ruta. Al escribir ejemplo.com se mantienen shop.example.com y cdn.example.com, y se omite un enlace a other.org que solo menciona ejemplo.com en su ruta.
¿Por qué faltan los enlaces mailto y relativos?
La herramienta enumera las URL que tienen un host. Los anclajes, rutas relativas, mailto, tel, javascript y URI de datos no contienen ninguno, por lo que se omiten en lugar de agregarse como ruido.
¿Mi texto está subido a alguna parte?
No. La extracción se ejecuta completamente en su navegador, por lo que el HTML o el texto que pega nunca sale de su dispositivo.