Extrator de URL
Extraia todos os links de texto ou HTML e obtenha uma lista limpa de URLs.
Extrator de URL
Cole uma página de texto, uma fonte HTML bruta ou uma exportação e esta ferramenta lista todos os links que ela contém. Ele lê valores href e src de âncoras, imagens, scripts e folhas de estilo, e também coleta URLs simples escritos em prosa corrente, incluindo hosts www sem esquema. Útil quando você está auditando links externos, coletando caminhos de ativos de um modelo ou transformando uma parede de texto copiado em uma lista com a qual você pode realmente trabalhar.
As duplicatas são removidas por padrão. O esquema e o host são comparados sem levar em conta maiúsculas e minúsculas, portanto, HTTPS://Example.com/a e https://example.com/a são recolhidos em uma entrada, enquanto o caminho e a consulta diferenciam maiúsculas de minúsculas porque os servidores os tratam dessa maneira. Classifique em ordem alfabética para agrupar uma longa lista por host. O filtro de protocolo restringe o resultado a https ou http, eliminando links ftp e hosts www sem esquema. O filtro de domínio corresponde a uma substring do host e nunca ao caminho; portanto, example.com não corresponderá a um link para other.org que apenas o mencione em um segmento de caminho. O Domains apenas substitui cada URL por seu host, nome de usuário e porta removidos - uma maneira rápida de ver para quais sites uma página está vinculada.
Os URLs retornam exatamente como aparecem na fonte; nada é recodificado ou normalizado, exceto transformar um "e" comercial com escape de HTML de volta em um simples em strings de consulta. A pontuação da frase colada no final é cortada e os colchetes de fechamento são equilibrados, de modo que um link da Wikipedia que termina em _(barra) sobrevive intacto. Valores sem host — caminhos relativos, âncoras, mailto, tel, javascript e URIs de dados — são ignorados. A contagem mostra o total de ocorrências, URLs exclusivos e domínios distintos.
Tudo roda no seu navegador. O HTML que você cola, seja de um site de cliente ou de uma página interna, nunca é carregado.