Ir para o conteúdo
TextArray
Totalmente local

Extrator de URL

Extraia todos os links de texto ou HTML e obtenha uma lista limpa de URLs.

Entrada
Saída

Extrator de URL

Cole uma página de texto, uma fonte HTML bruta ou uma exportação e esta ferramenta lista todos os links que ela contém. Ele lê valores href e src de âncoras, imagens, scripts e folhas de estilo, e também coleta URLs simples escritos em prosa corrente, incluindo hosts www sem esquema. Útil quando você está auditando links externos, coletando caminhos de ativos de um modelo ou transformando uma parede de texto copiado em uma lista com a qual você pode realmente trabalhar.

As duplicatas são removidas por padrão. O esquema e o host são comparados sem levar em conta maiúsculas e minúsculas, portanto, HTTPS://Example.com/a e https://example.com/a são recolhidos em uma entrada, enquanto o caminho e a consulta diferenciam maiúsculas de minúsculas porque os servidores os tratam dessa maneira. Classifique em ordem alfabética para agrupar uma longa lista por host. O filtro de protocolo restringe o resultado a https ou http, eliminando links ftp e hosts www sem esquema. O filtro de domínio corresponde a uma substring do host e nunca ao caminho; portanto, example.com não corresponderá a um link para other.org que apenas o mencione em um segmento de caminho. O Domains apenas substitui cada URL por seu host, nome de usuário e porta removidos - uma maneira rápida de ver para quais sites uma página está vinculada.

Os URLs retornam exatamente como aparecem na fonte; nada é recodificado ou normalizado, exceto transformar um "e" comercial com escape de HTML de volta em um simples em strings de consulta. A pontuação da frase colada no final é cortada e os colchetes de fechamento são equilibrados, de modo que um link da Wikipedia que termina em _(barra) sobrevive intacto. Valores sem host — caminhos relativos, âncoras, mailto, tel, javascript e URIs de dados — são ignorados. A contagem mostra o total de ocorrências, URLs exclusivos e domínios distintos.

Tudo roda no seu navegador. O HTML que você cola, seja de um site de cliente ou de uma página interna, nunca é carregado.

FAQ

Encontra links dentro de atributos HTML?
Sim. Os valores href e src são lidos de âncoras, imagens, scripts e folhas de estilo, juntamente com URLs simples em texto simples. Um valor de atributo é lido uma vez e nunca é digitalizado novamente como texto simples; se o mesmo link também aparecer como texto visível, essa é uma segunda ocorrência, que remove duplicatas e recolhe.
Posso listar apenas os domínios?
Ative apenas a extração de domínios. Cada URL é substituído por seu host, em letras minúsculas, com qualquer nome de usuário e porta removidos. Combine-o com remover duplicatas para obter uma lista limpa de sites.
Como funciona o filtro de domínio?
Ele corresponde a uma substring do host independentemente do caso, não do caminho. Digitar example.com mantém shop.example.com e cdn.example.com e ignora um link para other.org que menciona apenas example.com em seu caminho.
Por que mailto e links relativos estão faltando?
A ferramenta lista URLs que possuem um host. Âncoras, caminhos relativos, mailto, tel, javascript e URIs de dados não carregam nenhum, portanto são deixados de fora em vez de adicionados como ruído.
Meu texto é carregado em algum lugar?
Não. A extração é executada inteiramente no seu navegador, portanto o HTML ou o texto que você cola nunca sai do seu dispositivo.