Vai al contenuto
TextArray
100% locale

Estrattore URL

Estrai ogni collegamento dal testo o dall'HTML e ottieni un elenco pulito di URL.

Ingresso

Estrattore URL

Incolla una pagina di testo, una sorgente HTML grezza o un'esportazione e questo strumento elenca tutti i collegamenti in esso contenuti. Legge i valori href e src da ancore, immagini, script e fogli di stile e raccoglie anche URL semplici scritti in prosa corrente, inclusi host www senza schema. Utile quando controlli i collegamenti in uscita, raccogli percorsi di risorse da un modello o trasformi un muro di testo copiato in un elenco con cui puoi effettivamente lavorare.

I duplicati vengono rimossi per impostazione predefinita. Schema e host vengono confrontati senza considerare la distinzione tra maiuscole e minuscole, quindi HTTPS://Example.com/a e https://example.com/a si riducono in un'unica voce, mentre il percorso e la query mantengono la distinzione tra maiuscole e minuscole perché i server li trattano in questo modo. Ordina in ordine alfabetico per raggruppare un lungo elenco per host. Il filtro del protocollo restringe il risultato a https o http, eliminando i collegamenti ftp e gli host www senza schema. Il filtro del dominio corrisponde a una sottostringa dell'host e mai al percorso, quindi example.com non corrisponderà a un collegamento a other.org che lo menziona semplicemente in un segmento di percorso. Domains sostituisce solo ogni URL con il suo host semplice, nome utente e porta eliminati: un modo rapido per vedere a quali siti si collega una pagina.

Gli URL ritornano esattamente come appaiono nell'origine; nulla viene ricodificato o normalizzato, a parte trasformare una e commerciale con escape HTML in una semplice nelle stringhe di query. La punteggiatura della frase incollata alla fine viene tagliata e le parentesi di chiusura sono bilanciate, quindi un collegamento a Wikipedia che termina con _(bar) sopravvive intatto. I valori senza host (percorsi relativi, ancoraggi, mailto, tel, javascript e URI di dati) vengono ignorati. Il conteggio mostra le occorrenze totali, gli URL univoci e i domini distinti.

Tutto funziona nel tuo browser. L'HTML che incolli, sia da un sito cliente che da una pagina interna, non viene mai caricato.

FAQ

Trova collegamenti all'interno degli attributi HTML?
SÌ. I valori href e src vengono letti da ancore, immagini, script e fogli di stile, insieme a URL semplici in testo semplice. Il valore di un attributo viene letto una volta e mai scansionato nuovamente come semplice testo; se lo stesso collegamento appare anche come testo visibile, si tratta di una seconda occorrenza, che rimuove i duplicati si comprime.
Posso elencare solo i domini?
Attiva solo l'estrazione dei domini. Ogni URL viene sostituito dal suo host, in minuscolo, con qualsiasi nome utente e porta rimossi. Combinalo con Rimuovi duplicati per un elenco pulito di siti.
Come funziona il filtro del dominio?
Corrisponde a una sottostringa dell'host indipendentemente dal caso, non dal percorso. Digitando example.com vengono mantenuti shop.example.com e cdn.example.com e salta un collegamento a other.org che menziona solo example.com nel suo percorso.
Perchè mancano mailto e relativi link?
Lo strumento elenca gli URL che dispongono di un host. Ancore, percorsi relativi, mailto, tel, javascript e URI di dati non ne contengono, quindi vengono tralasciati anziché aggiunti come rumore.
Il mio testo è caricato da qualche parte?
No. L'estrazione viene eseguita interamente nel tuo browser, quindi l'HTML o il testo che incolli non lascia mai il tuo dispositivo.