Sări la conținut
TextArray
Complet local

Extractor de adrese URL

Scoateți fiecare link din text sau HTML și obțineți o listă curată de adrese URL.

Intrare
Ieșire

Extractor de adrese URL

Lipiți o pagină de text, o sursă HTML brută sau un export și acest instrument listează fiecare link pe care îl conține. Citește valorile href și src din ancore, imagini, scripturi și foi de stil și preia, de asemenea, URL-uri simple scrise în proză care rulează, inclusiv gazde www fără schemă. Este util atunci când auditați linkuri de ieșire, recoltați căi de active dintr-un șablon sau transformați un perete de text copiat într-o listă cu care puteți lucra efectiv.

Dublatele sunt eliminate implicit. Schema și gazda sunt comparate fără a ține cont de majuscule, așa că HTTPS://Example.com/a și https://example.com/a se restrâng într-o singură intrare, în timp ce calea și interogarea rămân sensibile la majuscule, deoarece serverele le tratează astfel. Sortați alfabetic pentru a grupa o listă lungă după gazdă. Filtrul de protocol restrânge rezultatul la https sau http, eliminând legăturile ftp și gazdele www fără scheme. Filtrul de domeniu se potrivește cu un subșir al gazdei și niciodată cu calea, așa că example.com nu va potrivi un link către other.org care doar îl menționează într-un segment de cale. Domeniile înlocuiește numai fiecare adresă URL cu gazda, numele de utilizator și portul eliminate - o modalitate rapidă de a vedea la ce site-uri trimite o pagină.

URL-urile revin exact așa cum apar în sursă; nimic nu este re-codificat sau normalizat, în afară de transformarea unui ampersand scapat de HTML într-unul simplu în șirurile de interogare. Punctuația propoziției lipite de sfârșit este tăiată și parantezele de închidere sunt echilibrate, astfel încât un link Wikipedia care se termină în _(bară) supraviețuiește intact. Valorile fără gazdă - căi relative, ancore, mailto, tel, javascript și URI de date - sunt omise. Numărul arată numărul total de apariții, adrese URL unice și domenii distincte.

Totul rulează în browserul tău. HTML-ul pe care îl inserați, fie de pe un site client sau de pe o pagină internă, nu este încărcat niciodată.

FAQ

Găsește linkuri în interiorul atributelor HTML?
Da. Valorile href și src sunt citite din ancore, imagini, scripturi și foi de stil, alături de adrese URL simple în text simplu. O valoare de atribut este citită o dată și nu este niciodată rescanată ca text simplu; dacă același link apare și ca text vizibil, aceasta este o a doua apariție, care elimină colapsurile duplicate.
Pot enumera doar domeniile?
Activați numai extragerea domeniilor. Fiecare adresă URL este înlocuită cu gazda sa, cu litere mici, cu orice nume de utilizator și port eliminate. Combinați-l cu eliminarea duplicatelor pentru o listă curată de site-uri.
Cum funcționează filtrul de domeniu?
Se potrivește cu un subșir al gazdei fără a ține cont de majuscule, nu de cale. Introducerea example.com păstrează shop.example.com și cdn.example.com și omite un link către other.org care menționează doar example.com în calea sa.
De ce lipsesc mailto și linkurile relative?
Instrumentul listează adrese URL care au o gazdă. Ancorele, căile relative, mailto, tel, javascript și URI-urile de date nu transportă niciuna, așa că sunt lăsate afară mai degrabă decât adăugate ca zgomot.
Textul meu este încărcat undeva?
Nu. Extragerea rulează în întregime în browserul dvs., astfel încât HTML sau textul pe care îl inserați nu părăsește niciodată dispozitivul.