Hoppa till innehåll
TextArray
100% lokalt

URL extraherare

Dra ut varje länk från text eller HTML och få en ren lista med webbadresser.

Inmatning
Utmatning

URL extraherare

Klistra in en sida med text, en rå HTML-källa eller en export och detta verktyg listar alla länkar som det innehåller. Den läser href- och src-värden från ankare, bilder, skript och stilmallar, och den plockar också upp nakna webbadresser skrivna på löpande prosa, inklusive www-värdar utan schema. Användbart när du granskar utgående länkar, samlar tillgångsvägar från en mall eller förvandlar en vägg med kopierad text till en lista som du faktiskt kan arbeta med.

Dubbletter tas bort som standard. Schema och värd jämförs utan hänsyn till skiftläge, så HTTPS://Example.com/a och https://example.com/a kollapsar till en post, medan sökvägen och frågan förblir skiftlägeskänsliga eftersom servrar behandlar dem på det sättet. Sortera i alfabetisk ordning för att gruppera en lång lista efter värd. Protokollfiltret begränsar resultatet till https eller http, släpper ftp-länkar och schemalösa www-värdar. Domänfiltret matchar en delsträng av värden och aldrig sökvägen, så example.com matchar inte en länk till other.org som bara nämner det i ett sökvägssegment. Domäner ersätter endast varje webbadress med dess blotta värd, användarnamn och port – ett snabbt sätt att se vilka webbplatser en sida länkar ut till.

URL:er kommer tillbaka exakt som de visas i källan; ingenting kodas om eller normaliseras, förutom att förvandla ett HTML-escapet et-tecken tillbaka till ett vanligt i frågesträngar. Meningsinterpunktion limmade på slutet trimmas och avslutande parenteser är balanserade, så en Wikipedia-länk som slutar på _(stapel) överlever intakt. Värden utan värd – relativa sökvägar, ankare, mailto, tel, javascript och data-URI:er – hoppas över. Sammanställningen visar totala förekomster, unika webbadresser och distinkta domäner.

Allt körs i din webbläsare. HTML-koden du klistrar in, oavsett om den är från en kundwebbplats eller en intern sida, laddas aldrig upp.

FAQ

Hittar den länkar i HTML-attribut?
Ja. href- och src-värden läses från ankare, bilder, skript och stilmallar, tillsammans med blotta webbadresser i vanlig text. Ett attributvärde läses en gång och skannas aldrig om som ren text; om samma länk också visas som synlig text, det är en andra förekomst, som tar bort dubbletter kollapsar.
Kan jag lista bara domänerna?
Aktivera endast extrahera domäner. Varje URL ersätts av dess värd, med små bokstäver, med alla användarnamn och portar borttagna. Kombinera det med ta bort dubbletter för en ren lista över webbplatser.
Hur fungerar domänfiltret?
Den matchar en delsträng av värden utan hänsyn till skiftläge, inte sökvägen. Om du skriver example.com behålls shop.example.com och cdn.example.com, och en länk till other.org som bara nämner exempel.com hoppar över.
Varför saknas mailto och relativa länkar?
Verktyget listar webbadresser som har en värd. Ankare, relativa sökvägar, mailto, tel, javascript och data-URI har inga, så de utelämnas istället för att läggas till som brus.
Är min text uppladdad någonstans?
Nej. Extraheringen körs helt i din webbläsare, så HTML eller text du klistrar in lämnar aldrig din enhet.