Ga naar inhoud
TextArray
100% lokaal

URL-extractor

Haal elke link uit tekst of HTML en krijg een overzichtelijke lijst met URL's.

Invoer
Uitvoer

URL-extractor

Plak een pagina met tekst, een onbewerkte HTML-bron of een export en deze tool vermeldt elke link die deze bevat. Het leest href- en src-waarden uit ankers, afbeeldingen, scripts en stylesheets, en pikt ook kale URL's op die in lopend proza zijn geschreven, inclusief www-hosts zonder schema. Handig wanneer u uitgaande links controleert, middelenpaden uit een sjabloon verzamelt of een muur met gekopieerde tekst omzet in een lijst waarmee u daadwerkelijk kunt werken.

Duplicaten worden standaard verwijderd. Schema en host worden vergeleken zonder rekening te houden met hoofdlettergebruik, zodat HTTPS://Example.com/a en https://example.com/a samenkomen in één item, terwijl het pad en de query hoofdlettergevoelig blijven omdat servers ze op die manier behandelen. Sorteer alfabetisch om een lange lijst op host te groeperen. Het protocolfilter beperkt het resultaat tot https of http, waarbij ftp-links en schemaloze www-hosts worden verwijderd. Het domeinfilter komt overeen met een subtekenreeks van de host en nooit met het pad, dus example.com zal geen link naar other.org matchen die deze alleen maar vermeldt in een padsegment. Domeinen vervangt alleen elke URL, waarbij de kale host, gebruikersnaam en poort zijn verwijderd – een snelle manier om te zien naar welke sites een pagina linkt.

URL's komen precies terug zoals ze in de bron verschijnen; niets wordt opnieuw gecodeerd of genormaliseerd, behalve het omzetten van een ampersand met HTML-escape terug in een gewoon ampersand in queryreeksen. De interpunctie van de zin die aan het einde is geplakt, is ingekort en de haakjes sluiten zijn uitgebalanceerd, zodat een Wikipedia-link die eindigt op _(bar) intact blijft. Waarden zonder host (relatieve paden, ankers, mailto, tel, javascript en data-URI's) worden overgeslagen. De telling toont het totale aantal voorkomens, unieke URL's en verschillende domeinen.

Alles draait in uw browser. De HTML die u plakt, ongeacht of deze afkomstig is van een klantsite of een interne pagina, wordt nooit geüpload.

FAQ

Vindt het links binnen HTML-attributen?
Ja. href- en src-waarden worden gelezen uit ankers, afbeeldingen, scripts en stylesheets, naast kale URL's in platte tekst. Een attribuutwaarde wordt één keer gelezen en nooit opnieuw gescand als kale tekst; als dezelfde link ook als zichtbare tekst verschijnt, is dat een tweede voorkomen, waarbij het verwijderen van duplicaten instort.
Kan ik alleen de domeinen vermelden?
Schakel alleen domeinextractie in. Elke URL wordt vervangen door de host, in kleine letters, waarbij eventuele gebruikersnaam en poort zijn verwijderd. Combineer het met het verwijderen van duplicaten voor een overzichtelijke lijst met sites.
Hoe werkt het domeinfilter?
Het komt overeen met een subtekenreeks van de host, ongeacht het hoofdlettergebruik, niet het pad. Als u voorbeeld.com typt, blijven shop.example.com en cdn.example.com behouden, en wordt een link naar other.org overgeslagen waarin alleen voorbeeld.com in het pad wordt vermeld.
Waarom ontbreken mailto en relatieve links?
De tool vermeldt URL's die een host hebben. Ankers, relatieve paden, mailto, tel, javascript en data-URI's bevatten geen gegevens, dus worden ze weggelaten in plaats van toegevoegd als ruis.
Wordt mijn tekst ergens geüpload?
Nee. De extractie vindt volledig plaats in uw browser, zodat de HTML of tekst die u plakt nooit uw apparaat verlaat.