Ekstraktor URL-jev
Povlecite vsako povezavo iz besedila ali HTML-ja in dobite čist seznam URL-jev.
Ekstraktor URL-jev
Prilepite stran z besedilom, neobdelani vir HTML ali izvoz in to orodje navede vse povezave, ki jih vsebuje. Bere vrednosti href in src iz sider, slik, skriptov in slogovnih listov ter pobere tudi gole URL-je, napisane v tekoči prozi, vključno z gostitelji www brez sheme. Uporabno, ko nadzirate izhodne povezave, zbirate poti sredstev iz predloge ali spreminjate steno kopiranega besedila v seznam, s katerim lahko dejansko delate.
Dvojniki so privzeto odstranjeni. Shema in gostitelj se primerjata ne glede na velike in male črke, zato se HTTPS://Example.com/a in https://example.com/a strneta v en vnos, medtem ko pot in poizvedba ostaneta občutljiva na velike in male črke, ker ju strežniki obravnavajo tako. Razvrstite po abecedi, da združite dolg seznam po gostitelju. Filter protokola zoži rezultat na https ali http, izpusti povezave ftp in gostitelje www brez sheme. Filter domene se ujema s podnizom gostitelja in nikoli s potjo, zato se example.com ne bo ujemal s povezavo do other.org, ki jo zgolj omenja v segmentu poti. Domene samo nadomestijo vsak URL z golim gostiteljem, uporabniškim imenom in vrati – hiter način za ogled, na katera spletna mesta vodi stran.
URL-ji se vrnejo točno tako, kot so prikazani v viru; nič ni ponovno kodirano ali normalizirano, razen spreminjanja znaka &, ubežnega HTML-ju, nazaj v navadnega v poizvedbenih nizih. Stavčna ločila, prilepljena na konec, so odrezana in oklepaji so uravnoteženi, tako da povezava do Wikipedije, ki se konča z _ (črt), ostane nedotaknjena. Vrednosti brez gostitelja – relativne poti, sidra, mailto, tel, javascript in podatkovni URI-ji – so preskočene. Seštevek prikazuje skupno število pojavitev, edinstvene URL-je in različne domene.
Vse teče v vašem brskalniku. HTML, ki ga prilepite s strani odjemalca ali notranje strani, se nikoli ne naloži.