Aller au contenu
TextArray
Tout en local

Extracteur d'URL

Extrayez chaque lien du texte ou du HTML et obtenez une liste claire d'URL.

Entrée
Sortie

Extracteur d'URL

Collez une page de texte, une source HTML brute ou une exportation et cet outil répertorie tous les liens qu'il contient. Il lit les valeurs href et src à partir des ancres, des images, des scripts et des feuilles de style, et récupère également les URL nues écrites en prose courante, y compris les hôtes www sans schéma. Utile lorsque vous auditez des liens sortants, récupérez des chemins d'actifs à partir d'un modèle ou transformez un mur de texte copié en une liste avec laquelle vous pouvez réellement travailler.

Duplicates are removed by default. Le schéma et l'hôte sont comparés sans tenir compte de la casse, donc HTTPS://Example.com/a et https://example.com/a se regroupent en une seule entrée, tandis que le chemin et la requête restent sensibles à la casse car les serveurs les traitent de cette façon. Triez par ordre alphabétique pour regrouper une longue liste par hôte. Le filtre de protocole restreint le résultat à https ou http, supprimant les liens ftp et les hôtes www sans schéma. Le filtre de domaine correspond à une sous-chaîne de l'hôte et jamais au chemin, donc example.com ne correspondra pas à un lien vers other.org qui le mentionne simplement dans un segment de chemin. Les domaines remplacent uniquement chaque URL par son hôte nu, son nom d'utilisateur et son port supprimés – un moyen rapide de voir vers quels sites une page renvoie.

URLs come back exactly as they appear in the source; rien n'est réencodé ou normalisé, à part transformer une esperluette échappée HTML en une simple esperluette dans les chaînes de requête. La ponctuation de la phrase collée à la fin est coupée et les crochets fermants sont équilibrés, de sorte qu'un lien Wikipédia se terminant par _(bar) survit intact. Les valeurs sans hôte (chemins relatifs, ancres, mailto, tel, javascript et URI de données) sont ignorées. Le décompte montre le nombre total d'occurrences, les URL uniques et les domaines distincts.

Tout fonctionne dans votre navigateur. Le HTML que vous collez, que ce soit depuis un site client ou une page interne, n'est jamais téléchargé.

FAQ

Trouve-t-il des liens dans les attributs HTML ?
Oui. Les valeurs href et src sont lues à partir des ancres, des images, des scripts et des feuilles de style, ainsi que des URL nues en texte brut. Une valeur d'attribut est lue une fois et n'est jamais réanalysée sous forme de texte brut ; si le même lien apparaît également sous forme de texte visible, il s'agit d'une deuxième occurrence, qui supprime les doublons.
Puis-je lister uniquement les domaines ?
Activez uniquement l'extraction de domaines. Chaque URL est remplacée par son hôte, en minuscules, et tout nom d'utilisateur et port sont supprimés. Combinez-le avec la suppression des doublons pour une liste de sites propre.
Comment fonctionne le filtre de domaine ?
Il correspond à une sous-chaîne de l'hôte sans tenir compte de la casse, et non du chemin. En tapant example.com, vous conservez shop.example.com et cdn.example.com, et ignorez un lien vers other.org qui ne mentionne que example.com sur son chemin.
Pourquoi les liens mailto et relatifs sont-ils manquants ?
L'outil répertorie les URL qui ont un hôte. Les ancres, les chemins relatifs, les URI mailto, tel, javascript et de données n'en portent pas, ils sont donc laissés de côté plutôt que ajoutés en tant que bruit.
Mon texte est-il téléchargé quelque part ?
Non. L'extraction s'exécute entièrement dans votre navigateur, de sorte que le code HTML ou le texte que vous collez ne quitte jamais votre appareil.