Extraire les URL d’images, les URL de liens et le HTML interne correspondant d’un fragment collé

Collez un fragment HTML, ou une page entière, puis utilisez l’un des trois modes : lister chaque src d’image, lister chaque href de lien, ou lister le HTML interne des éléments qui correspondent à un sélecteur CSS (sélecteurs compatibles jQuery, pas des expressions XPath). Les valeurs sont renvoyées telles quelles : une page qui utilise /images/hero.jpg conserve donc ce chemin relatif.

Le fragment est analysé dans un document inerte, dans ce navigateur. Les images ne sont pas téléchargées, les gestionnaires d’événements en ligne ne s’exécutent pas, et aucune requête ne quitte la page même lorsque le balisage pointe vers des hôtes distants.

  1. Collez le HTML dans le champ ci-dessus, ou appuyez sur Extraire les URL d’images pour partir de l’exemple fourni avec la page.
  2. Appuyez sur Extraire les URL d’images ou Extraire les URL de liens, ou saisissez un sélecteur CSS puis appuyez sur Tester le sélecteur CSS.
  3. Lisez la liste de résultats : une valeur par ligne, dans l’ordre du document. Les notes sous le cadre indiquent ce qui a été ignoré ou répété.
  4. Appuyez sur Copier le résultat pour copier la liste, ou sélectionnez le texte à la main.
  5. Appuyez sur Effacer pour vider l’entrée et le résultat avant le fragment suivant.

Ce que l’outil mesure, et ce qu’il laisse de côté

Comment le fragment est analysé

L’entrée passe par le même analyseur HTML que celui du navigateur pour une page. Les balises non fermées sont réparées, les valeurs d’attribut sont décodées (<img src="a&amp;b.png"> ressort en a&b.png) et un document complet, ligne <!DOCTYPE html> comprise, est accepté. Le contenu d’un <textarea>, les commentaires et les éléments SVG <image> ne sont pas traités comme des images.

Les éléments de premier niveau comptent. Un fragment réduit à <img src="c.png"> ou <a href="/a"> se lit comme n’importe quelle autre correspondance ; les notes précisent combien de correspondances n’avaient pas d’attribut exploitable et combien, en mode sélecteur, n’avaient pas de HTML interne (un <img> ou un <br>, par exemple).

Sélecteurs et sortie

Le champ sélecteur accepte les sélecteurs CSS compatibles jQuery, le langage compris par le moteur de la page elle-même (Sizzle) : .classe, #id, [data-id], div > p, li:nth-child(2), ainsi que des extensions comme :eq(1) ou :contains(texte). Un sélecteur illisible est signalé comme une erreur au lieu de produire un résultat vide.

Le mode sélecteur écrit le HTML interne de chaque correspondance sur sa propre ligne, de sorte que le balisage enfant survive à la copie. Les valeurs en double apparaissent une fois par occurrence et les notes indiquent combien se répètent.

Confidentialité, limites et exactitude

Tout s’exécute localement. Mesuré sur cette version : un fragment contenant <img src="https://example.com/x.png"> ne produit aucune requête réseau, et un attribut onerror dans le balisage collé ne s’exécute pas. Rien n’est envoyé, et l’outil continue de fonctionner hors ligne une fois la page chargée.

Seul le texte collé est traité : pas d’envoi de fichier, pas de récupération d’URL, pas de mode par lots. Les URL relatives restent relatives, car le fragment n’a pas d’URL de base. La liste suit l’ordre du document ; c’est une aide à la vérification, pas un robot d’exploration.

Outils récents :