AccueilBlogGuides LinkHarvest › Extraire les URL d’un sitemap.xml
EN中文日本語DeutschESFR

Extraire toutes les URL d’un sitemap.xml (SEO, 2026)

Votre sitemap contient 2 000 URL. Vous ouvrez sitemap.xml dans un éditeur de texte, vous voyez un mur de balises <loc>, et vous commencez à faire défiler. Vingt minutes plus tard, vous en êtes à l’URL 143, les yeux fatigués et sans aucun plan. C’est là que meurent les audits SEO.

La vérité, c’est qu’un sitemap est déjà une liste lisible par machine de toutes les URL que vous jugez importantes — il suffit d’extraire ces URL du XML et de les mettre dans un format réellement exploitable. Ce guide présente trois façons de le faire, d’une méthode navigateur de 60 secondes aux crawlers de bureau, plus une checklist courte qui transforme une liste d’URL brute en véritable audit.

Pourquoi extraire les URL d’un sitemap ?

Avant le comment, le pourquoi. Une liste aplatie d’URL issues de votre sitemap débloque plusieurs tâches SEO essentielles :

Méthode 1 : Ouvrir sitemap.xml dans le navigateur + extension extractrice (Recommandé)

Voici l’astuce que la plupart des gens laissent passer : un sitemap n’est qu’une liste de liens. Chaque URL se trouve dans une balise <loc>, et les navigateurs les affichent comme des liens cliquables sur la page. Cela signifie que tout outil qui extrait les liens d’une page web extrait aussi les URL d’un sitemap — sans parsing XML nécessaire.

C’est là qu’intervient VKT LinkHarvest, une extension Chrome et Edge qui extrait tous les liens de n’importe quelle page web, y compris les pages rendues dynamiquement. Ouvrez l’URL de votre sitemap, cliquez sur l’icône LinkHarvest, et il capture chaque URL de la page rendue — avec filtrage, tri, classification interne/externe et comptage des occurrences.

Deux remarques pratiques :

Méthode 2 : Screaming Frog / parseurs en ligne

Les crawlers de bureau comme Screaming Frog SEO Spider disposent d’un mode sitemap dédié : collez l’URL du sitemap, choisissez « List Mode », et le crawler visite chaque URL et signale les codes de statut, les redirections et les métadonnées. Les parseurs XML en ligne fonctionnent de façon similaire depuis votre navigateur.

Utilisez cette méthode quand vous avez besoin de données de crawl complètes — codes de réponse, titres, balises canoniques — et pas seulement de la liste d’URL. La contrepartie, ce sont la configuration et les ressources : les crawlers de bureau exigent une installation et peuvent être lents ou gourmands en mémoire sur de très gros sitemaps, et beaucoup de parseurs en ligne limitent le nombre d’URL traitées gratuitement. Si votre objectif est simplement « donnez-moi la liste des URL », la Méthode 1 est plus rapide.

Méthode 3 : Tableur + import XML

Excel et Google Sheets peuvent importer du XML directement. Dans Excel : Données → Obtenir des données → À partir d’un fichier XML ; dans Google Sheets, utilisez la fonction =IMPORTXML() avec un XPath comme //loc pointé vers l’URL du sitemap.

Cela fonctionne pour des sitemaps petits et plats, mais ça devient vite fragile : IMPORTXML a des limites de cellules et de longueur que les gros sitemaps dépassent allègrement, les index de sitemaps exigent une requête supplémentaire par sitemap enfant, et les espaces de noms XML font parfois échouer l’import en silence. Ça dépanne pour un coup unique sur un sitemap de 50 URL ; pour tout sitemap plus grand ou imbriqué, utilisez la Méthode 1.

Checklist d’audit rapide après l’extraction

Une fois les URL réunies dans une seule liste, l’audit est surtout mécanique :

  1. Dédupliquez. Regroupez les sitemaps enfants et supprimez les doublons — le comptage d’occurrences de LinkHarvest affiche chaque URL une fois avec le nombre de fois où elle est apparue.
  2. Vérifiez les codes de statut. Crawlz la liste (ou contrôlez par échantillon) à la recherche d’erreurs 404 et de chaînes 301/302. Les URL du sitemap devraient renvoyer un 200.
  3. Comparez avec les URL indexées. Lancez une requête site: ou consultez la couverture de votre Search Console. Un grand écart entre URL soumises et indexées est votre priorité numéro un.
  4. Repérez les schémas orphelins. Des schémas d’URL présents dans le sitemap mais liés de nulle part sur le site (ou l’inverse) révèlent des lacunes de navigation et de maillage interne.
  5. Signalez le bruit. Les pages de tags, les URL paramétrées et les sous-domaines de préproduction n’ont rien à faire dans un sitemap de production. Filtrez par mot-clé dans LinkHarvest pour les trouver en quelques secondes.

Étape par étape : extraire les URL du sitemap avec LinkHarvest

  1. Installez VKT LinkHarvest depuis le Chrome Web Store ou Edge Add-ons.
  2. Tapez l’adresse de votre sitemap (généralement votredomaine.com/sitemap.xml) dans la barre d’adresse et ouvrez-la. En cas de doute, consultez robots.txt pour trouver la directive Sitemap.
  3. Cliquez sur l’icône LinkHarvest. Il capture chaque URL rendue sur la page et les affiche avec leur nombre d’occurrences.
  4. S’il s’agit d’un index de sitemaps, ouvrez le lien de chaque sitemap enfant, répétez l’extraction, puis fusionnez les listes.
  5. Utilisez le filtre par mot-clé pour éliminer le bruit (par exemple, excluez les URL contenant tag ou page) et triez les résultats.
  6. Copiez les liens filtrés dans le presse-papiers ou exportez-les en TXT (tous deux gratuits). Pour les tableurs, passez à l’export CSV depuis la page des tarifs.

Si vous n’avez jamais utilisé d’extracteur de liens, notre guide sur comment extraire tous les liens d’une page web détaille l’interface plus en profondeur.

Comparaison des méthodes en un coup d’œil

MéthodeIdéale pourConfigurationSitemaps imbriqués
Navigateur + LinkHarvestListes d’URL rapides, filtrage, export gratuitInstallation unique✅ Visitez chaque sitemap enfant
Screaming Frog / crawlersCodes de statut, titres, données de crawl complètesInstallation + configuration✅ Automatique
Import XML en tableurPetits sitemaps plats, usage ponctuelAucune⚠️ Manuel par enfant

Questions fréquentes

Puis-je extraire des URL d’un fichier d’index de sitemap ?

Oui, mais un fichier d’index de sitemap contient des liens vers des sitemaps enfants plutôt que des URL de pages. Extrayez d’abord les URL de l’index, puis visitez chaque sitemap enfant et extrayez ses URL de la même manière, en tout regrouper dans une liste maîtresse. Une extension comme VKT LinkHarvest capture automatiquement les URL des sitemaps enfants depuis la page d’index rendue.

Comment ouvrir sitemap.xml ?

Tapez l’adresse du sitemap — généralement votredomaine.com/sitemap.xml — directement dans la barre d’adresse de votre navigateur. Les navigateurs modernes affichent le XML sous forme de liste de liens cliquables plutôt que de balisage brut. Si la page ne se charge pas, consultez robots.txt pour trouver une directive Sitemap : qui indique l’emplacement réel, car un sitemap peut se trouver à n’importe quelle URL choisie par le propriétaire du site.

LinkHarvest est-il gratuit ?

Le cœur de VKT LinkHarvest est gratuit : extraire tous les liens d’une page, les filtrer et les trier, copier les liens filtrés dans le presse-papiers et les exporter en TXT. La seule fonctionnalité payante est l’export CSV avec encodage UTF-8 BOM pour les tableurs, une mise à niveau unique de 9,99 $ à vie — sans abonnement.

Quelle est la différence entre l’export TXT et CSV ?

L’export TXT produit une liste simple, une URL par ligne, idéale pour les comparaisons rapides, les outils de fusion et les scripts. L’export CSV produit un tableau ouvrable dans Excel ou Google Sheets avec de vraies colonnes, et LinkHarvest ajoute un BOM UTF-8 pour que les caractères spéciaux des URL s’affichent correctement au lieu de devenir du texte illisible.

À quelle fréquence extraire et auditer les URL de mon sitemap ?

Il n’y a pas de règle fixe, mais les bons moments sont après une migration ou une refonte de site, après des ajouts ou suppressions de contenu importants, et selon une cadence d’entretien régulière, par exemple trimestrielle. L’objectif est de repérer les erreurs 404, les chaînes de redirections et les URL qui ne devraient pas figurer dans le sitemap avant que les moteurs de recherche et les utilisateurs ne les trouvent.

Transformez votre sitemap en une liste d’URL propre en quelques minutes : VKT LinkHarvest extrait chaque lien de la page rendue — filtrage, tri, classification, comptage d’occurrences. Cœur gratuit ; Premium (9,99 $ unique, à vie) ajoute l’export CSV compatible Excel. Chrome Web Store · Edge Add-ons.

Découvrez d’autres outils dans le catalogue d’extensions VKT, ou écrivez-nous à [email protected].

Pour continuer la lecture

Comment extraire tous les liens d’une page web — Guide de l’extension Chrome (2026)
Link Klipper vs LinkHarvest — Le meilleur extracteur de liens pour Chrome en 2026