Extraire toutes les URL d’un sitemap.xml (SEO, 2026)
Votre sitemap contient 2 000 URL. Vous ouvrez sitemap.xml dans un éditeur de texte, vous voyez un mur de balises <loc>, et vous commencez à faire défiler. Vingt minutes plus tard, vous en êtes à l’URL 143, les yeux fatigués et sans aucun plan. C’est là que meurent les audits SEO.
La vérité, c’est qu’un sitemap est déjà une liste lisible par machine de toutes les URL que vous jugez importantes — il suffit d’extraire ces URL du XML et de les mettre dans un format réellement exploitable. Ce guide présente trois façons de le faire, d’une méthode navigateur de 60 secondes aux crawlers de bureau, plus une checklist courte qui transforme une liste d’URL brute en véritable audit.
Pourquoi extraire les URL d’un sitemap ?
Avant le comment, le pourquoi. Une liste aplatie d’URL issues de votre sitemap débloque plusieurs tâches SEO essentielles :
- Audits d’indexation : comparez les URL que vous avez soumises à ce que les moteurs de recherche indexent réellement. Les écarts révèlent des problèmes de canonicalisation, des restes de noindex ou du contenu pauvre.
- Inventaire de contenu : une liste complète des pages publiées est le socle des audits de contenu, des décisions d’élagage et du clustering thématique.
- Checklists de migration : avant une refonte, extrayez l’ancien sitemap ; après le lancement, extrayez le nouveau. La différence constitue votre checklist de redirections et de QA.
- Recherche concurrentielle via les sitemaps : les sitemaps sont publics. Extraire le sitemap d’un concurrent révèle toute sa structure de pages, sa vitesse de publication et les sections que vous n’avez pas couvertes.
Méthode 1 : Ouvrir sitemap.xml dans le navigateur + extension extractrice (Recommandé)
Voici l’astuce que la plupart des gens laissent passer : un sitemap n’est qu’une liste de liens. Chaque URL se trouve dans une balise <loc>, et les navigateurs les affichent comme des liens cliquables sur la page. Cela signifie que tout outil qui extrait les liens d’une page web extrait aussi les URL d’un sitemap — sans parsing XML nécessaire.
C’est là qu’intervient VKT LinkHarvest, une extension Chrome et Edge qui extrait tous les liens de n’importe quelle page web, y compris les pages rendues dynamiquement. Ouvrez l’URL de votre sitemap, cliquez sur l’icône LinkHarvest, et il capture chaque URL de la page rendue — avec filtrage, tri, classification interne/externe et comptage des occurrences.
Deux remarques pratiques :
- Fichiers d’index de sitemap : si votre
sitemap.xmlest un index pointant vers des sitemaps enfants (sitemap-posts.xml,sitemap-pages.xml...), extrayez d’abord l’index, puis ouvrez chaque sitemap enfant et extrayez-le de la même manière. Le comptage d’occurrences de LinkHarvest permet de repérer facilement les URL déjà collectées. - Exports : la version gratuite permet de copier les liens filtrés dans le presse-papiers et de les exporter en TXT. LinkHarvest Premium (9,99 $ unique, à vie) ajoute l’export CSV avec encodage UTF-8 BOM — idéal pour coller directement dans Excel ou Google Sheets sans caractères corrompus.
Méthode 2 : Screaming Frog / parseurs en ligne
Les crawlers de bureau comme Screaming Frog SEO Spider disposent d’un mode sitemap dédié : collez l’URL du sitemap, choisissez « List Mode », et le crawler visite chaque URL et signale les codes de statut, les redirections et les métadonnées. Les parseurs XML en ligne fonctionnent de façon similaire depuis votre navigateur.
Utilisez cette méthode quand vous avez besoin de données de crawl complètes — codes de réponse, titres, balises canoniques — et pas seulement de la liste d’URL. La contrepartie, ce sont la configuration et les ressources : les crawlers de bureau exigent une installation et peuvent être lents ou gourmands en mémoire sur de très gros sitemaps, et beaucoup de parseurs en ligne limitent le nombre d’URL traitées gratuitement. Si votre objectif est simplement « donnez-moi la liste des URL », la Méthode 1 est plus rapide.
Méthode 3 : Tableur + import XML
Excel et Google Sheets peuvent importer du XML directement. Dans Excel : Données → Obtenir des données → À partir d’un fichier XML ; dans Google Sheets, utilisez la fonction =IMPORTXML() avec un XPath comme //loc pointé vers l’URL du sitemap.
Cela fonctionne pour des sitemaps petits et plats, mais ça devient vite fragile : IMPORTXML a des limites de cellules et de longueur que les gros sitemaps dépassent allègrement, les index de sitemaps exigent une requête supplémentaire par sitemap enfant, et les espaces de noms XML font parfois échouer l’import en silence. Ça dépanne pour un coup unique sur un sitemap de 50 URL ; pour tout sitemap plus grand ou imbriqué, utilisez la Méthode 1.
Checklist d’audit rapide après l’extraction
Une fois les URL réunies dans une seule liste, l’audit est surtout mécanique :
- Dédupliquez. Regroupez les sitemaps enfants et supprimez les doublons — le comptage d’occurrences de LinkHarvest affiche chaque URL une fois avec le nombre de fois où elle est apparue.
- Vérifiez les codes de statut. Crawlz la liste (ou contrôlez par échantillon) à la recherche d’erreurs 404 et de chaînes 301/302. Les URL du sitemap devraient renvoyer un 200.
- Comparez avec les URL indexées. Lancez une requête
site:ou consultez la couverture de votre Search Console. Un grand écart entre URL soumises et indexées est votre priorité numéro un. - Repérez les schémas orphelins. Des schémas d’URL présents dans le sitemap mais liés de nulle part sur le site (ou l’inverse) révèlent des lacunes de navigation et de maillage interne.
- Signalez le bruit. Les pages de tags, les URL paramétrées et les sous-domaines de préproduction n’ont rien à faire dans un sitemap de production. Filtrez par mot-clé dans LinkHarvest pour les trouver en quelques secondes.
Étape par étape : extraire les URL du sitemap avec LinkHarvest
- Installez VKT LinkHarvest depuis le Chrome Web Store ou Edge Add-ons.
- Tapez l’adresse de votre sitemap (généralement
votredomaine.com/sitemap.xml) dans la barre d’adresse et ouvrez-la. En cas de doute, consultezrobots.txtpour trouver la directive Sitemap. - Cliquez sur l’icône LinkHarvest. Il capture chaque URL rendue sur la page et les affiche avec leur nombre d’occurrences.
- S’il s’agit d’un index de sitemaps, ouvrez le lien de chaque sitemap enfant, répétez l’extraction, puis fusionnez les listes.
- Utilisez le filtre par mot-clé pour éliminer le bruit (par exemple, excluez les URL contenant
tagoupage) et triez les résultats. - Copiez les liens filtrés dans le presse-papiers ou exportez-les en TXT (tous deux gratuits). Pour les tableurs, passez à l’export CSV depuis la page des tarifs.
Si vous n’avez jamais utilisé d’extracteur de liens, notre guide sur comment extraire tous les liens d’une page web détaille l’interface plus en profondeur.
Comparaison des méthodes en un coup d’œil
| Méthode | Idéale pour | Configuration | Sitemaps imbriqués |
|---|---|---|---|
| Navigateur + LinkHarvest | Listes d’URL rapides, filtrage, export gratuit | Installation unique | ✅ Visitez chaque sitemap enfant |
| Screaming Frog / crawlers | Codes de statut, titres, données de crawl complètes | Installation + configuration | ✅ Automatique |
| Import XML en tableur | Petits sitemaps plats, usage ponctuel | Aucune | ⚠️ Manuel par enfant |
Questions fréquentes
Puis-je extraire des URL d’un fichier d’index de sitemap ?
Oui, mais un fichier d’index de sitemap contient des liens vers des sitemaps enfants plutôt que des URL de pages. Extrayez d’abord les URL de l’index, puis visitez chaque sitemap enfant et extrayez ses URL de la même manière, en tout regrouper dans une liste maîtresse. Une extension comme VKT LinkHarvest capture automatiquement les URL des sitemaps enfants depuis la page d’index rendue.
Comment ouvrir sitemap.xml ?
Tapez l’adresse du sitemap — généralement votredomaine.com/sitemap.xml — directement dans la barre d’adresse de votre navigateur. Les navigateurs modernes affichent le XML sous forme de liste de liens cliquables plutôt que de balisage brut. Si la page ne se charge pas, consultez robots.txt pour trouver une directive Sitemap : qui indique l’emplacement réel, car un sitemap peut se trouver à n’importe quelle URL choisie par le propriétaire du site.
LinkHarvest est-il gratuit ?
Le cœur de VKT LinkHarvest est gratuit : extraire tous les liens d’une page, les filtrer et les trier, copier les liens filtrés dans le presse-papiers et les exporter en TXT. La seule fonctionnalité payante est l’export CSV avec encodage UTF-8 BOM pour les tableurs, une mise à niveau unique de 9,99 $ à vie — sans abonnement.
Quelle est la différence entre l’export TXT et CSV ?
L’export TXT produit une liste simple, une URL par ligne, idéale pour les comparaisons rapides, les outils de fusion et les scripts. L’export CSV produit un tableau ouvrable dans Excel ou Google Sheets avec de vraies colonnes, et LinkHarvest ajoute un BOM UTF-8 pour que les caractères spéciaux des URL s’affichent correctement au lieu de devenir du texte illisible.
À quelle fréquence extraire et auditer les URL de mon sitemap ?
Il n’y a pas de règle fixe, mais les bons moments sont après une migration ou une refonte de site, après des ajouts ou suppressions de contenu importants, et selon une cadence d’entretien régulière, par exemple trimestrielle. L’objectif est de repérer les erreurs 404, les chaînes de redirections et les URL qui ne devraient pas figurer dans le sitemap avant que les moteurs de recherche et les utilisateurs ne les trouvent.
Transformez votre sitemap en une liste d’URL propre en quelques minutes : VKT LinkHarvest extrait chaque lien de la page rendue — filtrage, tri, classification, comptage d’occurrences. Cœur gratuit ; Premium (9,99 $ unique, à vie) ajoute l’export CSV compatible Excel. Chrome Web Store · Edge Add-ons.
Découvrez d’autres outils dans le catalogue d’extensions VKT, ou écrivez-nous à [email protected].
