Sitemap.php, Google et référencement : petite plongée dans les entrailles du Guichet du rêve
Lorsqu'on crée un site, on pense généralement au contenu avant de penser aux robots qui vont venir le visiter.
C'est assez logique : on écrit, on publie, on améliore ses pages et, un beau jour, on se demande pourquoi Google ne semble pas avoir tout compris.
C'est précisément ce qui m'est arrivé avec le Guichet du rêve.
Le site fonctionne sous PluXml 5.8.23, un CMS léger que j'apprécie notamment pour sa simplicité et pour les possibilités de référencement qu'il offre sans avoir besoin d'empiler les extensions.
Mais un détail technique est venu semer le doute : le fichier sitemap.php, pourtant accessible depuis un navigateur, n'était pas accepté correctement par Google Search Console.
J'ai donc posé mes questions à une IA.
Et comme souvent avec l'IA, la conversation a été instructive à deux titres : pour les réponses qu'elle apporte... et pour les erreurs qu'elle peut elle-même commettre.
C'est assez logique : on écrit, on publie, on améliore ses pages et, un beau jour, on se demande pourquoi Google ne semble pas avoir tout compris.
C'est précisément ce qui m'est arrivé avec le Guichet du rêve.
Le site fonctionne sous PluXml 5.8.23, un CMS léger que j'apprécie notamment pour sa simplicité et pour les possibilités de référencement qu'il offre sans avoir besoin d'empiler les extensions.
Mais un détail technique est venu semer le doute : le fichier sitemap.php, pourtant accessible depuis un navigateur, n'était pas accepté correctement par Google Search Console.
J'ai donc posé mes questions à une IA.
Et comme souvent avec l'IA, la conversation a été instructive à deux titres : pour les réponses qu'elle apporte... et pour les erreurs qu'elle peut elle-même commettre.
1. À quoi sert un sitemap ?
Un sitemap est essentiellement une liste structurée des URL importantes d'un site.
Il permet aux moteurs de recherche de découvrir plus facilement les pages que l'on souhaite leur signaler.
Dans le cas de PluXml, le fichier sitemap.php est généré dynamiquement. Il peut donc produire un document XML contenant les différentes pages et les informations associées, notamment leur date de modification lorsqu'elle est disponible.
Le fait que le fichier soit en .php ne signifie donc pas qu'il ne peut pas servir de sitemap. Ce qui compte est ce que le serveur renvoie réellement au moteur de recherche.
Dans mon cas, le sitemap était accessible à cette adresse :
https://guichet-du-reve.fr/sitemap.php
Et c'est cette adresse précise qui devait être communiquée à Google.
2. Le premier piège : l'adresse du sitemap
C'est un détail, mais il est révélateur.
Dans la conversation, l'IA m'a d'abord proposé d'inscrire dans robots.txt :
Sitemap: https://guichet-du-reve.fr
C'était incorrect.
L'adresse devait être celle du sitemap lui-même :
Sitemap: https://guichet-du-reve.fr/sitemap.php
Même chose dans Google Search Console : lorsque Google affiche déjà le début de l'adresse du site, il suffit généralement de renseigner la partie correspondant au fichier, ici :
sitemap.php
Cette petite erreur illustre bien une règle que j'ai fini par retenir : une réponse donnée avec assurance par une IA n'est pas nécessairement une réponse vérifiée.
3. Les fameux caractères invisibles
La première piste évoquée concernait les espaces, retours à la ligne ou caractères invisibles placés au début d'un fichier.
C'est une piste parfaitement plausible lorsqu'un fichier XML ou un script PHP produit une sortie inattendue.
Un fichier peut en effet sembler parfaitement normal à l'écran tout en contenant quelques octets indésirables avant le contenu attendu.
C'est ici qu'est apparu un terme que je ne connaissais pas : BOM, pour Byte Order Mark.
J'y reviendrai plus loin, car cette petite bestiole mérite quelques explications.
4. Le problème des dates <lastmod>
Un sitemap XML peut notamment contenir une indication de date de dernière modification avec la balise :
<lastmod>2026-09-11</lastmod>
ou une date avec une indication horaire.
Le format utilisé doit être compatible avec les règles du protocole Sitemap et avec les valeurs attendues par les moteurs.
Une date mal formée peut donc constituer une piste lorsqu'un sitemap est refusé ou mal interprété.
Mais il faut se garder d'une conclusion trop rapide : le simple fait que Google Search Console affiche temporairement « Impossible de lire le sitemap » ne permet pas, à lui seul, de déterminer que le problème vient de <lastmod>.
5. Quand Google dit « impossible de lire le sitemap »
C'est à ce moment que l'aventure devient intéressante.
Mon sitemap s'ouvrait parfaitement dans Firefox.
Je pouvais donc constater que le fichier existait et que le serveur répondait.
Mais Google Search Console affichait malgré tout :
« Impossible de lire le sitemap »
La tentation était grande de chercher immédiatement un caractère caché, une ligne vide ou une erreur dans le fichier.
L'IA m'a d'abord conseillé d'attendre 24 à 48 heures, en expliquant que Search Console peut mettre un certain temps à traiter une nouvelle soumission.
C'est une possibilité réelle, mais là encore il faut éviter les affirmations trop catégoriques du genre « le problème disparaîtra automatiquement ».
Lorsque Google signale un problème, mieux vaut vérifier méthodiquement :
-
que l'URL du sitemap est exacte ;
-
que le serveur répond correctement ;
-
que le document retourné est bien un XML valide ;
-
que le contenu est accessible à Googlebot ;
-
que le fichier
robots.txtne bloque pas son accès ; -
que les URL présentes dans le sitemap sont cohérentes ;
-
et, seulement ensuite, envisager les problèmes plus subtils.
6. Le sitemap peut fonctionner dans le navigateur et poser problème à Google
C'est un point important.
Un navigateur et un robot d'indexation ne travaillent pas exactement dans les mêmes conditions.
Lorsqu'une page s'affiche dans Firefox, cela nous dit essentiellement que le navigateur a réussi à obtenir une réponse et à l'interpréter.
Cela ne garantit pas que le document respecte parfaitement les attentes d'un moteur de recherche.
C'est particulièrement vrai pour un document XML.
Un navigateur peut parfois faire preuve d'une certaine tolérance. Un parseur XML, lui, peut être beaucoup moins accommodant.
C'est pourquoi les outils de validation peuvent être utiles.
7. Google Search Console : passage obligé
Une fois les bases techniques vérifiées, il faut évidemment donner à Google les moyens de comprendre que le site existe et qu'on en est bien le propriétaire.
Google Search Console permet notamment de suivre :
-
les pages découvertes et indexées ;
-
les requêtes qui ont conduit des internautes vers le site ;
-
les impressions dans les résultats de recherche ;
-
les clics ;
-
certaines erreurs d'exploration ou d'indexation ;
-
et les problèmes éventuels concernant les sitemaps.
Pour ajouter le Guichet du rêve à un compte Google Search Console déjà utilisé pour d'autres sites, il faut passer par :
Ajouter une propriété
Google propose alors différentes méthodes de validation.
Pour un site PluXml, l'une des possibilités consiste à utiliser une balise HTML de vérification, par exemple :
<meta name="google-site-verification"
content="UneSuiteDeLettresEtChiffres" />
Cette balise peut être placée dans l'en-tête du site selon les possibilités offertes par PluXml.
Une fois la propriété validée, on peut déclarer le sitemap dans la rubrique correspondante de Search Console.
Dans notre cas :
sitemap.php
8. Que signifie « Insights » ?
Un autre petit détail m'a arrêté dans l'interface de Google.
Le mot anglais Insights apparaît dans plusieurs services numériques.
Il désigne, selon le contexte, des informations permettant de mieux comprendre une situation : des enseignements, des indications utiles, des tendances ou des éléments d'analyse.
Dans le cas de Search Console, il ne s'agit donc pas simplement d'un compteur.
L'intérêt est de pouvoir observer progressivement comment le site apparaît dans les recherches :
-
quelles requêtes amènent des visiteurs ;
-
quelles pages obtiennent des impressions ;
-
quelles pages reçoivent des clics ;
-
quelle évolution suit la visibilité du site.
Autrement dit, Google commence peu à peu à nous montrer ce qu'il comprend de notre site.
Et parfois, ce qu'il comprend n'est pas exactement ce que nous pensions avoir écrit.
9. Le référencement ne s'arrête évidemment pas au sitemap
Le sitemap facilite la découverte des pages, mais il ne transforme pas miraculeusement un site en vedette des résultats Google.
Une fois les fondations techniques posées, d'autres éléments comptent :
Des URL propres
La réécriture des URL est activée sur mon PluXml.
Une adresse comme :
/article-interessant-sur-les-mobil-homes.htm
est évidemment plus lisible qu'une adresse remplie de paramètres incompréhensibles.
Des titres pertinents
Chaque article doit avoir un titre qui correspond réellement à son contenu.
Une bonne description
La meta description permet de présenter brièvement le contenu d'une page dans les résultats de recherche lorsque Google choisit de l'utiliser.
Une structure claire
Les titres et sous-titres doivent organiser le texte.
Le lecteur doit pouvoir comprendre la structure de l'article sans devoir traverser un mur de paragraphes.
Des images correctement renseignées
Les images doivent être raisonnablement optimisées et, lorsque c'est pertinent, accompagnées d'un texte alternatif descriptif.
10. Le maillage interne : faire circuler le lecteur
C'est une notion que j'ai également voulu clarifier avec l'IA.
Le maillage interne consiste à relier entre elles différentes pages d'un même site lorsque ces pages présentent un rapport réel.
Prenons trois articles du Guichet du rêve :
-
les litiges entre propriétaires de mobil-homes et gérants de campings ;
-
la résiliation et le non-renouvellement d'un contrat ;
-
les problèmes liés à la location ou à Airbnb.
Si, dans un article général sur les litiges, j'aborde la rupture du contrat, il est parfaitement logique de renvoyer le lecteur vers l'article consacré à ce problème précis.
Le lien devient alors une véritable indication pour le lecteur et non un simple artifice destiné à placer un lien quelque part.
11. Liens relatifs ou liens absolus ?
C'est une question qui me semblait importante pour le Guichet du rêve.
Pour nos liens internes, nous utilisons souvent des adresses relatives :
/droits-dentree-et-de-sortie-en-camping-legalite-recours-et-precarite-juridique-des-residents-de-mobil-homes.htm
plutôt que :
https://guichet-du-reve.fr/droits-dentree-et-de-sortie-en-camping-legalite-recours-et-precarite-juridique-des-residents-de-mobil-homes.htm
Cette pratique ne constitue pas, en elle-même, un problème de référencement.
L'avantage du lien relatif est surtout pratique.
Si le site change de domaine, si l'on travaille sur une installation de test ou si l'on déplace temporairement le site, les liens internes n'ont pas besoin d'être réécrits un par un pour changer le nom de domaine.
Pour un site comme le mien, c'est un avantage appréciable.
La règle essentielle reste cependant la même dans les deux cas : le lien doit fonctionner et mener vers la bonne page.
12. Les liens doivent avoir un sens
Un bon lien interne n'est pas nécessairement celui qui dit :
Cliquez ici.
Il vaut mieux que le texte du lien indique au lecteur ce qu'il va trouver.
Par exemple :
Les difficultés liées au non-renouvellement du contrat d'emplacement sont examinées dans notre dossier consacré à cette question.
Le lecteur sait immédiatement pourquoi le lien lui est proposé.
C'est cela que j'appelle un lien logique.
13. Quelques outils pour examiner un site
Il existe de nombreux services permettant d'effectuer des vérifications techniques.
Mais il faut là encore faire attention aux recommandations automatiques.
Un outil peut signaler une anomalie sans que celle-ci constitue réellement un problème grave.
Pour un site comme le Guichet du rêve, les outils officiels des moteurs de recherche restent particulièrement intéressants :
-
Google Search Console ;
-
Google PageSpeed Insights ;
-
Bing Webmaster Tools.
D'autres services peuvent compléter ces analyses pour examiner la structure des pages, les liens, les performances ou certaines erreurs techniques.
Mais là encore, un score de 97 ou de 63 ne doit pas devenir une religion.
Le but du référencement reste de rendre un site compréhensible, accessible et utile, pas de gagner une médaille dans un tableau de scores.
14. Et les robots d'intelligence artificielle ?
La conversation a également bifurqué vers une autre question : faut-il bloquer les robots utilisés par les systèmes d'intelligence artificielle ?
Dans mon cas, la réponse a été assez simple.
L'IA m'aide à chercher, à réfléchir, à structurer et parfois à rédiger.
Il me semblerait donc assez paradoxal de lui fermer la porte lorsqu'elle vient consulter les contenus du site.
J'ai donc choisi de ne pas bloquer par principe les robots d'IA.
Cela ne signifie pas que ces robots sont identiques aux robots des moteurs de recherche.
Googlebot, par exemple, participe à l'exploration utilisée par Google pour son moteur de recherche.
Les différents robots d'IA répondent à d'autres objectifs, selon leur opérateur et leur usage.
Il faut donc éviter de mélanger les deux questions :
être accessible à un robot d'IA et être correctement indexé par Google sont deux choses différentes.
15. Ce que cette conversation m'a finalement appris
Le plus intéressant dans cette histoire n'est peut-être pas le sitemap lui-même.
C'est la manière dont une conversation avec une IA évolue lorsqu'on commence à lui poser des questions très concrètes.
Au départ, le problème semblait simple :
« Pourquoi Google ne lit-il pas mon sitemap ? »
Puis sont apparus :
-
le fichier
sitemap.php; -
le XML ;
-
les dates
lastmod; -
robots.txt; -
Google Search Console ;
-
les liens relatifs ;
-
le maillage interne ;
-
les robots d'IA ;
-
les outils d'analyse ;
-
et finalement cette mystérieuse histoire de caractères invisibles.
Et surtout une leçon beaucoup plus générale :
l'IA est un excellent interlocuteur pour explorer un problème, mais elle n'est pas dispensée de se tromper.
Elle peut répondre très vite, très clairement et avec beaucoup d'assurance à une question dont elle n'a pourtant pas vérifié tous les éléments.
C'est précisément pour cela qu'il est intéressant de lui répondre, de la contredire, de vérifier ce qu'elle avance et de revenir avec les résultats obtenus.
Une conversation avec une IA ne doit donc pas forcément être considérée comme un dialogue entre quelqu'un qui sait et quelqu'un qui ne sait pas.
Elle peut aussi devenir une sorte d'atelier où les hypothèses sont posées, testées, corrigées et parfois jetées à la poubelle.
Et dans le cas du Guichet du rêve, le véritable intérêt de l'expérience aura finalement été là.
Le sitemap n'était que le prétexte.
Article issu d'une conversation de travail avec une intelligence artificielle. Les informations techniques ont été relues et corrigées lors de la mise en forme. Les outils et interfaces de Google étant susceptibles d'évoluer, les intitulés indiqués ici peuvent différer de ceux affichés au moment de la lecture.