Budget de crawl et indexation : ce que Google voit vraiment de votre site
Crawl, indexation, budget : comment les moteurs découvrent vos pages, pourquoi certaines n'apparaissent jamais, et les leviers techniques pour reprendre la main.
Avant de se positionner, une page doit être découverte (crawl) puis retenue (indexation). Beaucoup de sites perdent la partie à cette étape, bien avant toute considération de contenu ou de mots-clés : pages jamais visitées par les robots, versions dupliquées qui se cannibalisent, budget de crawl dilapidé en URLs sans valeur. C'est un sujet d'ingénierie plus que de marketing — et il se diagnostique avec des faits.
Crawl, indexation, positionnement : trois filtres successifs
Le moteur maintient une liste d'URLs connues, les visite selon une priorité qu'il calcule (le fameux « budget de crawl »), puis décide pour chacune si elle mérite l'index. Chaque étape élimine : la Search Console montre régulièrement des sites dont la moitié des pages connues sont « découvertes, actuellement non indexées » — Google sait qu'elles existent et a choisi de ne pas les visiter, ou de ne pas les retenir.
Le budget de crawl est surtout un sujet pour les sites de plusieurs dizaines de milliers d'URLs ou générant des URLs à l'infini (filtres à facettes, calendriers, paramètres de tri). Un site vitrine de 50 pages n'a pas de problème de budget — mais peut avoir des problèmes de découverte ou de duplication, qui se traitent avec les mêmes outils.
Les trois fichiers qui cadrent le dialogue
robots.txt dit ce que les robots peuvent visiter. Sa syntaxe est
simple, ses erreurs coûteuses — un Disallow: / oublié après une mise en
production a déjà désindexé des sites entiers :
User-agent: *
# Bloquer les espaces sans valeur pour la recherche
Disallow: /admin/
Disallow: /panier
# Les paramètres de tri génèrent des doublons infinis
Disallow: /*?tri=
Sitemap: https://www.exemple.fr/sitemap.xml
Attention au contresens fréquent : robots.txt empêche le crawl, pas
l'indexation. Une URL bloquée mais liée ailleurs peut apparaître dans
les résultats (sans description). Pour exclure de l'index, c'est la balise
meta robots noindex — qui exige au contraire que la page soit crawlable
pour être lue.
Le sitemap XML liste ce que vous voulez voir indexé — c'est une déclaration d'intention, pas une garantie. Il doit être généré dynamiquement (jamais à la main), ne contenir que des URLs canoniques en 200, et refléter les vraies dates de modification :
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://www.exemple.fr/services/audit-performance</loc>
<lastmod>2026-06-28</lastmod>
</url>
</urlset>
La balise canonique désigne la version de référence quand plusieurs
URLs servent le même contenu (?utm_source=, pagination, variantes).
Cohérence obligatoire : une canonique qui pointe vers une page en
redirection ou en noindex envoie des signaux contradictoires que le
moteur arbitrera seul — rarement dans votre sens.
Le maillage interne, levier sous-estimé
Les robots découvrent les pages en suivant les liens. Une page accessible uniquement par un moteur de recherche interne ou un menu JavaScript défaillant est invisible. Les questions à se poser : chaque page importante est-elle à moins de trois clics de l'accueil ? Les pages « orphelines » (présentes dans le sitemap mais liées nulle part) sont-elles volontaires ? Les pages qui reçoivent le plus de liens internes sont-elles celles qui comptent pour votre activité ?
Diagnostiquer avec des faits, pas des impressions
Deux sources donnent la réalité du crawl :
- La Search Console (gratuite) : rapport « Indexation des pages » pour les proportions et motifs d'exclusion, outil d'inspection d'URL pour le cas par cas.
- Les journaux serveur : la vérité brute de ce que Googlebot visite. Une analyse même sommaire révèle la part du crawl gaspillée :
# Top 20 des URLs les plus crawlées par Googlebot ce mois-ci
grep "Googlebot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20
Si 60 % des visites de Googlebot partent dans des URLs à paramètres ou des pages sans valeur, chaque correction (blocage, canonique, suppression des liens) redirige ce budget vers les pages qui comptent.
Ce qu'il faut retenir
L'indexation se pilote : un robots.txt qui bloque le sans-valeur, un
sitemap propre et généré, des canoniques cohérentes, un maillage qui met
vos pages importantes à portée de clic — puis la Search Console et les
logs pour vérifier que la réalité suit. Rien de tout cela ne remplace un
contenu qui mérite d'être indexé ; mais le meilleur contenu du monde ne
sert à rien si le moteur ne le voit pas, ou le voit en quatre exemplaires.
Deux articles voisins.
Vous avez le même problème ?
C'est souvent comme ça que les missions commencent. Décrivez votre contexte, on vous dit ce qu'on en pense sous 24 h.
Décrire votre projet