PYKEngine
disponible
8 mai 2026 · seo · 4 min de lecture

Budget de crawl et indexation : ce que Google voit vraiment de votre site

Crawl, indexation, budget : comment les moteurs découvrent vos pages, pourquoi certaines n'apparaissent jamais, et les leviers techniques pour reprendre la main.

Avant de se positionner, une page doit être découverte (crawl) puis retenue (indexation). Beaucoup de sites perdent la partie à cette étape, bien avant toute considération de contenu ou de mots-clés : pages jamais visitées par les robots, versions dupliquées qui se cannibalisent, budget de crawl dilapidé en URLs sans valeur. C'est un sujet d'ingénierie plus que de marketing — et il se diagnostique avec des faits.

Crawl, indexation, positionnement : trois filtres successifs

Le moteur maintient une liste d'URLs connues, les visite selon une priorité qu'il calcule (le fameux « budget de crawl »), puis décide pour chacune si elle mérite l'index. Chaque étape élimine : la Search Console montre régulièrement des sites dont la moitié des pages connues sont « découvertes, actuellement non indexées » — Google sait qu'elles existent et a choisi de ne pas les visiter, ou de ne pas les retenir.

Le budget de crawl est surtout un sujet pour les sites de plusieurs dizaines de milliers d'URLs ou générant des URLs à l'infini (filtres à facettes, calendriers, paramètres de tri). Un site vitrine de 50 pages n'a pas de problème de budget — mais peut avoir des problèmes de découverte ou de duplication, qui se traitent avec les mêmes outils.

Les trois fichiers qui cadrent le dialogue

robots.txt dit ce que les robots peuvent visiter. Sa syntaxe est simple, ses erreurs coûteuses — un Disallow: / oublié après une mise en production a déjà désindexé des sites entiers :

User-agent: *
# Bloquer les espaces sans valeur pour la recherche
Disallow: /admin/
Disallow: /panier
# Les paramètres de tri génèrent des doublons infinis
Disallow: /*?tri=

Sitemap: https://www.exemple.fr/sitemap.xml

Attention au contresens fréquent : robots.txt empêche le crawl, pas l'indexation. Une URL bloquée mais liée ailleurs peut apparaître dans les résultats (sans description). Pour exclure de l'index, c'est la balise meta robots noindex — qui exige au contraire que la page soit crawlable pour être lue.

Le sitemap XML liste ce que vous voulez voir indexé — c'est une déclaration d'intention, pas une garantie. Il doit être généré dynamiquement (jamais à la main), ne contenir que des URLs canoniques en 200, et refléter les vraies dates de modification :

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.exemple.fr/services/audit-performance</loc>
    <lastmod>2026-06-28</lastmod>
  </url>
</urlset>

La balise canonique désigne la version de référence quand plusieurs URLs servent le même contenu (?utm_source=, pagination, variantes). Cohérence obligatoire : une canonique qui pointe vers une page en redirection ou en noindex envoie des signaux contradictoires que le moteur arbitrera seul — rarement dans votre sens.

Le maillage interne, levier sous-estimé

Les robots découvrent les pages en suivant les liens. Une page accessible uniquement par un moteur de recherche interne ou un menu JavaScript défaillant est invisible. Les questions à se poser : chaque page importante est-elle à moins de trois clics de l'accueil ? Les pages « orphelines » (présentes dans le sitemap mais liées nulle part) sont-elles volontaires ? Les pages qui reçoivent le plus de liens internes sont-elles celles qui comptent pour votre activité ?

Diagnostiquer avec des faits, pas des impressions

Deux sources donnent la réalité du crawl :

  • La Search Console (gratuite) : rapport « Indexation des pages » pour les proportions et motifs d'exclusion, outil d'inspection d'URL pour le cas par cas.
  • Les journaux serveur : la vérité brute de ce que Googlebot visite. Une analyse même sommaire révèle la part du crawl gaspillée :
# Top 20 des URLs les plus crawlées par Googlebot ce mois-ci
grep "Googlebot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Si 60 % des visites de Googlebot partent dans des URLs à paramètres ou des pages sans valeur, chaque correction (blocage, canonique, suppression des liens) redirige ce budget vers les pages qui comptent.

Ce qu'il faut retenir

L'indexation se pilote : un robots.txt qui bloque le sans-valeur, un sitemap propre et généré, des canoniques cohérentes, un maillage qui met vos pages importantes à portée de clic — puis la Search Console et les logs pour vérifier que la réalité suit. Rien de tout cela ne remplace un contenu qui mérite d'être indexé ; mais le meilleur contenu du monde ne sert à rien si le moteur ne le voit pas, ou le voit en quatre exemplaires.

à lire ensuite

Deux articles voisins.

  1. 27 août 2026 · seo · 4 min SEO et JavaScript : SSR, SSG, hydratation — ce qui compte vraiment pour l'indexation
  2. 29 juillet 2026 · seo · 4 min Migrer son site sans perdre son référencement : la méthode des redirections

Vous avez le même problème ?

C'est souvent comme ça que les missions commencent. Décrivez votre contexte, on vous dit ce qu'on en pense sous 24 h.

Décrire votre projet
v0.5.1