Rankwell

Crawl budget

Définition

Le crawl budget désigne la quantité de ressources que Googlebot alloue à l'exploration d'un site web sur une période donnée. Il résulte de deux facteurs combinés : la capacité de crawl (le nombre de requêtes simultanées que le serveur peut supporter sans dégradation) et la demande de crawl (l'intérêt que Google porte aux URL du site en fonction de leur popularité, de leur fraîcheur et de leur type).

Cadre méthodologique

Le crawl budget concerne principalement les sites de grande taille (au-delà de 10 000 URL selon Google Search Central, 2024) ou les sites dont l'architecture technique génère un nombre élevé d'URL accessibles (paramètres d'URL, pagination infinie, facettes de filtrage). Pour un site de moins de 1 000 pages avec un contenu mis à jour régulièrement, le crawl budget n'est généralement pas un facteur limitant.

Selon une analyse Screaming Frog (2024) portant sur 200 sites e-commerce, les sites dont plus de 30 % des URL crawlées sont des doublons paramétriques subissent une indexation 2,4 fois plus lente de leurs nouvelles pages. Gary Illyes (Google, 2023) a confirmé que les sites de moins de quelques milliers de pages sont crawlés intégralement, rendant l'optimisation du crawl budget non prioritaire pour ces cas.

Google détermine la priorité de crawl en fonction de signaux internes (popularité des pages, fréquence de mise à jour, présence dans le sitemap XML) et de signaux techniques (temps de réponse du serveur, erreurs HTTP). Une page qui retourne des erreurs 5xx de façon répétée verra sa fréquence de crawl diminuer.

Crawl Googlebot vs crawl des robots IA

Crawl Googlebot et crawl des robots IA comparés
DimensionGooglebotRobots IA (GPTBot, ClaudeBot, PerplexityBot)
ObjectifIndexer les pages dans l'index GoogleCollecter du contenu pour entraînement ou réponses en temps réel
BudgetOui, limité par la capacité serveur et la demande GoogleNon, pas de mécanisme de budget auto-régulé documenté
PriorisationPar popularité, fraîcheur, signaux internesPar accessibilité : crawle ce qui est atteignable et autorisé
Respect du robots.txtOui (User-agent: Googlebot)Variable selon l'opérateur (GPTBot respecte robots.txt ; tous ne le font pas)
Rendu JavaScriptOui (via le Web Rendering Service)Non, la plupart des robots IA crawlent le HTML brut
FréquenceContinue, modulée par le budgetPonctuelle (entraînement) ou en temps réel (RAG)

Cette distinction est structurante : optimiser le crawl budget améliore l'indexation Google, mais n'a pas d'effet direct sur l'ingestion par les moteurs IA. Pour contrôler l'accès des robots IA, le levier est le fichier robots.txt (directives spécifiques par User-agent) et les balises <meta name="robots">.

Facteurs de gaspillage du crawl budget

Facteurs de gaspillage du crawl budget et solutions
FacteurMécanismeSolution
Pages à paramètres dupliquésLes filtres e-commerce génèrent des milliers d'URL avec le même contenuConfigurer les paramètres dans Google Search Console, balise canonical
Pagination infinieGooglebot suit les liens de pagination sans finLimiter la profondeur, implémenter rel="next"/"prev" ou pagination par blocs
Soft 404Pages vides qui retournent un code 200 au lieu de 404Retourner un vrai code 404 ou 410
Chaînes de redirectionsChaque redirection consomme une requête de crawlLimiter à une seule redirection par URL
Ressources lourdes non bloquéesCSS, JS et images non essentiels crawlésBloquer via robots.txt les ressources non nécessaires à l'indexation

Périmètre

Ce que ça couvre

  • L'allocation des ressources de crawl par Googlebot sur un site web
  • Les facteurs techniques qui influencent la fréquence et la profondeur du crawl
  • L'optimisation de l'architecture pour maximiser l'exploration des pages stratégiques
  • La gestion du fichier robots.txt et du sitemap XML pour guider le crawl

Ce que ça ne couvre pas

  • L'indexation des pages (être crawlé ne garantit pas d'être indexé) indexation
  • La qualité du contenu ou la pertinence des pages
  • La gestion de l'accès des robots IA au contenu du site GEO
  • La performance de chargement des pages Core Web Vitals

Concepts liés