Crawl budget
Définition
Le crawl budget désigne la quantité de ressources que Googlebot alloue à l'exploration d'un site web sur une période donnée. Il résulte de deux facteurs combinés : la capacité de crawl (le nombre de requêtes simultanées que le serveur peut supporter sans dégradation) et la demande de crawl (l'intérêt que Google porte aux URL du site en fonction de leur popularité, de leur fraîcheur et de leur type).
Cadre méthodologique
Le crawl budget concerne principalement les sites de grande taille (au-delà de 10 000 URL selon Google Search Central, 2024) ou les sites dont l'architecture technique génère un nombre élevé d'URL accessibles (paramètres d'URL, pagination infinie, facettes de filtrage). Pour un site de moins de 1 000 pages avec un contenu mis à jour régulièrement, le crawl budget n'est généralement pas un facteur limitant.
Selon une analyse Screaming Frog (2024) portant sur 200 sites e-commerce, les sites dont plus de 30 % des URL crawlées sont des doublons paramétriques subissent une indexation 2,4 fois plus lente de leurs nouvelles pages. Gary Illyes (Google, 2023) a confirmé que les sites de moins de quelques milliers de pages sont crawlés intégralement, rendant l'optimisation du crawl budget non prioritaire pour ces cas.
Google détermine la priorité de crawl en fonction de signaux internes (popularité des pages, fréquence de mise à jour, présence dans le sitemap XML) et de signaux techniques (temps de réponse du serveur, erreurs HTTP). Une page qui retourne des erreurs 5xx de façon répétée verra sa fréquence de crawl diminuer.
Crawl Googlebot vs crawl des robots IA
| Dimension | Googlebot | Robots IA (GPTBot, ClaudeBot, PerplexityBot) |
|---|---|---|
| Objectif | Indexer les pages dans l'index Google | Collecter du contenu pour entraînement ou réponses en temps réel |
| Budget | Oui, limité par la capacité serveur et la demande Google | Non, pas de mécanisme de budget auto-régulé documenté |
| Priorisation | Par popularité, fraîcheur, signaux internes | Par accessibilité : crawle ce qui est atteignable et autorisé |
| Respect du robots.txt | Oui (User-agent: Googlebot) | Variable selon l'opérateur (GPTBot respecte robots.txt ; tous ne le font pas) |
| Rendu JavaScript | Oui (via le Web Rendering Service) | Non, la plupart des robots IA crawlent le HTML brut |
| Fréquence | Continue, modulée par le budget | Ponctuelle (entraînement) ou en temps réel (RAG) |
Cette distinction est structurante : optimiser le crawl budget améliore l'indexation Google, mais n'a pas d'effet direct sur l'ingestion par les moteurs IA. Pour contrôler l'accès des robots IA, le levier est le fichier robots.txt (directives spécifiques par User-agent) et les balises <meta name="robots">.
Facteurs de gaspillage du crawl budget
| Facteur | Mécanisme | Solution |
|---|---|---|
| Pages à paramètres dupliqués | Les filtres e-commerce génèrent des milliers d'URL avec le même contenu | Configurer les paramètres dans Google Search Console, balise canonical |
| Pagination infinie | Googlebot suit les liens de pagination sans fin | Limiter la profondeur, implémenter rel="next"/"prev" ou pagination par blocs |
| Soft 404 | Pages vides qui retournent un code 200 au lieu de 404 | Retourner un vrai code 404 ou 410 |
| Chaînes de redirections | Chaque redirection consomme une requête de crawl | Limiter à une seule redirection par URL |
| Ressources lourdes non bloquées | CSS, JS et images non essentiels crawlés | Bloquer via robots.txt les ressources non nécessaires à l'indexation |
Périmètre
Ce que ça couvre
- L'allocation des ressources de crawl par Googlebot sur un site web
- Les facteurs techniques qui influencent la fréquence et la profondeur du crawl
- L'optimisation de l'architecture pour maximiser l'exploration des pages stratégiques
- La gestion du fichier robots.txt et du sitemap XML pour guider le crawl
Ce que ça ne couvre pas
- L'indexation des pages (être crawlé ne garantit pas d'être indexé) indexation
- La qualité du contenu ou la pertinence des pages
- La gestion de l'accès des robots IA au contenu du site GEO
- La performance de chargement des pages Core Web Vitals