Indexation
Définition
L'indexation désigne le processus par lequel un moteur de recherche analyse, comprend et intègre une page web dans sa base de données (index) afin de la rendre disponible en réponse à des requêtes. La crawlabilité désigne la capacité technique d'un site à être exploré par les robots d'indexation. Une page doit d'abord être crawlable (accessible au robot) pour pouvoir être indexée (intégrée à l'index).
Cadre méthodologique
L'indexation par Google suit un pipeline en trois étapes : le crawl (Googlebot parcourt les URL), le traitement (analyse du contenu, extraction des entités, évaluation de la qualité) et l'indexation (stockage dans l'index inversé). Chaque étape peut échouer indépendamment : une page peut être crawlée mais non indexée si Google juge son contenu de qualité insuffisante ou dupliqué.
Google indexe environ 400 milliards de pages (estimation de Sundar Pichai, 2020). Le délai d'indexation d'une nouvelle page varie de quelques heures à plusieurs semaines selon l'autorité du site et la fréquence de crawl. L'API Google Indexing API permet de demander l'indexation de pages de type JobPosting et BroadcastEvent, mais elle ne couvre pas les pages standards.
En 2025, Google a resserré ses critères d'indexation. De nombreux sites constatent un décalage entre le nombre de pages soumises et le nombre de pages effectivement indexées. Le rapport « Indexation des pages » dans Google Search Console distingue les pages indexées des pages non indexées, avec un motif d'exclusion pour chaque URL.
Indexation Google vs ingestion par les LLM
| Dimension | Indexation Google | Ingestion par les LLM |
|---|---|---|
| Mécanisme | Index inversé (termes → pages) | Données d'entraînement (corpus) + RAG (crawl temps réel) |
| Robot | Googlebot | GPTBot, ClaudeBot, PerplexityBot, Applebot |
| Critère de sélection | Qualité, pertinence, canonicité, absence de duplicate | Accessibilité, densité factuelle, structure du contenu |
| Mise à jour | Continue (re-crawl régulier) | Périodique (entraînement) + temps réel (RAG) |
| Résultat | La page apparaît dans les SERP | Le contenu est cité dans une réponse IA |
| Signal de désindexation | noindex, 404, 410, Search Console | robots.txt (User-agent spécifique), X-Robots-Tag |
Cette distinction a une implication directe : une page bloquée par noindex n'apparaîtra pas dans Google, mais elle peut avoir été ingérée par un LLM avant l'ajout de la directive, ou être accessible aux robots IA si le robots.txt ne les bloque pas spécifiquement.
Causes fréquentes de non-indexation
| Cause | Diagnostic | Correction |
|---|---|---|
| « Détectée, pas encore indexée » | Google connaît l'URL mais ne l'a pas crawlée | Améliorer le maillage interne, soumettre dans le sitemap |
| « Crawlée, actuellement non indexée » | Google a crawlé la page mais refuse de l'indexer | Renforcer le contenu (qualité, unicité), obtenir des liens internes |
| Balise noindex involontaire | Directive meta robots ou X-Robots-Tag bloquante | Retirer la balise, vérifier les configurations serveur |
| Canonicalisation vers une autre URL | La balise canonical pointe ailleurs | Corriger la balise canonical ou consolider les contenus |
| Contenu dupliqué | Google détecte un contenu similaire sur une autre URL | Fusionner les pages, rediriger l'une vers l'autre |
| Page orpheline | Aucun lien interne ne pointe vers la page | Intégrer la page dans le maillage interne du site |
Crawlabilité : les prérequis techniques
La crawlabilité repose sur un ensemble de conditions techniques. Le fichier robots.txt contrôle l'accès des robots par User-agent. Le sitemap XML signale les URL prioritaires. L'architecture du site détermine la profondeur de crawl (nombre de clics depuis la page d'accueil). Le temps de réponse du serveur influence la capacité de crawl allouée par Google.
Une page enfouie à plus de quatre niveaux de profondeur, non référencée dans le sitemap et sans lien interne a une probabilité de crawl significativement réduite, et une probabilité d'indexation encore plus faible.
Périmètre
Ce que ça couvre
- Le processus d'intégration d'une page dans l'index Google
- Les conditions techniques d'accessibilité pour les robots de crawl
- Le diagnostic des problèmes d'indexation via Google Search Console
- La gestion du robots.txt, du sitemap XML et des directives noindex
Ce que ça ne couvre pas
- L'optimisation du positionnement dans les SERP SEO
- L'allocation des ressources de crawl par Google Crawl budget
- La structuration du contenu pour la visibilité IA GEO
- Le balisage sémantique du contenu Données structurées