Aller au contenu principal
Retour au lexique

Crawl Budget

RÉFÉRENCEMENT

Définition courte

Le Crawl Budget est le nombre maximum de pages qu'un robot d'indexation (Googlebot) explore sur votre site sur une période donnée. Ce budget est alloué selon la vitesse serveur, l'autorité du domaine et la fraîcheur du contenu. Un site avec 10 000 pages réelles mais un budget de 2 000 pages/jour mettra 5 jours à être entièrement exploré.

Définition complète

Le Crawl Budget se compose de deux facteurs : le Crawl Rate Limit (vitesse maximale sans surcharger le serveur) et le Crawl Demand (intérêt de Google pour vos pages). Même un site de 100 000 pages ne sera jamais entièrement exploré si son budget est faible. Google décide du budget selon trois signaux : la réactivité serveur (TTFB < 200 ms), la fréquence de mise à jour (sites quotidiens = 3× plus de crawl), et la popularité du domaine (10 000+ liens entrants = crawl plus fréquent).

Pensée simple

Le Crawl Budget, c'est un géologue explorant un réseau de grottes avec une lampe frontale dont la batterie tient 3 heures. Chaque couloir sans intérêt (pages 404, filtres) épuise la batterie sans rien découvrir. Les grottes stratégiques restent dans le noir, jamais cartographiées — et donc jamais indexées.

Les 3 piliers du Crawl Budget

Réactivité serveur et TTFB

Googlebot adapte sa vitesse de crawl à la réponse de votre serveur. Si TTFB < 200 ms → crawl rapide. Si TTFB > 1 s → Google réduit la fréquence pour éviter de surcharger. Un TTFB de 2,5 s divise le budget par 3. Optimiser : CDN actif, compression Brotli, cache serveur, hébergement géographiquement proche.

Intérêt algorithmique (Crawl Demand)

Googlebot privilégie les pages importantes. Le Crawl Demand dépend de : la popularité de la page (PageRank interne), la fréquence de mise à jour (pages actualisées récemment re-crawlées 2× plus souvent), et les signaux utilisateurs (CTR, temps de session). Un blog actif qui publie 3 articles/semaine reçoit 3× plus de crawl qu'un site vitrine statique.

Élimination du bruit crawlable

Chaque seconde de crawl perdue sur une page sans valeur réduit le budget disponible pour les pages stratégiques. Sources de bruit : pages filtres avec paramètres (URLs ?color=red&size=M), pages paginées infinies, pages 404 statiques, contenus en double. Solutions : fichier robots.txt avec directives Disallow, balises noindex sur les pages de filtre, canonical sur les pages paginées.

Le cycle d'optimisation du Crawl Budget

  1. Audit crawl : Via Screaming Frog ou Log Analyzer, identifier les pages qui consomment du crawl sans valeur (404, duplicate, filters).
  2. Mesurer TTFB : Google Search Console → Rapport de performance. TTFB > 500 ms = problème serveur à résoudre en priorité.
  3. Bloquer le bruit : robots.txt pour les chemins non stratégiques (admin, checkout), noindex + canonical sur les filtres.
  4. Prioriser le contenu : Sitemap XML avec <lastmod> précis pour que Google re-crawl les pages modifiées.
  5. Améliorer la fraîcheur : Publier régulièrement (au moins 1×/semaine) pour maintenir un crawl frequency élevé.
  6. Monitorer : GSC → Rapport de couverture pour suivre l'évolution des pages explorées vs indexées.

Exemple concret

Site e-commerce avec 85 000 URLs dont 60 000 sont des variantes de filtres (couleur, taille, prix). Googlebot gaspillait 70% du crawl sur ces filtres. Actions : (1) Ajout de noindex sur toutes les pages de filtres, (2) Canonical vers la page catégorie principale, (3) robots.txt bloquant /filter/*. Résultat : crawl budget pour les fiches produits +180%, pages indexées passées de 12 000 à 41 000, trafic organique +55% en 90 jours.

Applications concrètes

  • E-commerce : noindex sur les filtres, paginations canonical vers page 1, sitemap produits avec lastmod précis.
  • Site multi-langue : hreflang complet + sitemap par langue pour éviter le crawl waste sur les doublons linguistiques.
  • Site avec faceted navigation : Utiliser le pattern « Google-friendly multi-select » avec URL canonique et robots.txt.
  • Blog avec archives : noindex sur les pages année/mois, canonical vers la page de catégorie parente.

Métriques clés

MétriqueObjectifImpact
TTFB< 200 msBudget crawl préservé
Crawl waste< 20% du budgetPages stratégiques crawlées
Pages indexées / URLs> 80% si qualité OKCouverture du site
Publication frequency> 1×/semaine3× plus de crawl