Le Crawl Budget est le nombre maximum de pages qu'un robot d'indexation (Googlebot) explore sur votre site sur une période donnée. Ce budget est alloué selon la vitesse serveur, l'autorité du domaine et la fraîcheur du contenu. Un site avec 10 000 pages réelles mais un budget de 2 000 pages/jour mettra 5 jours à être entièrement exploré.
Le Crawl Budget se compose de deux facteurs : le Crawl Rate Limit (vitesse maximale sans surcharger le serveur) et le Crawl Demand (intérêt de Google pour vos pages). Même un site de 100 000 pages ne sera jamais entièrement exploré si son budget est faible. Google décide du budget selon trois signaux : la réactivité serveur (TTFB < 200 ms), la fréquence de mise à jour (sites quotidiens = 3× plus de crawl), et la popularité du domaine (10 000+ liens entrants = crawl plus fréquent).
Le Crawl Budget, c'est un géologue explorant un réseau de grottes avec une lampe frontale dont la batterie tient 3 heures. Chaque couloir sans intérêt (pages 404, filtres) épuise la batterie sans rien découvrir. Les grottes stratégiques restent dans le noir, jamais cartographiées — et donc jamais indexées.
Googlebot adapte sa vitesse de crawl à la réponse de votre serveur. Si TTFB < 200 ms → crawl rapide. Si TTFB > 1 s → Google réduit la fréquence pour éviter de surcharger. Un TTFB de 2,5 s divise le budget par 3. Optimiser : CDN actif, compression Brotli, cache serveur, hébergement géographiquement proche.
Googlebot privilégie les pages importantes. Le Crawl Demand dépend de : la popularité de la page (PageRank interne), la fréquence de mise à jour (pages actualisées récemment re-crawlées 2× plus souvent), et les signaux utilisateurs (CTR, temps de session). Un blog actif qui publie 3 articles/semaine reçoit 3× plus de crawl qu'un site vitrine statique.
Chaque seconde de crawl perdue sur une page sans valeur réduit le budget disponible pour les pages stratégiques. Sources de bruit : pages filtres avec paramètres (URLs ?color=red&size=M), pages paginées infinies, pages 404 statiques, contenus en double. Solutions : fichier robots.txt avec directives Disallow, balises noindex sur les pages de filtre, canonical sur les pages paginées.
<lastmod> précis pour que Google re-crawl les pages modifiées.Site e-commerce avec 85 000 URLs dont 60 000 sont des variantes de filtres (couleur, taille, prix). Googlebot gaspillait 70% du crawl sur ces filtres. Actions : (1) Ajout de noindex sur toutes les pages de filtres, (2) Canonical vers la page catégorie principale, (3) robots.txt bloquant /filter/*. Résultat : crawl budget pour les fiches produits +180%, pages indexées passées de 12 000 à 41 000, trafic organique +55% en 90 jours.
| Métrique | Objectif | Impact |
|---|---|---|
| TTFB | < 200 ms | Budget crawl préservé |
| Crawl waste | < 20% du budget | Pages stratégiques crawlées |
| Pages indexées / URLs | > 80% si qualité OK | Couverture du site |
| Publication frequency | > 1×/semaine | 3× plus de crawl |