Budget de crawl : pourquoi Google n’indexe pas toutes vos pages

Si Google n’indexe pas toutes vos pages, le budget de crawl en est souvent la cause. Comment il fonctionne et comment cesser de le gaspiller.

Server and code representing crawl budget and Google indexation in technical SEO

Un problème de SEO courant et frustrant : vous publiez des pages, elles sont bonnes, et des semaines plus tard Google n’en a toujours pas indexé la moitié. La Search Console les affiche comme « détectée, actuellement non indexée » ou « explorée, actuellement non indexée ». Le contenu est très bien. Le problème vient souvent du budget de crawl, l’un des aspects les moins compris du SEO technique.

Ce qu’est réellement le budget de crawl

Le budget de crawl correspond au nombre de pages que Googlebot explorera sur un site dans un laps de temps donné. Il dépend de deux facteurs : la limite du taux d’exploration (la vitesse à laquelle Google peut explorer sans surcharger le serveur) et la demande d’exploration (le degré auquel Google souhaite explorer le site, selon l’importance et la fraîcheur qu’il lui prête).

Pour un petit site de quelques centaines de pages, le budget de crawl est rarement un souci. Pour un grand site, une boutique e-commerce comptant des milliers de produits ou tout site générant de nombreuses variantes d’URL, le budget de crawl devient une véritable contrainte. Google n’explore tout simplement pas chaque page assez souvent.

Les plus gros gaspilleurs de budget de crawl

  • Navigation à facettes. Les paramètres de filtre et de tri génèrent des milliers d’URL quasi identiques. Googlebot les explore toutes et épuise le budget sur des URL qui ne devraient jamais être indexées.
  • Chaînes de redirections. Chaque saut d’une chaîne de redirections est une exploration. Une chaîne de trois redirections coûte trois fois plus de budget de crawl qu’un lien direct.
  • Soft 404 et pages d’erreur. Les pages qui renvoient un statut 200 mais n’affichent aucun contenu réel gaspillent le budget de crawl et brouillent la perception qu’a Google de la qualité du site.
  • Espaces infinis. Calendriers, archives paginées sans fin, paramètres d’identifiant de session. Ils génèrent un nombre quasi illimité d’URL de faible valeur dans lesquelles Googlebot s’égare.
  • Réponse lente du serveur. Si le serveur est lent, Google explore moins de pages par session pour éviter de le surcharger. La vitesse du site est un facteur de budget de crawl, pas seulement de classement.

Comment récupérer du budget de crawl

La stratégie consiste à orienter Googlebot vers les pages qui comptent et à l’éloigner de celles qui ne comptent pas. Utilisez le fichier robots.txt pour bloquer l’exploration des URL à paramètres qui ne devraient jamais être indexées. Utilisez les balises canoniques pour regrouper les URL en double. Corrigez les chaînes de redirections pour que chaque redirection mène directement à la destination finale. Renvoyez des codes de statut 404 ou 410 corrects pour les pages réellement mortes. Gardez le sitemap XML propre, en n’y listant que les pages que vous voulez voir explorées et indexées.

Le maillage interne oriente lui aussi le budget de crawl. Les pages bien reliées en interne sont explorées plus souvent. Les pages orphelines le sont rarement, voire jamais. Une structure de maillage interne solide guide naturellement Googlebot vers les pages importantes.

Comment diagnostiquer un problème de budget de crawl

Le rapport sur les statistiques d’exploration de la Search Console indique combien de pages Google explore par jour, le temps de réponse moyen et la répartition de ce qui est exploré. Si une grande part de l’activité d’exploration porte sur des URL à paramètres, des redirections ou des pages d’erreur, c’est du budget gaspillé.

Le rapport sur la couverture de l’index montre l’écart entre les pages soumises et les pages indexées. Un nombre élevé de « détectée, actuellement non indexée » sur un grand site est un signal fort de budget de crawl.

Quand le budget de crawl n’est pas en cause

Parfois, « explorée, actuellement non indexée » n’est pas du tout un problème de budget. C’est un problème de qualité. Google a exploré la page, l’a évaluée et a décidé qu’elle ne valait pas la peine d’être indexée. Si un petit site sans contrainte de budget de crawl a des pages qui refusent de s’indexer, la solution consiste généralement à améliorer ces pages, et non à modifier les directives d’exploration.

Distinguer un problème de budget de crawl d’un problème de qualité de contenu est la première étape du diagnostic, et se tromper revient à gaspiller des efforts sur le mauvais correctif.

Qui doit s’en préoccuper

Le budget de crawl concerne surtout les grands sites : boutiques e-commerce, sites d’actualité, grandes entreprises de services, tout ce qui compte des milliers d’URL. Les sites vitrines de quelques pages ont rarement à s’en soucier. Mais pour les sites qui ont réellement un problème de budget de crawl, c’est souvent la principale raison pour laquelle un bon contenu n’est pas indexé.

L’optimisation du budget de crawl relève pleinement du SEO technique et exige quelqu’un capable de lire avec précision les journaux d’exploration et les données de la Search Console. L’équipe SEO technique de Defyn gère le budget de crawl dans le cadre de ses audits techniques. Si Google n’indexe pas vos pages et que vous ignorez pourquoi, un audit déterminera s’il s’agit d’un problème de budget de crawl ou d’autre chose.

Avatar de Claire Smith
Sponsored Loved this story? Defyn turns articles like this into the websites your competitors wish they had. Talk to us → defyn.com.au