Crawl budget: perché Google non indicizza tutte le tue pagine

Se Google non indicizza tutte le tue pagine, la causa è spesso il crawl budget. Come funziona e come smettere di sprecarlo.

Server and code representing crawl budget and Google indexation in technical SEO

Un problema SEO comune e frustrante: pubblichi delle pagine, sono valide e settimane dopo Google non ne ha ancora indicizzata la metà. Search Console le mostra come «rilevata, attualmente non indicizzata» o «scansionata, attualmente non indicizzata». Il contenuto va bene. Il problema è spesso il crawl budget, una delle parti meno comprese della SEO tecnica.

Che cos’è davvero il crawl budget

Il crawl budget è il numero di pagine che Googlebot scansiona su un sito entro un determinato periodo. Dipende da due fattori: il limite della frequenza di scansione (la velocità con cui Google può scansionare senza sovraccaricare il server) e la domanda di scansione (quanto Google vuole scansionare il sito, in base all’importanza e all’aggiornamento che gli attribuisce).

Per un sito piccolo di qualche centinaio di pagine, il crawl budget raramente è un problema. Per un sito grande, un negozio e-commerce con migliaia di prodotti o qualsiasi sito che generi molte varianti di URL, il crawl budget diventa un vincolo reale. Google semplicemente non scansiona ogni pagina con sufficiente frequenza.

I maggiori sprechi di crawl budget

  • Navigazione a faccette. Parametri di filtro e ordinamento che generano migliaia di URL quasi duplicate. Googlebot le scansiona tutte, esaurendo il budget su URL che non dovrebbero mai essere indicizzate.
  • Catene di reindirizzamenti. Ogni passaggio di una catena di reindirizzamenti è una scansione. Una catena di tre reindirizzamenti costa il triplo del crawl budget di un link diretto.
  • Soft 404 e pagine di errore. Le pagine che restituiscono uno stato 200 ma non mostrano contenuto reale sprecano crawl budget e confondono Google sulla qualità del sito.
  • Spazi infiniti. Calendari, archivi paginati senza fine, parametri di ID di sessione. Generano URL di scarso valore praticamente illimitate in cui Googlebot si perde.
  • Risposta lenta del server. Se il server è lento, Google scansiona meno pagine per sessione per non sovraccaricarlo. La velocità del sito è un fattore di crawl budget, non solo di posizionamento.

Come recuperare crawl budget

La strategia consiste nell’indirizzare Googlebot verso le pagine che contano e allontanarlo da quelle che non contano. Usa il file robots.txt per bloccare la scansione delle URL basate su parametri che non dovrebbero mai essere indicizzate. Usa i tag canonici per consolidare le URL duplicate. Correggi le catene di reindirizzamenti in modo che ogni reindirizzamento porti direttamente alla destinazione finale. Restituisci codici di stato 404 o 410 corretti per le pagine realmente morte. Mantieni pulita la sitemap XML, elencando solo le pagine che vuoi far scansionare e indicizzare.

Anche i link interni indirizzano il crawl budget. Le pagine ben collegate internamente vengono scansionate più spesso. Le pagine orfane vengono scansionate raramente o mai. Una solida struttura di link interni guida in modo naturale Googlebot verso le pagine importanti.

Come diagnosticare un problema di crawl budget

Il rapporto sulle statistiche di scansione di Search Console mostra quante pagine Google scansiona al giorno, il tempo di risposta medio e la ripartizione di ciò che viene scansionato. Se gran parte dell’attività di scansione va a URL con parametri, reindirizzamenti o pagine di errore, quello è budget sprecato.

Il rapporto sulla copertura dell’indice mostra il divario tra le pagine inviate e quelle indicizzate. Un numero elevato di «rilevata, attualmente non indicizzata» su un sito grande è un chiaro segnale di crawl budget.

Quando il crawl budget non è il problema

A volte «scansionata, attualmente non indicizzata» non è affatto un problema di budget. È un problema di qualità. Google ha scansionato la pagina, l’ha valutata e ha deciso che non valeva la pena indicizzarla. Se un sito piccolo senza vincoli di crawl budget ha pagine che non si indicizzano, la soluzione è di solito migliorare quelle pagine, non modificare le direttive di scansione.

Distinguere un problema di crawl budget da un problema di qualità del contenuto è il primo passo della diagnosi, e sbagliare significa sprecare energie sulla soluzione sbagliata.

A chi deve interessare

Il crawl budget riguarda soprattutto i siti grandi: negozi e-commerce, siti di notizie, grandi aziende di servizi, qualsiasi cosa con migliaia di URL. I siti vetrina di poche pagine raramente devono preoccuparsene. Ma per i siti che hanno davvero un problema di crawl budget, è spesso il motivo principale per cui un buon contenuto non viene indicizzato.

L’ottimizzazione del crawl budget rientra a pieno titolo nella SEO tecnica e richiede qualcuno in grado di leggere con precisione i log di scansione e i dati di Search Console. Il team di SEO tecnica di Defyn gestisce il crawl budget come parte degli audit tecnici. Se Google non indicizza le tue pagine e non sai perché, un audit diagnosticherà se si tratta di un problema di crawl budget o di qualcos’altro.

Avatar Claire Smith
Sponsored Loved this story? Defyn turns articles like this into the websites your competitors wish they had. Talk to us → defyn.com.au