抓取预算:为什么谷歌没有索引你的所有页面

如果谷歌没有索引你的所有页面,抓取预算往往是原因所在。本文讲解它的运作方式以及如何停…

Server and code representing crawl budget and Google indexation in technical SEO

一个常见而又令人沮丧的 SEO 问题:你发布了页面,内容也不错,可几周之后谷歌仍有一半没有索引。Search Console 将它们显示为”已发现 — 目前尚未编入索引”或”已抓取 — 目前尚未编入索引”。内容没有问题,问题往往出在抓取预算上,这是技术 SEO 中最不为人理解的部分之一。

抓取预算究竟是什么

抓取预算是指 Googlebot 在给定时间内会在一个网站上抓取的页面数量。它取决于两个因素:抓取速率上限(谷歌在不让服务器过载的前提下能够抓取的速度)和抓取需求(谷歌根据其感知到的重要性和新鲜度,想要抓取该网站的程度)。

对于只有几百个页面的小型网站,抓取预算很少成为问题。但对于大型网站、拥有数千件商品的电商商店,或任何会生成大量 URL 变体的网站,抓取预算就成了真正的制约。谷歌根本无法足够频繁地抓取每一个页面。

最浪费抓取预算的因素

  • 分面导航。筛选和排序参数会生成数千个近乎重复的 URL。Googlebot 会全部抓取,把预算耗费在本不该被索引的 URL 上。
  • 重定向链。重定向链中的每一跳都是一次抓取。三次重定向组成的链条所消耗的抓取预算,是直接链接的三倍。
  • 软 404 和错误页面。返回 200 状态却没有实际内容的页面会浪费抓取预算,并让谷歌对网站质量产生误判。
  • 无限空间。日历、没有尽头的分页归档、会话 ID 参数。它们会生成几乎无限多的低价值 URL,让 Googlebot 在其中徘徊。
  • 服务器响应缓慢。如果服务器很慢,谷歌每次会话抓取的页面就会减少,以免造成过载。网站速度是抓取预算的一个因素,而不仅仅是排名因素。

如何收回抓取预算

策略是把 Googlebot 引向重要的页面,让它远离不重要的页面。用 robots.txt 阻止抓取那些永远不该被索引的参数化 URL。用规范标签(canonical)合并重复的 URL。修复重定向链,让每一次重定向都直达最终目标。对真正失效的页面返回正确的 404 或 410 状态码。保持 XML 网站地图整洁,只列出你希望被抓取和索引的页面。

内部链接同样会引导抓取预算。内部链接良好的页面会被更频繁地抓取。孤立页面则很少甚至从不被抓取。强健的内部链接结构会自然而然地把 Googlebot 引向重要页面。

如何诊断抓取预算问题

Search Console 中的抓取统计报告会显示谷歌每天抓取多少页面、平均响应时间,以及抓取内容的构成。如果抓取活动中有很大一部分花在参数 URL、重定向或错误页面上,那就是被浪费的预算。

索引覆盖率报告会显示已提交页面与已索引页面之间的差距。在大型网站上,大量”已发现 — 目前尚未编入索引”的计数是强烈的抓取预算信号。

什么时候抓取预算并非问题所在

有时”已抓取 — 目前尚未编入索引”根本不是预算问题,而是质量问题。谷歌抓取了该页面,进行了评估,认为不值得索引。如果一个没有抓取预算限制的小型网站有页面无法被索引,答案通常是改进这些页面,而不是去摆弄抓取指令。

区分抓取预算问题和内容质量问题,是诊断的第一步;判断错误就会把精力浪费在错误的修复上。

谁需要关注

抓取预算主要是大型网站需要关注的问题:电商商店、新闻网站、大型服务企业,以及任何拥有数千个 URL 的网站。只有几页的小型企业展示型网站很少需要考虑它。但对于确实存在抓取预算问题的网站来说,这往往是优质内容无法被索引的最大原因。

抓取预算优化完全属于技术 SEO 的范畴,需要能够准确解读抓取日志和 Search Console 数据的人。Defyn 的技术 SEO 团队会将抓取预算管理作为技术审计的一部分。如果谷歌没有索引你的页面而你又不知道原因,一次审计能够诊断出这究竟是抓取预算问题还是其他问题。

Claire Smith 的头像
Sponsored Loved this story? Defyn turns articles like this into the websites your competitors wish they had. Talk to us → defyn.com.au