核对抓取限制的核心动作,是打开Google Search Console的“设置→抓取统计信息”和“网址检查”,再对照robots.txt、页面meta robots、X-Robots-Tag以及服务器返回码,确认Googlebot究竟是被拒绝抓取、被允许抓取但被禁止索引,还是抓取正常却未被收录。时间和人手有限时,先处理“整站级拦截”和“核心目录被屏蔽”,再处理单页问题,因为前者影响面最大。
不要一上来就改文件。先收集三类观察结果:
这些现象可能来自不同原因:robots.txt拒绝、meta robots的noindex、X-Robots-Tag响应头、登录墙、CDN或防火墙误拦Googlebot、服务器返回5xx。没有定位到具体原因前,不要断言是“被降权”或“被惩罚”。
判断抓取限制时,按“先粗后细”的顺序检查,能最快缩小范围:
https://你的域名/robots.txt,检查是否出现Disallow: /,或是否屏蔽了CSS、JS、图片所在目录。Googlebot抓取页面时若拿不到这些资源,可能无法正确理解页面。<meta name="robots" content="noindex">。注意:noindex是“禁止索引”,不是“禁止抓取”,两者要分开判断。curl -I或浏览器开发者工具的“网络”面板查看响应头。若出现X-Robots-Tag: noindex,即使页面meta没有写,也会生效。判断结果可以这样区分:robots.txt屏蔽会导致Googlebot无法抓取,网址检查会提示“已被robots.txt屏蔽”;noindex则允许抓取,但搜索结果中不展示该页。两者处理方式不同,不能混为一谈。
时间有限时,优先顺序建议是:整站robots.txt → 核心栏目目录 → 模板级noindex → 单页noindex。原因是前者的影响范围覆盖全站或整类页面,后者只影响个别URL。
假设某站点在robots.txt中写了Disallow: /,那么所有页面都无法被抓取。处理方式是删除该行,保留必要的后台、购物车、搜索结果页屏蔽规则,然后提交robots.txt更新。若只是某个栏目被Disallow,则只调整对应路径。
如果确认是noindex,需要区分是模板自动输出还是编辑手动添加。模板级问题要改模板,单页问题改页面字段。修改后不要立刻期待收录变化,先让Googlebot重新抓取。
复查分两步:
如果测试抓取仍失败,回到服务器日志,确认Googlebot请求返回的是200还是其他状态码。若返回200但页面内容为空,可能是JS渲染问题,而不是抓取限制。
下一步:挑一个你怀疑被限制的核心URL,按“robots.txt→meta robots→X-Robots-Tag→服务器响应码”的顺序逐项核对,把结果记录下来,再决定改哪一层。