形成可复用检查清单的关键,是先把“页面是否能被抓取、是否允许被索引、是否已被索引”拆成三个独立判断,再按准备、实施、验证、维护四步固定下来。第一次接触时,最容易犯的错是把 robots.txt 当成收录开关:它只能限制抓取,不能可靠地移除已经建立的索引;站点地图也只能帮助发现网址,不保证收录。
检查清单要围绕三个对象设计,不要混在一起:
准备阶段的产出是一张字段表:网址、检查日期、抓取状态、索引状态、canonical 目标、结论、下一步。字段固定后,后续每次检查都填同一张表,清单才可复用。
对每个待检查网址,按顺序执行,不要跳步:
site: 查询该网址,记录是否出现。这是初筛,不是最终结论。<meta name="robots"> 是否含 noindex;同时看响应头是否含 X-Robots-Tag。两者任一为 noindex,都可能阻止索引。最关键的一步是第 2 步和第 3 步:noindex 与 canonical 是页面级信号,直接决定该网址能否作为独立条目进入索引。robots.txt 的 Disallow 只影响抓取,不能替代移除索引的手段。
验证时,把“可能原因”和“已经定位的原因”分开写。例如“site: 查不到”可能有多种解释:网址未被发现、被抓取但未索引、被 noindex 阻止、canonical 指向他处。没有逐项排除前,不要写成“因为 robots.txt 所以没收录”。
可用的验证依据包括:
假设某页面返回 200、无 noindex、canonical 指向自身、robots.txt 允许抓取,但 site: 查询无结果——此时结论应写“已具备索引条件,尚未观察到索引”,下一步是提交或等待重新抓取,而不是修改 robots.txt。适用条件是:该判断只针对当前查询的搜索引擎,不同搜索引擎的支持与表现需分别核查。
清单本身也要维护。每次复查后更新三处:检查日期、状态变化、结论依据。若页面改版、更换域名、调整 canonical 策略或修改 robots.txt,应把相关网址重新纳入检查,而不是沿用旧结论。
维护阶段还要固定判断口径:HTTPS 只说明传输加密,不保证页面没有漏洞,也不保证排名;站点地图不保证收录;robots.txt 的抓取限制不等于可靠的索引移除。把这些边界写进清单备注,可以避免下次复查时把不同信号混为一谈。
下一步:选一个你关心的网址,按上面的字段表填一遍,把“抓取状态、索引状态、canonical 目标”三项写清楚,再决定是改页面信号、改 robots.txt,还是只需等待重新抓取。