核对抓取限制,不是看一遍robots.txt就算完成,而是先明确你希望搜索引擎最终抓到哪些页面、屏蔽哪些路径,再用“抓取测试 + 日志观察 + 索引结果”三项证据交叉验证。若你正在建立自己的博客,常见选择是“全站放开,仅屏蔽后台和重复页”与“先收紧,只放开文章页”。两种方案没有绝对优劣,判断依据是你的内容成熟度、页面重复程度和可投入的维护精力。
把目标写成可验收的清单,后面所有核对都围绕它进行:
清单越具体,越容易判断一条抓取限制是“必要”还是“误伤”。如果连自己希望哪些页面被收录都说不清,先不要动限制规则。
方案A:全站放开,只屏蔽明确无价值的路径。适合文章数量少、结构简单、后台路径与内容路径容易区分的新博客。优点是配置少、出错概率低;风险是站内搜索结果页、标签页可能被大量抓取,稀释抓取预算。
方案B:默认收紧,只放开文章与必要列表页。适合页面类型多、参数复杂、已经出现大量重复页被抓的博客。优点是抓取更集中;风险是规则写错会把正文页一起挡掉,且排查成本更高。
选择依据可以量化为三个检查项:一,你的博客是否存在两种以上路径能到达同一篇文章;二,站内搜索或标签是否会产生大量组合页;三,你是否有精力定期看抓取日志。三项中有两项为“是”,优先考虑方案B;否则先用方案A。
User-agent、Allow、Disallow对应的路径,写下来,不要只看有没有报错。noindex或canonical设置,单独核对,因为它们与robots.txt的作用层级不同:robots.txt阻止抓取,noindex阻止索引,两者不能互相替代。短例子(假设):某博客把/tag/整段写进Disallow,测试时标签页显示“已被屏蔽”,但文章页正常可抓,日志中文章页请求稳定,这属于方案B生效。若测试发现文章页也被屏蔽,说明规则路径写得太宽,需要收窄到具体目录。
核对完成后,不要只看一天的数据就下结论。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,因此建议至少观察一个完整的抓取周期再判断。若出现以下信号,说明当前限制需要调整:正文页长时间不被抓取;无价值页面占据大量抓取请求;搜索结果中出现了你明确想屏蔽的页面。
调整时每次只改一类规则,改完重新执行上面的测试步骤,保留改动前后的日志片段作为对照。这样即使结果不理想,也能定位是哪一条规则造成的。
下一步:把你博客当前的robots.txt和目标页面清单并排放在一起,先完成一次抓取测试,再决定是维持方案A还是切换到方案B。