如何建立自己的博客 - 用抓取限制核对清单判断该放开还是收紧

📍 WDQWDWQD987AAAAA:216.73.216.23
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /ec37b32ed98a.html
📄

如何建立自己的博客 - 用抓取限制核对清单判断该放开还是收紧

核对抓取限制,不是看一遍robots.txt就算完成,而是先明确你希望搜索引擎最终抓到哪些页面、屏蔽哪些路径,再用“抓取测试 + 日志观察 + 索引结果”三项证据交叉验证。若你正在建立自己的博客,常见选择是“全站放开,仅屏蔽后台和重复页”与“先收紧,只放开文章页”。两种方案没有绝对优劣,判断依据是你的内容成熟度、页面重复程度和可投入的维护精力。

先定交付结果:你要搜索引擎抓到什么

把目标写成可验收的清单,后面所有核对都围绕它进行:

清单越具体,越容易判断一条抓取限制是“必要”还是“误伤”。如果连自己希望哪些页面被收录都说不清,先不要动限制规则。

两种处理方案的适用条件

方案A:全站放开,只屏蔽明确无价值的路径。适合文章数量少、结构简单、后台路径与内容路径容易区分的新博客。优点是配置少、出错概率低;风险是站内搜索结果页、标签页可能被大量抓取,稀释抓取预算。

方案B:默认收紧,只放开文章与必要列表页。适合页面类型多、参数复杂、已经出现大量重复页被抓的博客。优点是抓取更集中;风险是规则写错会把正文页一起挡掉,且排查成本更高。

选择依据可以量化为三个检查项:一,你的博客是否存在两种以上路径能到达同一篇文章;二,站内搜索或标签是否会产生大量组合页;三,你是否有精力定期看抓取日志。三项中有两项为“是”,优先考虑方案B;否则先用方案A。

核对抓取限制的可执行步骤

  1. 打开robots.txt,逐条读出User-agent、Allow、Disallow对应的路径,写下来,不要只看有没有报错。
  2. 用搜索引擎提供的抓取测试工具,分别测试一篇文章页、一个标签页、一个后台路径,记录返回的是“可抓取”还是“已被屏蔽”。
  3. 把测试结果与第一步写下的目标清单逐条对照,标记“符合”“误伤”“漏挡”三类。
  4. 若页面级还有noindex或canonical设置,单独核对,因为它们与robots.txt的作用层级不同:robots.txt阻止抓取,noindex阻止索引,两者不能互相替代。
  5. 在服务器日志中筛选搜索引擎爬虫的访问记录,观察被屏蔽路径是否仍有大量请求,以及正文页抓取频率是否异常偏低。

短例子(假设):某博客把/tag/整段写进Disallow,测试时标签页显示“已被屏蔽”,但文章页正常可抓,日志中文章页请求稳定,这属于方案B生效。若测试发现文章页也被屏蔽,说明规则路径写得太宽,需要收窄到具体目录。

判断结果与调整时机

核对完成后,不要只看一天的数据就下结论。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,因此建议至少观察一个完整的抓取周期再判断。若出现以下信号,说明当前限制需要调整:正文页长时间不被抓取;无价值页面占据大量抓取请求;搜索结果中出现了你明确想屏蔽的页面。

调整时每次只改一类规则,改完重新执行上面的测试步骤,保留改动前后的日志片段作为对照。这样即使结果不理想,也能定位是哪一条规则造成的。

下一步:把你博客当前的robots.txt和目标页面清单并排放在一起,先完成一次抓取测试,再决定是维持方案A还是切换到方案B。

图1 图2

nginx