Robots.txt 是网站根目录下一个简单的纯文本文件,它的作用是向搜索引擎爬虫说明哪些页面可以访问,哪些路径应当避开。这份文件并非强制性的安全屏障,而是一种行业公认的抓取约定。如果配置得当,它能够引导爬虫优先索引页面价值高的内容,同时有效降低服务器的资源消耗。
每当搜索引擎的爬虫准备抓取一个网站时,它首先会尝试访问该域名根目录下的 /robots.txt 文件。如果文件存在,并且爬虫遵守此协议,它就会根据文件中的规则来规划本次的抓取范围和顺序。反之,如果文件不存在,爬虫的默认行为是允许抓取所有能够公开访问的链接地址。
在实际操作中,网站管理员通常利用这个文件来实现以下目标:阻止爬虫访问后台登录界面、过滤带有参数的低质量搜索结果页或标签聚合页,以及通过降低特定路径的抓取频率来节省带宽。不过,这里必须强调一点:该协议只对合规的搜索引擎有效,市面上某些恶意采集程序根本不理会这些规则,因此在任何情况下都不能把它当作安全防护措施来依赖。
这个文件的基本结构是由若干条记录组成的,每条记录的开头必须先声明 User-agent,随后换行列出具体的指令。下面这五个指令是你必须完全掌握的。
参考下面这段标准写法,逻辑上直观易懂,也方便日后检索修改:
User-agent: *
Disallow: /tmp/
Disallow: /private/
Allow: /private/special.html
Sitemap: https://www.example.com/sitemap.xml
上述规则产生的实际效果是:所有参与抓取的爬虫均不得访问 tmp 和 private 两个目录,唯一例外是 private 文件夹下的 special.html 文件被允许抓取,同时赋予爬虫读取站点地图的路径。
尽管修改这个文件看起来简单,但细节上的疏忽很容易导致配置效果与预期完全背离。以下几种常见情境需要特别警惕。
避坑经验:文件匹配规则属于前缀匹配机制。例如 Disallow: /news 会同时屏蔽掉 /newsletter 以及 /news-archive 这类前缀相同的页面。如果你只打算屏蔽以斜杠结尾的版块,必须在末尾补上斜杠(例如写 /news/),否则限制范围会超出你的预期。
为了让规则长期稳定生效,维护过程中还需要关注文件上传的位置与格式细节。以下要点务必遵守:
该文件本身不会直接导致网站被降权,但如果误用了 Disallow: / 导致全站被屏蔽,等同于是自动放弃收录,进而造成页面从索引中被清除。这种长期不收录的状况会让站点权重与流量快速下滑。
你可以在浏览器直接输入网址查看文件内容,也可以借助搜索引擎的站长工具查看该文件的抓取报告。这里能直观看到最近一次爬虫抓取该文件的时间以及解析是否出现异常,从而判断更新是否已生效。
前者是作用于整个站点或某个路径的全局指令,在爬虫抓取网页之前先被读取。后者是写在具体 HTML 页面的 head 区域内的标签,用以控制该页面的索引与否。两者互补使用,但作用层级和处理时机不同。
配置 Robots.txt 时要秉持少而精的原则,只屏蔽真正不需要被索引的私密或低价值路径。编写时注意使用前缀匹配的斜杠细节,避免误伤正常页面。每次改动后,记得利用搜索引擎站长工具主动提交并核对效果,这样才能在不损失站点流量的前提下,确保爬虫将资源用在最关键的内容上。