Robots.txt 是部署在网站根目录的纯文本文件,核心功能是向搜索引擎爬虫声明哪些内容可以抓取、哪些需要避开。需要明确的是,它依靠爬虫自觉遵守,并非强制性的安全防线。合理规划这份文件,能让爬虫更高效地抓取关键页面,同时避免服务器资源的无谓消耗。
搜索引擎爬虫在抵达站点时,第一步通常是请求根目录下的 robots.txt。只要文件存在且爬虫遵循协议,便会依据其中的指令划定抓取边界。若文件缺失,默认意味着全站内容均向爬虫开放。
日常运维中,这份文件常被用于隔离后台管理路径、过滤低价值的标签聚合页或搜索结果页,以及通过降低抓取频次来减轻服务器带宽压力。但务必保持清醒:主流搜索引擎会认真执行相关指令,而恶意采集程序往往对此视而不见,因此绝不能将其视为访问控制的工具。
文件由若干“记录”组成,每条记录以具体的 User-agent 声明起始,继而包含若干操作指令。掌握以下五个核心指令是入门的关键:
下面是一份参考实际工作场景的配置,结构简洁明了,方便日后维护:
User-agent: *
Disallow: /temp/
Disallow: /backup/
Allow: /backup/readme.html
Sitemap: https://www.your-site.com/sitemap.xml
这段规则传达的意思是:热蜘蛛不得抓取 temp 与 backup 两个目录,但 backup 目录内的 readme.html 文件被特殊放行,同时指明了站点地图的具体位置。
文件编写看似简单,却常因细节疏忽导致效果未达预期。以下几种典型场景和误区需重点防范:
修改完 robots.txt 后,不能仅仅在浏览器地址栏输入网址查看内容就宣告完成。务必将最终的绝对URL(比如 https://www.your-site.com/robots.txt)粘贴到百度的搜索资源平台或谷歌的 Search Console 中,使用其自带的“robots 测试工具”进行模拟抓取,以核对允许与禁止的实际匹配结果。
需要特别留神的是,当站点改版或迁移目录结构时,旧规则极易被遗漏,导致新页面被意外屏蔽。建议将文件修改纳入发布流程中的检查清单,每次更新后都重新利用工具进行一次快速校验。
是的。若网站目录结构发生变化,旧的 Disallow 路径会自动失效,且浏览器不会自动更新这份文件。因此,每次改版后应当立刻审查并更新 robots.txt 中的对应路径,避免新内容被误屏蔽或旧规则失去约束力。
Sitemap 指令只接受文件的绝对完整网址,如 https://www.baidu.com/sitemap.xml。若写成相对路径(如 /sitemap.xml)或包含额外空格,部分工具会将该行解析失败。请检查网址是否完整、是否包含多余字符,同时确保该 URL 能正常访问。
立即将文件想内容恢复为允许全站抓取的状态,即清空 Disallow 值或移除该行,保存并上传。随后第一时间通过站长平台的抓取测试工具确认为“允许”状态,提交一次网站地图以通知爬虫更新。由于爬虫抓取存在周期,通常需要数小时到数天才能完全恢复收录。
Robots.txt 是搜索引擎优化中的基础治理工具,善用能提升抓取效率、守护服务器资源。本文梳理了其执行逻辑、核心指令和常见误区。建议你现在就检查一遍站点根目录下的文件内容,核对是否出现重复规则、无效路径或缺失 Sitemap 声明。修正后,利用官方工具做一次深度验证,确保每一行规则都真正服务于站点内容的安全曝光。