Robots.txt 是网站根目录下的纯文本文件,用标准化协议告知搜索引擎爬虫哪些站点区域可抓取、哪些应规避。它是行业普遍遵循的协作规范,而非安全机制。合理配置能让爬虫聚焦核心内容,同时降低服务器不必要的访问压力。
爬虫访问网站时,会首先检查根目录下的 robots.txt 文件。若文件存在并解析正常,爬虫将遵循其中规则执行抓取;若文件缺失,爬虫通常会默认抓取所有公开内容。
实际应用中,该文件常用于屏蔽后台路径、过滤搜索参数页与标签聚合页等低价值内容,也可通过配置抓取频率缓解服务器瞬时负荷。但务必明确:此协议仅约束合规搜索引擎,恶意程序与采集工具视若无物,因此绝不能将其作为敏感数据防护手段。
规则组以 User-agent 声明起始,后接该爬虫的特定配置。掌握以下五项,足以处理绝大多数场景:
以下配置兼具代表性与直观性:
User-agent: *
Disallow: /upload/
Disallow: /backup/
Allow: /backup/readme.html
Sitemap: https://www.example.com/sitemap.xml
其含义:阻止所有爬虫访问 upload 与 backup 目录,但 backup 下的 readme.html 例外可抓取,并同步公开站点地图 URL。
语法并不复杂,但配置疏漏常致预期效果落空。以下高频失误需特别警惕:
配置完成后,务必通过多渠道验证规则是否真正生效。各大搜索引擎的站长平台均提供抓取测试工具,如 Google Search Console 的 URL 检查功能、Bing Webmaster Tools 等。使用这些工具,你能模拟爬虫抓取行为,查看服务器返回信息及 robots.txt 拦截详情。
另一种简单验证方法是使用命令行工具——输入 curl 等指令直接请求 robots.txt 文件,检查输出是否符合预期配置。但需注意,部分 CDN 或服务器缓存可能导致文件更新延迟,验证时务必考虑此因素。
不能。robots.txt 仅对合规搜索引擎有效,恶意程序、采集工具甚至普通用户都可通过直接输入 URL 访问文件,其本身就是公开可读的。若需真正保护文件,须借助服务器端权限设置或认证机制。
建议保持简洁清晰,虽没有明确规定文件大小上限,但过大的文件会增加解析负担且易出错。更关键的是格式要求 UTF-8 编码,且每条指令须独立成行。不同搜索引擎对格式要求大体兼容,个别细节差异需查阅各平台文档。
改版移除了某些页面或更换了网址结构后,需第一时间复查并更新 robots.txt,确保不会误屏蔽新路径或对已废弃目录请求导致 404 频发。建议在正式切换前完成规则测试,并持续观察搜索引擎抓取报告,根据反馈调整配置。
Robots.txt 配置看似简单,却深刻影响网站收录效率与搜索引擎友好度。建议从明确目标页面清单入手,保持规则精简,每次修改后使用各类站长工具验证效果。用心维护这份文件,让搜索引擎更高效地理解你的网站内容结构。