robots.txt 是放在网站根目录的纯文本文件,用简短指令告诉搜索引擎爬虫哪些路径可以抓取、哪些路径需要回避。配置合理,抓取预算会被集中到重点页面,新内容收录速度也会提升;配置失误,则可能造成重要页面无法被抓取,甚至影响整站在搜索结果中的表现。以下从语法规则说起,梳理实际操作中的关键细节。
robots.txt 本质是一份指引协议,它的权限范围是控制爬虫是否发起抓取请求,至于页面后续是否进入索引、排名如何,这份文件无权干预。很多人误以为在 robots.txt 里屏蔽某个链接,页面就会从搜索结果中彻底消失。事实并非如此——若该地址被众多外部网站引用,搜索引擎仍然可能凭借其他来源将其纳入索引。
想让页面真正从结果页移除,正确做法是使用 noindex 元标签或登录后的返回码处理。另外,这份协议依赖爬虫遵守规则,主流搜索引擎的蜘蛛通常配合,但部分采集脚本和第三方抓取工具不会遵循。凡是涉及后台管理、会员数据、订单记录等敏感区域,必须额外布置登录验证、IP 白名单或安全防火墙,不能只靠这份文件来保护。
文件内容由若干规则组组成,每组以 User-agent 行开头。每条记录遵循“字段: 值”的格式,冒号使用英文半角,后面建议留一个空格。多数蜘蛛对格式容错较高,但保持规范书写能减少日后解析偏差的可能。
这一行标明规则组针对的爬虫类型。只约束谷歌蜘蛛时,写成 User-agent: Googlebot;需要所有搜索引擎统一执行时,用通配符写法 User-agent: *。同一文件中可以建立多个规则组,对不同爬虫采取不同策略,比如对谷歌放宽访问目录,同时约束必应的抓取范围。
Disallow 声明禁止抓取的路径,Allow 声明允许访问的路径,二者相互配合。关键细节在于:当 Disallow 后面没有值(只有 Disallow: 而无内容),表示清空所有限制,爬虫可访问全站内容。当同一地址同时命中多条规则时,搜索引擎普遍执行“最长匹配优先”,即路径越详细、优先级越高。例如同时存在 Disallow: /backend/ 和 Allow: /backend/public/ 时,因为后者路径更长、匹配更具体,public 子目录中的资源会被放行。
Sitemap 指令填写站点地图的完整地址,便于爬虫快速掌握全站结构,通常放在文件末尾。Crawl-delay 用来设置爬虫两次访问之间的间隔,单位为秒。但需要明确的是,谷歌蜘蛛并不支持 Crawl-delay 字段,官方更建议通过 Search Console 后台的抓取频率设置来控制节奏。其他搜索引擎对该指令的支持程度不同,使用时需根据目标平台确认。
路径理解是出错频率最高的环节。robots.txt 中的路径均相对于根域名,例如 Disallow: /admin 阻止的是域名下的 admin 路径。若缺少开头的斜杠,写成 Disallow: admin,部分蜘蛛会视为匹配所有包含 “admin” 字符的路径,结果范围会被意外扩大。通配符方面,星号(*)代表任意字符序列,止于斜杠处;美元符号($)表示匹配结束。比如 Disallow: /*.php$ 能屏蔽所有以 .php 结尾的地址,但不会影响 .html 页面。
主机名也需注意。文件里不支持书写带协议的完整域名作为路径前缀,误写成 Disallow: https://www.example.com/private/ 会导致规则无法匹配。此外,文件中的注释使用 # 开头,只能位于行首或值之后,放在字段中途会被整行忽略。修改完文件后,建议用各搜索引擎提供的 robots 测试工具核对每条规则的实际匹配结果。
规划抓取范围时,优先允许核心栏目和产品详情页,屏蔽后台、接口、搜索结果页和重复参数链接。不要随意屏蔽静态资源如 CSS 或 JS,否则可能引发页面渲染不完整、影响质量评估。配置文件放于站点根目录,命名为全部小写的 robots.txt,其他位置或大小写不符均不会被识别。
文件内容应保持精简,避免堆砌大量规则。每次调整都需确认语法无误,防止一处错误导致整组规则失效。定期查看站点的抓取报告,判断是否存在异常流量或未预期的屏蔽行为。若站点上线过改版,务必检查旧路径是否有 301 跳转,避免在 robots.txt 中留下过时规则。
从规则层面可以,使用 User-agent: * 配合 Disallow: / 即可。但这一操作只对遵守协议的搜索引擎蜘蛛生效,恶意程序不会理会。若需要彻底阻止访问,必须配合服务端访问控制,例如 IP 限制或账号认证。
没有固定时限。搜索引擎爬虫会按自身频率重新读取该文件,短则几小时,长则数日。修改后可通过更新 Sitemap 或站内提交工具加速通知,但不能保证立即生效。若发现重要页面被屏蔽,应尽快修正并观察抓取日志确认变化。
可以。使用 Disallow: /images/ 能阻止爬虫访问图片目录。但需注意,图片被屏蔽后可能无法出现在搜索结果图片板块,影响这部分流量来源。若只是担心授权图片被盗用,更稳妥的方式是启用防盗链或水印处理,而非单纯依赖协议。
robots.txt 是站点与搜索引擎沟通的基础工具,合理使用能优化抓取分配、保护敏感目录。配置时重点核对路径写法、规则优先级和通配符含义,避免因小失大。建议每季度检查一次文件内容和抓取报告,确保站点结构调整后,控制规则依然符合最新情况。