robots.txt是一个放在网站根目录下的纯文本文件,它的职责是向搜索引擎爬虫说明哪些路径可以访问、哪些路径应当绕开。对站长来说,它是引导搜索抓取的基础工具:配置合理,既能帮助爬虫把精力集中在有价值的内容上,也能降低后台、隐私数据被收录的风险。下面从语法入手,逐步拆解常见场景与容易被忽略的细节。
一个完整的robots.txt由若干独立的规则块组成,每个规则块通过几个关键字段定义抓取边界:
日常配置通常长这样:
User-agent: *
Disallow: /cache/
Allow: /cache/public/
Sitemap: https://www.example.com/sitemap.xml
编写时务必注意两点:路径区分大小写,且所有符号必须使用英文半角。任何一行的格式错误,都可能导致整段规则不被识别。
站的阶段和结构不同,robots.txt的写法也随之变化。以下梳理四种典型情况供参考。
适合新站上线前调试或者站点临时维护使用。但要清楚,这不会立刻把已收录的页面从索引中移除,想清掉旧快照,还需借助搜索引擎站长工具的收录删除功能。
User-agent: *
Disallow: /
如果站内所有内容都适合公开,无需屏蔽任何资源,那么可以不加任何Disallow声明,只保留Sitemap地址。这类写法最省事,也有利于爬虫完整遍历站点。
User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml
企业站和内容站通常需要把管理后台、会员中心、临时文件目录隐藏起来,避免隐私外泄或被批量抓取。
User-agent: *
Disallow: /admin/
Disallow: /member/
Disallow: /tmp/
这样能在很大程度上降低后台导航被搜索引擎收录的可能,从而减少被定向试探的风险。
想保留主流搜索引擎的正常收录,同时屏蔽一些用途不明的爬虫,可以分别为它们写单独的规则块。注意针对同一爬虫,后面的规则块会覆盖前面的同名声明。
User-agent: SomeSpider
Disallow: /
替某个爬虫单独配置时,先确认其UA名称是否拼写正确,否则规则不会生效。
初次配置robots.txt时,有几个问题几乎每个人都会遇到。
建议每次修改后,打开搜索引擎站长工具里的抓取测试功能,验证规则是否符合预期,还能直接看到模拟抓取结果。
robots.txt发布后并非一劳永逸,需要定期检查更新。
一个简单的自检方法:浏览器直接访问 域名/robots.txt,若能看到纯文本内容且无报错,说明文件可正常读取。
写错的结果通常是某些页面无法被爬虫访问,直接影响是收录减少和流量下滑,但不会因为文件本身导致降权。发现后及时修正,再提交给搜索引擎重新抓取即可恢复。
正常。未提供robots.txt时,搜索引擎会默认抓取所有允许访问的页面。对大多数内容开放的站点来说,没有这个文件并不影响正常收录,只是缺少了对敏感路径的主动保护。
可以,在Disallow中直接写明图片文件的完整路径或所在目录即可。但要注意,如果图片已被引用在其他页面,爬虫仍可能通过页面链接访问到它,所以最稳妥的办法是对该资源同时设置权限控制。
robots.txt的配置并不复杂,核心在于理解语法顺序和路径匹配规则,再结合站点实际结构谨慎设定。建议先从屏蔽后台、临时目录等风险路径入手,逐渐摸索出适合自己站点的一套规则,并养成每次修改后测试验证的习惯。这样既能让搜索引擎高效抓取内容,也能守住隐私与安全的底线。