工具 08 · P1
Robots.txt 测试器
用任意 User-Agent 检查任意路径。抓取线上 robots.txt 或粘贴草稿,逐条给出允许或禁止,并指出是哪一条规则决定的。
robots.txt 来源
经由 http://localhost:8080 抓取。也可以在下方粘贴内容,无需任何请求即可测试草稿。
测试抓取权限
结果
解析出的分组
0
文件中找到的 User-agent 分组数量。
Sitemap
警告
怎么用
- 01
载入你的 robots.txt
输入站点 URL 抓取线上 robots.txt,或直接把内容粘进输入框。粘贴的内容在本地解析,所以能在上线前先测草稿。
- 02
选一个 user-agent
选一个常见爬虫如 Googlebot 或 Bingbot,保留通配符 *,或输入自定义 token。适用哪组规则取决于哪个分组匹配该 token。
- 03
列出要测试的路径
每行一个路径,以斜杠开头。输入时每条路径都会被重新判定——改路径、改 user-agent 或改规则,结论都会立即更新。
线上文件经由 Go 服务抓取;解析与匹配全部在你的浏览器里完成。粘贴规则不会发出任何请求。
常见问题
▸ robots.txt 的规则是怎么匹配的?
最具体的匹配分组优先:优先匹配请求 user-agent 字符串中最长的 user-agent token,找不到则回退到 * 组。在同一组内,由最长的匹配 Allow 或 Disallow 规则决定;两条规则等长时 Allow 优先。
▸ 路径里的 * 和 $ 是什么意思?
在规则值里,* 匹配任意字符序列,结尾的 $ 把匹配锚定到路径末尾。所以 Disallow: /*.pdf$ 拦截以 .pdf 结尾的路径,而 Disallow: /private* 拦截 /private 下的所有内容。
▸ 如果没有 robots.txt 会怎样?
如果文件缺失(404),或服务器返回的不是纯文本,那就没有规则,默认允许抓取所有路径。工具会明确提示这一点,同时仍允许你粘贴规则来测试。
▸ 通配符 * 会同时覆盖 Googlebot 和 Bingbot 吗?
只有在没有更具体的分组匹配时才会。如果文件里有专门的 Googlebot 组,那么对 Googlebot 来说该组完全覆盖 * 组——不会把 * 组的规则合并进来。这是最常见的意外来源。
▸ robots.txt 能把页面从搜索结果里移除吗?
不能。Disallow 只是让爬虫不去抓取某个 URL,本身并不会把页面移出索引——而且被拦截的页面抓不到,放在上面的 noindex 标签也不会被看到。要让页面不进索引,应该放开抓取并改为返回 noindex。