robots.txt 规则测试
粘贴或导入 robots.txt 规则,用目标 URL 与爬虫产品标识测试,显示允许结论、采用的规则组、最终命中规则和行号。
- 1添加输入
- 2调整设置
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
粘贴或导入 robots.txt 规则,用目标 URL 与爬虫产品标识测试,显示允许结论、采用的规则组、最终命中规则和行号。 输入完整 URL 和爬虫产品标识后运行。
如何使用
- 粘贴 robots.txt 或选择 UTF-8 .txt 文件,再输入完整 URL 和爬虫产品标识。
- 运行后查看允许结论、采用的规则组,以及最终命中规则和原行号。
- 下载 JSON 查看全部命中规则与忽略行号;依赖结论前另行检查线上站点。
支持范围与限制
仅本地测试一个 HTTP(S) URL 的分组、通配符、结束锚点和 UTF-8 路径匹配;不抓取 robots.txt、不核验所属站点或服务器状态,也不能证明收录。
粘贴最多 1 MiB,或导入一份最多 1 MiB 的 UTF-8 .txt 文件;最多 5,000 行。不支持或无效的行会列出,复杂匹配有计算上限。
操作示例
示例输入
User-agent: * Disallow: /private/ Allow: /private/public/
示例参数
{"agent": "ExampleBot", "url": "https://example.com/private/file"}示例输出
{
"allowed": false,
"path": "/private/file",
"agent": "examplebot",
"implicitRobotsTxt": false,
"selectedGroups": [
{
"agents": [
"*"
],
"line": 1
}
],
"matchedRule": {
"allow": false,
"pattern": "/private/",
"line": 2
},
"matchedRules": [
{
"allow": false,
"pattern": "/private/",
"line": 2
}
],
"ignoredLines": []
}出现问题时
仅本地测试一个 HTTP(S) URL 的分组、通配符、结束锚点和 UTF-8 路径匹配;不抓取 robots.txt、不核验所属站点或服务器状态,也不能证明收录。 粘贴最多 1 MiB,或导入一份最多 1 MiB 的 UTF-8 .txt 文件;最多 5,000 行。不支持或无效的行会列出,复杂匹配有计算上限。
常见问题
如何找到命中的 robots 规则?
运行后查看允许结论、采用的规则组,以及最终命中规则和原行号。 下载 JSON 查看全部命中规则与忽略行号;依赖结论前另行检查线上站点。
页面示例应该得到什么结果?
/private/file 应被禁止,/private/public/file 由更具体规则允许;等效的 Allow 与 Disallow 规则优先 Allow。
哪些情况不适用?
仅本地测试一个 HTTP(S) URL 的分组、通配符、结束锚点和 UTF-8 路径匹配;不抓取 robots.txt、不核验所属站点或服务器状态,也不能证明收录。 粘贴最多 1 MiB,或导入一份最多 1 MiB 的 UTF-8 .txt 文件;最多 5,000 行。不支持或无效的行会列出,复杂匹配有计算上限。