https://域名/robots.txt。用表单拼出 robots.txt,实时预览,可复制或下载。也能把现有的 robots.txt 粘进来「解析导入」成表单继续改。
* 或 Googlebot、Baiduspider、Bingbot、YandexBot、GPTBot 等分别设规则(输入框有常见爬虫补全)。/ 前缀,Crawl-delay 只接受数字。Disallow: / 屏蔽整站、Sitemap 不是完整 URL、Crawl-delay 对 Google 无效等。配置只在浏览器本地处理,不上传;表单会自动存到本机 localStorage。
https://你的域名/robots.txt,子目录里的无效。Disallow: 后面留空 = 允许全部;Disallow: / = 屏蔽整站。差一个字符结果完全相反。Crawl-delay,抓取频率在 Search Console 里调;Bing、Yandex、百度仍支持。Host: 指令基本只有 Yandex 用,Google 忽略,本工具不再生成。| 场景 | 规则 |
|---|---|
| 允许全站 | User-agent: * + Disallow: |
| 屏蔽全站 | User-agent: * + Disallow: / |
| 屏蔽后台和搜索页 | Disallow: /admin/ + Disallow: /*?* |
| 只让 Google 抓、其它不抓 | User-agent: Googlebot Allow: / 之后 User-agent: * Disallow: / |
| 屏蔽 AI 训练 | 为 GPTBot、Google-Extended、CCBot、ClaudeBot 等各写 Disallow: / |
Q:改了 robots.txt 多久生效?
A:爬虫会缓存 robots.txt(Google 一般最多 24 小时)。想让已被收录的页面从搜索结果消失,光靠 Disallow 不够,要用 noindex 或 Search Console 的移除工具。
Q:Disallow 能隐藏页面不被别人看到吗?
A:不能。robots.txt 本身是公开的,反而等于告诉别人哪些目录"值得看"。真要保护请加密码。
Q:通配符能用吗?
A:主流搜索引擎支持 *(任意字符)和 $(URL 结尾),如 Disallow: /*.pdf$。这不是原始规范,但 Google、Bing、百度都支持。
Q:一定要有 Sitemap 行吗? A:不是必须。加上能帮爬虫更快发现页面,也可以在 Search Console / 站长平台单独提交。
Q:数据会上传吗? A:不会。全部在浏览器本地生成。
相关:HTML/JS 互转 · URL 编解码 · 正则表达式 · 文本对比 · 字符计数。