反馈

robots文件生成器

robots.txt 预览

      
检查
robots.txt 只是"请求"爬虫遵守,不能阻止访问。真正的私密内容必须用登录 / 鉴权保护,别只靠 Disallow。文件要放在域名根目录:https://域名/robots.txt。

📖 工具说明

1. 这个工具做什么

用表单拼出 robots.txt,实时预览,可复制或下载。也能把现有的 robots.txt 粘进来「解析导入」成表单继续改。

配置只在浏览器本地处理,不上传;表单会自动存到本机 localStorage。

2. 几点提醒

3. 常见示例

场景 规则
允许全站 User-agent: * + Disallow:
屏蔽全站 User-agent: * + Disallow: /
屏蔽后台和搜索页 Disallow: /admin/ + Disallow: /*?*
只让 Google 抓、其它不抓 User-agent: Googlebot Allow: / 之后 User-agent: * Disallow: /
屏蔽 AI 训练 为 GPTBot、Google-Extended、CCBot、ClaudeBot 等各写 Disallow: /

4. 常见问题(FAQ)

Q:改了 robots.txt 多久生效? A:爬虫会缓存 robots.txt(Google 一般最多 24 小时)。想让已被收录的页面从搜索结果消失,光靠 Disallow 不够,要用 noindex 或 Search Console 的移除工具。

Q:Disallow 能隐藏页面不被别人看到吗? A:不能。robots.txt 本身是公开的,反而等于告诉别人哪些目录"值得看"。真要保护请加密码。

Q:通配符能用吗? A:主流搜索引擎支持 *(任意字符)和 $(URL 结尾),如 Disallow: /*.pdf$。这不是原始规范,但 Google、Bing、百度都支持。

Q:一定要有 Sitemap 行吗? A:不是必须。加上能帮爬虫更快发现页面,也可以在 Search Console / 站长平台单独提交。

Q:数据会上传吗? A:不会。全部在浏览器本地生成。


相关:HTML/JS 互转 · URL 编解码 · 正则表达式 · 文本对比 · 字符计数。

📖 了解原理

📖 相关推荐