反馈

网页 SEO 基础:meta 标签、robots.txt、sitemap 是什么

网站想被搜索引擎正确收录,除了内容本身,还需要一些标准化的"信号文件"和标签,告诉爬虫这个页面是什么、该不该抓、抓了之后该怎么展示。meta 标签、robots.txt、sitemap 就是这套沟通机制里最基础的三件东西。


目录

  1. meta 标签:告诉搜索引擎和社交平台这页是什么
  2. robots.txt:告诉爬虫哪些能抓哪些不能抓
  3. sitemap:告诉爬虫网站上有哪些页面
  4. 三者的分工边界

1. meta 标签:告诉搜索引擎和社交平台这页是什么

<head> 里的一批 meta 标签,承担着"页面自我介绍"的作用:

  • <title>:页面标题,搜索结果列表里最显眼的一行,也是浏览器标签页显示的文字
  • meta description:页面摘要,搜索引擎经常直接把这段文字展示在搜索结果标题下方
  • meta robots:单独针对这一页告诉爬虫要不要收录、要不要跟踪页面上的链接(比如 noindex 表示不收录这一页)
  • Open Graph(og:title/og:description/og:image:微信、微博、Facebook 等社交平台分享链接时展示的标题、描述、缩略图,靠的就是这套标签,不设置的话分享出去的卡片可能显示得很难看

这些标签本身不影响页面实际内容,纯粹是元信息,但直接决定了页面在搜索结果和社交分享里"看起来是什么样"。

2. robots.txt:告诉爬虫哪些能抓哪些不能抓

robots.txt 是放在网站根目录的一个纯文本文件,用来声明"哪些爬虫可以访问哪些路径",遵循的是一套业界自愿遵守的约定(Robots Exclusion Protocol)——它不是强制性的技术屏蔽手段,只是对遵守规则的爬虫(包括几乎所有主流搜索引擎)发出的"请求"。基本语法是针对不同 User-agent(针对全部爬虫用 *,或针对 Googlebot、Baiduspider 等具体爬虫)分别写 Allow/Disallow 规则,声明允许或禁止访问的路径。

几个常见的坑:Disallow: / 会屏蔽整个网站被收录(新手很容易误配置成这样导致网站消失在搜索结果里);Sitemap 字段需要写完整的 URL,写相对路径爬虫无法正确解析;Crawl-delay(限制抓取频率)并不是所有搜索引擎都支持,比如 Google 就不遵守这个字段。

3. sitemap:告诉爬虫网站上有哪些页面

sitemap.xml 是一份列出网站所有希望被收录页面 URL 的清单文件,作用是主动告知爬虫网站结构,而不是被动等待爬虫通过链接一层层自己爬过来发现。对于新站、页面之间内部链接不够密集、或者有大量深层页面的网站,提交 sitemap 能明显加快搜索引擎发现和收录新页面的速度。sitemap 通常还会带上每个 URL 的最后修改时间,帮助爬虫判断哪些页面值得重新抓取。

4. 三者的分工边界

三者职责完全不同,不能互相替代:meta 标签决定单个页面展示给用户/爬虫看到的信息,robots.txt 决定爬虫在整站范围内能访问哪些路径,sitemap 主动告诉爬虫网站上有哪些页面值得抓取。一个常见的误区是把 robots.txt 当作"隐藏页面不被外部访问"的安全手段——它只是对爬虫的君子协定,完全不设访问权限的验证,真正需要保密的内容必须用服务器端的权限校验来保护,而不能依赖 robots.txt 的"建议性"屏蔽。


在线工具:网页META检测 · robots文件生成器