上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能拿到页面、拿到后愿意收录、收录的是正确版本。人手有限时,按“可抓取—可索引—规范化”的顺序检查,先排除会直接导致整站不收录的硬伤,再处理单页层面的细节。下面用一个假设例子说明具体步骤。
假设你为一家本地制造企业做了新官网,旧站已运行多年,新站换了域名结构,产品页从动态参数改成了静态路径。上线前一天,你只有两个小时做检查。此时最容易犯的错误是:只打开首页看是否正常,就认为搜索引擎也能正常抓取。实际上,抓取与索引问题往往藏在 robots 文件、meta 标签和跳转规则里。
按优先级,先做下面三步。
robots.txt 是抓取入口的第一道门。常见错误是开发阶段为阻止测试环境被收录,写了全站禁止,上线时忘记删除。
你的域名/robots.txt,确认没有 Disallow: / 这类全站屏蔽规则。判断结果:如果发现全站禁止,这是最高优先级问题,必须在上线前改掉;如果只是屏蔽了后台或搜索参数页,属于正常配置,可以保留。
页面能被抓取,不等于能被收录。每个页面头部可能带有控制索引的标签,需要抽查关键页面。
noindex。如果关键页面出现 <meta name="robots" content="noindex">,该页不会被收录。判断结果:noindex 出现在需要收录的页面上,属于必须修复项;canonical 指向错误,会导致权重和收录集中在错误地址上,同样需要上线前改掉。
换域名或改结构时,跳转配置决定旧地址的权重能否传递到新地址。
301 永久跳转,而不是 302 临时跳转。判断结果:如果旧页面全部跳首页,搜索引擎会认为原页面内容消失,新页面难以继承原有信号;逐页对应跳转才是正确做法。
如果只有一小时,按这个顺序执行:先看 robots.txt 是否全站禁止,再看关键页面是否 noindex,最后抽查十条重要旧链接的跳转。这三项覆盖了导致“整站不收录”和“收录错地址”的主要原因。Sitemap 提交、结构化数据、页面速度等可以放到上线后继续处理,它们影响的是收录效率和质量,而不是能否被收录。
上线后第二天,用搜索引擎的站点查询指令确认首页是否已被抓取,再观察一周内收录页面数量变化。如果首页长期未收录,回到 robots.txt 和 noindex 两项重新核对。