上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引到的地址是最终要展示的地址。时间和人手有限时,先处理 robots 封锁、noindex 误用、canonical 指向错误这三类问题,它们会直接导致整站或整批页面不进索引。
假设你为衡阳一家本地服务企业做了一个二十页的展示站,测试域名是 test.example.com,正式域名是 www.example.com。上线前一天,按下面顺序核对。
Disallow: / 这类整站封锁。测试阶段常写的封锁规则,必须在切正式域名时删掉。<meta name="robots" content="noindex">。这条标签会明确阻止页面进索引,比 robots 封锁更隐蔽,因为页面仍可被抓取。这个顺序的理由是:robots 封锁和 noindex 属于硬性阻止,不先排除,后面所有检查都没有意义;canonical 错误会让正确页面被合并掉;sitemap 和提交属于加速发现,放在最后。
第一类错误是测试配置残留。现象是页面能打开、内容正常,但搜索不到。判断方法是查看源码中的 robots 元标签和 robots.txt。如果发现 noindex 或整站 Disallow,就是已经定位的原因,删除后重新提交即可。
第二类错误是 canonical 自指错误。现象是多个页面只索引了其中一个。判断方法是逐页查看 canonical 的完整地址,确认协议、域名、路径与当前页面一致。如果 canonical 指向了别的页面,该页面通常不会单独出现在索引里。
第三类错误是参数和重复地址。同一内容可能通过带 www 与不带 www、http 与 https、带尾斜杠与不带尾斜杠等多种形式访问。判断方法是选定一个主形式,其余形式做跳转,并让 canonical、sitemap、内链统一使用主形式。
第四类错误是抓取被服务器拦截。现象是抓取工具返回 403 或 503。可能原因是防火墙、CDN 或安全策略拦住了搜索引擎的抓取请求,也可能是服务器本身不稳定。这两者需要区分:前者要在访问日志里确认拦截来源,后者要检查服务器响应时间。不要看到 403 就直接断定是搜索引擎的问题。
这份清单适用于页面数量不多、没有复杂参数的中小站点。如果站点有分页、筛选参数或大量商品页,还需要额外处理参数地址的索引策略,但那属于另一个问题,不必在上线前一次做完。
确认上述项目无误后,提交 sitemap,并对首页和两三个重点内页分别发起抓取请求。之后不需要反复提交同一地址,而是观察抓取统计和索引状态是否随时间正常变化。如果一周后重点页面仍未出现在索引中,回到本清单重新检查 noindex 与 canonical,而不是继续重复提交。