上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能读到页面、读到的内容是你想让它读的、读完后允许它收录。对青海本地企业站、政务站或面向全国流量的站点来说,这一步做漏,后面再改标题、加内容都可能延迟生效。下面用一个假设例子说明具体步骤。
假设某青海牦牛肉干企业做了一个新官网,域名已解析,服务器在境内,页面包括首页、产品列表、产品详情、企业介绍和联系页。上线前一天,负责人只检查了页面能否打开,没有看抓取配置。下面是可以照着执行的核对顺序。
robots.txt,检查是否误写了 Disallow: /,或把产品目录、联系页整段屏蔽。<title>、<meta name="description"> 和唯一 URL,不把同一产品复制成多个只差参数的地址。sitemap.xml 是否只列出希望收录的页面,并确认其中 URL 返回 200 状态码。<meta name="robots">,确认没有误加 noindex。robots.txt 放在站点根目录,只控制抓取,不直接控制索引。常见错误是测试阶段写了全站禁止抓取,上线时忘记删除。检查时逐行看 User-agent 和 Disallow 的对应关系,确认没有把 / 放在禁止项下。
<meta name="robots"> 写在页面 <head> 中,控制的是索引和链接跟随。若内容是 noindex,页面即使被抓取也不会进入索引。判断结果很简单:希望收录的页面不应出现 noindex;不希望收录的页面才使用它。两者冲突时,以更严格的一方为准。
抓取配置正常,不等于索引配置正常。索引阶段常见问题是同一内容有多个 URL,例如带 www 和不带 www、带末尾斜杠和不带斜杠、带跟踪参数和不带参数。核对时选一个主版本,其余版本用 301 跳转到主版本。
这里要区分“可能原因”和“已经定位的原因”。页面不被收录,可能是抓取被屏蔽、返回错误、内容重复、质量不足或尚未被发现,不能只凭一个现象断定是 robots.txt 的问题。
sitemap.xml 是给搜索引擎的 URL 清单,不是收录保证。检查时看三点:文件能正常访问、URL 数量与站点实际可收录页面大致一致、每个 URL 都是规范版本。假设 sitemap 里列了 300 个产品页,但其中 80 个返回 404,这会浪费抓取预算,也会让搜索引擎降低对清单的信任。
抓取测试可以用服务器日志观察爬虫访问频率和返回码,也可以用搜索引擎官方提供的抓取测试工具查看单个 URL 的抓取结果。工具显示“可抓取”只代表这次请求成功,不代表一定收录。适用条件是:你已确认页面内容合格、没有 noindex、没有屏蔽,才把问题转向内容质量和外部链接。
把核对做成固定动作,比上线后临时排查更省事。可以按下面顺序执行:
robots.txt 没有全站禁止抓取。noindex。sitemap.xml 可访问且 URL 返回正常。下一步建议:把上述检查项整理成一份上线前核对表,每次改版或新增栏目后重新执行一遍,避免旧配置被覆盖。