上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址与内容符合预期。具体做法是拿一份待上线页面清单,逐项检查可访问性、robots 规则、canonical、状态码和站点地图,再用抓取工具模拟一次,把结果与清单比对,差异项在上线前修掉。
抓取与索引核对不能凭感觉点几个页面,要从交付结果倒推需要哪些资料。让开发或内容负责人提供上线后的完整 URL 列表,至少包含首页、栏目页、详情页、分页、标签页和表单结果页。每个 URL 标注三件事:期望状态码、是否允许索引、是否希望出现在站点地图中。没有这份清单,后面的检查就没有判断依据。
抓取通道分几层,逐层排查能减少误判。第一层是服务器可达性,用命令行或浏览器开发者工具看响应状态码。第二层是 robots.txt,确认没有把整站或关键目录写成禁止抓取。第三层是页面级指令,检查 <meta name="robots"> 是否出现 noindex。第四层是链接可达性,确认重要页面能从首页通过正常链接到达,而不是只靠提交站点地图。
这里要区分“可能原因”和“已经定位的原因”。如果某页面没被收录,可能是抓取被拒、可能被 noindex、可能内容重复被合并、也可能是刚上线还没处理。不要看到一种现象就断言唯一原因,先收集证据再下结论。
允许抓取不等于允许索引,也不等于索引到你想展示的地址。逐项确认:
检查方法:打开页面源代码,搜索 canonical 与 robots 指令;再用抓取工具批量抓取,导出状态码、canonical、meta robots 三列,与 URL 清单比对。判断结果是“一致”“需修改”还是“需确认”,不要只记录现象。
上线前做一次模拟抓取,能提前暴露配置冲突。假设有一个详情页,清单标注为“允许索引、canonical 指向自身、应出现在站点地图”,模拟抓取后却发现返回 302 跳转到列表页,同时站点地图里仍有该地址。这就是一个需要在上线前修掉的差异项,处理方式是确认跳转规则是否误伤,再决定保留跳转还是恢复 200。
适用条件:这套核对适合有明确页面清单、有开发配合改配置的项目。如果站点规模很小,可以只做关键页面抽查;如果站点规模大,建议用抓取工具批量执行,人工只复核差异项。判断结果的标准始终是同一条:实际表现与清单标注是否一致。
上线后不要立刻停止核对。先确认服务器日志中抓取请求是否正常,再观察索引状态是否按预期变化。发现差异时,回到 URL 清单定位是抓取、索引还是规范地址环节的问题,改完后重新模拟抓取一次,保留修改前后的对比记录。