上线前核对抓取与索引配置,核心不是看页面能不能打开,而是确认三件事:爬虫能抓到、抓到的版本是你想被收录的、抓取后允许被索引。常见误解是“网站能访问就会被收录”,实际上抓取、索引、排名是三个独立阶段,任何一个环节被阻断,页面都可能长期不出现。
抓取指搜索引擎爬虫请求并下载页面内容;索引指搜索引擎把抓到的内容分析、存储,并允许它出现在搜索结果中。页面被抓取不等于被索引,被索引也不等于有排名。上线前要分别检查这两道关口,而不是只看服务器返回 200。
常见阻断点包括:robots.txt 禁止抓取、页面返回 noindex、整站测试环境密码保护、主要导航用 JavaScript 渲染但爬虫拿不到内容。这些情况页面在浏览器里完全正常,但爬虫视角是空的或被拒绝的。
第一步,打开浏览器访问 /robots.txt,确认没有误写 Disallow: / 这类全站禁止规则,也没有把正式目录写进禁止列表。测试阶段常用的屏蔽规则,上线时最容易忘记删除。
第二步,查看页面源代码,确认没有残留 <meta name="robots" content="noindex">。这种标签常由测试环境模板、SEO 插件默认设置或复制旧页面带来,肉眼看不到,但会直接阻止索引。
判断结果:以上任何一项不通过,先修复再提交,否则提交后仍可能不收录。
如果页面内容依赖 JavaScript 渲染,需要用爬虫视角检查实际返回的 HTML。方法是用浏览器开发者工具禁用 JavaScript 后刷新,或查看“查看网页源代码”而不是“检查元素”。如果源代码里没有正文、标题和主要链接,说明爬虫可能拿不到内容。
适用条件:内容型页面、电商详情页、依赖前端框架渲染的站点要重点查。判断结果:源代码中能看到核心文字和链接,才算抓取层面基本合格;只有渲染后才出现,则需要评估是否要做服务端渲染或预渲染。
/robots.txt,确认没有误封正式目录。假设某页面在站点地图中,但 robots.txt 禁止了该目录,那么提交也不会被抓取。此时应先改 robots.txt,再重新提交。这个顺序不能颠倒。
配置核对不是上线当天的单次动作。域名切换、CDN 缓存、模板更新都可能重新引入 noindex 或错误 canonical。建议在上线后一周内复查一次抽样页面,确认抓取和索引状态没有回退。下一步:先完成上面五步抽样检查,把不通过的项目列成修复清单,再决定是否提交站点地图。