上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能顺利抓到页面、抓到的页面允许被索引、最终返回给爬虫的内容和用户看到的一致。做法不是凭感觉点几下,而是按清单逐项查证据:用抓取工具看返回状态,用robots与meta标签看放行规则,用规范化标记看重复页面归属,最后用真实URL验证。下面每项都给出查什么、怎么查、结果说明什么,适合在漳州网站开发项目交付前逐条走一遍。
要查什么:根目录robots.txt是否对爬虫放行了需要收录的页面,有没有误写Disallow: /,或者把栏目、产品、文章目录整段屏蔽。
怎么查:在浏览器直接打开你的域名/robots.txt,逐行看规则;再用搜索引擎站长平台自带的robots测试工具,输入一个真实内页URL,看它被判为允许还是阻止。
结果说明什么:如果测试结果显示“已阻止”,而该页本来希望被收录,就说明配置与目标冲突,需要改规则后重新测试。注意robots.txt只控制抓取,不控制索引,被阻止抓取的页面仍可能因外部链接被索引,所以它不能当作删除页面的手段。
要查什么:列表页、详情页、搜索结果页、分页、标签聚合页分别输出什么meta robots指令;每个页面是否指向正确的规范地址。
怎么查:在浏览器查看网页源代码,搜索meta name="robots"和link rel="canonical"。至少各抽一个列表页、一个详情页、一个分页对比。分页不要全部canonical到第一页,否则后续页内容可能不被单独处理。
结果说明什么:如果详情页出现noindex,说明模板默认值写错,需要按页面类型区分输出。如果canonical指向了不存在的地址或错误域名,说明规范化失效,搜索引擎可能选错展示版本。带参数的筛选页若内容重复,可考虑用canonical归并,而不是一律noindex。
要查什么:目标URL返回的是200还是3xx、4xx、5xx;是否存在多跳重定向;http到https、带www到不带www是否只保留一个版本。
怎么查:用命令行工具查看响应头,例如curl -I https://你的域名/路径,观察状态码和Location字段;连续请求几次,确认跳转链不超过一跳。批量页面可用站点抓取工具跑一遍,导出状态码列表。
结果说明什么:返回200说明页面可正常抓取。出现301且最终落到200,通常是域名统一配置,属于正常;但若链条超过两跳,会浪费抓取配额,应改为直接跳转。返回404说明链接或路由错误,返回5xx说明服务端异常,这两种都会阻碍收录,需要先修好再提交。
要查什么:爬虫拿到的HTML里是否包含正文、标题、主要链接;是否存在“用户看到内容、爬虫看到空壳”的差异;JavaScript渲染的内容能否被抓到。
怎么查:在浏览器禁用JavaScript后刷新页面,看正文是否还在;或用站长平台的抓取预览功能,查看返回的原始HTML。对比源代码中的标题、描述、正文与页面实际展示是否一致。
结果说明什么:如果原始HTML里没有正文,只有一段脚本,说明内容依赖客户端渲染,抓取和索引可能延迟或缺失,需要改为服务端渲染或预渲染。如果标题、描述与页面主题不符,说明模板变量取错,会影响搜索结果展示。
要查什么:选取首页、一个栏目页、一个详情页、一个分页,共四类URL,确认它们都能被抓取、被索引、返回正确规范地址。
怎么查:把四个URL逐一放进站长平台的URL检查工具,查看抓取状态、robots放行情况、canonical识别结果和索引状态。记录每项的判定,形成一份上线检查表。
结果说明什么:四项都显示可抓取、可索引、规范地址正确,说明基础配置达标,可以提交站点地图。若某一项异常,先修该模板,再重新抽样。提交站点地图不等于保证收录,它只是帮助发现URL,最终是否收录仍取决于页面质量和抓取预算。下一步建议把这份检查表固化为上线流程,每次改版或新增栏目后重跑一遍,避免配置回退。