上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常抓到页面、页面没有被误设为“不索引”、站点能通过抓取工具看到真实响应。时间和人手有限时,优先处理 robots.txt、页面 meta 标签、sitemap 和服务器响应这四项,再抽查关键页面。
要查的是:robots.txt 里有没有 Disallow: / 这类禁止全部抓取的规则,以及是否误屏蔽了 CSS、JS 或图片目录。
怎么查:在浏览器地址栏输入你的域名加 /robots.txt,直接看返回内容;再用抓取测试工具请求首页和一篇内容页,观察是否被 robots 规则拦截。
结果说明:如果首页被抓取测试判定为“被 robots.txt 阻止”,搜索引擎就无法正常收录;如果只是屏蔽了后台或搜索参数页,属于正常配置,不影响前台内容索引。
要查的是:页面 <head> 里有没有 <meta name="robots" content="noindex">,以及 HTTP 响应头里有没有 X-Robots-Tag: noindex。
怎么查:打开几个代表性页面,用浏览器查看源代码,搜索 noindex;同时用抓取测试工具查看响应头。两个位置都要看,因为响应头优先级高于页面 meta。
结果说明:只要任一位置出现 noindex,该页面就不会进入索引。常见误操作是测试环境模板带着 noindex 上线,或者全站统一加了不索引标签,发布时没有移除。
要查的是:sitemap 文件能否正常打开、里面列出的 URL 是否都返回 200、是否混入了登录页或参数页。
怎么查:访问 /sitemap.xml,随机挑 5 到 10 条 URL 用抓取测试工具请求,看状态码和是否被 noindex。
结果说明:sitemap 本身不会保证收录,它只是提交入口。如果 sitemap 里混入被 robots 屏蔽或被 noindex 的页面,会浪费抓取配额,也会让索引状态报告出现大量“已排除”。
要查的是:首页和栏目页返回的状态码是 200 还是 301、302;带 www 和不带 www 是否统一;rel="canonical" 指向的地址是否和实际可访问地址一致。
怎么查:用抓取测试工具分别请求带 www、不带 www、http 和 https 四个版本,记录状态码和最终地址;再查看页面源代码里的 canonical 链接。
结果说明:如果多个版本都返回 200,会出现重复内容,搜索引擎需要自行判断哪个是主版本;如果 canonical 指向一个 404 或重定向地址,索引信号会混乱。正确做法是选定一个主域名,其余版本 301 过去。
按下面顺序做,通常能在半小时内覆盖最关键的风险点:
/robots.txt,确认没有 Disallow: /。noindex。/sitemap.xml,确认能打开且列出的是正式域名。这套清单适用于刚完成开发、准备绑定正式域名的站点。如果站点已经有大量内容,还应额外检查分页、筛选参数和旧域名重定向,但这些可以放在上线后第一周处理。
下一步:把上述检查结果记录成一张表,每项标注“通过”或“待改”,然后把待改项按是否影响全站排序,先处理影响首页和栏目页的问题,再处理单篇内容页。