改版前保留搜索基础的核心,是把“旧页面已经积累的抓取、索引和排名信号”平稳转移到新页面,而不是等新站上线后再补救。时间和人手有限时,优先做三件事:盘点有搜索价值的旧URL、规划新旧URL的一对一映射、确保旧URL能返回可被识别跳转。下面这份清单按执行顺序排列,每项都说明查什么、怎么查、结果说明什么。
查什么:旧站中曾被搜索引擎收录、且能带来访问的页面清单。
怎么查:从服务器访问日志或统计工具中导出最近3个月有自然搜索流量的落地页;同时用site:查询和搜索引擎站长后台的索引报告,导出已收录URL。两批数据合并去重,得到候选清单。
结果说明什么:清单里的URL就是改版时必须保留或跳转的对象。没有流量也没有收录的页面,可以合并或删除,不必占用改版人力。如果两批数据差异很大,说明部分页面有排名但流量低,仍应保留跳转,因为排名信号可能尚未转化为点击。
查什么:每个旧URL在新站中对应的目标URL是否存在、内容是否对应。
怎么查:用表格列出旧URL、新URL、页面主题、处理方式四列。逐条打开新站对应页面,确认主题一致。栏目页对栏目页,文章页对文章页,不要把多个旧页面全部指向首页。
结果说明什么:如果新站没有对应内容,说明该页面在改版中被裁掉,需要决定是补建页面还是做最接近主题的跳转。批量指向首页会被搜索引擎视为软404,旧页面的排名信号难以转移。映射表完成后再动手改版,比上线后逐条排查省力得多。
查什么:旧URL返回的HTTP状态码,以及跳转是否直达最终目标。
怎么查:改版上线后,用curl -I或浏览器开发者工具逐个检查映射表中的旧URL,看返回的是301、302还是404。301表示永久跳转,适合改版场景;302是临时跳转,不适合长期替代。同时确认跳转链不超过一跳,避免A跳B、B再跳C。
结果说明什么:返回301且直达新URL,说明跳转配置正确。返回404说明旧URL已失效,搜索基础和用户都会丢失。返回302说明搜索引擎可能仍保留旧URL,信号转移不充分。跳转链过长会稀释传递效果,应改为直接跳转。
查什么:新站是否允许搜索引擎抓取,重要页面是否允许索引。
怎么查:查看robots.txt是否误屏蔽整站或关键目录;检查重要页面HTML中是否误加了<meta name="robots" content="noindex">;确认新站的导航和列表页能通过普通链接到达目标页面,而不是只靠JavaScript点击。
结果说明什么:如果robots.txt屏蔽了整站,搜索引擎无法抓取,跳转和内容都无从谈起。如果重要页面带noindex,页面即使被访问也不会进入索引。这两项属于改版上线前的必查项,出错时影响范围是整站级别的。
查什么:新URL是否被收录,旧URL是否逐渐被替换,自然搜索流量是否出现异常下跌。
怎么查:上线后第1周、第2周、第1个月分别记录:站长后台中新URL的提交与收录数量、旧URL的索引状态、自然搜索落地页和点击量。与改版前同期数据对比。
结果说明什么:新URL收录数稳步上升、旧URL逐步减少,属于正常替换过程。若新URL长期不被收录,回到第四步检查抓取和索引设置。若流量在跳转正确的前提下仍明显下跌,重点排查映射表是否有遗漏页面,以及新页面内容是否与旧页面主题偏离。
如果只能保留一项工作,优先保证有搜索流量的旧URL都能301跳转到主题一致的新URL。下一步是打开统计工具,导出最近3个月的自然搜索落地页,开始填映射表的第一列。