抓取、索引、排名是三个先后不同、可以分别验证的环节。抓取是百度蜘蛛请求并读取页面;索引是百度把页面内容存入可供检索的库;排名是用户搜索某个词时,页面在结果中的位置。多人协作时,只要把“是否被抓取”“是否被索引”“是否排在前面”分开记录,就能减少把一种问题误判成另一种问题导致的返工。
准备阶段最重要的不是分配任务,而是统一证据口径。建议在交付文档里固定三列:抓取证据、索引证据、排名证据,每列只填可复核的现象。
这三列不能互相替代。日志里有蜘蛛,不等于页面被索引;页面能被搜到,不等于目标词有排名。把结论写进对应列,协作时就不会出现“明明收录了为什么没排名”和“根本没收录”混在一起讨论的情况。
排查顺序应当从前往后,不要跳步。第一步确认目标URL是否可被正常访问,返回状态码是否为200;如果是301或302,要确认跳转终点是否为希望参与检索的页面。第二步确认页面是否被robots协议或页面级meta robots设置为不允许抓取或不允许索引,这两类限制的影响范围不同,需要分别核对。第三步确认页面内容是否足够独立,如果多个URL输出几乎相同的正文和标题,可能被合并处理,表现为部分URL长期不出现在搜索结果中。
这里最关键的一步,是把“抓取失败”和“已抓取但未索引”分开记录。前者通常伴随日志中缺少请求或请求返回异常,后者往往能看到蜘蛛访问记录,但搜索中查不到该URL。两种现象对应的处理动作完全不同:前者优先解决可访问性和抓取限制,后者优先检查内容质量、重复度和页面是否值得独立保留。
假设有一个威海本地服务页面,日志显示百度蜘蛛三天内访问过该URL,返回200,但用URL限定在百度中查不到。这个例子中,抓取环节已经通过,问题落在索引环节,应继续检查内容是否与站内其他页面高度重复、标题是否唯一、页面是否有实际正文。若该页面能被搜到,但搜索“威海某类服务”时排在第三页,则抓取和索引都已通过,应转向排名环节,检查该查询词与页面主题是否匹配、标题和正文是否覆盖用户实际表达。
验证阶段要求同一现象能被第二个人复现。记录时写清查询词、查询时间、限定方式、观察到的结果,而不是只写“已收录”“没排名”这类结论。对于排名,还要注明是网页搜索结果还是其他类型结果,两者不能混为一谈。
可以用一个简单对照:同一页面在“site:”限定下能查到,说明索引环节大概率已通过;再用目标词搜索却找不到,说明问题在排名而非索引。反过来,限定查询也找不到该URL,同时日志中也没有蜘蛛请求,则应回到抓取环节。两种判断结果指向不同负责人,这正是分开记录的价值。
页面改版、更换模板、调整robots、合并栏目之后,三个环节都可能重新变化。维护时不必每天全量检查,可以按URL分组,对重点页面定期复查访问日志、索引状态和目标词位置,并保留每次变更前后的记录。这样出现波动时,能判断是抓取被阻断、索引被移除,还是排名正常浮动。
下一步,挑一个当前有疑问的URL,按抓取、索引、排名三列各填一条可复核证据,再决定由谁处理。三列填不满时,缺的那一列就是当前最该先解决的问题。