批量出现百度不收录时,不要逐条URL翻日志。更有效的做法是:先确定“收录”的验收口径,再把URL按来源、模板、目录、发布时间分层,从每层随机抽取少量样本,用抓取、索引、内容三类证据交叉判断,最后把结论回推到整批。抽样不是为了证明全部URL都有问题,而是为了用最小成本判断问题集中在哪一层、是否值得全量处理。
“百度不收录”在实际排查中至少对应三种不同状态,抽样前必须统一:
site:查询不到该URL,但页面可正常访问,属于未展现或未索引;这三种状态的下一步动作完全不同。如果团队内部对“不收录”的定义不一致,抽样出来的样本会混在一起,结论也会失真。可执行的验收标准是:每个样本URL都要记录“是否被抓取”“是否可索引”“是否有展现”三个字段,缺一项就不算完成定位。
批量URL通常不是同质的。直接随机抽全部URL,容易抽到大量首页、栏目页,掩盖真正的问题模板。建议按以下维度分层,每层至少抽5到10条,样本总量控制在30到50条即可:
分层后优先抽“同一模板下表现差异大”的URL。如果同一模板有的收录、有的不收录,问题更可能出在单页内容或内部链接,而不是模板本身;如果同一模板全部不收录,才需要检查模板级的robots、canonical、渲染方式或状态码。
每个样本URL至少采集以下检查项,并记录判断结果:
把这些字段做成一张表,按层汇总。若某一层中超过半数样本都出现同一项异常,例如canonical全部指向列表页,就可以把该原因列为“已定位的原因”;若只是个别样本异常,只能列为“可能原因”,不能直接下结论。
抽样定位后通常面临两种处理方案,选择依据不是感觉,而是样本证据:
方案一:先修模板,再全量重提。适用条件是同一模板下多数样本都出现相同异常,例如模板级noindex、canonical错误、JS渲染后正文为空。此时逐条改URL没有意义,应先修模板,再重新提交站点地图并观察抓取。验收标准是:修复后新样本能被抓取,且抓取到的HTML包含正文。
方案二:先处理单页,再观察模板。适用条件是同一模板下只有少数样本不收录,多数样本正常。此时问题更可能来自单页内容质量、内部链接深度或重复内容。可先修这些单页,记录修改日期,两周后复查同一批样本是否被抓取或展现。验收标准是:修改后的样本出现抓取记录,或site:查询出现结果。若仍无变化,再升级为模板级排查。
两种方案的分界点是“同一模板内异常样本占比”。占比高选方案一,占比低选方案二。这个比例来自抽样表,不来自主观判断。
如果要把这件事交给团队执行,交付结果应包含:一份分层抽样表、每层异常原因汇总、选定方案及依据、修复后的复查日期。对应需要的资料是:服务器访问日志、百度搜索资源平台的抓取与索引数据、URL清单、模板与路由配置。责任划分上,技术负责状态码、robots、canonical和渲染;内容负责正文质量与重复度;SEO负责抽样设计、证据汇总和复查。验收时不看“提交了多少URL”,而看“样本中抓取率或展现率是否发生变化”。
下一步可以直接从现有URL清单里按模板和目录各抽10条,填入抓取、可索引、展现三个字段,先跑一轮分层抽样表。表出来后,再决定是修模板还是修单页。