先给结论:额度有限时,不要按“页面数量”平均分配查询,而要先确定这次查询要支持哪一个决策,再挑能改变该决策的最小样本。如果目标是判断整站是否存在系统性问题,优先抽模板相同、但业务角色不同的页面各若干条;如果目标是验证某个具体改动是否有效,优先抽改动前后可直接对照的同一组对象,而不是扩大范围。前者追求覆盖面,后者追求可比性,两者的抽样逻辑不能混用。
额度限制下最容易犯的错,是把“多查一些”当成“更有信息量”。实际上,样本的信息量取决于它能否排除其他解释。
判断标准很简单:如果换一批样本,结论可能完全相反,说明你选的是覆盖面样本;如果必须用同一批对象重复查才有意义,说明你选的是可比性样本。额度有限时,先确认自己属于哪一种,再决定怎么分配。
面向整站判断时,建议先列出站内实际存在的页面类型,例如首页、栏目页、详情页、聚合页、活动页。每类里再按业务价值分两层:核心变现页和辅助流量页。然后从每个交叉格子里抽一到三条。
这样做的理由是:不同模板的抓取、渲染和内容组织方式不同,混在一起查,异常会互相掩盖。分层之后,如果某一层普遍异常、其他层正常,问题范围就收窄到模板或该层特有的配置上;如果各层都异常,才需要往站点级因素上找。
实施动作:先查核心变现页的各模板样本。如果这批结果已经能解释你关心的决策,就不必再查辅助流量页;如果核心页正常而辅助页异常,再决定是否把剩余额度投到辅助层。这个顺序的作用是让每一批查询都可能提前结束判断,避免一开始就平均用完额度。
例外情况:如果站内某一类页面数量极少、且不承载主要业务,即使它表现异常,也不值得占用额度,除非它正好是你这次决策的对象。
面向具体改动时,样本量小不是问题,对象不稳定才是问题。正确做法是先固定一组对象和一组查询词,记录改动前的状态,改动生效并经过一段合理的观察期后,再用完全相同的对象和查询词查一次。
假设例子:某站只调整了十个详情页的标题写法。与其用剩余额度去查另外五十个页面,不如把这十个页面在改动前后各查一次,并额外保留两三个未改动的同类页面作为对照。如果改动组普遍变化、对照组基本不变,这个信号比“多查五十个页面”更有参考价值。这里的数字只是说明比较方法,不代表任何实际结果。
需要注意:观察期内如果同时上线了其他改动,比如换模板、改内链、调整栏目结构,那么即使结果出现变化,也无法单独归因到标题写法上。这种情况下,应把结论降级为“方向性参考”,并记录还有哪些变量在同时起作用,作为下一次抽样的约束条件。
额度有限时,人容易把某个指标的变化直接当成结论。以下几种情况需要多留一步:
处理办法是把这些现象记下来,作为下一轮抽样的线索,而不是直接写进结论。额度越少,越要把“待验证”和“已确认”分开记录。
按这个顺序执行,额度消耗通常集中在前两步,而这两步恰好是最可能改变判断的部分。如果第一批结果已经足以支撑决策,剩下的额度留着用于验证,比一次性用完更有价值。