先查实施,但只在你能拿到一条独立于该试验本身的执行证据时才成立;如果试验改动没有任何可回看的中间记录,先改结论反而更省时间,因为继续追实施只会把不确定性拖长。
把“检查试验是否真正实施”和“直接判定结论无效”当成两条路,它们的适用条件并不对称。
选择的分界不是“效果差多少”,而是“是否存在一条不依赖试验结果就能判断执行与否的证据”。有,就先查实施;没有,就先改结论并补上留痕机制。
一个常见反例是:改动确实上线了,但只覆盖了部分入口,而你的整体流量指标把未覆盖部分一起平均进去。这时“实施检查”会显示已执行,效果却依然被稀释,于是你先查实施的判断就失效了。
另一种反例是流量本身没动,但结构动了。假设某栏目改版后,总访问量持平,而该栏目的进入页会话下降、站内搜索使用上升。总量指标看不出变化,分渠道和分页面口径才看得出。若只看总量就改结论,会漏掉真实影响。
因此,检查实施之前要先确认一件事:你用来判断效果的指标,口径是否和改动的作用范围一致。口径不一致时,实施与否都无法从该指标读出。
不要依赖单一指标下判断。按下面顺序收集,每一步都能独立回答一个小问题:
如果第 2 步就发现覆盖范围小于预期,后面的数据不必再深挖,先解决覆盖问题。如果覆盖范围符合预期,而第 3 步的分组数据出现变化,说明改动生效,只是被总量掩盖。
假设某站把文章页的相关推荐从三条改成六条,预期停留时间上升。观察两周后全站平均停留时间几乎不变。
此时先查实施:确认模板是否只在新发布的文章上生效,旧文章是否仍走旧模板。若发现只有约一小部分页面用了新模板,那么全站平均值被大量旧页面拉平是合理解释,下一步应改为只统计新模板页面,而不是推翻推荐条数的假设。
若确认全部文章页都已生效,而新模板页面的停留时间同样没有变化,那么实施无误,结论应改为该改动在此场景下无效果,下一步转向其他变量。
把改动覆盖范围作为分组维度,重新取一次数。如果分组后出现与预期同向的变化,说明之前是口径问题,继续沿该方向做小步调整;如果分组后仍无变化,停止在该改动上追加投入,把资源转到下一个待验证变量,并为下次试验补上覆盖范围记录,让“是否真正实施”这一步以后能直接查证。