From Abtest to Eval:当产品里开始跑大模型,决策证据链该怎么升级
作者:zhanbo · 2026-10-10 声明:本文为独立方法论沉淀,基于公开资料与个人实践整理,不代表任何雇主或客户观点;本工作室不承接游戏(含手游 / 休闲 / 中重度)行业相关咨询。 tl;dr 证据有等级:案例 → 观察 → 准实验 → 随机实验(AB)→ 系统综述,可信度逐层升高,成本也逐层升高。按决策的赌注大小选证据等级,而不是事事都开 AB。 大模型没有推翻金字塔,而是横切出两条线:Offline(Eval + 模拟,不占真实流量)产假设、筛候选;Online(AB,占真实流量)做因果裁决。 Eval 的本质只有两个动作:题库 + 专家标注。LLM-as-judge、模拟器都只是这两个动作的规模化替身,必须经人工校准。 标准发布链:离线 Eval 筛选 → 护栏评测 → 小流量 → 在线 AB 裁决 → 放量,trace 持续回流。 新地基是语义层 + Trace 仓库:一处定义口径,BI、Agent、Eval 三处消费。 一、证据金字塔:先分清"这个结论有多不可能是假的" 证据金字塔来自循证医学,衡量的是内部有效性——这个"有效"的结论有多可信。 L4 系统综述 / 知识收敛 ← 跨研究合并,等级最高 L3 随机对照实验(AB / RCT) ← 随机化消除混杂,因果识别最强 L2 准实验(DID/合成控制/Geo holdout…) L1 观察性研究(报表/相关/监控) L0 专家判断 / 单个案例 / 直觉 ← 最快、最便宜、最易偏 对业务团队,真正有用的不是记住五层名字,而是一条决策纪律: ...