作者:zhanbo · 2026-10-10

声明:本文为独立方法论沉淀,基于公开资料与个人实践整理,不代表任何雇主或客户观点;本工作室不承接游戏(含手游 / 休闲 / 中重度)行业相关咨询。


tl;dr

  1. 证据有等级:案例 → 观察 → 准实验 → 随机实验(AB)→ 系统综述,可信度逐层升高,成本也逐层升高。按决策的赌注大小选证据等级,而不是事事都开 AB。
  2. 大模型没有推翻金字塔,而是横切出两条线:Offline(Eval + 模拟,不占真实流量)产假设、筛候选;Online(AB,占真实流量)做因果裁决。
  3. Eval 的本质只有两个动作:题库 + 专家标注。LLM-as-judge、模拟器都只是这两个动作的规模化替身,必须经人工校准。
  4. 标准发布链:离线 Eval 筛选 → 护栏评测 → 小流量 → 在线 AB 裁决 → 放量,trace 持续回流。
  5. 新地基是语义层 + Trace 仓库:一处定义口径,BI、Agent、Eval 三处消费。

一、证据金字塔:先分清"这个结论有多不可能是假的"

证据金字塔来自循证医学,衡量的是内部有效性——这个"有效"的结论有多可信。

L4  系统综述 / 知识收敛        ← 跨研究合并,等级最高
L3  随机对照实验(AB / RCT)    ← 随机化消除混杂,因果识别最强
L2  准实验(DID/合成控制/Geo holdout…)
L1  观察性研究(报表/相关/监控)
L0  专家判断 / 单个案例 / 直觉  ← 最快、最便宜、最易偏

对业务团队,真正有用的不是记住五层名字,而是一条决策纪律:

小决策用快证据,大预算、不可逆决策用强证据。

一个必须同时盯住的盲点:金字塔只保证"结论是不是真因果",不保证"换个场景还成立"(外部有效性)。在一个国家跑出来的显著 AB,放到另一个国家可能完全不成立。比给方法排座次更实用的产品动作,是给每条结论打上可信度标签(随机实验 > 准实验 > 观察 > 案例)。


二、横切一刀:Offline 线与 Online 线

产品里一旦开始跑大模型,垂直金字塔被横向切成两条线,分界是占不占真实流量。

  L4  实验知识库
  L3  AB / RCT                          ← ONLINE:占真实流量
  L2  准实验
  L1  报表 / 监控
  L0  案例 / 专家判断
  ───────────────────────────────────────
  OFFLINE(不占真实流量,产"待检验假设")
     · Eval:题库 / LLM-as-judge / 人工标注 / red-team
     · Simulation:用户模拟器、领域环境、合成场景
Offline(Eval + 模拟)Online(AB)
产出候选方案 + 待检验假设因果结论 + 业务决策
回答哪个值得上、可能多好它真的让业务变好没有
优势快、便宜、零业务风险、可批量覆盖长尾因果识别最强、来自真实用户总体
风险sim-to-real gap、judge 偏差慢、贵、有护栏风险

三句话记住关系:

  1. Offline 是假设发生器,Online 是假设裁决器。 Eval 说"这个模型更好",本质是一个假设,不是业务结论——它没碰过真实用户总体。
  2. 高风险改动,Offline 的假设必须再过一次 Online AB。
  3. 两线共用同一份语义层和证据登记库,否则 Eval 的"答对"和 AB 的"变好"口径都不一样,无法互相校准。

Offline 大胆假设、快速筛选;Online 小心求证、一锤定音。


三、Eval 的本质:题库 + 专家标注

剥掉所有工具外壳,Eval 只有两个核心动作:拿到一批输入(题库)、让人对输出做判定(标注)。各有两种形态,构成一个 2×2:

题库 \ 标注优劣选择(成对偏好)价值评判(rubric 原则判定)
Benchmark(标准基准)跑标准题集,比较版本通过率与排序按 Helpful / Honest / Harmless 等原则判定
Case 回放(真实 trace 回流)同一真实 query 切新旧模型,人工或 judge 选哪边更好真实 case 按 rubric 判正确性、安全性、高风险
  • Benchmark 跨团队可比,但容易被针对性优化、被训练集污染;
  • Case 回放贴合真实分布、天然抗污染,靠 trace 飞轮持续供给——越往后越该以私有 trace 题库为主。
  • LLM-as-judge 替代专家标注、模拟器替代真实 trace,都是"规模化替身":效率高,但有位置偏差、冗长偏差、自我偏好,必须先与人工标注做校准,不能反客为主。

Eval 自身也有一座小金字塔:人工校准过的 judge / golden set > 未校准 judge > 纯启发式;真实分布 > 合成分布。

三条容易被忽略的工程原则

  • 评测集也是采样:从生产分布(含长尾)抽样,就有抽样误差,通过率要带置信区间。
  • Trace 驱动:线上 bad case 回流补进评测集,形成飞轮。
  • 门禁化:关键维度 Eval 不过,禁止放量——Eval 是模型世界的质检流水线。

OpenAI、Anthropic、DeepMind、xAI 各自的题库组织、防污染方案(如 DeepMind 双盲密码盒)、以及"专家可以在跑分上涨时仍否决上线"的通道,完整对标表较长,放在后续文章展开。


四、标准证据链:一次模型改动的完整旅程

离线 Eval(题库/judge/模拟,筛候选)
   → 安全护栏 Eval(red-team、高危用例)
   → Canary / 小流量(工程稳定性)
   → 在线 AB(业务指标 + 护栏指标,因果裁决)
   → 放量推全
   → 线上持续 Eval + trace 回流(飞轮回到第一步)

排序 / 推荐类系统常在中间加 interleaving 做高灵敏度的在线快速筛选;存在单元间互相干扰的 marketplace / Agent 系统,会用 switchback(时间片随机)、聚类随机——这是 AB 在大模型时代自身的演进。

一个常见误读要校准:Eval 不是 AB 的子集式"延伸",更准确的说法是同一套实验统计思维在两个研究对象上的分叉——AB 用随机化识别"对用户行为的因果效果",Eval 离线测量"模型输出分布的质量"。两者共享采样、功效、置信区间、护栏、Winner’s Curse 这套思维,但回答的问题不同。


五、数据产品经理该建什么

层产品建设核心
L0–L1知识库、指标平台 / 语义层、BI、异常监控口径契约、SSoT、决策导向看板
L2因果工具包、增量测试、MMM假设 checklist、可信度标签
L3AB 平台分流质量、门禁、与语义层同源
L4实验知识库收录 null 结果、记录调节条件
新层Eval 平台(题库 / 标注 / judge / 门禁)rubric 管理、judge 人工校准、trace 回流
新层Trace 可观测trace 明细仓库、token / 成本 / 延迟 / 质量

最关键的一条:语义层同时是 BI 的口径源、Agent 的取数源、Eval 判定"答对没有"的标准答案源。一处定义,三处消费。 LLM 把取数和分析的边际成本打到接近零,反而让证据分级、口径治理、决策闭环这些能力更稀缺。


六、行动清单

  1. 盘现状:L0–L4 + Eval,每层标出"有产品 / 有运营 / 两者皆无",优先补"有工具无运营"那几层。
  2. 统一语义层,让 BI、AB、增量测试、Eval 引用同一份口径。
  3. 给所有结论加可信度标签。
  4. 建证据登记库,强制收录 null 结果,立项前强制检索历史实验。
  5. 有大模型业务的:先建最小 Eval 闭环(golden set + 一个经人工校准的 judge + CI 门禁 + trace 回流),再把"Eval 过 → AB 验"固化成发布流程。

下一步

如果你的团队正在把大模型接进产品,却不确定——现有数据口径能不能支撑 Eval、评测和 AB 该怎么分工、哪些环节正在用弱证据冒充强结论:

延伸阅读: