作者:zhanbo · 2026-10-10
声明:本文为独立方法论沉淀,基于公开资料与个人实践整理,不代表任何雇主或客户观点;本工作室不承接游戏(含手游 / 休闲 / 中重度)行业相关咨询。
tl;dr
- 证据有等级:案例 → 观察 → 准实验 → 随机实验(AB)→ 系统综述,可信度逐层升高,成本也逐层升高。按决策的赌注大小选证据等级,而不是事事都开 AB。
- 大模型没有推翻金字塔,而是横切出两条线:Offline(Eval + 模拟,不占真实流量)产假设、筛候选;Online(AB,占真实流量)做因果裁决。
- Eval 的本质只有两个动作:题库 + 专家标注。LLM-as-judge、模拟器都只是这两个动作的规模化替身,必须经人工校准。
- 标准发布链:离线 Eval 筛选 → 护栏评测 → 小流量 → 在线 AB 裁决 → 放量,trace 持续回流。
- 新地基是语义层 + Trace 仓库:一处定义口径,BI、Agent、Eval 三处消费。
一、证据金字塔:先分清"这个结论有多不可能是假的"
证据金字塔来自循证医学,衡量的是内部有效性——这个"有效"的结论有多可信。
L4 系统综述 / 知识收敛 ← 跨研究合并,等级最高
L3 随机对照实验(AB / RCT) ← 随机化消除混杂,因果识别最强
L2 准实验(DID/合成控制/Geo holdout…)
L1 观察性研究(报表/相关/监控)
L0 专家判断 / 单个案例 / 直觉 ← 最快、最便宜、最易偏
对业务团队,真正有用的不是记住五层名字,而是一条决策纪律:
小决策用快证据,大预算、不可逆决策用强证据。
一个必须同时盯住的盲点:金字塔只保证"结论是不是真因果",不保证"换个场景还成立"(外部有效性)。在一个国家跑出来的显著 AB,放到另一个国家可能完全不成立。比给方法排座次更实用的产品动作,是给每条结论打上可信度标签(随机实验 > 准实验 > 观察 > 案例)。
二、横切一刀:Offline 线与 Online 线
产品里一旦开始跑大模型,垂直金字塔被横向切成两条线,分界是占不占真实流量。
L4 实验知识库
L3 AB / RCT ← ONLINE:占真实流量
L2 准实验
L1 报表 / 监控
L0 案例 / 专家判断
───────────────────────────────────────
OFFLINE(不占真实流量,产"待检验假设")
· Eval:题库 / LLM-as-judge / 人工标注 / red-team
· Simulation:用户模拟器、领域环境、合成场景
| Offline(Eval + 模拟) | Online(AB) | |
|---|---|---|
| 产出 | 候选方案 + 待检验假设 | 因果结论 + 业务决策 |
| 回答 | 哪个值得上、可能多好 | 它真的让业务变好没有 |
| 优势 | 快、便宜、零业务风险、可批量覆盖长尾 | 因果识别最强、来自真实用户总体 |
| 风险 | sim-to-real gap、judge 偏差 | 慢、贵、有护栏风险 |
三句话记住关系:
- Offline 是假设发生器,Online 是假设裁决器。 Eval 说"这个模型更好",本质是一个假设,不是业务结论——它没碰过真实用户总体。
- 高风险改动,Offline 的假设必须再过一次 Online AB。
- 两线共用同一份语义层和证据登记库,否则 Eval 的"答对"和 AB 的"变好"口径都不一样,无法互相校准。
Offline 大胆假设、快速筛选;Online 小心求证、一锤定音。
三、Eval 的本质:题库 + 专家标注
剥掉所有工具外壳,Eval 只有两个核心动作:拿到一批输入(题库)、让人对输出做判定(标注)。各有两种形态,构成一个 2×2:
| 题库 \ 标注 | 优劣选择(成对偏好) | 价值评判(rubric 原则判定) |
|---|---|---|
| Benchmark(标准基准) | 跑标准题集,比较版本通过率与排序 | 按 Helpful / Honest / Harmless 等原则判定 |
| Case 回放(真实 trace 回流) | 同一真实 query 切新旧模型,人工或 judge 选哪边更好 | 真实 case 按 rubric 判正确性、安全性、高风险 |
- Benchmark 跨团队可比,但容易被针对性优化、被训练集污染;
- Case 回放贴合真实分布、天然抗污染,靠 trace 飞轮持续供给——越往后越该以私有 trace 题库为主。
- LLM-as-judge 替代专家标注、模拟器替代真实 trace,都是"规模化替身":效率高,但有位置偏差、冗长偏差、自我偏好,必须先与人工标注做校准,不能反客为主。
Eval 自身也有一座小金字塔:人工校准过的 judge / golden set > 未校准 judge > 纯启发式;真实分布 > 合成分布。
三条容易被忽略的工程原则
- 评测集也是采样:从生产分布(含长尾)抽样,就有抽样误差,通过率要带置信区间。
- Trace 驱动:线上 bad case 回流补进评测集,形成飞轮。
- 门禁化:关键维度 Eval 不过,禁止放量——Eval 是模型世界的质检流水线。
OpenAI、Anthropic、DeepMind、xAI 各自的题库组织、防污染方案(如 DeepMind 双盲密码盒)、以及"专家可以在跑分上涨时仍否决上线"的通道,完整对标表较长,放在后续文章展开。
四、标准证据链:一次模型改动的完整旅程
离线 Eval(题库/judge/模拟,筛候选)
→ 安全护栏 Eval(red-team、高危用例)
→ Canary / 小流量(工程稳定性)
→ 在线 AB(业务指标 + 护栏指标,因果裁决)
→ 放量推全
→ 线上持续 Eval + trace 回流(飞轮回到第一步)
排序 / 推荐类系统常在中间加 interleaving 做高灵敏度的在线快速筛选;存在单元间互相干扰的 marketplace / Agent 系统,会用 switchback(时间片随机)、聚类随机——这是 AB 在大模型时代自身的演进。
一个常见误读要校准:Eval 不是 AB 的子集式"延伸",更准确的说法是同一套实验统计思维在两个研究对象上的分叉——AB 用随机化识别"对用户行为的因果效果",Eval 离线测量"模型输出分布的质量"。两者共享采样、功效、置信区间、护栏、Winner’s Curse 这套思维,但回答的问题不同。
五、数据产品经理该建什么
| 层 | 产品 | 建设核心 |
|---|---|---|
| L0–L1 | 知识库、指标平台 / 语义层、BI、异常监控 | 口径契约、SSoT、决策导向看板 |
| L2 | 因果工具包、增量测试、MMM | 假设 checklist、可信度标签 |
| L3 | AB 平台 | 分流质量、门禁、与语义层同源 |
| L4 | 实验知识库 | 收录 null 结果、记录调节条件 |
| 新层 | Eval 平台(题库 / 标注 / judge / 门禁) | rubric 管理、judge 人工校准、trace 回流 |
| 新层 | Trace 可观测 | trace 明细仓库、token / 成本 / 延迟 / 质量 |
最关键的一条:语义层同时是 BI 的口径源、Agent 的取数源、Eval 判定"答对没有"的标准答案源。一处定义,三处消费。 LLM 把取数和分析的边际成本打到接近零,反而让证据分级、口径治理、决策闭环这些能力更稀缺。
六、行动清单
- 盘现状:L0–L4 + Eval,每层标出"有产品 / 有运营 / 两者皆无",优先补"有工具无运营"那几层。
- 统一语义层,让 BI、AB、增量测试、Eval 引用同一份口径。
- 给所有结论加可信度标签。
- 建证据登记库,强制收录 null 结果,立项前强制检索历史实验。
- 有大模型业务的:先建最小 Eval 闭环(golden set + 一个经人工校准的 judge + CI 门禁 + trace 回流),再把"Eval 过 → AB 验"固化成发布流程。
下一步
如果你的团队正在把大模型接进产品,却不确定——现有数据口径能不能支撑 Eval、评测和 AB 该怎么分工、哪些环节正在用弱证据冒充强结论:
延伸阅读: