📝 相关文章

AI 能替你跑实验吗?能筛,不能定

副标题:从 RCT 到 s-RCT:把实验从「省着跑」变成「跑得值」 作者:zhanbo · 2026-08-21 声明:本文为独立行业观察,基于公开资料整理,不代表任何雇主或客户观点;本工作室不承接游戏(含手游 / 休闲 / 中重度)行业相关咨询。 tl;dr(3 条) 每个实验都有流量和时间成本,但是实验成功率却越来越低——s-RCT 用 AI agent 先模拟、先筛,把流量省给值得的实验。 Amazon 论文的实证:agent 模拟的原始方向信号偏弱(符号重合 0.70 没明显超过无信息基线),校准后才把误差降 77×——能筛,不能定。 实验效率的第一步不是换工具,是检查你的漏斗:历史实验库有没有、AI 会不会泛化假设、拟合指标建没建(回复「实验效率」拿诊断)。 一、开题:AI 能替我跑实验吗 「AI 能替我跑实验吗?」 增长团队最近被问得最多的,就是这个问题。 问的人手里通常攒着一叠实验报告:有的没跑完就被砍,有的跑完了结论是「无显著差异」。真正变成决策的,一个季度下来数得过来。 不是团队不努力。是实验这件事本身在变贵——每个实验都要真实流量、要排期、要工程师陪跑,而这些成本,一半花在了注定没结论的实验上。 另一面,想法的供给在爆炸。以前一周想三个实验,现在 AI 一天能给你三十个。流量和工期没变,候选池却大了十倍,实验成功率自然被稀释。这不是哪家公司的管理问题,是整个行业的漏斗问题。 二、从 RCT 到 s-RCT:效率的漏斗 实验效率的瓶颈,已经从「能不能跑」变成了「值不值得跑」。 过去十年,我们把 RCT 当作金标准:随机分组、真实流量、统计显著,一切都对。但金标准的前提是流量够、工期够、候选少。当候选变多、流量变贵,金标准就变成了奢侈品——不是不该用,是没那么多预算给每个想法都用一遍。 s-RCT(Simulated RCT,模拟随机对照试验)就是冲这个错配来的。Amazon 的两位研究者(Stefan Hut、Lorenzo Masoero,8/13 更新论文)提出:让 AI agent 拿着用户的「行为画像」和「干预描述」,在投入真实流量之前,先模拟一遍 A/B 结果,把明显没戏的候选筛掉。 把流程拆成四段: 历史实验库沉淀 → AI 泛化出假设 → AI 收敛掉弱候选 → 高价值的进真实 A/B 前两段是「库」和「生成」:历史实验库沉淀每次实验的结论,AI 从里面学模式、批量泛化出新假设。第三段是 s-RCT 的主场:agent 模拟结果,做候选的收敛和排序。第四段,只有排在前面的高价值候选,才拿到真实流量跑 RCT。 ...

2026年8月21日 · 1 分钟 · 165 字 · 展博

MMM 不是归因器:为什么你花几十万建的模型最后都进了抽屉

需求是"看清每笔预算",验收却是"这条 campaign 的 ROAS"——错配,是 MMM 项目死亡的第一推手。 作者:zhanbo · 2026-08-07 声明:本文为独立行业观察与通用测量方法论,基于公开资料整理,不代表任何雇主或客户观点;本工作室不承接游戏(含手游 / 休闲 / 中重度)行业相关咨询。 开篇:那笔进了抽屉的预算 “帮我看清每笔预算到底带来多少回报。” 这是几乎每个 CMO 找我时说的第一句话。同行(包括早年的我)下意识的反应都是:上 MMM(Marketing Mix Modeling,营销组合建模)。 三个月后,一份几十页的报告交付:边际 ROI 曲线、渠道贡献分解、最优预算分配建议。客户点头说"很有启发"。然后——报告进抽屉,预算照旧,明年再花几十万重做一遍。 这不是段子。这是过去十年营销分析行业最普遍的真实图景。MMM 项目交付率不低,采用率极低。 模型跑出来了,决策没发生。 问题不在模型,在我们用错了问题框。 一、五个典型死法:都死于同一类错配 把失败现象倒推,根因只有一类——期望与能力的错配。具体有五种姿势。 1. 期望错配(最大死因) 老板要的是"这条 campaign 的 ROAS 多少",MMM 给的是"品牌和效果整体怎么组合最优"。MMM 在周级聚合层跑回归,根本看不到单条 campaign。拿聚合模型去答用户级问题,等于拿望远镜看细胞——看不清,于是判"模型没用"。 2. 数据地基没打 建的是 spend(花费) 而非 impression(触达):MMM 的自变量应该是媒体权重,不是美元。CPM 一变,spend 和效果就错位,系数算反。 序列太短:稳健 MMM 要 104 周(两年)周级数据。很多团队跑 6 个月就建模,噪声吃掉信号。 共线性 / 无变异:所有渠道常年 always-on、同涨同跌、从不关停——模型在数学上无法识别各自系数,出来的数字纯靠先验,等于编。 3. 无校准(相关性当因果) MMM 系数是相关性。没有 geo holdout 实验当 ground truth,它就是"看起来科学的相关性幻觉"。Stella MMM 的基准很直白:未校准 MMM 前向预测精度 87%,用增量实验结果当贝叶斯先验回灌后到 95%——这 8 个点就是 CFO 信不信你的差别。 ...

2026年8月7日 · 2 分钟 · 341 字 · 展博
← 查看所有标签