想象一下:你是一个产品经理,正在为两个新闻标题哪个点击率更高而争论。传统A/B测试需要分配流量、等待几天收集数据,而LLM几秒钟就能给出预测。省时省力,何乐而不为?但如果你真的用LLM预测直接代替用户行为,你很可能会做出错误决策。一项基于Upworthy数据集(包含数千个A/B测试的开源数据集)的研究使用gpt-4o-mini预测标题点击率,发现原始LLM预测只能恢复39%的真实处理效应——也就是说,LLM认为有效的标题,实际效果可能打对折。

Feature Image
Feature Image

这不仅仅是随机噪声,而是系统性偏差:LLM预测会衰减处理效应,使其趋向于零。这意味着,如果团队依赖LLM做A/B测试,会系统性地低估新功能对用户的价值,从而可能做出不发布正确决策。那么,问题出在哪?作者从生物统计学中的替代终点理论出发,形式化了LLM替代人类进行A/B测试必须满足的两个条件。

第一个是替代性(Surrogacy):要求LLM的预测完全中介了处理对人类结果的影响。换句话说,在已知LLM预测和基线特征后,用户被分配到哪个组(处理或对照)不再提供任何额外信息。通俗讲,就是LLM捕捉到了处理中所有影响人类响应的因素。这个条件通常被隐含假设,但很少被明确验证。

Surrogacy
Surrogacy

第二个是可比性(Comparability):要求LLM预测与人类结果之间的校准关系(calibration function)在新实验中与用于估计它的历史数据保持一致。如果处理变化导致LLM预测映射到人类行为的方式发生改变,校准就会失效。这个条件可以推广到要求处理前特征和LLM预测的联合分布在实验间稳定。

Comparability
Comparability

当两个条件都满足时,可以通过校准LLM输出来恢复人类处理效应。但校准方法很关键。作者在Upworthy数据上测试了两种方法:线性校准(普通最小二乘法)失败了——它过于刚性,无法捕捉LLM预测与人类行为之间的非线性关系,校准后的估计与人类基准相差3.8个标准误差。而机器学习模型(随机森林和梯度提升树)更灵活,校准后的估计落在人类效应的抽样误差范围内,没有统计显著差异。

sticky
sticky

此外,LLM预测本身有噪声(由于采样温度)。作者借鉴测量误差理论,提出对每个实验单元多次采样取平均,可以减轻噪声导致的偏差和方差增大。

sticky
sticky

但最根本的限制在于:替代性和可比性条件可以在历史数据上部分评估,但永远无法证明对新干预成立。一个新干预与过去测试的差异越大,信任LLM输出的基础就越弱。对于真正新颖的干预(如不同的UI范式、新的定价模型、从未发布过的功能),这些假设本质上是不可测试的。也就是说,LLM在A/B测试中带来最大收益的场景(快速评估全新想法)恰恰是它最不可能可靠的场景。因此,人类实验对于真正的产品创新仍然不可或缺。

那么,这个思路在哪些场景能直接用?对于结果简单(如点击率)、处理是文本且语言相似(如标题变体)的A/B测试,LLM经过校准后可能提供有价值的参考,尤其适合快速筛选大量候选方案。但要注意:校准需要足够的历史数据,且必须使用灵活的机器学习方法而非简单线性回归。更重要的是,永远不要用LLM替代对全新干预的测试——那些场景下,你无法验证关键假设,结果可能误导决策。一句话:LLM可以加速已知领域的迭代,但不能替代探索未知的勇气。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://engineering.atspotify.com/2026/8/when-can-llms-replace-humans-in-a-b-tests/