· Xiaojing Yang · Statistics · 3 min read

EN

多重比较:AI 实验中的隐藏问题

当我们测试很多模型、prompt、seed 和指标时,假阳性会比想象中更容易出现。

核心观点

比较次数越多,越容易偶然找到一个看起来赢了的结果。

1. 隐藏的比较膨胀

AI 实验通常包含很多比较:模型、checkpoint、prompt、数据集、随机种子、指标、子群体。即使每次检验的假阳性率都不高,整个实验也会积累很多“被骗”的机会。

比较在哪里膨胀
模型
A、B、C...
Prompts
模板和措辞
Seeds
训练随机性
指标
accuracy、F1、COMET...
子群体
领域、语言、用户群

2. 研究风险

如果我们在很多尝试之后只报告最好的结果,这个结果可能反映的是对随机性的搜索,而不是稳定提升。

报告里可见的

一个干净的胜出数字。

背后隐藏的

为了找到胜者做过很多比较。

3. AI/NLP 例子

Prompt engineering 特别容易受影响。如果我测试 40 个 prompt variant,然后只报告 dev set 上最好的一个,它可能只是适配了开发集的偶然特征。

4. 更好的习惯

习惯为什么有帮助
区分 dev 和 test防止最终测试集变成调参集
报告搜索空间让读者知道有多少次机会
必要时做校正控制假阳性
验证选出的方案检查 winner 是否泛化

总结

多重比较不是小技术细节,而是 AI 实验最容易无意中过度声称的原因之一。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.