· Xiaojing Yang · Statistics · 3 min read
EN多重比较:AI 实验中的隐藏问题
当我们测试很多模型、prompt、seed 和指标时,假阳性会比想象中更容易出现。
核心观点
比较次数越多,越容易偶然找到一个看起来赢了的结果。
1. 隐藏的比较膨胀
AI 实验通常包含很多比较:模型、checkpoint、prompt、数据集、随机种子、指标、子群体。即使每次检验的假阳性率都不高,整个实验也会积累很多“被骗”的机会。
A、B、C...
模板和措辞
训练随机性
accuracy、F1、COMET...
领域、语言、用户群
2. 研究风险
如果我们在很多尝试之后只报告最好的结果,这个结果可能反映的是对随机性的搜索,而不是稳定提升。
报告里可见的
一个干净的胜出数字。
背后隐藏的
为了找到胜者做过很多比较。
3. AI/NLP 例子
Prompt engineering 特别容易受影响。如果我测试 40 个 prompt variant,然后只报告 dev set 上最好的一个,它可能只是适配了开发集的偶然特征。
4. 更好的习惯
| 习惯 | 为什么有帮助 |
|---|---|
| 区分 dev 和 test | 防止最终测试集变成调参集 |
| 报告搜索空间 | 让读者知道有多少次机会 |
| 必要时做校正 | 控制假阳性 |
| 验证选出的方案 | 检查 winner 是否泛化 |
总结
多重比较不是小技术细节,而是 AI 实验最容易无意中过度声称的原因之一。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。