· Xiaojing Yang · Statistics · 4 min read
EN效应量:显著不等于重要
统计显著的结果,仍然可能小到没有研究或应用意义。
核心观点
统计显著问“能不能检测到”,效应量问“到底重要不重要”。
1. 为什么这篇要放得很早
AI 论文经常关注一个模型是否超过另一个模型。但当测试集很大时,很小的提升也可能统计显著。下一步应该问:这个效果在研究或应用上真的重要吗?
分数相差多少?
噪声能否解释?
效果到底多大?
我们付出了什么代价?
是否值得强调?
2. 例子
Model A: 87.20 accuracy
Model B: 87.35 accuracy
difference: +0.15这个差异在巨大 benchmark 上可能可以被检测出来。但如果新模型成本翻倍、速度更慢、可解释性更差,或者在少数安全关键样本上更差,那么 headline improvement 远远不够。
3. AI/NLP 中的效应量问题
| 场景 | 效应量问题 |
|---|---|
| 分类 | 到底多修正了几个样本? |
| MT | BLEU/COMET 提升是否能在人类错误分析中看见? |
| RAG | 是否减少了 unsupported answers? |
| Bias evaluation | 差异是否有实际意义? |
| 系统 | 质量收益是否值得成本和延迟? |
指标提升
一个数字变了。
研究贡献
这个变化改变了系统能稳定做到什么。
4. 我会怎么写
比起“our method significantly improves performance”,我更喜欢:
这个提升在统计上可检测,但幅度较小;它的实际价值取决于术语错误减少是否对目标领域重要。
总结
效应量让统计检验重新连接到研究意义。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。