· Xiaojing Yang · Statistics · 4 min read
ENPower Analysis:到底需要多少实验
Power analysis 连接样本量、效应大小,以及检测到真实提升的概率。
核心观点
Power analysis 问的是:实验规模是否足够检测到我们关心的效果?
1. 为什么 power 重要
不显著的结果可能表示没有效果,也可能表示实验太小,检测不到这个效果。Power analysis 帮助我们在花时间和算力之前区分这两种可能。
真实效果有多大
收集了多少证据
测量有多波动
检验有多严格
检测到效果的概率
2. AI 实验很贵
在 NLP 和 LLM evaluation 里,更多样本可能意味着更多人工标注、API 成本、推理时间或专家评审。Power analysis 是计划工具:它帮助判断一个实验是否值得运行。
太小
实验可能错过真正重要的效果。
足够大
实验有合理概率检测到目标效果。
3. 实用问法
不要只问“我需要多少样本”,而要问:
| 问题 | 例子 |
|---|---|
| 什么效果值得关注? | +1 COMET 或少 10 个严重错误 |
| 指标有多噪? | seed variation 或 item-level variance |
| 可接受的错误率是什么? | false positive 和 false negative |
| 预算是多少? | 标注和推理限制 |
4. AI/NLP 例子
如果 RAG evaluation 只有 50 个问题,它可能太弱,检测不到 groundedness 的小但有用提升。如果目标是把 unsupported answers 从 20% 降到 10%,所需样本量取决于置信要求和 power。
总结
Power analysis 让评估从“我们测了手上有的东西”,变成“我们设计了一个能回答问题的实验”。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。