· Xiaojing Yang · Statistics · 3 min read
ENNLP 和 LLM 评估中的统计检验
一张面向 NLP、MT、RAG 和 LLM 评估的统计检验选择图。
核心观点
选择检验时,关键不是指标名字,而是比较结构。
1. 从比较结构开始
选择统计检验之前,先描述实验。两个系统是否在同一批样本上评估?标签是二分类、有序、连续,还是人工排序?是否涉及多个语言或领域?
paired 或 unpaired
binary、continuous、ranking
是否需要校正
标注不确定性
检验支持什么说法
2. 常见 NLP 场景
| 场景 | 可用方法 |
|---|---|
| MT 指标比较 | paired bootstrap 或 approximate randomization |
| 分类 accuracy | McNemar 风格 paired logic 或 bootstrap |
| F1 / macro metrics | 对样本 bootstrap |
| 人类偏好 | paired tests 或 hierarchical models |
| 很多 prompts/models | multiple-comparison control |
3. LLM evaluation 的复杂性
LLM evaluation 还会受到 prompt sensitivity、stochastic decoding、judge model、污染风险和题目难度影响。统计检验不能消除这些设计问题,它只能在给定协议下量化不确定性。
检验能回答
观察到的差异在这个协议下是否稳定?
检验不能单独回答
benchmark 是否有效、公平、足够贴近真实任务?
4. 报告模板
我会报告:
- 指标分数;
- 不确定性区间;
- paired comparison 结果;
- 效应量;
- 按错误类别的分析;
- benchmark 和 judge 的限制。
总结
好的 NLP/LLM 评估不是一个检验,而是一条证据链:指标、不确定性、配对比较、效应量和定性错误分析。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。