· Xiaojing Yang · Statistics · 3 min read

EN

NLP 和 LLM 评估中的统计检验

一张面向 NLP、MT、RAG 和 LLM 评估的统计检验选择图。

核心观点

选择检验时,关键不是指标名字,而是比较结构。

1. 从比较结构开始

选择统计检验之前,先描述实验。两个系统是否在同一批样本上评估?标签是二分类、有序、连续,还是人工排序?是否涉及多个语言或领域?

选择图
是否同样本?
paired 或 unpaired
指标类型
binary、continuous、ranking
是否多重比较?
是否需要校正
是否有人类判断?
标注不确定性
结论
检验支持什么说法

2. 常见 NLP 场景

场景可用方法
MT 指标比较paired bootstrap 或 approximate randomization
分类 accuracyMcNemar 风格 paired logic 或 bootstrap
F1 / macro metrics对样本 bootstrap
人类偏好paired tests 或 hierarchical models
很多 prompts/modelsmultiple-comparison control

3. LLM evaluation 的复杂性

LLM evaluation 还会受到 prompt sensitivity、stochastic decoding、judge model、污染风险和题目难度影响。统计检验不能消除这些设计问题,它只能在给定协议下量化不确定性。

检验能回答

观察到的差异在这个协议下是否稳定?

检验不能单独回答

benchmark 是否有效、公平、足够贴近真实任务?

4. 报告模板

我会报告:

  • 指标分数;
  • 不确定性区间;
  • paired comparison 结果;
  • 效应量;
  • 按错误类别的分析;
  • benchmark 和 judge 的限制。

总结

好的 NLP/LLM 评估不是一个检验,而是一条证据链:指标、不确定性、配对比较、效应量和定性错误分析。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »