· Xiaojing Yang · Statistics · 8 min read
EN为什么统计对 AI 研究很重要
统计不是公式集合,而是帮助我们理解 AI 实验不确定性、证据强度和模型评估可信度的思维工具。
核心观点
统计是我在面对 AI 实验结果时使用的一种判断语言:不是只问“分数是多少”,而是问“这个分数代表什么,它有多稳定?”
1. AI 实验充满不确定性
一个模型分数看起来很干净:
模型 A:61.48 BLEU
模型 B:60.92 BLEU但这个分数背后的实验并不“干净”。它会受到测试集、数据划分、随机种子、评估指标、数据分布,以及指标是否能看见关键错误等因素影响。
所以真正的问题不只是:
哪个模型分数更高?
而是:
这个分数能提供什么样的证据?
这个问题本质上就是统计问题。
2. 分数是一次观察,不是完整真相
在 AI 研究里,我们经常把 evaluation score 当成模型的固定属性。
但更准确地说,一个分数通常是从某个样本中观察到的结果。
更大的问题空间
任务空间的一次抽样
某个设置下的预测
一种测量规则
一个观察结果
如果测试集变了,分数可能会变。如果随机种子变了,分数可能会变。如果指标变了,模型排序也可能会变。
这不是说分数没用,而是说分数必须放在上下文里理解。
3. 统计帮助我们区分信号和噪声
一个非常重要的统计习惯是问:
这个差异真的足够大吗?还是可能只是随机波动?
假设两个翻译系统相差 0.3 BLEU。看起来模型 A 更好。但根据测试集大小和样本波动,这个差异可能并不可靠。
| 问题 | 统计工具 | AI 研究例子 |
|---|---|---|
| 分数可能波动多少? | 方差 / 标准误 | fine-tuning 的随机种子差异 |
| 可信范围在哪里? | 置信区间 | BLEU 或 COMET 区间 |
| 模型 A 是否可靠地更好? | 配对检验 / bootstrap | MT 系统比较 |
| 多次比较是否增加假阳性? | 多重比较校正 | 测试多个 prompts 或模型 |
| 效果是否有实际意义? | 效应量 | accuracy 提升是否值得关注 |
统计在这里不是装饰,而是防止我们被偶然结果骗到。
4. 数据分布是每个实验里的隐藏角色
模型不是在真空中运行的。它从一个分布中学习,又在另一个分布中被评估。
在领域机器翻译中,这一点非常具体:
通用网页数据
↓
通用多语言 MT 模型
↓
NPD 石油领域语料
↓
领域适配后的 MT 系统
↓
真实石油行业文档每一个箭头都可能引入 distribution shift。
在我的 English—Norwegian petroleum MT 项目里,关键问题不只是模型会不会翻译挪威语,而是它能不能处理石油领域术语、正式监管文本风格,以及高风险技术细节。
5. 指标是测量,不是现实本身
指标是工具,不是任务本身。
在机器翻译里,BLEU 衡量 n-gram overlap,chrF 衡量字符级相似度,COMET 估计语义质量,术语指标检查领域术语是否保留,人工评估可以发现自动指标漏掉的关键错误。
在 RAG 里,retrieval metrics 可能告诉我们证据是否进入候选集合,但不能直接说明最终答案是否真的 grounded。
在 bias evaluation 里,自动标签可以发现模式,但还需要人工验证和统计检验,才能避免过度声称。
指标
一种形式化测量规则。
证据
这个指标真正支持什么判断。
结论
我们被允许说到什么程度。
好的评估习惯,就是把这三层分清楚。
6. 统计让研究结论更诚实
没有统计意识时,我们很容易写出:
Our model is better.有统计意识时,结论会变得更精确:
在这个测试集和评估协议下,模型在 chrF 和 BLEU 上提升;
bootstrap 区间显示提升较稳定,但人工错误分析仍发现术语和严重性问题。第二种说法更长,但也更诚实,更像真正的研究结论。
7. 这个系列的路线图
| 部分 | 主题 | 目标 |
|---|---|---|
| Part I | 统计基础 | 建立 random variables、expectation、variance、distributions 的直觉。 |
| Part II | 不确定性与模型评估 | 用 confidence intervals、bootstrap、hypothesis testing 理解模型分数。 |
| Part III | 从统计到机器学习 | 把 regression 和 PCA 连接到 ML 模型、表示空间和评估。 |
总结
统计对 AI 研究重要,是因为 AI 实验不是只产生数字,而是要求我们判断这些数字意味着什么。
我希望这个系列训练的是一个习惯:
不要只问“分数是多少”,要问“是什么不确定性、数据分布、测量选择和证据结构产生了这个分数?”