· Xiaojing Yang · Statistics · 5 min read

EN

随机变量、期望和方差

从 AI 实验角度理解随机变量、期望和方差:分数为什么会波动,我们如何描述这种波动。

核心观点

随机变量的意义,是把“不确定的事情”变成可以计算、比较和建模的对象。

1. 核心想法

在 AI 研究里,很多量都不是固定事实。测试集 accuracy、翻译任务里的 BLEU、人工标注一致性、fine-tuning 之后的 loss、真实系统里的延迟,都会随着样本和实验条件变化。随机变量就是用一种严谨方式描述这种变化。

直觉图
结果
可能发生的一种情况
数值
给这个结果赋予的数字
分布
不同数值出现的规律
期望
长期平均中心
方差
围绕中心的波动

2. 期望是长期平均中心

期望不是对下一次观察的保证,而是在同一个生成过程下重复很多次之后的平均趋势。

E[X] = 每个数值 × 它出现的概率,然后求和

对于分类模型,如果我们从同一个总体中抽取很多个测试集,那么这些测试集分数的平均值,可以看成模型在这个总体上的期望表现。

3. 方差描述数字有多不稳定

两个模型可以有相同的平均分数,但稳定性完全不同。这对 NLP 很重要,因为测试集小、稀有现象多、领域术语密集、低资源语料噪声大时,分数可能明显波动。

低方差

分数集中在一个较窄范围内,单次分数更有代表性。

高方差

分数会随着样本或随机种子明显变化,不能过度解读一次结果。

4. AI/NLP 例子

假设你在 500 个句对上评估机器翻译模型。如果测试集里大多是短而普通的句子,BLEU 可能比较稳定。如果测试集包含石油领域术语、长法律句、噪声对齐,观察到的分数就可能强烈依赖具体抽到了哪些例子。

统计思维会提醒我:分数是一个过程中的一次观察,不是模型全部真实能力。

5. 常见误区

误区更好的习惯
只报告一个数字同时说明评估设置
忽略随机种子对不稳定训练记录 seed variation
把很小差异当成决定性结果问差异相对方差是否足够大
忘记总体说明数据集代表的真实任务是什么

总结

期望帮助我描述不确定量的中心,方差帮助我判断一次观察结果到底有多可靠。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatistics中文

为什么统计对 AI 研究很重要

统计不是公式集合,而是帮助我们理解 AI 实验不确定性、证据强度和模型评估可信度的思维工具。