· Xiaojing Yang · Statistics · 5 min read
EN机器学习中的概率分布
概率分布不是抽象曲线,而是关于数据、标签、误差和模型行为的假设。
核心观点
分布是一种压缩叙事:哪些值可能出现,它们分别有多可能。
1. 为什么分布重要
机器学习里到处都是分布假设,即使我们没有明确说出来。分类任务假设标签来自某种过程;回归任务假设误差有结构;语言模型学习 token 的概率分布;检索系统面对的 query 分布也会随时间变化。
样本长什么样
结果如何生成
预测如何偏离
哪些参数值更合理
评估结果如何波动
2. 离散分布和连续分布
离散分布描述可数结果,比如 token ID、类别标签、某个 retrieval result 是否相关。连续分布描述连续量,比如 embedding 维度、延迟、loss、标注时间。
| 分布 | 直觉 | AI 例子 |
|---|---|---|
| Bernoulli | 是/否事件 | 预测正确或错误 |
| Binomial | 成功次数 | N 个样本里答对几个 |
| Categorical | 多类别之一 | 情感类别或下一个 token |
| Normal | 围绕中心的噪声测量 | 重复评估得到的指标 |
| Long-tailed | 大量稀有事件 | 词频、领域、用户查询 |
3. 隐藏风险:真实数据经常不整齐
文本数据很少真的“像正态分布一样干净”。token frequency 是长尾的,领域分布是不均匀的,标注错误也不一定独立。一个 benchmark 可能包含很多简单样本,却低估少数但重要的失败类型。
所以分布思维不只是数学,它也是诊断工具:哪些样本常见?哪些样本稀有?训练、测试、部署之间发生了什么变化?
公式视角
分布给出概率或密度。
研究视角
分布告诉我们实验实际上从哪里抽样。
4. AI/NLP 例子
在领域机器翻译里,通用网页文本和石油监管文件来自不同分布。模型可能学会了常见语言模式,但测试领域包含大量不常见技术短语。一个模型可以在大分布上看起来很强,却在真正重要的长尾案例上失败。
总结
分布帮助我不把数据看成中性的样本堆,而是追问:这个数据集代表哪个世界?模型之后会面对哪个世界?
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。