· Xiaojing Yang · Statistics · 3 min read

EN

最大似然估计:模型为什么能学习参数

最大似然把概率模型和参数学习连接起来。

核心观点

MLE 选择的是让观察数据在模型下最“合理”的参数。

1. 核心问题

如果一个模型有参数,我们应该怎么选?最大似然估计的答案是:选择让观察数据在模型下概率最高的参数。

MLE 流程
模型族
带参数的概率故事
观察数据
我们看到了什么
似然
数据在参数下有多合理
优化
寻找最佳参数
拟合模型
用于预测或分析

2. 从概率到学习

很多 ML loss 本质上可以理解为 negative log-likelihood。分类任务里最小化 cross-entropy,可以看成最大化正确标签的似然。

似然视角

选择最能解释观察数据的参数。

损失视角

减少给真实标签低概率带来的惩罚。

3. AI/NLP 例子

语言模型训练模型给观察到的 token 序列高概率。next-token prediction loss 不只是工程技巧,它也是基于似然的学习目标。

4. 注意

MLE 依赖模型族和数据。如果数据有偏、噪声大或不代表真实任务,拟合出来的参数也会继承这些问题。

总结

MLE 是统计建模和 ML 训练之间的桥:学习就是找到让观察数据更可能的参数。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.