· Xiaojing Yang · Statistics · 4 min read

EN

正则化:L1 和 L2 背后的统计思想

正则化通过约束参数,让模型复杂度不至于吞掉泛化能力。

核心观点

正则化是在说:除非数据强烈支持,否则优先选择更简单的解释。

1. 过拟合问题

灵活模型可以把训练数据解释得“太好”。它可能学到了信号,也可能记住了噪声。正则化加入惩罚项,让过度复杂的参数设置变得昂贵。

正则化学习
训练损失
拟合观察数据
惩罚项
抑制复杂度
目标函数
loss + penalty
参数
偏好稳定取值
泛化
降低过拟合风险

2. L2 和 L1 直觉

L2 正则化平滑地惩罚大权重。L1 正则化可以把一些权重推向零,因此在简单模型里常用于特征选择。

方法惩罚直觉
L2 / Ridge权重平方和平滑缩小权重
L1 / Lasso权重绝对值和鼓励稀疏解

没有正则化

模型可能追逐训练集里的每个细节。

有正则化

模型必须用足够证据证明复杂性值得。

3. 深度学习连接

在神经网络里,weight decay 和 L2 风格的正则化关系很近。Dropout、early stopping、data augmentation 也有正则化效果,只是机制不同。

4. AI/NLP 例子

在小规模领域数据上 fine-tune 语言模型时,full fine-tuning 很容易过拟合。LoRA 这类参数高效方法不等同于经典正则化,但它们有相似的实际目标:在限制变化范围的同时完成适配。

总结

正则化不是技巧,而是一种统计偏好:优先选择能泛化的模型,而不是只会记住训练集的模型。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.