· Xiaojing Yang · Machine Learning · 3 min read

EN

过拟合与正则化

模型为什么会学到噪声,验证曲线如何暴露它,正则化如何控制它。

核心观点

过拟合是模型在训练样本上变得很优秀,却在样本外不可靠。

1. 直觉

模型应该学习可复用结构。过拟合意味着它还学到了训练集里的偶然细节:噪声、重复、标注习惯、数据集特有捷径。

过拟合曲线
太简单
训练误差和验证误差都高
有用复杂度
验证表现改善
太复杂
训练继续变好但验证变差

2. 正则化

正则化会抑制不必要复杂度。它可以是 L1/L2 惩罚、early stopping、dropout、data augmentation、pruning 或架构约束。

方法实际效果
L2 / weight decay让权重更小、更平滑
L1鼓励稀疏特征
Early stopping在记忆加深前停止
Dropout减少对单一路径的依赖
Data augmentation让捷径没那么有用

3. sklearn 例子

from sklearn.linear_model import LogisticRegression

model = LogisticRegression(C=0.1, penalty="l2", max_iter=1000)
model.fit(X_train, y_train)

在很多 scikit-learn 线性模型里,C 越小,正则化越强。

4. AI/NLP 连接

在小规模领域 NLP 数据中,过拟合可能意味着记住文档模板,或者记住同时出现在 train/validation 里的术语。对于 fine-tuning,正则化也意味着限制预训练模型被改动的程度。

面试回答

过拟合是模型学习了噪声或样本特有模式,导致泛化失败。

研究回答

我们用 held-out data、learning curves、seed variation 和领域错误分析来诊断它。

总结

正则化不只是数学惩罚,而是让模型必须“证明”复杂度值得。

面试回答模板

如果面试问到这个概念,我会分四层回答:

  1. 先给短定义;
  2. 再讲直觉;
  3. 指出常见失败模式;
  4. 最后连接到真实评估或部署决策。

参考资料

Share:
Back to Blog

Related Posts

View All Posts »