· Xiaojing Yang · Statistics · 4 min read

EN

作为统计模型的线性回归

线性回归不只是一条线,而是关于信号、噪声、假设和解释的统计模型。

核心观点

回归教会我们一个基本 ML 模式:预测 = 结构 + 噪声。

1. 不只是拟合一条线

线性回归常被讲成“给散点画一条最好的线”。这个直觉有用,但研究意义更深:回归把系统性结构和残差噪声区分开。

回归视角
特征
我们观察到什么
线性结构
带权组合
噪声
模型无法解释的部分
预测
估计结果
残差
关于模型拟合的证据

2. 模型

y = β0 + β1x1 + ... + βpxp + ε

系数描述的是在假设下的关系,残差则显示这个简单模型捕捉不到什么。

3. 为什么 AI 研究者仍然需要它

即使做深度模型,回归思维也到处出现:probing embeddings、分析错误因素、估计标注时间、测量 bias effect、建立 baseline。

作为预测器

用特征估计结果。

作为分析工具

问哪些变量解释了行为差异。

4. NLP 例子

假设我们用句长、术语密度、源语言、文档类型预测翻译错误率。回归模型不会替代神经机器翻译系统,但它能帮助我们发现哪些因素和错误相关。

5. 需要检查什么

检查为什么重要
残差模式暗示模型遗漏了结构
异常点稀有样本可能强烈影响拟合
共线性特征可能含义重叠
训练/测试划分拟合好不等于泛化好

总结

线性回归是小模型,但它训练的是大习惯:说明模型解释了什么,以及还没有解释什么。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.