· Xiaojing Yang · Statistics · 3 min read
ENPCA:从方差到表示空间
PCA 连接了方差、投影和表示空间,是理解 embedding 与降维的重要入口。
核心观点
PCA 找到数据变化最大的方向,并把这些方向作为更简洁的表示。
1. 几何直觉
PCA 从一团点开始问:数据沿哪些方向变化最大?这些方向就是 principal components。
样本 × 特征
去掉均值
衡量共同变化
找到主要方向
用更少维度表示数据
2. 为什么方差重要
如果某个方向方差大,说明点在这个方向上分散得多。PCA 保留高方差方向,是因为这些方向在线性投影下保留更多结构。
原始空间
维度很多,通常很难观察。
PCA 空间
维度更少,保留主要变化。
3. AI/NLP 例子
Embedding 空间通常是高维的。PCA 可以把 word、sentence 或 document embeddings 投影到 2D/3D,用于观察 cluster、domain shift、outlier 和 artifact。它不能完全解释神经表示,但很适合作为探索工具。
4. 注意事项
| 注意 | 含义 |
|---|---|
| PCA 是线性的 | 可能看不见非线性结构 |
| 高方差不一定等于语义 | 频率或风格可能主导 |
| 可视化可能误导 | 2D 投影会丢信息 |
| scaling 很重要 | 特征尺度会改变 component |
总结
PCA 的价值在于把方差转化为表示。对 AI 研究来说,它常常是探索性镜头,不是最终证明。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。