· Xiaojing Yang · NLP and LLMs · 3 min read
ENNLP 中的 Transformers
Transformers 如何组合 self-attention、feed-forward layers、residuals 和位置信息。
核心观点
Transformer 是一层层基于 attention 的表示更新。
1. 架构想法
Transformers 用 self-attention 和并行计算替代 recurrence。每一层都会利用序列信息更新 token representations。
输入向量
混合上下文信息
稳定更新
逐位置变换
重复
2. Encoder、decoder、encoder-decoder
| 类型 | 常见用途 |
|---|---|
| Encoder-only | 分类、NER、句向量 |
| Decoder-only | 语言建模、聊天、生成 |
| Encoder-decoder | 翻译、摘要、text-to-text tasks |
3. Hugging Face 实践
from transformers import AutoTokenizer, AutoModelForSequenceClassification
name = "distilbert-base-uncased"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModelForSequenceClassification.from_pretrained(name, num_labels=2)4. 我的研究连接
Transformers 是多语 encoder、MT 系统、COMET 类指标和 LoRA fine-tuning 的共同骨架。理解 block 有助于解释 adapter 插在哪里,以及为什么 tokenization 会影响后续一切。
工程视角
使用 pretrained checkpoints 和 task heads。
研究视角
追问架构支持什么表示、语言覆盖和适配机制。
总结
Transformers 不是一个模型,而是一种可复用的上下文表示和生成架构模式。
面试回答模板
如果面试问到这个概念,我通常会这样回答:
- 用一句话定义;
- 解释数据如何流动;
- 指出主要失败模式;
- 连接到 evaluation、multilinguality 或 fine-tuning。
参考资料
- Hugging Face Course
- Hugging Face Transformers documentation
- Hugging Face tokenizer summary
- Hugging Face fine-tuning guide
- Hugging Face PEFT
- The Illustrated Transformer
- Speech and Language Processing, Jurafsky & Martin
- Stanford CS224N readings
- Attention Is All You Need
- COMET: A Neural Framework for MT Evaluation