· Xiaojing Yang · NLP and LLMs · 3 min read
ENFine-Tuning Transformers
如何用监督数据把预训练语言模型适配到任务或领域。
核心观点
Fine-tuning 更新预训练模型,让通用语言知识变成任务特定行为。
1. 流程
Fine-tuning 从预训练 checkpoint 开始,准备数据集,tokenize 样本,定义标签或目标,用较小 learning rate 训练,并在 held-out data 上评估。
预训练模型
任务/领域样本
模型兼容输入
优化循环
held-out 指标和错误
2. 什么会变化
Full fine-tuning 会更新所有模型参数。它能力强,但在小而噪的数据上昂贵且有风险。
| 风险 | 为什么重要 |
|---|---|
| 过拟合 | 小领域数据可能被记住 |
| 灾难性遗忘 | 通用知识可能退化 |
| 成本 | GPU 显存和时间增加 |
| 评估泄漏 | benchmark 可能被过度调参 |
3. Hugging Face 实践
from transformers import TrainingArguments, Trainer
args = TrainingArguments(
output_dir="outputs",
learning_rate=2e-5,
per_device_train_batch_size=8,
num_train_epochs=3,
eval_strategy="epoch",
)
trainer = Trainer(model=model, args=args, train_dataset=train_ds, eval_dataset=val_ds, tokenizer=tokenizer)4. 我的研究连接
在领域 MT 里,fine-tuning 问的是:通用多语模型能否更好地适配石油领域 English—Norwegian translation,同时不丢失通用翻译能力?
好的 fine-tuning
清楚划分、稳定超参数、领域错误分析。
坏的 fine-tuning
隐藏大量试错,只挑一个好 checkpoint。
总结
Fine-tuning 是适配,但可信适配需要严肃评估。
面试回答模板
如果面试问到这个概念,我通常会这样回答:
- 用一句话定义;
- 解释数据如何流动;
- 指出主要失败模式;
- 连接到 evaluation、multilinguality 或 fine-tuning。
参考资料
- Hugging Face Course
- Hugging Face Transformers documentation
- Hugging Face tokenizer summary
- Hugging Face fine-tuning guide
- Hugging Face PEFT
- The Illustrated Transformer
- Speech and Language Processing, Jurafsky & Martin
- Stanford CS224N readings
- Attention Is All You Need
- COMET: A Neural Framework for MT Evaluation