系列
NLP 与 LLM 基础
一条面向研究和实践的路线:tokenization、embeddings、seq2seq、attention、Transformers、fine-tuning、PEFT、prompting 和 NLP/LLM evaluation。
Part III
适配与交互
这个系列为什么更像你
它不是普通 NLP 教程,而是把每个基础概念都连接到 multilingual AI、domain MT、LoRA/PEFT、RAG 和 evaluation。
概念主线
Jurafsky & Martin、CS224N 和 Illustrated Transformer 提供概念骨架。
实践主线
Hugging Face Course、Transformers、Tokenizers、Evaluate 和 PEFT 提供实现方式。
研究连接
MT、多语、LoRA、COMET 和 LLM failure modes 连接到你的研究身份。
从语言变成模型输入的地方开始。
Tokenization 是一个安静但关键的第一决定,它塑造了多语模型能学到什么。