系列

NLP 与 LLM 基础

一条面向研究和实践的路线:tokenization、embeddings、seq2seq、attention、Transformers、fine-tuning、PEFT、prompting 和 NLP/LLM evaluation。

这个系列为什么更像你

它不是普通 NLP 教程,而是把每个基础概念都连接到 multilingual AI、domain MT、LoRA/PEFT、RAG 和 evaluation。

概念主线

Jurafsky & Martin、CS224N 和 Illustrated Transformer 提供概念骨架。

实践主线

Hugging Face Course、Transformers、Tokenizers、Evaluate 和 PEFT 提供实现方式。

研究连接

MT、多语、LoRA、COMET 和 LLM failure modes 连接到你的研究身份。

从语言变成模型输入的地方开始。

Tokenization 是一个安静但关键的第一决定,它塑造了多语模型能学到什么。