· Xiaojing Yang · NLP and LLMs · 3 min read

EN

词向量与句向量

离散语言如何变成向量空间,以及句向量为什么对检索和评估重要。

核心观点

Embedding 把符号文本变成几何对象,让模型可以比较、变换和检索。

1. 从词到向量

词是离散符号,神经模型需要数字。Embeddings 把 token、词、句子或文档映射到稠密向量空间,让相似性可以被计算。

Embedding 层级
Token embedding
一个模型 token
Word embedding
词汇意义
Sentence embedding
句子级语义
Document embedding
更长上下文
Retrieval
最近邻搜索

2. 为什么句向量不一样

词向量表示词项。句向量试图把上下文、句法、主题和意义压缩到一个向量里。这种压缩有用,但也会丢信息。

用途Embedding 层级
相似词word embeddings
语义搜索sentence/document embeddings
RAG 检索passage embeddings
MT 评估multilingual sentence representations

3. Hugging Face 实践

from transformers import AutoTokenizer, AutoModel

name = "sentence-transformers/all-MiniLM-L6-v2"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModel.from_pretrained(name)

4. 我的研究连接

Embeddings 直接连接 RAG、COMET 风格 MT evaluation、多语相似度和错误分析。在石油领域 MT 中,句向量可以帮助观察技术意义是否保留,即使表面措辞不同。

相似性视角

向量距离近,就被认为语义相关。

注意

Embedding similarity 可能漏掉事实 groundedness、领域术语和否定。

总结

Embedding 强大,是因为它让语言可以被测量;但测量永远不等于完整意义。

面试回答模板

如果面试问到这个概念,我通常会这样回答:

  1. 用一句话定义;
  2. 解释数据如何流动;
  3. 指出主要失败模式;
  4. 连接到 evaluation、multilinguality 或 fine-tuning。

参考资料

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsNLP and LLMsEN

Attention Mechanism

Attention as a learned way to decide what context matters for each token.

FoundationsNLP and LLMsEN

Fine-Tuning Transformers

How pretrained language models are adapted to a task or domain with supervised data.

FoundationsNLP and LLMsEN

LLM Evaluation and Failure Modes

A practical map of LLM evaluation risks: hallucination, prompt sensitivity, bias, contamination, and brittle benchmarks.

FoundationsNLP and LLMsEN

NLP Evaluation

Why NLP evaluation needs metrics, uncertainty, human judgment, and task-specific error analysis.