- 文档
- 教程
- 知识库
【免费下载链接】developer-roadmap
Interactive roadmaps, guides and other educational content to help developers grow in their careers.
在 developer-roadmap 项目的 AI Engineer 路线图中,Embedding Models 节点位于语义搜索、RAG(检索增强生成)与向量数据库等技术链路的起点:一切"让机器理解语义"的能力,最终都归结为把文本、图像等非结构化数据转成可计算的向量。读完本篇,你将掌握 Embedding 模型的核心定义、向量空间的数学基础、它在语义检索与 RAG 中的具体角色,以及托管 API 与开源模型两条落地路径的取舍方法。
什么是 Embedding 模型
Embedding 模型的核心任务,是把数据(如文本、图像)转换为数值化表示,这种表示被称为Embedding(嵌入向量)。路线图原文的定义将其拆解为三个要点:
- 输入可以是异构数据:文本、图像等不同类型的数据都能被转换为数值向量;
- 向量承载语义:转换得到的 Embedding 在向量空间中捕获了数据本身的语义含义(semantic meaning)以及数据之间的关系(relationships);
- 向量可被计算:一旦数据被表示为向量,就可以执行数学运算来判断相似性、聚类相关项,或者把向量直接喂给下游机器学习模型。
这与路线图中 Embeddings、What are Embeddings 等节点的表述互为印证:Embeddings 是数据在低维(相对原始输入而言)空间中的稠密(dense)、连续(continuous)向量表示,相似的数据项在向量空间中彼此靠近。例如,单词嵌入(word embeddings)能够基于词义与上下文表示单词,使模型理解同义词、类比等关系;同一机制被推广到句子、段落、图像乃至音频,支撑起语义搜索、推荐系统和聚类等任务。
与相关概念的关系
在 AI Engineer 路线图中,"Embedding" 一词出现在多个节点,含义各有侧重:
| 节点 | 侧重点 |
|---|---|
| Embedding Models(本文) | 生成 Embedding 的模型本身:输入数据 → 输出向量 |
| Embeddings | Embedding 作为数据表示:稠密连续向量的性质与用途 |
| Embedding(RAG 视角) | Embedding 在RAG 链路中衔接检索与生成的角色 |
| Sentence Transformers | 一类具体的 Embedding 模型:面向句子级语义的孪生网络方案 |
简言之:Embedding Models 是"生产者",Embeddings 是"产品",而语义搜索与 RAG 是"消费场景"。
向量空间:Embedding 为什么能表达语义
Embedding 模型把原始数据映射到一个高维向量空间,其核心特性是语义邻近性(semantic proximity):语义相近的数据项,其向量在空间中的距离也更近。这使得原本无法直接比较的非结构化数据,变成了可以用欧氏距离、余弦相似度(cosine similarity)等度量进行数值比较的对象。
路线图中 Performing Similarity Search 节点描述了这一过程的典型形态:
- 用户输入一个查询(一段文本或一张图片);
- 使用预训练模型(文本用 BERT 类模型,图像用神经网络)把查询转换为向量;
- 将该向量与存储在向量数据库中的既有 Embedding 逐一比较,找出最相似者。
由此,"判断两段文字是否相关"这一语义任务被转化为"计算两个向量是否接近"这一数值任务——这就是 Embedding 模型支撑大规模语义计算的底层原理。
从词嵌入到句子嵌入:模型的演进形态
传统词嵌入(word embeddings)为每个单词生成独立向量,但无法表达"同一个词在不同语境中的不同含义"。路线图 Sentence Transformers 节点指出:句子变换器(Sentence Transformers)是一类专门为整句语义设计 Embedding 的模型,它基于 BERT、RoBERTa 等 Transformer 架构构建,把整个句子编码为稠密向量,使语义相近的句子在向量空间中彼此靠近。其典型适用场景包括:
- 句子聚类:把语义相同/相近的句子聚合到同一分组;
- 语义搜索:用自然语言查询检索语义匹配的文档片段;
- 释义检测(paraphrase detection):判断两句话是否表达相同含义。
从词嵌入到句子嵌入的演进说明:Embedding 模型的质量上限,取决于它对"上下文语境"的建模能力。Transformer 架构的自注意力机制正是捕获这种上下文的计算基础。
语义搜索:Embedding 模型的第一大应用
路线图 Semantic Search 节点解释了 Embedding 在语义搜索中的核心价值:传统关键词搜索依赖字面匹配,而基于 Embedding 的语义搜索把查询与文档都转换为高维向量,比较的是"底层含义与上下文"而非"精确用词"。因此,即使查询与文档没有任何相同的关键词,只要语义相关,系统依然能够检索到它。
一个典型流程是:
- 索引阶段:用 Embedding 模型把知识库中的文档逐段编码为向量并入库;
- 查询阶段:用同一模型把用户查询编码为向量;
- 匹配阶段:在向量空间中检索与查询向量最接近的文档向量,按相似度排序返回。
这里强调"使用同一模型"至关重要——只有查询与文档被映射到同一个向量空间,向量距离比较才有意义;跨模型生成的向量通常不具备可比性。
RAG:Embedding 模型如何衔接检索与生成
在 RAG(Retrieval-Augmented Generation,检索增强生成)架构中,Embedding 是连接"信息检索"与"语言生成"两个环节的桥梁。路线图 Embedding(RAG 视角) 节点指出:
- 用户查询与文档都在同一共享向量空间中被表示为稠密向量;
- 系统基于向量相似度检索出与查询相关的信息;
- 检索到的信息被送入生成式模型(如 GPT 类模型),产出有外部知识支撑的回答。
这样做的收益在于:生成模型的输出被"锚定"在真实数据上,显著降低幻觉风险,使其在问答、摘要等需要可靠、最新信息的任务上表现更佳(见 RAG 节点)。
向量数据库:Embedding 的存储与检索底座
当知识库规模变大,逐条线性扫描向量不再可行。路线图 Vector Database 节点描述了向量数据库在 RAG 中的职责:存储文档、图像等知识源的向量表示,并在查询时高效检索最相似的 Embedding。查询到来时,系统把查询编码为向量,在向量数据库中找出最相关的文档片段,再交给生成模型。从源码结构看,AI Engineer 路线图在此环节并列列出了 Chroma、Pinecone、Qdrant、Weaviate、FAISS、LanceDB 等具体实现,它们与 Performing Similarity Search 节点共同构成"Embedding 生产 → 入库 → 检索"的完整工程闭环。
获取与使用 Embedding 模型的两条路径
从路线图内容看,实践中获取 Embedding 模型主要有两条路径:托管 API与开源/本地模型。
路径一:托管 Embedding API
托管服务把"训练与管理 Embedding 模型"的复杂性完全封装在服务端,开发者只需调用接口即可获得向量。路线图中明确列出:
- OpenAI Embeddings API:将文本转换为数值向量的直白接口,抽象掉训练与维护 Embedding 模型的复杂度,直接服务于语义搜索、聚类、相似度比较等任务;
- Gemini Embedding:支持把文本、图像或其他数据类型转换为向量,官方定位为付费/订阅制(proprietary)服务;
- 路线图中 Cohere 等模型服务商节点也与 Embedding 能力直接相关。
此类方案的优势是上手快、免运维;代价是需要支付 API 费用,且数据需经第三方服务处理(涉及数据隐私考量)。
路径二:开源与本地部署模型
对数据隐私敏感或追求低延迟的场景,可在本地运行开源 Embedding 模型。路线图中与之直接相关的节点包括:
- Sentence Transformers:基于 BERT/RoBERTa 的句子级语义模型生态,社区资源丰富,适合句子聚类、语义搜索与释义检测;
- Hugging Face 及 Models on Hugging Face:开源模型的分发与托管平台,可据此查找、下载与试用各类开源 Embedding 模型;
- Ollama、LM Studio 等本地模型运行工具,可降低本地部署门槛;
- 路线图另设 Closed vs Open-Source Models 节点,专门讨论闭源与开源模型的取舍。
选型与工程实践要点
结合路线图中多个节点的内容,选择与使用 Embedding 模型时建议关注以下维度(以下均为一般性工程经验,具体数值应以所选模型官方文档为准):
- 维度(dimensionality):向量维度影响存储开销与检索精度。低维度省存储、省计算,但可能损失表达能力;高维度表达力强,但需更大的向量数据库与更高的查询延迟。维度同时受托管 API 定价模式影响(部分服务按 token/请求计费)。
- 语义对齐:查询与文档必须使用同一个模型编码,才能保证向量可比;更换模型意味着需要全量重新索引。
- 输入长度与预处理:文档在编码前通常需要按模型支持的上下文长度切分(chunking),路线图 Chunking 节点对此有专门讲解——切分粒度直接影响检索质量。
- 成本与隐私:托管 API 便捷但按量付费,且数据出境;开源/本地模型免费、可控,但需要 GPU 与运维投入。
- 检索效果验证:路线图 Ragas、Deterministic Evals 等评估节点提示:Embedding 选型不应只凭主观感受,而应通过检索质量评测来量化对比。
在 AI Engineer 路线图中的学习位置
Embedding Models 节点处于 AI Engineer 路线图的中间层:向上衔接 How LLMs Work 等模型原理基础,向外辐射 Semantic Search、RAG、Vector Databases 等应用层主题。推荐的递进学习路径是:
- 先通过本文与 What are Embeddings 建立"语义 → 向量"的基本心智模型;
- 再通过 Sentence Transformers 与 Hugging Face 上手实际生成向量;
- 最后结合 Performing Similarity Search、Vector Database 与 RAG 完成一个端到端的语义检索或 RAG 应用。
这套链路正是当前 AI 工程领域最通用的实战组合:Embedding 模型把非结构化数据变成可计算的向量,向量数据库与相似度检索把它们组织成可查询的知识,生成模型再基于检索结果产出可信的回答。
- 文档
- 教程
- 知识库
【免费下载链接】developer-roadmap
Interactive roadmaps, guides and other educational content to help developers grow in their careers.
相关推荐
RAG 语义检索基石:向量嵌入(Embedding)原理、模型训练与选型实战
RAG 语义检索基石:向量嵌入(Embedding)原理、模型训练与选型实战 导读 向量嵌入(Embedding)是 RAG(检索增强生成)系统中“语义检索”环
教程人工智能大模型RAGEmbedding 策略实战:面向 RAG 与语义搜索的向量化选型、切分与优化指南
Embedding 策略实战:面向 RAG 与语义搜索的向量化选型、切分与优化指南 本指南以 embedding strategies 技能 https://l
AI 插件AI 技能开发工具深度解析DeepSeek4j:Java向量化模型全链路集成与工程实践
深度解析DeepSeek4j:Java向量化模型全链路集成与工程实践 引言:大模型时代的向量计算痛点与解决方案 在企业级AI应用开发中,向量化(Embeddin
人工智能大模型AI 应用
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考