@v0xium: LLM推理工程:嵌入模型详解 1. 嵌入模型将一段文本或任何其他……
摘要
本文解释了嵌入模型及其在LLM推理中的作用,涵盖架构、流量特征和量化等优化技术。
查看缓存全文
缓存时间: 2026/08/24 15:52
LLM 推理工程:嵌入模型详解
-
嵌入模型(EM)将文本或其他任何模态的数据转换为固定长度的向量,该向量能捕获输入的语义含义/上下文。
-
一旦我们获得表征向量,就可以使用简单的向量数学来计算它们之间的距离。这就是为什么这些模型可用于构建智能体记忆、RAG 应用、搜索和推荐系统。
-
嵌入模型有两种流量特征:
- 高吞吐量回填:大规模批量操作,如索引数百万文档、为LLM训练准备数据等。
- 低延迟查询:用户进行搜索、检索、推荐等的查询。我们需要快速响应,因为每增加一毫秒都会影响用户体验。
-
嵌入模型的推理工程应首先提出一个问题:我们正在服务于哪种特征?例如,如果您需要同时支持两者且有足够的流量,可以为两种用途构建独立的系统。
-
大多数嵌入模型使用以下两种架构之一。两者都基于 Transformer:
- BERT 式:仅编码器神经网络。
- 基于 LLM:现代语言模型,但被重新用于生成嵌入。
-
BERT 式模型仍用于简单、对延迟敏感的任务,如分类。但大部分使用的是基于 LLM 的模型。
-
它们在速度和质量之间各有取舍。输出向量的大小,或嵌入维度,会影响这一点。
-
维度主要不影响推理时间,但会影响嵌入模型系统的存储、检索和距离计算时间。
-
在大多数情况下,一个嵌入模型生成的向量无法与另一个嵌入模型的向量进行比较。
-
推理性能的提升也可能来自量化。对较大的嵌入模型使用 FP8 量化,可在质量损失最小的情况下提升性能。
-
要检查嵌入模型量化后的质量,您可以将输入分别通过原始和量化版本,然后检查两个输出向量的余弦相似度。99% 的相似度表明量化效果良好。
(完)
以上是阅读 Philip Kiely 所著《推理工程》一书时整理的笔记集。更多文章即将推出。
图片来源:选择嵌入模型,Pinecone。
相似文章
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.
嵌入模型的两难:LLMs更优,但代价如何?
本文比较了LLMs和嵌入模型在37个任务上的表现,发现尽管总体性能相似,但嵌入模型更便宜且更快,支持分工以提高成本效率。
@CamilleRoux: 对LLMs内部工作原理的精彩解释:tokens、embeddings、positional encoding、attention、feed-forward…
这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。
基于LLM的嵌入用于程序分析与优化
本文介绍了LLMCompiler(一个在IR代码上大规模预训练的LLM)产生的程序嵌入在程序分析和优化任务中的首次应用,在算法分类中实现了1.54%的错误率,并在异构设备映射上取得了有竞争力的准确率。
大型语言模型是如何工作的(26分钟阅读)
详细讲解基于Transformer的大型语言模型的工作原理,涵盖分词、嵌入、注意力机制和下一个词元预测,无需复杂数学。