@v0xium: LLM推理工程:嵌入模型详解 1. 嵌入模型将一段文本或任何其他……

X AI KOLs Timeline 新闻

摘要

本文解释了嵌入模型及其在LLM推理中的作用,涵盖架构、流量特征和量化等优化技术。

LLM推理工程:嵌入模型详解 1. 嵌入模型将一段文本或任何其他模态转换为固定长度的向量,该向量捕获输入的语义含义/上下文。 2. 一旦我们有了表示向量,就可以使用简单的向量数学比较它们之间的距离。这就是为什么这些模型可以用于构建智能体记忆、RAG应用、搜索和推荐系统。 3. 嵌入模型的流量特征有两种类型: - 高吞吐量回填:大规模批量操作,如索引数百万文档、为LLM训练准备数据等。 - 低延迟查询:用户的搜索、检索、推荐等查询。我们需要快速,因为每一毫秒的额外延迟都会影响用户体验。 4. 嵌入模型的推理工程应从一个问题开始:我们服务的是哪种特征?例如,如果需要同时支持两者且流量足够,可以为两种用途构建独立的系统。 5. 大多数嵌入模型使用这两种架构之一。两者都基于Transformer: - BERT风格:仅编码器神经网络。 - 基于LLM:现代语言模型,但被重新用于生成嵌入。 6. BERT风格模型仍用于简单、延迟敏感的任务,如分类。但主要使用的是基于LLM的模型。 7. 它们在速度和质量之间有自己的权衡。输出向量的大小,或嵌入维度,会影响这一点。 8. 维度主要不影响推理时间,但会影响嵌入模型系统的存储、检索和距离计算时间。 9. 在大多数情况下,一个嵌入模型的向量不能与另一个嵌入模型的向量进行比较。 10. 推理增益也可以来自量化。对于较大的嵌入模型,FP8提供了性能提升,质量损失最小。 11. 要检查量化后嵌入模型的质量,可以将输入通过原始版本和量化版本运行,并检查两个输出向量的余弦相似度。99%的相似度表示良好的量化。 (结束) 这是阅读Philip Kiely所著《Inference Engineering Book》时所做的笔记集合。更多文章即将推出。 图片来源:Choosing an Embedding Model, Pinecone。
查看原文
查看缓存全文

缓存时间: 2026/08/24 15:52

LLM 推理工程:嵌入模型详解

  1. 嵌入模型(EM)将文本或其他任何模态的数据转换为固定长度的向量,该向量能捕获输入的语义含义/上下文。

  2. 一旦我们获得表征向量,就可以使用简单的向量数学来计算它们之间的距离。这就是为什么这些模型可用于构建智能体记忆、RAG 应用、搜索和推荐系统。

  3. 嵌入模型有两种流量特征:

    • 高吞吐量回填:大规模批量操作,如索引数百万文档、为LLM训练准备数据等。
    • 低延迟查询:用户进行搜索、检索、推荐等的查询。我们需要快速响应,因为每增加一毫秒都会影响用户体验。
  4. 嵌入模型的推理工程应首先提出一个问题:我们正在服务于哪种特征?例如,如果您需要同时支持两者且有足够的流量,可以为两种用途构建独立的系统。

  5. 大多数嵌入模型使用以下两种架构之一。两者都基于 Transformer:

    • BERT 式:仅编码器神经网络。
    • 基于 LLM:现代语言模型,但被重新用于生成嵌入。
  6. BERT 式模型仍用于简单、对延迟敏感的任务,如分类。但大部分使用的是基于 LLM 的模型。

  7. 它们在速度和质量之间各有取舍。输出向量的大小,或嵌入维度,会影响这一点。

  8. 维度主要不影响推理时间,但会影响嵌入模型系统的存储、检索和距离计算时间。

  9. 在大多数情况下,一个嵌入模型生成的向量无法与另一个嵌入模型的向量进行比较。

  10. 推理性能的提升也可能来自量化。对较大的嵌入模型使用 FP8 量化,可在质量损失最小的情况下提升性能。

  11. 要检查嵌入模型量化后的质量,您可以将输入分别通过原始和量化版本,然后检查两个输出向量的余弦相似度。99% 的相似度表明量化效果良好。

(完)

以上是阅读 Philip Kiely 所著《推理工程》一书时整理的笔记集。更多文章即将推出。

图片来源:选择嵌入模型,Pinecone。

相似文章

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

arXiv cs.CL

This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.

基于LLM的嵌入用于程序分析与优化

arXiv cs.LG

本文介绍了LLMCompiler(一个在IR代码上大规模预训练的LLM)产生的程序嵌入在程序分析和优化任务中的首次应用,在算法分类中实现了1.54%的错误率,并在异构设备映射上取得了有竞争力的准确率。