嵌入模型的两难:LLMs更优,但代价如何?
摘要
本文比较了LLMs和嵌入模型在37个任务上的表现,发现尽管总体性能相似,但嵌入模型更便宜且更快,支持分工以提高成本效率。
查看缓存全文
缓存时间: 2026/08/21 20:11
论文页面 - 嵌入器的困境:LLM表现更优,但代价几何?
来源:https://huggingface.co/papers/2608.12875
摘要
大型语言模型与专用嵌入模型在各类任务中的总体表现近乎持平,但嵌入模型在成本与速度上具有显著优势,支持按任务类型进行分工协作。
是否应当用大语言模型替换你的文本嵌入流程?为此,我们进行了一项成本感知的对照比较:涵盖十大语言模型(跨六个系列)、26个嵌入模型(参数量从1.18亿到140亿),在分类、语义文本相似度、聚类、配对分类及检索等37项任务上展开评估。整体而言,两种范式表现相当:最优LLM(Gemini 3.1 Pro,得分77.6)与最优嵌入模型(得分77.2)仅相差0.4分。两者优势因任务而异:LLM在需要深度推理的检索任务中领先,嵌入模型在分类任务中占优,而在聚类、语义文本相似度和配对分类任务上表现持平。
达成这种性能对等的代价高昂。在同等质量基准下,LLM的单次基准测试成本最高可达嵌入模型的1431倍(154美元对比0.11美元)。在相同GPU上,被测试的开源LLM处理token的速度比嵌入模型慢2.5至736倍。推理token占LLM推理成本的28%至81%;在我们的消融实验中,降低推理预算能使大多数模型保持甚至提升检索质量。
帕累托前沿包含领先的嵌入模型和一个LLM(Gemini 3.1 Pro)。这些结果支持分工协作方案:使用嵌入模型处理相似度匹配、分类和聚类任务,将LLM保留用于需要深度推理的检索任务。我们的代码、数据集和结果已公开于 https://github.com/embeddings-benchmark/embedders-dilemma。
查看 arXiv 页面 (https://arxiv.org/abs/2608.12875)查看 PDF (https://arxiv.org/pdf/2608.12875)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.12875)
通过代理获取此论文:
hf papers read 2608.12875
若未安装最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。
引用此论文的 Spaces 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。
包含此论文的收藏夹 0
暂无收藏夹收录此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从本页面建立关联。
相似文章
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.
基于LLM的嵌入用于程序分析与优化
本文介绍了LLMCompiler(一个在IR代码上大规模预训练的LLM)产生的程序嵌入在程序分析和优化任务中的首次应用,在算法分类中实现了1.54%的错误率,并在异构设备映射上取得了有竞争力的准确率。
如果你已经付费使用LLM服务,运行本地嵌入模型和重排序模型比运行本地LLM更有用
作者认为,对于已经订阅ChatGPT Pro等LLM服务的用户来说,为记忆系统运行本地嵌入模型和重排序模型比运行本地LLM更实用,并详细介绍了他们基于GBrain的配置。
大小真的重要吗?(LLMs vs. SLMs)
讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。