嵌入模型的两难:LLMs更优,但代价如何?

Hugging Face Daily Papers 论文

摘要

本文比较了LLMs和嵌入模型在37个任务上的表现,发现尽管总体性能相似,但嵌入模型更便宜且更快,支持分工以提高成本效率。

您是否应该用大语言模型替换您的文本嵌入管道?我们通过一项受控且考虑成本的比较研究来回答这个问题,比较了六个家族的十个LLMs和26个嵌入模型(参数范围从118M到14B)在37个任务上的表现,任务涵盖分类、语义文本相似度(STS)、聚类、配对分类和检索。总体而言,两种范式实际上不相上下:最佳LLM(Gemini 3.1 Pro,77.6分)与最佳嵌入模型(77.2分)仅相差0.4分。它们的优势因任务而异:LLMs在推理密集型检索中领先,嵌入模型在分类中领先,而在聚类、STS和配对分类上两者持平。实现这种平衡代价高昂。LLM的成本最高可达同等质量嵌入模型的1,431倍(每次基准测试通过需154美元 vs. 0.11美元),且测试的开放LLMs在同一GPU上处理令牌的速度慢2.5到736倍。推理令牌占LLM推理成本的28%至81%;在我们的消融实验中,降低推理预算可以保持或提高大多数模型的检索质量。帕累托前沿包含领先的嵌入模型和一个LLM,即Gemini 3.1 Pro。这些结果支持分工:将嵌入模型用于相似性、分类和聚类,将LLMs保留用于推理密集型检索。我们的代码、数据集和结果可在https://github.com/embeddings-benchmark/embedders-dilemma公开获取。
查看原文
查看缓存全文

缓存时间: 2026/08/21 20:11

论文页面 - 嵌入器的困境:LLM表现更优,但代价几何?

来源:https://huggingface.co/papers/2608.12875

摘要

大型语言模型与专用嵌入模型在各类任务中的总体表现近乎持平,但嵌入模型在成本与速度上具有显著优势,支持按任务类型进行分工协作。

是否应当用大语言模型替换你的文本嵌入流程?为此,我们进行了一项成本感知的对照比较:涵盖十大语言模型(跨六个系列)、26个嵌入模型(参数量从1.18亿到140亿),在分类、语义文本相似度、聚类、配对分类及检索等37项任务上展开评估。整体而言,两种范式表现相当:最优LLM(Gemini 3.1 Pro,得分77.6)与最优嵌入模型(得分77.2)仅相差0.4分。两者优势因任务而异:LLM在需要深度推理的检索任务中领先,嵌入模型在分类任务中占优,而在聚类、语义文本相似度和配对分类任务上表现持平。

达成这种性能对等的代价高昂。在同等质量基准下,LLM的单次基准测试成本最高可达嵌入模型的1431倍(154美元对比0.11美元)。在相同GPU上,被测试的开源LLM处理token的速度比嵌入模型慢2.5至736倍。推理token占LLM推理成本的28%至81%;在我们的消融实验中,降低推理预算能使大多数模型保持甚至提升检索质量。

帕累托前沿包含领先的嵌入模型和一个LLM(Gemini 3.1 Pro)。这些结果支持分工协作方案:使用嵌入模型处理相似度匹配、分类和聚类任务,将LLM保留用于需要深度推理的检索任务。我们的代码、数据集和结果已公开于 https://github.com/embeddings-benchmark/embedders-dilemma。

查看 arXiv 页面 (https://arxiv.org/abs/2608.12875)查看 PDF (https://arxiv.org/pdf/2608.12875)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.12875)

通过代理获取此论文:

hf papers read 2608.12875

若未安装最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。

引用此论文的 Spaces 0

暂无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.12875,可从本页面建立关联。

包含此论文的收藏夹 0

暂无收藏夹收录此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从本页面建立关联。

相似文章

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

arXiv cs.CL

This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.

基于LLM的嵌入用于程序分析与优化

arXiv cs.LG

本文介绍了LLMCompiler(一个在IR代码上大规模预训练的LLM)产生的程序嵌入在程序分析和优化任务中的首次应用,在算法分类中实现了1.54%的错误率,并在异构设备映射上取得了有竞争力的准确率。

大小真的重要吗?(LLMs vs. SLMs)

Reddit r/artificial

讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。