通过证据校准的查询聚类捕捉LLM能力
摘要
本文提出了一种证据校准的查询聚类算法(ECC),该算法通过后验模型比较和Bradley-Terry建模,将语义嵌入与潜在LLM能力需求对齐,显著提高了LLM评估中能力排名的质量。
查看缓存全文
缓存时间: 2026/05/22 02:32
论文页面 - 通过证据校准的查询聚类捕捉LLM能力
来源: https://huggingface.co/papers/2605.17110
摘要
查询聚类算法ECC通过后验模型比较与Bradley-Terry建模,将语义嵌入与潜在能力需求对齐,从而改进LLM能力评估。
查询聚类(https://huggingface.co/papers?q=Query%20clustering)将查询组织成反映共享潜在能力需求(https://huggingface.co/papers?q=latent%20capability%20demands)的群组,实现能力感知的LLM评估。现有聚类方法主要依赖语义分类体系或嵌入,往往因表面语义与实际模型性能之间的错位而无法捕捉此类潜在能力需求。我们提出ECC算法,该算法利用有限的后验模型比较(https://huggingface.co/papers?q=posterior%20model%20comparisons)对先验语义嵌入(https://huggingface.co/papers?q=semantic%20embeddings)进行校准,弥合表面语义与潜在能力需求之间的鸿沟。ECC通过Bradley-Terry模型(https://huggingface.co/papers?q=Bradley-Terry%20model)参数化的能力特征描述每个聚类,并使用可训练的混合权重(https://huggingface.co/papers?q=trainable%20mixture%20weights)来适应具有混合能力需求的查询,共同学习一个灵活的能力感知聚类(https://huggingface.co/papers?q=capability-aware%20clustering)结构,支持对LLM能力进行查询特定的推断。广泛的定量和定性评估表明,ECC显著提升了LLM能力排名(https://huggingface.co/papers?q=LLM%20capability%20ranking)质量,平均分别超过基于人工标注和嵌入的基线方法17.64和18.02个百分点,并在查询路由(https://huggingface.co/papers?q=query%20routing)等下游任务中表现有效。
查看arXiv页面(https://arxiv.org/abs/2605.17110)查看PDF(https://arxiv.org/pdf/2605.17110)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17110)
引用本论文的模型0
无模型关联本论文
在模型README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
引用本论文的数据集0
无数据集关联本论文
在数据集README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
引用本论文的Space0
无Space关联本论文
在Space README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
包含本论文的收藏集0
无收藏集包含本论文
将本论文添加至收藏集(https://huggingface.co/new-collection)以链接至此页面。
相似文章
更新:小模型 + Engram
作者提供了关于构建一个小型20亿参数AI模型的更新,该模型具有Engram组件,在1500万维基百科tokens上训练,达到了惊人的连贯性,并计划进行Apache 2.0开源发布。
问错问题:HuggingFace事件与LLMs中语义场的(误)校准
本文讨论了OpenAI-HuggingFace事件,并提出了一个使用语义场力学的理论框架来解释大型语言模型如何处理意义。
市场信号注入:LLM定价代理的对抗性上下文操纵
本文介绍了市场信号注入(MSI),一种对抗性攻击,通过操纵向LLM定价代理呈现市场数据的方式,影响其决策和市场结果,并提出了输入规范化和决策边界锚定等防御措施。
AutoTuneBench: 用于LLM服务引擎代理自动调优的可信度量
AutoTuneBench 提出了一个基准和测量协议,用于LLM服务引擎的可信代理自动调优,解决了诸如稻草人基线和基础设施缺陷等故障模式,以确保可靠的结果。
连续性而非重要性:文档编辑后陈旧KV缓存的预算修复
本文研究了文档编辑后LLM系统中陈旧KV缓存的预算修复方法,证明了连续的编辑本地窗口能有效恢复性能,并且比完全重新预填充更快。