通过证据校准的查询聚类捕捉LLM能力
摘要
本文提出了一种证据校准的查询聚类算法(ECC),该算法通过后验模型比较和Bradley-Terry建模,将语义嵌入与潜在LLM能力需求对齐,显著提高了LLM评估中能力排名的质量。
查看缓存全文
缓存时间: 2026/05/22 02:32
论文页面 - 通过证据校准的查询聚类捕捉LLM能力
来源: https://huggingface.co/papers/2605.17110
摘要
查询聚类算法ECC通过后验模型比较与Bradley-Terry建模,将语义嵌入与潜在能力需求对齐,从而改进LLM能力评估。
查询聚类(https://huggingface.co/papers?q=Query%20clustering)将查询组织成反映共享潜在能力需求(https://huggingface.co/papers?q=latent%20capability%20demands)的群组,实现能力感知的LLM评估。现有聚类方法主要依赖语义分类体系或嵌入,往往因表面语义与实际模型性能之间的错位而无法捕捉此类潜在能力需求。我们提出ECC算法,该算法利用有限的后验模型比较(https://huggingface.co/papers?q=posterior%20model%20comparisons)对先验语义嵌入(https://huggingface.co/papers?q=semantic%20embeddings)进行校准,弥合表面语义与潜在能力需求之间的鸿沟。ECC通过Bradley-Terry模型(https://huggingface.co/papers?q=Bradley-Terry%20model)参数化的能力特征描述每个聚类,并使用可训练的混合权重(https://huggingface.co/papers?q=trainable%20mixture%20weights)来适应具有混合能力需求的查询,共同学习一个灵活的能力感知聚类(https://huggingface.co/papers?q=capability-aware%20clustering)结构,支持对LLM能力进行查询特定的推断。广泛的定量和定性评估表明,ECC显著提升了LLM能力排名(https://huggingface.co/papers?q=LLM%20capability%20ranking)质量,平均分别超过基于人工标注和嵌入的基线方法17.64和18.02个百分点,并在查询路由(https://huggingface.co/papers?q=query%20routing)等下游任务中表现有效。
查看arXiv页面(https://arxiv.org/abs/2605.17110)查看PDF(https://arxiv.org/pdf/2605.17110)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17110)
引用本论文的模型0
无模型关联本论文
在模型README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
引用本论文的数据集0
无数据集关联本论文
在数据集README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
引用本论文的Space0
无Space关联本论文
在Space README.md中引用arxiv.org/abs/2605.17110以链接至此页面。
包含本论文的收藏集0
无收藏集包含本论文
将本论文添加至收藏集(https://huggingface.co/new-collection)以链接至此页面。
相似文章
自行量化 Kimi K3 (2.8T A50B) 至 GGUF 格式 - Q3_K_S 可行,磁盘占用 1.1 TB
我们成功使用 Q3_K_S 量化方式将 Kimi K3 2.8T 参数模型量化为 GGUF 格式,最终磁盘文件大小为 1.1 TB。
Theo Conjecture 解决了35年前的数学问题,发现了一个无人预见的项
一个名为 Theo Conjecture 的AI系统,利用了大型语言模型,解决了一个35年前的图论问题,该问题最初由数学家 Paul Erdős 提出,发现了一个意想不到的项。该系统通过循环提出、测试和修正数学想法来工作。
我预训练了一个700M参数的模型,在180亿个token上优化了Python和Wikitext | TheOneWhoWill/Shibai-700M-Base · Hugging Face
Shibai-700M-Base是一个基于LLaMA的700M参数模型,在180亿个token的英文、数学和Python代码上进行了预训练。尽管与更大模型相比训练不足,但仍能生成连贯的文本,并且因其在单个RTX 5070 Ti GPU上的高效训练而备受瞩目。
有人在 OpenRouter 上试过 Qwen3.7 flash 吗?相比我们现有的 Qwen 3.6 27B 怎么样?
一位用户询问在 OpenRouter 上使用 Qwen3.7 flash 的体验,以及它与 Qwen 3.6 27B 相比如何,并暗示这可能是 Qwen 团队的下一个开源权重版本。
Linux 中的人工智能
本文讨论了将 LLM 等 AI 工具集成到 Linux 内核开发中的情况,强调了 Linus Torvalds 对 AI 辅助代码的支持,以及围绕新 Sashiko 代码审查工具的争议,同时批评了 Torvalds 对伦理问题的忽视。