RepBench:将基准测试编译为大语言模型的能力表示
摘要
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。
arXiv:2607.28008v1 公告类型:新
摘要:表示工程读取并引导大语言模型中的能力方向,然而这些方法通常是在论文特定的合成数据上进行评估的。由此产生的测量结果难以比较或复现,并且可能反映表面模式而非真实能力。我们提出了RepBench,一个面向能力对齐表示探测的、以基准测试为基础的数据层。通过爬取13,427篇基准测试论文,我们得到了一个包含13个家族、182个能力聚类的分类体系;收集353个公共基准测试数据集,我们获得了46,149条经过审计的探测文本,覆盖94种能力,每种能力至少由两个独立的基准测试支持。这种多基准测试设计减少了对任何单一来源的依赖:原始逐文本向量没有自然的聚类粒度,而基准测试池化的能力向量在所有12个评估模型上都表现出在少量聚类数时达到内部聚类最优,且与人工分类体系的一致性较低。在跨基准测试迁移评估中,12个模型全部由4种读出器完成,差异均值法在10个模型上取得了最高的模型级均值,而逻辑回归在最多的能力-模型单元中获胜。这种分歧表明,读出方法和聚合标准是有意义的评估维度。该流水线、语料库和评估代码已作为可复用的闭环工作流发布。
查看缓存全文
缓存时间: 2026/07/31 10:03
# RepBench:将基准编译为大型语言模型的能力表示 来源:https://arxiv.org/html/2607.28008 ###### 摘要 表示工程读取并引导大型语言模型中的能力方向,但相关方法通常在论文特有的合成数据上评估。由此得到的测量结果难以比较或复现,并且可能反映的是表层模式而非真正能力。我们提出 RepBench,一个以基准为基础的能力对齐表示探测数据层。通过爬取13,427篇基准论文,我们得到包含13个族、182个能力簇的分类体系;采集353个公开基准数据集,得到46,149条经过审核的探测文本,覆盖94种能力,且每种能力至少由两个独立基准支持。这种多基准设计降低了对单一来源的依赖:原始逐文本向量没有自然的聚类粒度,而基准池化后的能力向量在所有12个被评估模型上都表现出小簇数处的内部聚类最优值,且与人工分类体系的一致性较低(ARI≈0.1)。在四种读出方法全部完成的十二个模型上的跨基准迁移评估中,均值差法在十个模型上取得最高的模型级均值,而逻辑回归在最多的能力–模型单元上获胜(38%)。这种分歧表明,读出方法和聚合标准都是有意义的评估维度。该流水线、语料库和评估代码以可复用的闭环工作流形式发布。 ## 1 引言 见图1:从基准文献汇编的能力全景:9,576个提取概念,分为182个簇和13个族。点的大小与提及次数成比例;颜色表示族。 见图2:跨基准表示几何。上:六个检查点的池化能力向量。下:Qwen3-8B池化前与池化后。颜色显示模型发现的聚类;原始面板使用能力族颜色。 表示工程读取隐藏状态方向以进行监测,并通过操纵这些方向来引导模型(Zou 等,2023;Turner 等,2023;Panickssery 等,2024);J-Lens 等新方法继续扩展读出方法家族(Gurnee 等,2026)。但评估数据并未跟上。大多数论文通过模板、手写对比对或LLM生成示例来合成探测语料,导致结果难以比较和复现。从某个数据集提取的方向还可能继承该数据集的格式和词元统计信息,因此表面上的能力读出可能部分反映的是表层模式。诊断研究进一步表明,引导成功度随概念和层的不同而剧烈变化(Billa,2026)。针对*引导方法*已有统一评估(Wu 等,2025),但它们仍然建立在合成概念数据之上。该领域缺少的是一个基于基准、可复现的*数据层*:一个通用的能力表示语料库,使任何探测或引导方法——从 diff-mean 到 J-Lens——都能在统一协议下接受测试。
相似文章
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
RedBench:大型语言模型综合红队测试通用数据集
RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。
BrainBench:面向全面脑电图理解的大型语言模型基准测试
BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。
大型语言模型个性化能力的基准测试
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。
JOR-Bench:面向大型语言模型的日语运筹学基准测试
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。