标签
PADMÉ 将语言模型智能体评估器的元评估重新表述为一个偏好对齐问题,并提出了一种仅使用小型语言模型的数据合成方法。与朴素基线相比,该方法将与人类判断的一致率从 73% 提升至 85%,同时能够在智能体领域对 25 个常见模型进行评估。
本文研究了语言模型代理能否自动化机械可解释性中的解释阶段,为此引入了AgenticInterpBench基准(包含84个半合成电路)和HyVE解释器(通过迭代假设、验证和解释电路组件)。实验显示出潜力,但可靠的验证仍是关键障碍。