标签
本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
AdversaBench介绍了一个自动化LLM红队测试流程,该流程使用五个变异算子和一个由三位裁判及元裁判(用于决断平局)组成的评审团来确认失败,揭示了攻击难度因类别而异,并且对抗性提示可以从较小模型迁移到较大模型。
Skill-MAS提出了一种在无需修改模型权重的情况下,为多智能体系统演化元技能以提升编排能力的方法,实现了跨任务和LLM的可迁移性能提升。
本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。