标签
本文提出了 Meta-Skill 方法,让一个冻结的 Builder 模型从 Target 的执行反馈中学习可复用的原则,从而为未见过的任务构建更优的智能体框架。该方法在 Harness-Bench 和 NewtonBench 上将性能提升了 8.95 个百分点,指出了一条通过学习构建更好的环境(而非修改模型权重)来实现系统级自我改进的路径。
本文介绍Spectral Feedback算法,该算法通过使用稀疏傅里叶表示迭代选择编辑位置,增强了蛋白质反折叠中离散扩散模型的测试时对齐,从而提高了奖励最大化的性能。
本文介绍了GradCuit,一种测试时潜在推理方法,在选定的Transformer层插入可优化的潜在状态。它在五个骨干模型和三个推理基准上实现了64.5%的平均准确率,优于思维链提示,并展现出更好的稳健性和可解释性。
介绍了SEVRA,一种用于预算感知推理的选择性验证控制器,它决定何时接受模型的初始答案,何时在验证上花费额外计算资源,在MATH500和GSM8K等基准上提高了准确率并减少了不必要的token。