test-time

标签

Cards List
#test-time

在测试时 AI4AI 中学习智能体框架设计的元技能

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出了 Meta-Skill 方法,让一个冻结的 Builder 模型从 Target 的执行反馈中学习可复用的原则,从而为未见过的任务构建更优的智能体框架。该方法在 Harness-Bench 和 NewtonBench 上将性能提升了 8.95 个百分点,指出了一条通过学习构建更好的环境(而非修改模型权重)来实现系统级自我改进的路径。

0 人收藏 0 人点赞
#test-time

用于蛋白质扩散模型测试时对齐的Spectral Feedback

arXiv cs.AI ↗ · 5天前 缓存

本文介绍Spectral Feedback算法,该算法通过使用稀疏傅里叶表示迭代选择编辑位置,增强了蛋白质反折叠中离散扩散模型的测试时对齐,从而提高了奖励最大化的性能。

0 人收藏 0 人点赞
#test-time

GradCuit: 信用分配的梯度流实现稳健且可解释的测试时潜在推理

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了GradCuit,一种测试时潜在推理方法,在选定的Transformer层插入可优化的潜在状态。它在五个骨干模型和三个推理基准上实现了64.5%的平均准确率,优于思维链提示,并展现出更好的稳健性和可解释性。

0 人收藏 0 人点赞
#test-time

重新思考还是思考更久?面向预算感知推理的选择性验证

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

介绍了SEVRA,一种用于预算感知推理的选择性验证控制器,它决定何时接受模型的初始答案,何时在验证上花费额外计算资源,在MATH500和GSM8K等基准上提高了准确率并减少了不必要的token。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈