测试时AI4AI:通过框架实现强到弱能力迁移
摘要
本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。
查看缓存全文
缓存时间: 2026/08/13 15:34
论文页面 - AI4AI 测试时:通过辅助框架实现强到弱能力迁移
来源:https://huggingface.co/papers/2608.12307
摘要
更强大的模型可以构建推理时辅助框架,通过将推理过程转移到结构化代码和路由中,在不更新参数的情况下大幅提升较弱模型的任务性能。
近期关于蒸馏的研究通常通过更新较小模型的参数,利用教师强制、在策略蒸馏及相关训练时方法,将大型模型的能力迁移到较小模型。在本文中,我们探讨这种迁移是否可以在测试时发生。我们研究强到弱脚手架:一个更强的构建者模型能否构建推理时辅助框架,帮助较弱的目标模型在不进行任何参数更新的情况下更可靠地解决任务。使用四个具有代表性的 Theory-of-Mind 基准,每个构建者模型使用 5% 的数据作为验证集,通过多轮迭代优化其辅助框架,然后将最终确定的辅助框架在完整测试集上进行评估。实验表明,这种形式的测试时能力迁移非常有效,将目标模型的平均性能从 0.49 几乎翻倍提升到 0.91。我们的分析显示,性能提升主要来自将不稳定的模型推理转移到确定性代码、基准特定路由和严格的答案格式强制中,而不是来自鼓励目标模型进行更广泛的推理或更大量的采样。我们进一步发现,构建者模型的推理努力可以单调地提高辅助框架质量,平台效应相对于构建者模型自身能力而言较小
相似文章
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
不是能力问题:LLM智能体层级间的控制敏感度是非单调的
本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。
训练一个用于模型无关和任务环境无关的能力改进的harness,基于类似PyTorch的框架 [P]
介绍了一个训练框架,以模型无关和任务环境无关的方式提升任务型LLM的能力,并在Terminal Bench和SWE-Bench上展示了结果。
AI能否让其他AI变得更优秀?我们测试了5个前沿LLM在重写其他代理框架的能力,评分基于它们从未见过的测试集(HarnessOpt-Bench,arXiv + MIT代码)
文章介绍了HarnessOpt-Bench,一个评估LLM改进其他AI代理框架能力的基准测试,并基于5个前沿模型的研究结果,指出模型选择对性能的影响大于框架选择。
Why The Harness Matters More Than The Model | YC Paper Club
本文探讨了AI领域中Harness(框架)的重要性,展示了通过改进Harness如何能大幅提升模型性能,并介绍了自我改进型Harness的前沿探索。