测试时AI4AI:通过框架实现强到弱能力迁移

Hugging Face Daily Papers 论文

摘要

本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。

近期关于蒸馏的研究通常采用教师强制、同策略蒸馏及相关训练时方法,通过更新较小模型的参数,将大模型的能力迁移到较小模型。本文探讨这种迁移能否改在测试时进行。我们研究强到弱脚手架(strong-to-weak scaffolding):一个更强的构建者模型能否构建推理时框架(inference-time harness),帮助较弱的目标模型在无需任何参数更新的情况下更可靠地解决任务。在四个具有代表性的心智理论(Theory-of-Mind)基准上,每个构建者模型将5%的数据用作验证集,通过多轮迭代优化其框架,随后在完整测试集上评估最终定型的框架。实验结果表明,这种测试时能力迁移形式非常有效,目标模型的平均性能从0.49提升至0.91,几乎翻倍。我们的分析显示,这些提升主要源于将不稳定的模型推理转移到确定性代码、采用基准特定的路由策略以及严格强制答案格式,而非鼓励目标模型进行更充分的推理或更广泛的采样。我们进一步发现,构建者模型的推理努力会单调地提高框架质量,平台效应相对构建者模型自身能力而言较为有限,且较弱的目标模型获得的提升最大。这些结果表明,推理时框架设计是对传统训练时蒸馏的重要补充,使强模型无需重新训练即可将认知结构迁移到弱模型。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

论文页面 - AI4AI 测试时:通过辅助框架实现强到弱能力迁移

来源:https://huggingface.co/papers/2608.12307

摘要

更强大的模型可以构建推理时辅助框架,通过将推理过程转移到结构化代码和路由中,在不更新参数的情况下大幅提升较弱模型的任务性能。

近期关于蒸馏的研究通常通过更新较小模型的参数,利用教师强制、在策略蒸馏及相关训练时方法,将大型模型的能力迁移到较小模型。在本文中,我们探讨这种迁移是否可以在测试时发生。我们研究强到弱脚手架:一个更强的构建者模型能否构建推理时辅助框架,帮助较弱的目标模型在不进行任何参数更新的情况下更可靠地解决任务。使用四个具有代表性的 Theory-of-Mind 基准,每个构建者模型使用 5% 的数据作为验证集,通过多轮迭代优化其辅助框架,然后将最终确定的辅助框架在完整测试集上进行评估。实验表明,这种形式的测试时能力迁移非常有效,将目标模型的平均性能从 0.49 几乎翻倍提升到 0.91。我们的分析显示,性能提升主要来自将不稳定的模型推理转移到确定性代码基准特定路由严格的答案格式强制中,而不是来自鼓励目标模型进行更广泛的推理或更大量的采样。我们进一步发现,构建者模型的推理努力可以单调地提高辅助框架质量,平台效应相对于构建者模型自身能力而言较小

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。

不是能力问题:LLM智能体层级间的控制敏感度是非单调的

arXiv cs.AI

本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。