标签
本文提出TASCO,一个用于LLMs测试时自适应的框架,它将局部稳定性融入基于置信度的优化中,以提高推理准确性和令牌效率,同时无需更新模型参数。
本文介绍了选择性超图精炼(SHR),一种无标签的后处理方法,它利用超图来精炼冻结图模型中的聚类分配,无需更新参数,并显示出可测量的改进。
本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。
本文介绍了YOPO方法,该方法在冻结语言模型的单次前向传递中结合了引导探针和充分性方向,以提高推理准确性,并在信息不足时实现拒绝,展示了在各种基准和模型规模上的改进。
The paper introduces DIVE, a diversity-driven framework that enables frozen LLMs to self-improve by evolving persistent natural-language skills from task experience and verifier feedback, without parameter updates. It outperforms existing methods on math and logical reasoning tasks and transfers across model scales.
This paper introduces SHAPER, a self-evolving framework for embodied agents that keeps model parameters frozen and improves performance by evolving reusable skills and context-code harnesses through target-environment rollouts. Evaluated on VLABench and ESI-Bench, it proposes a practical alternative to fine-tuning when training is expensive or unavailable.
介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。
本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。
HALO 提出了一种针对冻结语言模型的混合自适应潜在精炼方法,该方法选择性地对一部分 token 应用第二阶段精炼,在计算量更少的情况下实现了比固定精炼步骤更好的性能。
本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。
提出了Life-Harness,一种通过适配运行时接口而非模型权重来改进冻结的LLM智能体的方法,在126个设置和18个backbones中实现了平均88.5%的相对改进。
残差耦合(RC)使用轻量级学习线性桥接器并行连接冻结的语言模型,实现无需权重修改的水平扩展。与MoE相比,它最多可将困惑度降低80.7%,并在TruthfulQA上提升9.1个百分点的准确率。