标签
本文评估了使用Chain-of-Thought推理的大型语言模型的能力和效率,发现随着模型大小的增加,能力增益减弱,而效率改善甚微。
论文介绍了 MIRAGE,这是一个推理时框架,通过使用强化学习引导动态切换视角来增强 LLM 推理,在各种基准测试中优于现有的提示方法。
本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。
ARIA是一种用于大型语言模型的测试时遗忘方法,它使用稀疏自编码器在推理过程中抑制不需要的知识,而不修改权重,从而改善遗忘-保留权衡,并在对抗性攻击中保持稳健。
本文介绍了ReActNet,一个无需训练的框架,为多智能体LLM系统合成任务条件化的时序工作流图,提升协调性和性能,超越固定或学习拓扑的基线。
ERASE 是一个用于机器学习模型功能性遗忘的框架,无需修改权重,通过输入扰动在推理期间抑制私有数据影响,以实现隐私合规。
本文介绍了Private Best-of-N (PrivBoN)和Private Inference-Time Pessimism (PrivITP)方法,这些方法在推理时对齐中向奖励分数添加校准噪声,以实现差分隐私并减轻奖励哈希,且额外对齐成本最小。
本文提出EmoVec,一个轻量级框架,通过潜在向量引导在大型语言模型中实现可控情感生成,无需更新模型权重即可实现对情感强度的连续控制。
CritICL 是一个推理时框架,它利用来自较小模型的结构化失败模式作为批判性指导来增强大型语言模型的推理能力,其性能优于标准上下文学习,并降低了生成和令牌成本。
GGSS通过在推理过程中使用自适应门控沿测地线弧引导视觉令牌,减少生成式视觉语言模型中的人口统计偏差,同时保持视觉语言准确性。
本文介绍了读出反馈(RoFB),一种测试时干预方法,利用自身的读出概率引导循环推理模型中的潜在动态,在数独和迷宫任务上无需重新训练即可获得性能提升。
论文介绍了'recirculation',这是一种针对基础模型的推理时架构增强技术,通过改进状态跟踪,显著降低了困惑度并提高了准确性,在生成过程中无额外延迟。
本文提出了使用思维链提示和直接偏好优化来缓解大型语言模型中对抗性政治偏见的推理时策略,展示了在政治中立性分数上的显著改进。
本文介绍了一种问题级审计框架,用于区分LLM基准测试中的“已实现”答案与“可达”答案,表明总体得分提升往往来自生成已经可达的答案,而非扩展真实能力,并且在匹配预算下,随机层路由与结构化搜索表现相当。
本文提出了一种推理时策略塑形框架,受大语言模型推理时对齐的启发,无需重新训练即可将预训练的强化学习策略引导至基于福利的公平目标。
介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。
提出DiFA,一种无需训练的框架,将推理时的数据预测优化重新定义为使用卡尔曼滤波的序列状态估计,显著提升了CIFAR-10和ImageNet上的生成保真度。
Motion4Motion 是一个无需训练的运动迁移框架,它从视频中建模运动流而不是依赖骨架结构,从而在推理时实现跨物种(例如,从人类到动物)的运动迁移。
提出了LARA框架,用于安全的推理时对齐。该框架通过拉格朗日对偶化,从单独的奖励和成本模型中推导出增强奖励,从而在不重新训练的情况下改善有用性-无害性权衡。
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。