标签
本文深入解释了大模型推理强度(reasoning effort)的原理:同一模型通过调节推理强度(low/medium/high),在输出最终答案前允许更多中间推理轨迹(串行自回归计算),从而在答案质量、响应速度和计算成本之间做出取舍。关键在于模型学会了将更长的生成过程组织成有效计算,而非简单增加参数或网络层数。
介绍深度熵引导采样(DEGS),一种无需训练、测试时的方法,利用大语言模型中逐层熵崩塌来改善推理能力,无需强化学习训练,达到与RL后训练模型相竞争的结果。
本文介绍了LoopCoder-v2,一个70亿参数的并行循环变换器系列,用于代码生成,并研究了最优循环次数,发现两个循环能带来显著提升,而更多循环则会导致性能下降。
本文提出了测试时个性化(TTP),这是一种通过候选采样和基于奖励的选择来扩展推理时计算,从而提升大语言模型(LLM)个性化能力的框架。该研究诊断了标准奖励模型中的失效模式,并提出了一种概率个性化奖励模型以缓解这些问题。
本文介绍了 PaT(试错后规划),这是一种用于代码生成的自适应测试时计算策略,在保持与更大模型相当的性能的同时,将推理成本降低了约 69%。
本文介绍了“前缀一致性”这一方法,它根据思维链推理中痕迹再生成时的答案重现率对候选响应进行加权。该方法在各种推理模型和基准测试中,以显著少于标准多数投票的令牌数实现了高准确率。