标签
本文研究了在推理过程中状态适应(state adaptation)对于 masked diffusion language models(MDMs)何时真正重要,将推理过程组织为五个维度,并表明选择性适应(利用轻量级检测器识别高机会状态)能够捕获大部分 oracle 收益——例如,在 LLaDA-8B 的受限 JSON 填充任务上,仅适应 10% 的状态便捕获了 56.9% 的机会收益。
本文系统评估了基于回滚机制的不确定性感知解码,以改进大语言模型中的代码生成,并展示了使用不确定性信号相对于标准方法的性能提升。
MIT CSAIL 和哈佛大学的研究人员借助一款改编版《战舰》游戏,研究并提升了语言模型的提问能力。通过运用蒙特卡洛推理策略,他们将 Llama 4 Scout 这样的小型模型对人类胜率从 8% 显著提升至 82%,不仅以更低成本超越了大型模型,还展现出更强的性能。