标签
介绍了PetriBench,一个利用Petri网评估大语言模型在动态状态空间上推理能力的可扩展基准测试。研究表明,准确率随难度增加而下降,并揭示了不同模型在特定任务上的能力差异。
本文论证三项独立的大语言模型可靠性研究发现,均指向需要实现校准弃权能力——即模型在不确定时能够恰当地拒绝回答,并提出了三重评分、校准指标等评估改革方案以填补这一空白。
决策流采样是一个无需训练的框架,通过构建分层树并执行全局轨迹评估,从大语言模型中提取高质量推理路径,在基准测试中超越现有采样方法。
本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。
本文提出TASCO,一个用于LLMs测试时自适应的框架,它将局部稳定性融入基于置信度的优化中,以提高推理准确性和令牌效率,同时无需更新模型参数。
本文通过引入反事实控制,挑战了LLM推理轨迹包含突破性时刻以及正确性可早期预测的观点,表明早期信号受问题难度混淆。
本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。
本文提出ERR+,一个两阶段强化学习框架,通过奖励思考阶段的熵下降来改进LLM推理,从而在多个数据集上提升准确性和效率。
本文研究了科学方程发现中的测试时缩放,将其表述为一个迭代搜索过程,并发现搜索宽度是在计算预算下提高性能和效率的主导分配参数。
本文提出一种神经符号框架,将推理解耦为符号有效性和语义 grounding,利用验证器和训练的PRM来提高LLM在科学推理任务中的可靠性。
本文研究了Evolution Strategies (ES)作为LLM推理的后训练范式,表明ES通过稀疏功能更新和种群多样性,提供了比GRPO更广泛的推理覆盖和更好的Pass@K性能。
一个高度量化的Qwen3.8-27B模型在16 GB Quadro GPU上运行,尽管经历了超过100分钟的广泛推理和调试,仍从零开始成功实现了正确的多层传输矩阵法。
本文实证研究了词汇扰动如何通过Attention Diversion破坏大语言模型推理,发现字符级噪声显著降低性能,而填充插入则影响甚微。
LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。
本文提出一种统计模型,用于高效估计文本生成中的不确定性动态,平滑嘈杂的重采样数据,以在保持LLM推理链分析准确性的同时显著降低计算成本。
本研究介绍了BudgetDoc,第一个用于评估文档任务中模型-预算-性能权衡的多模态基准,并开发了DRB,一种轻量级估计器,用于预测推理性能以优化计算分配并降低LLMs成本。
这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。
这篇arXiv论文介绍了社会思维链(SCoT),一种用于医学鉴别诊断的多智能体架构,它将多轮专家对话组织成结构化流程。评估显示,它优于单智能体和整体式推理,尤其是在最困难的诊断案例上。
本文表明,对于小型指令微调LLM,在GPQA Diamond基准的大多数硬科学问题上,基于多数投票的自洽性(self-consistency)会适得其反,而诸如多数一致性或令牌熵等无验证器门控无法防止这一问题。预注册的验证性实验量化了准确率下降,并表明置信度并不反映正确性。