标签
本文引入了一个框架,将复合逻辑答案选项分解为原子判断,并使用受算子约束的整数线性规划来改进大语言模型在 AND、OR 以及 NEITHER/NOR 算子上的推理能力。该框架在 LOGICAL-COMMONSENSEQA 和新的基准 LOGICAL-SATA 上取得了显著的 F1 提升。
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
本文认为,包括GPT-5在内的数据驱动机器学习系统无法仅通过缩放达到符号级别的逻辑推理,原因在于它们在区分逻辑结构与统计规律方面存在固有局限性。
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
介绍ChLogic,这是一个英汉对齐的基准测试,用于检验大型语言模型在不同语言间是否保持逻辑推理性能,揭示了持续存在的差距,这些差距受到表面实现和翻译痕迹的影响。
MIT研究人员发现了一种方法,使大型语言模型能够进行真正的逻辑推理,这一消息在Twitter推文串中宣布。
本文介绍了奇美拉训练(Chimera Training),这是一种用于逻辑异常检测的方法,通过在特征层面进行反事实构建来训练神经规则评估器,无需真实的异常图像,从而在CLEVRER、OpenImages和VidOR等基准测试上提升了规则级异常检测性能。
ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。
本文介绍了使用三元组损失生成用于Horn逻辑推理的高质量嵌入的新方法,包括平衡训练样本生成和困难样本强调的技术,这些方法提高了下游逻辑推理的效率。
LLMEval-Logic 是一个新的中文基准,专门评估大语言模型的逻辑推理能力,具有求解器验证的答案和对抗性加固。该基准揭示了当前模型的显著差距,最佳模型在困难项目上仅达到37.5%的准确率。
本文介绍了 ScaleLogic 框架,该框架证明了强化学习的训练计算资源消耗遵循与大型语言模型推理深度相关的幂律分布。文章强调,逻辑表达力对于提升下游迁移能力和训练效率至关重要。