标签
这项预注册的重复研究测试了NLI中单调性对标签一致性的影响是否从选定的低一致性项推广到未选择的群体,结果发现效应反转且很小,表明早期的发现依赖于选择。
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。
ProvenanceGuard是一种用于MCP驱动的LLM代理的源感知事实性验证器,它通过分解回答为原子声明、路由到特定源证据、检查支持并验证归因,解决了跨源混淆问题。在医疗领域的评估中,它达到了0.802的块F1和0.858的源准确率。
StepGap是一个混合NLI-LLM决策树,用于检测多跳问答中的步骤级证据缺口,并将其标记为矛盾声明、无关证据或缺失桥梁。它在实现有竞争力的F1分数的同时,提供了一种可分解的结构,当用作强化学习的过程奖励时,可以提高下游问答的性能。
本文指出了人工智能法律推理中法律解释与形式逻辑之间的系统性鸿沟,提出了一种神经符号方法来弥合这一鸿沟,并展示了在严格形式蕴含条件下重新标注法律自然语言推理数据时出现的显著标签偏移。