nli

标签

Cards List
#nli

选择塑造边界:在未选择的NLI群体中单调性与标签一致性的预注册重复研究

arXiv cs.CL · 2026-07-22 缓存

这项预注册的重复研究测试了NLI中单调性对标签一致性的影响是否从选定的低一致性项推广到未选择的群体,结果发现效应反转且很小,表明早期的发现依赖于选择。

0 人收藏 0 人点赞
#nli

RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性

arXiv cs.CL · 2026-07-20 缓存

本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。

0 人收藏 0 人点赞
#nli

形式语义结构解释人类标注变异的程度有多大?:NLI中的群体级效应与项目级上限

arXiv cs.CL · 2026-07-20 缓存

本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。

0 人收藏 0 人点赞
#nli

ProvenanceGuard: 基于MCP的LLM代理的源感知事实性验证

arXiv cs.AI · 2026-06-17 缓存

ProvenanceGuard是一种用于MCP驱动的LLM代理的源感知事实性验证器,它通过分解回答为原子声明、路由到特定源证据、检查支持并验证归因,解决了跨源混淆问题。在医疗领域的评估中,它达到了0.802的块F1和0.858的源准确率。

0 人收藏 0 人点赞
#nli

StepGap: 一种混合NLI-LLM检测器用于多跳问答中的步骤级证据缺口检测

arXiv cs.CL · 2026-05-26 缓存

StepGap是一个混合NLI-LLM决策树,用于检测多跳问答中的步骤级证据缺口,并将其标记为矛盾声明、无关证据或缺失桥梁。它在实现有竞争力的F1分数的同时,提供了一种可分解的结构,当用作强化学习的过程奖励时,可以提高下游问答的性能。

0 人收藏 0 人点赞
#nli

连接法律解释与形式逻辑:忠实性、假设与人工智能法律推理的未来

arXiv cs.AI · 2026-05-15 缓存

本文指出了人工智能法律推理中法律解释与形式逻辑之间的系统性鸿沟,提出了一种神经符号方法来弥合这一鸿沟,并展示了在严格形式蕴含条件下重新标注法律自然语言推理数据时出现的显著标签偏移。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈