标签
ReacTOD提出了一种用于零样本对话状态跟踪的有界神经符号架构,采用带有确定性验证的自校正ReAct循环。它在MultiWOZ和Schema-Guided Dialogue基准上取得了最先进的结果,将联合目标准确率提升了多达14个百分点。
介绍了ANNEAL,一种神经符号代理,能将重复性故障转化为过程知识图谱的受控符号编辑,无需修改模型权重,在测试环境中实现持久的结构修复并消除重复性故障。
提出了Logic-GNN,一种神经符号框架,通过时序图神经网络和图柯尔莫哥洛夫复杂度归纳出临床记录的符号语法,从而能够将数据录入错误检测为语法违规并进行纠正。该系统在一个大型医疗数据集上取得了0.94的F1分数,性能比现有最佳方法提升12%。
本文实证研究了LLMs在税法中的法律推理,表明数据污染会夸大性能,而神经符号混合系统比单体LLMs提供更可靠和稳健的泛化能力。
本文提出了NSPI,一种结合LLM与符号计算的神经符号框架,用于证明多项式不等式。它利用LLM生成的平方和猜想,通过符号计算进行精炼,并在Lean中形式化验证证明,在最多10个变量的多项式上展示了可扩展性。
本文指出了人工智能法律推理中法律解释与形式逻辑之间的系统性鸿沟,提出了一种神经符号方法来弥合这一鸿沟,并展示了在严格形式蕴含条件下重新标注法律自然语言推理数据时出现的显著标签偏移。
本文介绍了一种神经网络架构,该架构从完全观测到的状态轨迹中学习提升动作模式,其中动作参数未观测,旨在实现神经符号模型规划域的鲁棒学习。
介绍了Ethical Immanence,一种新型AI对齐范式,通过损失函数正则化和元认知检测将道德行为嵌入模型架构,为开源LLM带来更低成本和内在稳定性。
ReaComp将LLM推理轨迹编译为可重用的符号程序合成器,在程序合成基准测试中实现了强大的准确性,同时消除了测试时的LLM调用,显著降低了计算成本。
TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。