标签
本文研究了AI系统中放弃行动策略的忠实推理问题,发现存在一种权衡:直接策略能获得更高的决策质量但缺乏可审计的推理,而推理策略则以较低性能为代价提供监督。
本文提出了一种结构内化规则语言模型(SIRLM),旨在解决知识图谱推理中使用大语言模型时的推理证据感知漂移问题,通过耦合结构和参数知识来提高忠实性和有效性,实验表明其优于最先进的方法。
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。