标签
本文提出 GRATE(用于时间编码的门控旋转注意力),一种无参数的时间编码方法,通过结合相对时间差和查询条件门控来增强归纳知识图谱基础模型。同时引入了新的归纳时间知识图谱基准(GDELTIndT 和 WIKIIndT)以评估跨数据集迁移,展示了相比静态基础模型的性能提升。
InductWave提出了一种基于小波的归纳嵌入方法,用于知识图谱上的多跳逻辑查询回答,在更少的消息传递层数下实现了竞争性的性能。
本文介绍了基于程序的后验训练(PPT),一种利用LLM生成的概率程序来创建分布目标,以微调归纳推理的方法,从而提高了在保留任务和人类对齐基准上的估计准确性和校准能力。
FalsifyBench 是一个用于评估大语言模型归纳推理能力的新型评测框架,灵感来源于 Wason 2-4-6 任务。在该框架中,智能体通过提出示例并接收反馈来发现隐藏的语义规则。对 12 个大语言模型的评估结果表明,推理模型的表现优于指令微调模型,而负面测试(即假设证伪)是决定成败的关键因素。
提出了KMAS,一种自适应负采样方法,用于改进知识图谱基础模型的训练,在44个数据集上取得了最先进的结果。
MIND-Skill 是本研究论文提出的一种新框架,它利用基于 TextGrad 优化的多智能体归纳和演绎,自动化生成高质量、可复用的智能体技能,并提供质量保证。