标签
本文提出了Search-on-Graph-R1(SoG-R1),该模型通过首先使用黄金SPARQL查询搭建前沿教师模型以生成有依据的轨迹,然后应用监督微调和强化学习,训练一个8B参数的大型语言模型在知识图谱中导航。这个紧凑的模型在WebQSP、CWQ和GrailQA上超越了冻结的前沿系统,尤其是在CWQ上取得了所有对比方法中的最佳结果。