标签
本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。
Moth-Retrieval提出了一种无图的多跳检索方法,在HotpotQA基准测试上优于基于图的系统。
ProvenAI 提出了一种框架,将多跳问答中的透明度分解为三个可独立衡量的层次:答案正确性、引用忠实度和每文档影响力,揭示了一个引用-影响力差距,即被引用的来源可能影响力较弱,而未引用的来源却显著影响输出。