标签
本文描述了在AI验证管道中测试降低阅读成本的方法,同时保持高召回率和少数证据,指出了当前方法的挑战,并邀请社区参与。
本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。