标签
本文介绍了AlphaAgent,一个面向证据感知材料文献分析的技能驱动智能体框架,该框架将基于检索的问答与报告生成解耦,并在40个材料科学问题上优于基线系统。
本文识别了长上下文推理大型语言模型中的重复复制问题,并提出GEAR,一种奖励塑造方法,通过奖励与关键证据的重叠并惩罚无关上下文复制来改进扎根,实现了高达+4.6平均分的持续改进。