标签
本文首次系统研究了在单轮聊天中校准的加法激活引导如何迁移到使用工具的ReAct智能体。研究发现,尽管注入的方向在不同设定下几乎以全强度到达深层,但行为耦合在不同模型和上下文之间变化莫测,放大至2倍或衰减,带来即时安全担忧。
本文提出使用LangGraph中的有状态ReAct智能体取代无状态自动研究模式,将每次迭代的令牌成本从O(n)降低至O(1),在超参数调优和代码优化基准测试中实现了52-90%的令牌减少。
Co-ReAct 引入了一种基于评分标准的动作选择框架,在推理过程中将评分标准作为 ReAct 代理的步骤级指导,提高了轨迹质量,并在 DeepResearchBench 和 SQA-CS-V2 上超越了基线模型。