FORGE:通过群体广播实现无需权重更新的自演化智能体记忆

arXiv cs.AI 论文

摘要

FORGE是一种协议,使LLM智能体能够通过群体广播无需权重更新地演化其记忆,将失败轨迹转化为可复用的知识构件。在CybORG CAGE-2网络防御任务中,相较于零样本和Reflexion基线,该协议在多个LLM家族上显著提升了性能。

arXiv:2605.16233v1 公告类型:新 摘要:LLM智能体能否通过自生成记忆(无需梯度更新)来改进决策?我们提出FORGE(失败优化反思式渐进与演化),这是一种分阶段、基于群体的协议,用于演化为分层ReAct智能体注入提示的自然语言记忆。FORGE包裹了一个Reflexion风格的内循环,其中专门的反思智能体(使用相同的底层LLM,无来自更强模型的蒸馏)将失败的轨迹转化为可复用的知识构件:文本启发式(规则)、少样本演示(示例)或两者混合(混合),外循环则在阶段间将表现最佳实例的记忆传播给群体,并通过毕业标准冻结收敛的实例。我们在CybORG CAGE-2(一个随机网络防御POMDP,30步时间范围,对抗B-line攻击者)上进行了评估,所有四个测试的LLM家族(Gemini-2.5-Flash-Lite、Grok-4-Fast、Llama-4-Maverick、Qwen3-235B)均表现出强烈负值、重尾分布的零样本奖励。与零样本基线和Reflexion基线(孤立的单流学习)相比,在所有12个模型-表示条件下,FORGE将平均评估回报提高了零样本的1.7-7.7倍,比Reflexion提高了29-72%,将重大失败率(低于-100)降至约1%。我们发现:(1)群体广播是关键机制,无毕业消融实验证实广播带来了性能提升,而毕业主要节省计算资源;(2)对于三个模型,“示例”实现了最强的回报,“规则”提供了最佳的成本-可靠性曲线,节省约40%的令牌;(3)较弱的基线模型获益更大,表明FORGE可能弥合能力差距,而非放大强模型。所有证据仅限于CAGE-2 B-line;跨家族发现为方向性证据。
查看原文

相似文章

MemoryForge:为类人LLM智能体合成终身记忆

arXiv cs.CL

本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。

EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体

Hugging Face Daily Papers

EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。