标签
本文提出了一种双层自动研究框架,其中外环AI代理自主优化内环LLM策略合成管道,用于多智能体序列社会困境,实现了优越的性能,并发现了在最大最小福利目标下的公平等具体目标机制。
本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。