ALSO:面向社交智能体的对抗性在线策略优化
摘要
ALSO引入了一个多智能体社交模拟中的在线策略优化框架,将多轮交互建模为对抗性赌博机问题,并利用神经代理进行奖励预测。在Sotopia基准上的实验表明,它优于静态基线和现有优化方法。
arXiv:2605.15768v1 公告类型:新\n摘要:社会模拟为研究社会智能提供了一个引人注目的测试平台,其中智能体在动态演变的上下文和策略性适应的对手环境中通过多轮对话进行互动。这类环境本质上是非平稳的,要求智能体随时间动态调整其策略。然而,大多数基于大语言模型(LLM)的社交智能体依赖于静态角色,而现有的增强社交智能的方法,如离线强化学习或外部规划器,并不适合这些场景,它们通常假设平稳性并带来大量的训练开销。为了弥补这一差距,我们提出了\textbf{ALSO}(\textbf{A}dversarial on\textbf{L}ine \textbf{S}trategy \textbf{O}ptimization),这是首个面向多智能体社交模拟的在线策略优化框架。ALSO通过两个关键贡献推进了社交适应性。(1)ALSO将多轮交互建模为对抗性赌博机问题,其中静态角色和动态策略指令的组合被视为臂(arms),为非平稳性提供了一种原则性解决方案,无需依赖环境稳定性假设。(2)为了预测奖励并泛化多轮对话中的稀疏反馈,ALSO引入了一个轻量级神经代理,通过交互历史预测奖励,实现了样本高效的探索和持续的在线适应。在Sotopia基准上的实验表明,ALSO在动态环境中始终优于静态基线和现有优化方法,验证了对抗性在线策略优化在构建鲁棒社交智能体方面的有效性。
查看缓存全文
缓存时间: 2026/05/18 06:34
# ALSO:面向社交智能体的对抗式在线策略优化
来源:https://arxiv.org/html/2605.15768
###### 摘要
社交模拟为研究社交智能提供了一个引人注目的试验平台,其中智能体通过多轮对话在动态演变的上下文中进行交互,并面对策略性自适应对手。这类环境本质上具有非平稳性,要求智能体随时间动态调整其策略。然而,大多数基于大语言模型(LLM)的社交智能体依赖于静态角色设定,而现有的增强社交智能的方法(如离线强化学习或外部规划器)难以适应这些场景——它们通常假设平稳性,并带来大量的训练开销。为弥补这一差距,我们提出 **ALSO**(Adversarial Online Strategy Optimization,对抗式在线策略优化),这是首个面向多智能体社交模拟的在线策略优化框架。ALSO 通过两项关键贡献推动了社交适应性的发展:
(1) ALSO 将多轮交互建模为对抗式老虎机问题,其中静态角色设定与动态策略指令的组合被视为臂,这为在非平稳环境下提供了一种无需依赖环境稳定性假设的原则性解决方案。
(2) 为预测奖励并泛化多轮对话中的稀疏反馈,ALSO 引入了一个轻量级神经代理模型,用于从交互历史中预测奖励,从而实现样本高效的探索与持续的在线适应。
在 Sotopia 基准上的实验表明,ALSO 在动态环境中持续优于静态基线及现有优化方法,验证了对抗式在线策略优化对于构建鲁棒社交智能体的有效性。
大语言模型,多智能体系统,社交智能
参考图注
图 1:具有角色设定与自适应策略的智能体之间的在线社交交互,其中多轮对话的反馈驱动着在行为演变下的持续策略优化。
## 1 引言
建模社交智能(Mathur 等,2024)是人工智能研究的核心追求。大语言模型(LLM)的出现,通过赋予智能体类人沟通能力(Spitale 等,2023)和规划能力(Wu 等,2024a;Park 等,2023),极大地推动了这一领域的发展。这一进展使得基于 LLM 的社交模拟成为研究大规模及目标导向交互中涌现社交行为的强大框架(Epstein,2012;Wang 等,2024a)。在这类模拟中,智能体行为通常由 **角色设定**(persona)——一种形式化的档案,封装了性格特征、职业和背景故事(Reiss,2023;Salinas 和 Morstatter,2024;Bisbee 等,2024)——来支配。然而,静态角色设定虽提供了基础身份,却不足以激发自适应的社交智能。有必要区分 **角色设定** 与 **策略**:角色设定定义了智能体“是谁”,而策略则规定了智能体“如何”行动以驾驭交互并达成目标。实证研究表明,仅依赖静态角色设定往往会导致刻板、同质化的行为,无法捕捉鲁棒社交模拟所需的多样性(Taubenfeld 等,2024;Hwang 等,2025;Zeng 等,2025;Venkit 等,2026)。基于人类反馈的强化学习(RLHF)的“对齐代价”进一步强化了这种同质性——它抑制了行为变异以换取安全性(Kirk 等)。如果没有不断演变的策略来补充身份,智能体难以适应动态对手,从而产生僵化且次优的交互模式(Li 等,2023;Wang 等,2024b;Zeng 等,2025)。
为增强社交适应性,近期工作探索了用于优化智能体指令的自动提示优化(APO)(Zhou 等,2022a;Guo 等,2024;Lin 等,2024b;Opsahl-Ong 等,2024a),这可通过多臂老虎机形式加以解释。然而,离线方法与在线变体(Yang 等,2023;Lin 等,2024a;Wu 等,2024b)从根本上依赖于平稳性假设——每个提示在固定验证集上诱导出稳定的奖励分布。这类假设在社交模拟中失效,因为来自多轮交互的反馈涉及策略性自适应对手,对手的行为会随智能体的策略选择共同适应,导致奖励发生持续偏移并产生强时间耦合。这种动态反馈循环使得标准随机老虎机模型不足以应对社交策略指令优化。
为弥补这一差距,我们提出 **ALSO**(Adversarial Online Strategy Optimization,对抗式在线策略优化),这是一个 **在线** 框架,**将社交策略适应建模为对抗式多臂老虎机问题**,从而在非平稳性下实现原则性优化,如图 1 所示。ALSO 并未假设奖励平稳,而是通过两种设计显式建模社交交互的共同演化与策略自适应特性:
(1) 在 ALSO 中,每个臂对应一条从生成的策略集(如合作、竞争、欺骗、理性讨价还价)中采样得到的策略指令。在每个交互回合中,选中的策略与智能体的角色设定相结合,形成最终的提示上下文,确保动态适应始终植根于一致的身份。基于该对抗式老虎机公式,ALSO 实例化了一个鲁棒的在线优化过程,该过程受 EXP3(Lattimore 和 Szepesvári,2020)启发并结合平滑处理,以应对对手行为的偏移。
(2) 标准老虎机方法将各臂独立对待,未能利用策略指令间的语义关系。为克服此局限,ALSO 引入了一个轻量级神经代理模型,该模型利用交互历史预测奖励,并在语义相关的策略间泛化稀疏反馈。这实现了在稀疏多轮反馈下的样本高效在线优化。
总体而言,ALSO 构成了一个闭环在线系统,该系统迭代地选择策略,在角色设定条件化的提示下进行交互,并根据反馈同时更新老虎机策略与代理模型。
我们在 Sotopia(一个涵盖七个社交智能维度的全面 LLM 社交模拟基准)上评估了 ALSO。在多种设置下,ALSO 始终优于静态角色设定智能体与现有优化基线,实现了整体 +16.60% 的提升,并在关系结果上取得了 +83.79% 的显著进步。
**贡献。** 我们做出以下贡献:
- • 首次为基于 LLM 的多智能体社交模拟引入在线策略学习框架,使智能体能够在演变环境中超越静态角色设定驱动的行为实现动态适应。
- • 将社交策略优化形式化为带代理奖励建模的对抗式老虎机问题,为非平稳且策略自适应的交互提供原则性解决方案。
- • 在 Sotopia 基准上进行广泛评估,证明在多种社交场景下,该方法相较于静态智能体与现有优化基线具有持续改进。
## 2 相关工作
### 2.1 社交智能
社交智能不同于抽象智能与机械智能,它指的是处理人际关系与社交情境的能力(Thorndike,1920;Strang,1930;Thorndike 和 Stein,1937)。在计算环境中,人工社交智能强调对交互伙伴(包括人类与人工智能体)的心理与行为动态进行建模与响应(Sap 等,2022;Gweon 等,2023;Mathur 等,2024)。大语言模型(LLM)的最新进展为构建具备社交能力的智能体提供了坚实基础(Hoppler 等,2022;Lee 等,2024;Anthis 等,2025)。早期的社交评估框架(如 Social IQa(Sap 等,2019)和 SocialBench(Chen 等,2024))侧重于静态选择题设置,未能捕捉社交交互的动态与非平稳性质。这一局限促使了基于动态模拟的基准问世,包括 SOTOPIA(Zhou 等,2024)和 AgentSense(Mou 等,2025),它们在开放式多轮环境中评估智能体,这些环境具有持续演变的目标与社会关系。
现有增强社交智能的方法通常遵循两种范式。第一类侧重于 **离线优化**。Sotopia-π(Wang 等,2024b)通过数据核心的精炼提升性能,而 Sotopia-RL(Yu 等,2025)和 SDPO(Kong 等,2025a)则解决多轮对话中的信用分配与偏好优化问题。自适应模式学习(AML, Wang 等,2025a)进一步促进了多样化的社交推理模式。第二类通过离线训练的外部规划器增强推理。诸如 Sotopia-Ω(Zhang 等,2025)、DAT(Li 等,2024)和 EPO(Liu 等,2025)等方法从生成数据中学习辅助规划模型,以在测试时提供高层策略指导。尽管这些方法强调了策略在社交交互中的重要性,但它们将策略行为嵌入模型参数或固定规划器中。因此,引入新策略或适应演变的社交动态通常需要重新收集数据和重新训练。这一局限催生了我们的 ALSO,它通过在线优化实现了动态且样本高效的策略适应,无需离线再训练。
### 2.2 提示优化
提示优化(PO)提供了一种无需参数微调即可调整智能体行为的有效机制,它将策略视为可优化的指令(Wang 等,2025b)。早期的 PO 方法主要分为两类:**LLM 作为优化器** 方法,如 APE(Zhou 等,2022b)、OPRO(Yang 等,2023)和 Instinct(Lin 等,2024c),它们迭代生成并优化提示;以及 **进化方法**,包括 EvoPrompt(Guo 等,2024)和 PromptBreeder(Fernando 等,2024),它们通过变异与选择探索指令空间。尽管在静态任务中有效,但大多数 PO 方法依赖于离线预言机(如固定验证集)来评估和排序候选策略(Opsahl-Ong 等,2024b;Kong 等,2025b)。这种离线范式假设奖励分布平稳,未能捕捉社交交互中耦合且演变的动态——最优策略会随自适应对手的步调而偏移。因此,现有的 PO 框架不适合在线社交模拟,这促使了像 ALSO 这样的对抗式在线策略优化的需求。
## 3 问题形式化
参考图注
图 2:ALSO 用于基于 LLM 的多智能体社交模拟中自适应社交策略学习的概览。静态角色设定驱动的智能体表现出僵化交互,无法达成社交目标(左),而 ALSO 借助对抗式在线策略选择与代理奖励建模来动态调整策略,实现成功的社交结果(中–右)。
我们考虑一个多智能体社交模拟环境,并将在线社交策略学习形式化为在非平稳交互下的序列策略选择。
### 3.1 多智能体社交模拟环境
我们考虑一个通用的多智能体社交模拟框架,其中 LLM 充当交互式智能体。智能体集合记为 \(\mathcal{N} = \{1, 2, \ldots, N\}\),其中每个智能体 \(i \in \mathcal{N}\) 由角色设定 \(b_i \in \mathcal{B}\) 和私有社交目标 \(g_i \in \mathcal{G}\) 刻画。场景 \(\mathcal{S}\) 指定了社交上下文,包括环境设置与交互约束。模拟以离散对话轮次(索引 \(l = 1, \ldots, L\))进行。在第 \(l\) 轮,主动智能体 \(i\) 通过以场景、交互历史 \(\mathcal{H}_{l-1}\)、角色设定及其目标为条件形成观察 \(o_l^i\):
\[
o_l^i = \text{Prompt}(\mathcal{S}, \mathcal{H}_{l-1}, b_i, g_i).
\tag{1}
\]
然后,智能体基于 \(o_l^i\) 从 LLM 中采样动作 \(a_l^i\):
\[
a_l^i \sim \text{LLM}(o_l^i).
\tag{2}
\]
环境更新状态并将历史扩充为 \(\mathcal{H}_l = \mathcal{H}_{l-1} \cup \{a_l^i\}\)。经过 \(L\) 轮对话后,基于 LLM 的评估器沿着 \(M\) 个社交维度评估智能体性能:
\[
\{d_m^{(i)}\}_{m=1}^M = \text{LLM}_{\text{eval}}(\mathcal{S}, \mathcal{H}^{(L)}, b_i, g_i),
\tag{3}
\]
这些维度被聚合为一个标量奖励:
\[
r_i = \frac{1}{M} \sum_{m=1}^M \phi_m(d_m^{(i)}).
\tag{4}
\]
然而,与此设定相比,社交模拟的一个关键区别是其所固有的 **非平稳性**,这种非平稳性源于策略性自适应智能体。令 \(\mathbf{A}_l = (a_l^{(1)}, \ldots, a_l^{(N)})\) 表示在第 \(l\) 步的联合动作集,且 \(\mathbf{a}_l^相似文章
多目标多智能体赌博机:从学习效率到公平性优化
本文针对多目标多智能体多臂赌博机问题,介绍了 Pareto UCB1 Gossip 和模拟 NSW UCB Gossip 算法,旨在解决随机环境下的学习效率与公平性问题。
SAVOIR:基于Shapley值奖励归因的社交技巧学习框架
SAVOIR框架将合作博弈论与Shapley值应用于语言智能体训练,显著提升其社交智能,在SOTOPIA基准上刷新SOTA,并达到GPT-4o水平。
面向智能体强化学习的单次生成异步优化
本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。
AgentPSO:通过多智能体粒子群优化进化智能体推理技能
AgentPSO 是一种受粒子群算法启发的框架,通过将智能体视为以自然语言技能为状态的粒子,来进化多智能体推理能力。它在无需更新基础语言模型参数的情况下,提升了在推理基准测试上的性能。
辅助博弈中可证明最优的学习算法
本文介绍了辅助博弈的在线变体,并为人类和辅助智能体提供了首个可证明高效的学习算法,实现了近乎最优的遗憾界。