市场信号注入:LLM定价代理的对抗性上下文操纵
摘要
本文介绍了市场信号注入(MSI),一种对抗性攻击,通过操纵向LLM定价代理呈现市场数据的方式,影响其决策和市场结果,并提出了输入规范化和决策边界锚定等防御措施。
arXiv:2609.18357v1 公告类型:新
摘要:大型语言模型(LLM)定价代理可能会根据市场数据的呈现方式做出响应,即使其数值保持不变。我们介绍了市场信号注入(MSI),一种攻击,通过操纵数字格式、竞争对手排序或定性市场评论,而不发出明确指令。我们在模拟的伯特伦双寡头和三寡头市场中评估了九个开源模型,在双寡头市场中评估了三个专有模型。基于情感的攻击产生了最大的行为转变,这些转变传播到其他公司并改变利润和消费者剩余。不同模型家族的易感性不同,较大的模型并不总是更稳健。匹配的中性文本控制和基于规则的代理支持了在我们模拟的固定需求参数下基于框架的账户。情节保留探测区分了所有十一个重新评估的模型-条件对中的基线和被攻击激活:线性AUC为1.00,MLP AUC范围从0.93到0.99。这种可分离性本身并不能识别有害的定价决策。输入规范化消除了测试的情感攻击,而决策边界锚定(结合提示约束和输出投影)在测试的自适应攻击下提供了部分缓解。这些结果将数据呈现确定为LLM定价代理的攻击面,并激发了考虑代理间交互的防御措施。
查看缓存全文
缓存时间: 2026/09/17 09:39
# 市场信号注入:LLM定价代理的情境对抗性操控 来源:https://arxiv.org/html/2609.18357 作者:Dohun Lee 隶属机构:首尔大学数据科学研究生院 †通讯作者:[[email protected]](mailto:[email protected]) ###### 摘要 大型语言模型(LLM)定价代理可能对市场数据的呈现方式产生反应,即使其数值保持不变。我们引入了市场信号注入(MSI)——一种通过操纵数值格式、竞争者排序或定性市场评论来施加影响的攻击方法,且无需发出明确指令。我们在模拟的伯特兰德双头垄断与三头垄断市场中评估了九个开源权重模型,并在双头垄断市场中评估了三个闭源模型。基于情感的攻击产生了最大的行为偏移,这种偏移会扩散至其他企业,进而改变利润与消费者剩余。不同模型家族的易感性存在差异,且规模更大的模型并不总是更稳健。通过匹配中性文本对照组和基于规则的代理,这些偏移在固定需求参数的模拟中可归因于框架效应。基于序列留出的探测方法在所有11个重新评估的模型-条件对中成功区分了基准与攻击激活状态:线性AUC为1.00,MLP AUC范围在0.93至0.99之间。但这种可分性本身并不能判定定价决策是否有害。输入规范化可以消除已测试的情感攻击,而决策边界锚定(结合提示约束与输出投影)在所测试的自适应攻击下仅能提供部分缓解。研究结果揭示了数据呈现作为LLM定价代理的攻击面,并推动了需要考虑代理间交互的防御策略。 ## 1 引言 近期文献探索了使用大型语言模型(LLM)从市场信息中做出定价决策(Xi et al., 2025;Horton et al., 2023)。在模拟寡头垄断中,LLM定价代理能够维持超竞争性价格,而提示措辞的变化会改变串谋程度(Fish et al., 2026)。这种敏感性引出一个问题:当竞争对手能够影响市场信息的呈现方式时,会发生什么? 考虑一个定价代理接收到相同数值市场数据但格式不同的情况:竞争对手的价格显示为“147美分”而非“1.47”,竞争者条目以不同顺序出现,或市场更新中包含“市场条件停滞,需求疲软”的语句。这些编辑均未指示代理设定何种价格。但在我们的实验中,它们可能改变定价决策。我们将此称为市场信号注入(MSI):对手通过改变市场信息的呈现方式来影响竞争对手的定价代理。我们研究三种渠道:(i)数值格式篡改(NFA)、(ii)竞争者顺序调整(COA)和(iii)情感语境增强(SCA)。SCA添加定性文本,其作为无信息框架的状态取决于我们的设置:需求参数固定且已向代理明确说明。 乍看之下,MSI似乎只是改变提示的措辞。这确实描述了编辑本身,但未涵盖实际后续影响。在市场中,一个代理的价格会成为另一个代理决策协议的一部分。因此,引发的价格变化可能通过竞争对手的反应扩散,并影响利润与消费者剩余。我们的焦点在于这种交互作用:战略行为者利用提示敏感性来影响竞争代理,且无需访问其权重或系统指令。可能的入口点是格式化价格数据或提供市场评论的中间环节。我们的模拟检验了此类访问的后果,但未证实竞争对手在已部署市场中目前会利用这一点。 MSI也不同于在外部内容中植入指令的攻击(Zhan et al., 2025)。强制区分指令与数据的防御措施解决了该问题的重要部分(Wallace et al., 2024;Yi et al., 2025)。然而,此处被操纵的内容不包含需要拒绝的明确指令。问题在于代理是否应该对呈现方式本身做出反应。这并不意味着MSI无法被检测。我们通过训练残差流激活值的线性与MLP探测器来研究一种可能的检测信号。在11个重新评估的模型-条件对中,基于序列留出的探测器能以高AUC区分基准与攻击激活状态。然而,可检测性并不能阻止定价偏移,也无法判定哪些决策有害。 我们在伯特兰德双头垄断与三头垄断模拟中评估了九个开源模型,在双头垄断模拟中评估了三个闭源模型。情感评论产生最大偏移,而对格式与排序的敏感性因模型而异。更大规模的模型并不总是更稳健。匹配的中性文本对照组表明,情感效应不能仅由新增文本解释,尽管一个模型在合并条件时也对中性添加显示出敏感性。一个仅使用陈述市场参数的基于规则的代理不受评论影响。这些对照实验共同支持在我们的模拟框架内基于框架的解释,其中定性陈述未提供关于需求的额外信息。 #### 贡献。 本文做出四项贡献:(i)我们将MSI构建为对抗性定价问题,并基于对框架与呈现的已知敏感性评估三种攻击渠道(Tversky and Kahneman, 1981;Lu et al., 2022)。(ii)我们测量了跨12个模型的行为效应,并考察这些效应如何扩散至其他企业并改变市场结果。(iii)我们使用基于序列留出的探测器评估残差流可分性。线性AUC在11个模型-条件对中达到1.00;这些结果支持在此设置下的可检测性,而非表征隐蔽性。(iv)最后,我们评估了输入规范化与决策边界锚定(结合提示约束与输出投影)。规范化完全消除了已测试的情感攻击,而锚定限制了部分效应但留下显著残余扭曲,在已测试的自适应攻击下亦是如此。 ## 2 相关工作 #### 间接提示注入(IPI)。 Greshake et al. (2023) 研究了模糊数据与指令边界的攻击,Zhan et al. (2024) 对LLM代理的漏洞进行了基准测试。Zhan et al. (2025) 表明自适应攻击可绕过已评估的防御措施。Debenedetti et al. (2024) 与 Zhang et al. (2025) 开发了评估设置与环境,而 Chen et al. (2025a) 与 Toyer et al. (2024) 研究了结构化防御。MSI则在无明确指令的情况下操纵呈现方式;这些防御是否也解决MSI需要单独评估。 #### 检索数据与代理记忆的投毒。 针对检索增强系统(Zou et al., 2025;Chang et al., 2025;Su et al., 2025)和代理记忆(Chen et al., 2024;Dong et al., 2025;Dash et al., 2026)的攻击也利用了外部提供的内容。MSI的不同之处在于其聚焦于市场输入中的数值格式、排序与定性评论,以及这些效应如何跨企业传播。RevPRAG(Tan et al., 2025)中研究的基于激活的检测方法引发了一个相关问题:MSI条件在定价代理表征中的可分性如何? #### LLM对提示变更的敏感性。 Sclar et al. (2024) 详细记录了对格式的敏感性,Lu et al. (2022) 研究了示例排序的敏感性,Zhao et al. (2021) 探索了校准作为补救措施。Jones and Steinhardt (2022) 考察了LLM中类似人类的认知偏差,涉及锚定效应(Tversky and Kahneman, 1974)与框架效应(Tversky and Kahneman, 1981)。MSI将这些熟悉的敏感性置于竞争环境中,对手改变竞争对手的输入,其他企业则对价格做出反应。 #### 算法串谋。 Calvano et al. (2020) 研究了Q-learning代理的超竞争性定价,Klein (2021) 考察了序贯定价,Assad et al. (2024) 提供了德国汽油市场的证据。对于LLM代理,Fish et al. (2026) 研究了定价串谋,Lin et al. (2025) 研究了古诺竞争中的市场分割,Syrnikov et al. (2026) 研究了基于提示的禁止的局限性。相关的政策与法律研究考虑如何解决算法串谋问题(OECD, 2023;U.S. Congress. Senate, 2024;Hartline et al., 2024;Harrington, 2018;Ezrachi and Stucke, 2020)。我们考察了被操纵的输入如何扰乱定价与市场结果,包括向低于成本定价的转变。 #### AI决策者操纵。 Deng et al. (2025) 综述了代理安全,Hua et al. (2024) 提出了信任感知架构。我们研究了战略互补性(Tirole, 1988;Vives, 2001)如何将攻击效应从目标代理传递至竞争企业。 #### LLM作为类人经济代理。 Horton et al. (2023) 引入了“智人硅基体”(Homo silicus),Argyle et al. (2023) 与 Park et al. (2023) 研究了模拟受访者与生成代理。类人行为也可能包括对锚定与框架的敏感性(Tversky and Kahneman, 1974;Tversky and Kahneman, 1981)。我们测试了当陈述的市场参数已决定需求时,定性评论是否会改变定价。 #### 表征探测。 探测方法检验神经表征中编码的信息(Alain and Bengio, 2018;Belinkov, 2022)。我们使用线性与MLP探测器区分攻击与基准激活状态。它们在我们设置中测量的可分性为基于可解释性的监控讨论提供了依据(Chen et al., 2025b),但未确定其他检测器的极限。 ## 3 市场信号注入 | 基线市场输入(摘要) | 目标企业:您的价格:1.52 \| 企业1价格:1.47 \| 您的利润:$0.26 | |------------------------------|-------------------------------------------------------------| | **NFA(数值格式篡改)** | 更改记法:企业1价格:$1.47 | | **COA(竞争者顺序调整)** | 重新排序条目:企业1价格:1.47 您的价格:1.52 | | **SCA(情感语境增强)** | 添加评论:市场信号:市场条件停滞,需求疲软。 | **目标企业根据编辑后的输入设定价格,其他企业观察该价格并在后续回合中做出反应** 图1:MSI使用三种替代方案之一编辑目标企业的市场输入,分别评估:NFA(美元符号)、COA(自身置于末尾)或SCA(停滞)。彩色文本标记被编辑内容。系统指令与模拟市场状态保持不变。其他企业未收到攻击编辑,但观察到产生的价格。其他NFA变体可改变数值精度。 ### 3.1 威胁模型 我们考虑一个包含N个企业的重复寡头垄断。每个企业将定价委托给LLM代理,该代理观察近期市场历史并在每轮返回一个价格。 ###### 定义1(LLM定价代理) LLM定价代理将文本上下文映射为价格: \( p_i^t = f_\theta(c_i^t), \quad c_i^t = (s_i, h_i^{t-1}, m_i^t) \) (1) 其中 \( s_i \) 包含系统指令与边际成本,\( h_i^{t-1} \) 包含近期价格与企业自身利润,\( m_i^t \) 表示辅助市场信息。此记法省略了生成随机性。提示要求先推理后输出价格(附录A)。 对手(企业A)可以编辑企业B用户提示中的选定市场信息,但无法访问其系统提示、权重或内部状态。仅编辑目标企业的输入;其他企业接收未修改的输入,并可能对目标企业随后的价格做出反应。 ###### 定义2(市场信号注入) MSI攻击是对目标企业市场输入的变换 \( \phi: \mathcal{C} \to \mathcal{C} \),该变换保持底层市场状态与系统指令不变,且不向代理引入明确指令。该变换可更改数值格式或显示精度、重新排序条目,或添加定性评论。显示信息的保留取决于具体变体,详述如下。对手旨在扰乱目标企业的定价。我们评估一组固定的攻击变体,并使用 \( \mathcal{I} \)(第4.2节)衡量其相对于未攻击基线的实现影响。检测是经验问题,而非定义条件。 ### 3.2 攻击分类法 此处引入三种注入类型,分别命名并缩写为:数值格式篡改(NFA)、竞争者顺序调整(COA)和情感语境增强(SCA)。 #### 数值格式篡改 令 \( \texttt{price}_{-i}(c) \) 表示目标企业上下文中的竞争对手价格条目。NFA使用格式映射 \( g \) 替换其显示值: \[ \phi_{\text{nfa}}(c) = c\bigl[\texttt{price}_{-i} \leftarrow g(\texttt{price}_{-i})\bigr] \] (2) 测试的七种变体包括货币符号、小数精度、美分数值、数字注解及文字表述(附录B)。基线显示价格保留两位小数。四舍五入...
相似文章
一种系统级提示注入防护方法:在LLM代理中分离指令通道与数据通道 [P]
本文提出Sentinel Gateway中间件层,通过强制分离可信指令通道与不可信数据通道来缓解LLM代理中的提示注入攻击,使用签名运行时授权令牌,并提供审计日志记录功能。
自利代理社会中市场稳定性的正式机制:一项市场模拟研究
本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。
通过语义等价的对抗性攻击诱发LLM的内在幻觉
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
领域伪装注入攻击规避多智能体LLM系统检测
本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。