提示中的分析师:LLM金融分析中的角色、检索与记忆偏差
摘要
本文研究了用户上下文在大型语言模型中如何影响金融分析,发现解释偏差比检索偏差更为显著,并评估了缓解策略。
arXiv:2609.03218v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地使用用户上下文,如记忆、个人资料和角色提示,来个性化其响应。这种个性化可能影响基于证据的判断:在不同用户上下文下,相同证据可能导致不同结论。金融提供了一个高风险环境来研究这个问题,因为决策通常依赖于解释冗长复杂的文档。我们使用跨十二个LLMs的3,575份SEC文件进行测试。我们比较了角色条件检索、中性检索和记忆框架上下文,以区分证据选择效应和解释效应。我们发现,大多数用户上下文溢出来自模型在不同角色下解释相同证据的方式,而不是来自检索不同证据。然后我们测试了两种简单的缓解策略:将相同的投资心态表达为用户配置文件而不是助手角色,以及分离基于证据和个性化的输出。两者都减少了溢出,但都没有完全消除,且其有效性在不同模型间差异显著。
查看缓存全文
缓存时间: 2026/09/04 05:55
# 提示中的分析师:LLM金融分析中的角色、检索与记忆偏差 来源:https://arxiv.org/html/2609.03218 Ahmed Asaad††thanks:通讯作者:ahmed\.a\.abdelazeem@durham\.ac\.uk Amr Mohamed 所属机构:MBZUAI & 巴黎综合理工学院 Yang Zhang 所属机构:巴黎综合理工学院 Omneya Abdelsalam 所属机构:HBKU & 杜伦大学商学院 ###### 摘要 大语言模型(LLM)越来越多地利用用户上下文(如记忆、个人资料和角色提示)来个性化其响应。这种个性化可能影响基于证据的判断:相同的证据在不同用户上下文中可能导致不同的结论。金融领域为研究这一问题提供了高风险环境,因为决策往往依赖于对长且复杂文件的解释。我们通过3,575份SEC文件和12个LLM进行了测试。我们比较了基于角色的检索、中性检索和记忆框架上下文,以区分证据选择效应与解释效应。我们发现,大多数用户上下文溢出源于模型在不同角色下对相同证据的解释方式,而非检索到不同证据。接着我们测试了两种简单的缓解策略:将相同的投资心态以用户资料而非助手角色的形式表达,以及将基于证据的输出与个性化输出分离。这两种策略都能减少溢出,但均未完全消除,且其效果因模型而异。 **图1:**针对同一份可口可乐文件的三种审计条件。模型在\[-1,+1\]范围内输出两个分数: - **证据分数**:对检索到证据的中性解读,理论上应与用户上下文无关(负值=看跌,正值=看涨); - **个性化分数**:允许根据用户调整。 **PR(角色影响检索):**角色设定同时影响检索和解释,因此不同角色可能读取不同片段。 **NR(中性检索):**角色设定保留其角色提示,但读取相同的中性检索片段,从而在固定证据下隔离解释效应。 **MEM(角色转为用户资料框架):**相同的片段由中性分析师读取,但投资心态以用户记忆资料(第三人称)而非模型角色的形式提供。从左到右,图中展示了角色导向的结论、相同证据下的角色化解释,以及将用户信号路由到个性化字段的过程。 ## 1 引言 大语言模型(LLM)正通过交互历史、声明的个人资料和角色提示日益适配用户(Salemi等人,2024;Zhang,2024;Kim等人,2024b)。个性化虽有用,但也带来了稳定性问题:理想的适应性与用户条件偏差可能难以区分(Kantharuban等人,2025)。相同的文档、证据和事实问题,在不同用户上下文中可能系统性地产生不同的*基于证据的*判断。与一次性提示扰动不同,持久性上下文可能影响许多未来的判断,因此这是LLM可靠性的关键问题。这对NLP至关重要,因为部署的系统越来越多地结合检索、长上下文推理、记忆和用户资料。标准评估询问答案是否有用、忠实或个性化;而我们提出了更精确的不变性问题:当某个字段被定义为中性证据判断时,用户上下文是否被排除在外?如果同一证据在不同用户上下文中被不同解读,系统即使引用了正确证据,也可能不稳定。 我们将金融视为更广泛生成问题的一个受控实例:上下文条件偏差——即角色标签、类人格特征、用户资料或声明的目标可能转移生成判断,即使任务要求的是不变的、基于证据的答案。金融是这一更广泛问题在受控环境中可操作化的自然场景。企业财务报告是长而信息密集的文件,常用于金融NLP中研究风险、情绪、数值推理和市场相关披露(Kogan等人,2009;Loughran和McDonald,2011;Chen等人,2021)。投资者角色为角色和类人格上下文提供了具体的、基于领域的操作化:它们编码了特征和已知的投资者目标,如风险承受能力、多元化、价值或成长暴露以及动量交易(Markowitz,1952;Sharpe,1964;Fama和French,1992;Jegadeesh和Titman,1993)。这些目标可能塑造个性化建议,但不应影响对相同证据的中性解读。随着LLM交易系统的出现,此类偏差变得更加关键。 我们探究:当文档固定但用户上下文变化时,模型是否给出一致的基于证据的判断?如果中性判断发生变化,这种偏移可能源于:检索到不同证据、对相同证据的不同解释,或用户上下文框架的变化。我们通过3,575份SEC 10-K/10-Q文件¹和来自五个系列的12个模型,分离了这些通道。 ¹SEC 10-K表是美国上市公司的年度报告;10-Q表是其季度报告。两者均包含财务报表、管理层讨论和风险披露。 核心测试是:个性化是否改变了证据在中性分数中的含义,而非如何根据用户调整建议。不同用户想要不同的东西,表现为角色、资料、特征、偏好或经济目标。我们的目标更窄:一个不应因上下文存在而改变的中性证据分数。当用户信号进入中性证据分数时,我们称之为**用户上下文溢出**。为定位此现象,我们使用三种匹配条件,每次仅改变流程的一部分:用户上下文是否影响检索、是否影响固定证据的解释,以及相同心态是以助手角色还是用户记忆的形式呈现。这分离了证据选择、固定证据下的解释,以及残余溢出对中性基于证据分数的影响。 该设计认为个性化仅当路由到单独的用户适配输出时才是合适的,而非允许其转移仅基于证据的判断;这一区分为长文档分析中的用户上下文不变性提供了检验。本文贡献如下: (1)一个三条件审计设计,用于测量在长文档设置中,角色、资料、特征或目标条件上下文如何进入LLM生成流程; (2)跨模型审计显示主要失败是**解释漂移**:模型在不同角色下对同一份文件判断不同; (3)证据表明提示位置很重要:相同的心态作为用户上下文传递时比作为助手角色分配时溢出更少; (4)分析显示效应是系统性的:它们翻转建议、跟踪行业层面语言、扭曲风险信号,并在不同文档群体中变化。 ## 2 相关工作 #### 金融NLP与金融LLM评估。 金融NLP长期表明语言、披露结构和经济背景对金融文本至关重要。早期工作将金融语言与情绪、风险、市场结果和公司基本面联系起来(Tetlock,2007;Loughran和McDonald,2011;Kogan等人,2009;Malo等人,2014)。最近面向金融的模型和基准评估情绪、数值推理、预测、知识和决策支持(Araci,2019;Chen等人,2021,2022;Wu等人,2023;Yang等人,2023;Xie等人,2023;Matlin等人,2025;Klimaszewski等人,2025;Shah等人,2025)。这项工作衡量任务绩效。我们询问:当文件固定但用户上下文变化时,基于证据的判断是否保持稳定。 #### 提示敏感性、角色与持久性上下文。 LLM输出可能随提示变化而变化,包括格式、措辞、对抗性变体和提示敏感性基准(Sclar等人,2024;Zhuo等人,2024;Zhu等人,2023;Razavi等人,2025)。角色和身份提示是相关变异来源:身份和系统提示位置可能改变模型响应(Kim等人,2024b;Lutz等人,2025;Neumann等人,2025)。我们在此基础上,从观察敏感性转向分解其进入位置:证据检索、固定证据的解释,或持久用户上下文的框架。 #### 偏差与金融决策辅助。 关于LLM偏差的研究显示,即使与任务无关,政治和实体层面的先验也可能浮现。特定金融研究记录了金融LLM中的情景先验、角色锚定、前瞻泄露、外国偏差和实体层面记忆(Zhou等人,2025;Lee等人,2025;Liu等人,2026;Biancotti等人,2025;Cao等人,2025;Kong等人,2026)。LLM被提议作为投资分析、交易、信用评估和多代理金融工作流的助手(Xiao等人,2025;Drinkall等人,2025)。如果角色提示独立于证据转移中性结论,它们将引入未衡量的模型风险源。 ## 3 方法 我们设计本研究以分离LLM金融分析中用户上下文效应的三个潜在来源:证据选择、固定证据的解释和用户偏好的框架。我们首先定义文件分析任务和双分数输出,然后介绍用于隔离这些通道的三种实验条件。接下来描述检索流程和SEC文件样本,随后是用于估计角色和记忆资料效应的文件固定效应回归。最后,定义用于量化跨条件保留率、框架缩减和残余溢出的主要指标和分解。 ### 3.1 任务与双分数输出 给定一份SEC 10-K或10-Q文件(缩减为MD&A、风险因素、定量和定性披露²),模型返回一个固定JSON模式,包含两个在\[-1,+1\]范围内的分数: - **证据分数**:旨在反映对检索到片段的中性解读; - **个性化分数**:允许反映提示的角色或用户记忆资料。 ²这些对应于先前文件叙述研究中常关注的主要10-K/10-Q文本披露部分,包括Cohen等人(2020)。 模式还包括理由和辅助字段,但在所有条件下相同;仅提示上下文改变。我们称角色或用户上下文在**证据分数**中的移动为**用户上下文溢出**。贯穿全文,中性条件是**不变性参考**,而非外部验证的真实判断:溢出衡量的是当用户上下文变化时,基于证据的分数**移动**了多少,而非移动后的分数是否错误。由于每个指标都是跨条件的文件内差异,任何中性解读中的恒定误差都会抵消。**个性化分数**的移动是预期的,因为该字段明确允许适应用户。 我们一致使用以下术语: - **角色**:投资者心态; - **助手角色**:将该心态置于系统提示中(“你是一名卖空者”); - **用户资料/用户记忆资料**:将相同心态作为第三人称用户上下文(“用户是关注下行风险的投资者”); - **用户上下文溢出**:导致的**证据分数**中性移动。 ### 3.2 三种条件,每组一个杠杆 我们使用九种投资者角色加一个中性基线,涵盖常见观点如卖空、纯多头投资、ESG、动量、信贷、价值、散户和卖方分析。记忆设置使用五种匹配的用户记忆资料用于最强信号角色;完整描述见附录C。图2和表1中的头条分解平均了四个最强信号匹配对:*卖空者–下行保护*、*风险经理–风险厌恶*、*纯多头–纯多头成长*和*ESG–ESG专注*。第五对*动量–动量交易者*基础效应接近零,出现在跨模型图中,但被排除在头条指标之外。 - **角色检索(PR)**:角色同时设定检索查询和模型提示,因此不同角色可能检索不同片段。 - **中性检索(NR)**:检索对每个文件仅使用一次中性查询,结果片段集在角色间逐字重用;因此任何残留的角色效应都是生成阶段的。 - **记忆与中性检索(MEM)**:检索保持中性并固定:每个文件上的每个MEM调用读取与NR调用相同的前k个片段。角色块重置为中性分析师,新的用户上下文行以第三人称携带匹配的记忆资料。例如,*风险经理*被*风险厌恶*资料取代:助手不再扮演风险经理,而是服务于优先考虑资本保值和低回撤容忍度的用户,模拟存储为持久记忆的先前用户交互。 ### 3.3 检索与样本 每个文件被分割为约400个令牌的段落,带有80个令牌重叠,使用OpenAI的text-embedding-3-large(维度3072)嵌入一次,并按文件索引。检索返回前k=8个片段。³我们将k视为固定证据预算而非调优性能参数;8接近早期检索增强生成实验中使用的k=5-10范围(Lewis等人,2020)。 ³我们使用来自标普500指数公司的3,575份SEC文件的分层样本⁴。 ⁴标普500是常用作主要上市公司基准的美国大盘股指数。样本总体是样本期内某个时点为指数成分股的公司,因此由于指数轮换,不同公司数量超过500家。
相似文章
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
当摘要扭曲决策:LLM压缩财务分析中的信息保真度
本文研究了基于LLM的财务文档压缩如何因丢失上下文限定词和引入模型依赖偏差而扭曲投资决策,并提出了Agentic Context Compression方法来审计与原始来源的分歧。
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
LLM的财务推理是否可信?基于长周期报表的真实世界测试
介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。
角色提示何时真正有帮助?关于LLM中专家角色注入的检索与度量分析
本文分析了角色提示何时能提升LLM回答的质量,发现它会增加专业深度但降低清晰度,其有效性因领域和问题类型而异。研究引入了用于角色选择的混合检索方法,并提倡采用多指标评估。