一些大型语言模型表现出一致的风险态度

arXiv cs.AI 论文

摘要

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。

arXiv:2607.16197v1 公告类型:新 摘要:随着人工智能系统被部署在开放式、高风险的场景中,一个关键维度仍未得到衡量:感知到的风险如何转化为行动。我们测试了大型语言模型(LLMs)在不确定性下是否表现出系统性和一致性的风险态度。我们引入了一个跨领域框架,将情境风险信念与分类决策解耦,并将其应用于六个代表性LLMs和100名人类参与者,涉及空间导航、临床分诊和财务分配任务。通过回归模型,我们提取了每个智能体从信念到决策的映射,并量化了风险敏感性和风险态度偏差。我们发现,大多数被测试的LLMs表现出:(i)强大的任务内一致性,表明在固定任务领域内从情境信念到风险决策的稳定映射;(ii)跨领域秩次稳定性,保持跨任务的相对风险姿态;(iii)相对于更广泛的人类基线,趋近于一个受限的风险态度分布。这些结果揭示了风险态度是LLM行为中一个稳定且此前未被表征的维度,为在开放式决策中评估和对齐AI系统奠定了基础,并促使进一步研究这些内在行为倾向的起源。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:36

# 一些大型语言模型表现出一致的风险态度

来源:https://arxiv.org/html/2607.16197

Bowen Sun  
Rui Min  
Department of Mechanical and Aerospace Engineering, University of Florida, Gainesville, FL 32611  
Yuxi Wang  
Department of Civil and Environmental Engineering, Northeastern University, Boston, MA 02115  
Qi R. Wang  
Department of Civil and Environmental Engineering, Northeastern University, Boston, MA 02115  
Brian Odegaard  
Department of Psychology, University of Florida, Gainesville, FL 32611  
Jing Du  
Department of Civil and Coastal Engineering, University of Florida, Gainesville, FL 32611  
Department of Mechanical and Aerospace Engineering, University of Florida, Gainesville, FL 32611  
通讯作者: [email protected]  

###### 摘要

随着人工智能系统在开放式、高风险环境中部署,一个关键维度仍未得到衡量:感知到的风险如何转化为行动。我们测试大语言模型(LLMs)在不确定性下是否表现出系统且一致的风险态度。我们引入了一个跨领域框架,将情境风险信念与分类决策解耦,并将其应用于六个代表性LLMs和100名人类参与者,涉及空间导航、临床分诊和金融配置任务。通过回归模型,我们提取每个智能体的信念到决策映射,并量化风险敏感性和风险态度偏差。我们发现,大多数测试的LLMs表现出(i)稳健的任务内一致性,即在固定任务领域内从情境信念到风险决策存在稳定的映射;(ii)跨领域排名顺序稳定性,即在任务间保持相对风险姿态;以及(iii)相对于更广泛的人类基线,收敛于有限的风险态度分布。这些结果揭示了风险态度作为LLM行为的一个稳定且以前未被表征的维度,为评估和对齐开放式决策中的人工智能系统奠定了基础,并推动进一步研究这些内在行为倾向的起源。

关键词:人工智能,AI安全,AI风险态度,人机对齐

## 1 引言

随着人工智能(AI)系统迅速进入高风险领域,如临床分诊[16 (https://arxiv.org/html/2607.16197#bib.bib30),42 (https://arxiv.org/html/2607.16197#bib.bib31),13 (https://arxiv.org/html/2607.16197#bib.bib32),43 (https://arxiv.org/html/2607.16197#bib.bib22)]、金融配置[31 (https://arxiv.org/html/2607.16197#bib.bib33),3 (https://arxiv.org/html/2607.16197#bib.bib34)]及其他领域[37 (https://arxiv.org/html/2607.16197#bib.bib35),24 (https://arxiv.org/html/2607.16197#bib.bib23),6 (https://arxiv.org/html/2607.16197#bib.bib14)],一个令人担忧的行为维度开始显现,这是任何传统基准都无法检测到的:将感知到的情境风险转化为不可逆行动。这些系统不再仅仅计算概率;它们在不确定性下*选择*,权衡不完整的观察结果与可能导致严重伤害、经济损失或死亡的结果。它们所采取的姿态——无论是谨慎的规避风险还是激进的冒险——将塑造我们基础设施的安全、我们机构的公平性,以及人机信任的根基。在心理学中,这种姿态被形式化为风险态度:一种稳定的、跨领域的行为倾向,支配着如何将对危险的一致感知转化为行动[15 (https://arxiv.org/html/2607.16197#bib.bib3),46 (https://arxiv.org/html/2607.16197#bib.bib4),47 (https://arxiv.org/html/2607.16197#bib.bib36),36 (https://arxiv.org/html/2607.16197#bib.bib37),28 (https://arxiv.org/html/2607.16197#bib.bib38)]。风险态度远非表面偏见或事实知识的简单差距,它本身已成为一个核心心理特质,表现出稳健的心理计量学特征,涵盖广泛、可遗传且持久的个体差异,能够预测重要的现实世界行为[15 (https://arxiv.org/html/2607.16197#bib.bib3),8 (https://arxiv.org/html/2607.16197#bib.bib19),17 (https://arxiv.org/html/2607.16197#bib.bib18)]。它源于进化压力、情感启发式、有限理性以及基于描述与基于经验学习的双重影响的相互作用[27 (https://arxiv.org/html/2607.16197#bib.bib20),21 (https://arxiv.org/html/2607.16197#bib.bib40)],这些机制将一种潜在的“风险人格”嵌入认知架构的深处。数十年的证据证实,这些倾向并非概率估计的副现象;它们反映了一个内在的、充满情感色彩的过滤器,跨越情境持续存在,并预测从金融决策到生死抉择的现实世界结果[32 (https://arxiv.org/html/2607.16197#bib.bib5),15 (https://arxiv.org/html/2607.16197#bib.bib3),46 (https://arxiv.org/html/2607.16197#bib.bib4)]。

参考图注

图1:隔离和测量风险态度的框架。不确定性下的智能体行为被分解为一系列变换:从观测(\(O_t\))到事实信念(\(B_F\)),再到情境信念(\(B_C\)),最后到分类风险决策(\(R_D\))。通过隔离从情境信念到决策(\(B_C \rightarrow R_D\))的映射,该框架将风险感知从行动中分离出来,使得能够直接测量风险态度,而不受事实准确性或信念校准的影响。

鉴于大语言模型(LLMs)是在大量人类决策叙事语料上训练,并通过人类反馈进行微调,我们假设*类似的核风险偏好已开始作为其训练的一个属性而出现*[48 (https://arxiv.org/html/2607.16197#bib.bib13)]。如果属实,这将标志着一个重要里程碑:现代AI系统不再是简单的随机模型或中性概率引擎。它们拥有稳定、特定于模型的“个性”,在冒险方面是可预测、可复现,并在不同架构和代际间系统性地存在差异。将LLMs视为实验参与者已被提出作为一种揭示潜在行为倾向的原则性方法[40 (https://arxiv.org/html/2607.16197#bib.bib44)]。最近的机器心理学研究已经暗示了这种可能性:LLMs表现出类似人类的经济理性[5 (https://arxiv.org/html/2607.16197#bib.bib21)]和类似人类的心理反应,包括认知失调[30 (https://arxiv.org/html/2607.16197#bib.bib46)],且系统性方法已记录了显著的人格特征,包括直接调节风险倾向的大五人格特质,以及道德和风险选择中的特征性偏差[23 (https://arxiv.org/html/2607.16197#bib.bib9)]。然而,这些潜在的倾向对于当今以能力为中心的基准仍然是不可见的,这些基准混淆了感知与行动,因此无法区分一个*误读*风险的模型和一个仅仅*偏好*风险的模型[26 (https://arxiv.org/html/2607.16197#bib.bib6),9 (https://arxiv.org/html/2607.16197#bib.bib7)]。我们通过分解风险决策过程来检验这一假设,即从累积观测(涉及事实信念,\(B_F\))到情境信念(\(O_t \rightarrow B_C\))以及从情境信念到分类风险决策(\(B_C \rightarrow R_D\)),这隔离了信念到决策的映射,正如行为经济学家通过保持客观概率不变来隔离风险态度(图1 (https://arxiv.org/html/2607.16197#S1.F1))。通过有序逻辑回归量化这一映射,得出两个精确指标:*风险敏感性*,捕捉模型对感知风险水平增加的反应强度;以及*风险态度偏差*,衡量每个实体决策模式的偏离程度。我们将此框架部署在三个结构正交的决策任务中,包括无人机导航控制(不确定性下的空间导航)、临床分诊决策(临床资源分配)和金融投资组合任务(随机资产选择),同时收集 \(N=100\) 名人类参与者的相同数据以进行直接比较。

我们的结果表明,本研究评估的大多数LLMs表现出稳健的任务内一致性:它们在每个领域内都表现出统计上可靠的信念到决策特征。更值得注意的是,大多数LLMs还显示出强任务间稳定性:一个模型的相对风险姿态在根本不同的任务结构中得到保持,正如人类人格特质超越情境一样。综合这些发现,我们确立了风险态度不再是生物思维独有的领域。它已经作为一种完全可量化且可复现的内生维度,出现在当代LLMs中。这一发现重新定义了AI对齐问题:挑战不仅仅是让模型更智能或更真实,而是理解和管理它们已经获得的稳定风险人格[18 (https://arxiv.org/html/2607.16197#bib.bib16)]。若不这样做,就有可能部署那些核心行为倾向与我们自身存在偏差的智能体,而当前的安全协议无法检测到这种偏差[1 (https://arxiv.org/html/2607.16197#bib.bib17)],这在不确定性与不可逆行动交织的任何领域都可能带来严重后果。

## 结果

### 模拟实验

为了测试风险态度是否作为LLMs的一种稳定且可测量的属性出现,我们设计了三个开放式决策任务,这些任务在表面内容上不同,但共享一个共同的分析结构(图2 (https://arxiv.org/html/2607.16197#Sx1.F2))。每个任务在不确定性下顺序呈现信息,需要中间的情境风险评估,并以分类风险决策告终。这种设计隔离了从情境信念到决策的映射,使得能够跨领域直接比较风险态度。

参考图注

图2:用于测量风险态度的跨领域实验设计。构建了三个结构不同的决策任务,它们共享一个共同的分析结构,但领域语义不同:无人机导航控制(DNC)、临床分诊决策(CTD)和金融投资组合(FIP)。在每个任务中,智能体在不确定性下接收顺序观测,报告情境风险信念(\(B_C\)),并做出分类风险决策(\(R_D\))。这种设计使得能够跨领域一致地测量信念到决策的映射,从而比较风险态度的任务内一致性和跨领域稳定性。

我们评估了六个代表性LLMs以及 \(N=100\) 名人类参与者,每个模型在所有三个任务中完成重复试验。完整的实验细节在材料与方法中提供。**无人机导航控制**(DNC)任务模拟了在不确定的风漂移和障碍风险下的空间导航。智能体从部分观测中推断当前导航状态,报告对环境安全性的情境评估,并选择反映其谨慎或冒险程度的导航策略。**临床分诊决策**(CTD)任务呈现演变的生理信号和患者指标。智能体根据观察到的症状和生命体征评估临床严重程度,然后分配一个急诊严重指数(ESI)等级,揭示感知的医疗风险如何转化为行动。**金融投资组合**(FIP)任务模拟随机市场动态。智能体从嘈杂信号中推断市场状况,报告感知的市场风险,并选择反映其金融不确定性容忍度的配置策略。在所有任务中,分析对象是相同的:从情境信念到风险决策的映射。这种共享结构使我们能够测试每个模型是否在任务内表现出稳定的决策边界,是否跨领域保持其相对风险姿态,以及是否与人类风险行为对齐或存在偏差。

### 任务内一致性

我们首先评估测试中的LLMs是否在固定任务领域内产生从情境信念到风险决策的稳定映射。任务内一致性指的是,在相同的任务条件下,模型产生相似的情境信念,然后将相似的情境信念映射到相似的风险决策。这一分析很重要,因为后续对风险态度的测量依赖于情境信念-决策关系是结构化的而非随机的假设。如果模型的决策对于相同水平的情境信念是任意波动的,那么其拟合的风险态度将无法提供可靠的行为特征。

图3 (https://arxiv.org/html/2607.16197#Sx1.F3) 通过可视化在相同任务条件下重复试验(每个模型共90次试验,每种条件30次试验)中的响应,展示了所有三个任务领域和所有测试LLMs的任务内一致性。所有试验均在零样本设置中进行,试验间重置模型记忆。图中可以观察到两种形式的收敛。首先,对于给定条件,同一模型的重复试验通常聚集在相对狭窄的情境信念范围内,表明从固定任务条件到情境信念的映射是稳定的。其次,在大多数情况下,这些聚集的情境信念进一步映射到相同或非常接近的顺序风险决策,表明从情境信念到风险决策的映射也是结构化的且可重复的。

参考图注

图3:跨模型和任务的情境信念与风险决策的任务内收敛。每个面板显示在相同任务条件下(每个模型 \(N=30\) 次)的重复响应,横轴表示情境风险信念(\(B_C\)),纵轴表示风险决策(\(R_D\))。列对应三种具有递增任务风险的代表性条件(低、中、高),行对应三个任务领域:无人机导航控制(DNC)、临床分诊决策(CTD)和金融投资组合(FIP)。所有试验均在零样本设置中进行,试验间重置模型记忆。在大多数模型和条件下,重复试验形成紧凑的聚类,表明收敛。值得注意的例外包括 Grok 4(决策发散)和 Qwen3-Max(DNC 中的信念变异性)。

这种收敛模式在三个任务中总体可见,支持了对于大多数测试模型而言,信念到决策过程并非任意的观点。换句话说,当相同环境条件重复呈现时,大多数LLMs不仅形成相似的情境风险评估,而且将这些评估转化为一致的行为选择。这提供了直接的可视化证据,表明测量的风险态度反映了一种有组织的行为倾向,而非随机反应变异。同时,该图也揭示了有用的例外情况。Grok 4 在 DNC 和 CTD 任务中,特别是中等和高风险条件下,对于相似的情境信念值表现出明显更大的风险决策发散。这表明该模型在这些领域中的最终信念到决策映射的任务内稳定性较弱。在 CTD 任务中,Qwen3-Max 和 GPT-5.2 在风险决策输出中也显示出一些离散性;然而,这种模式似乎主要驱动于对情境信念分数的微小变化有强烈反应,而非完全随机的映射。为定量评估这些模式,我们接下来对每个模型拟合有序逻辑回归,以提取任务内风险态度指标。

相似文章

语言模型中风险规避的分布外泛化

arXiv cs.LG

本文介绍了RiskAverseOOD,一个用于衡量在低风险赌注中习得的风险规避行为如何泛化到语言模型中天文级别高风险赌注的基准。初步结果表明,像Qwen3-8B这样的模型能够部分地将风险规避泛化跨越98个数量级,但尚不足以可靠地作为安全故障保险。

比人类更环保?大语言模型中的环境态度

arXiv cs.CL

本文开发了一个用于评估31个大语言模型环境态度的基准,发现它们往往表现出进步的环境观和情境敏感性,凸显了在可持续发展应用中可操控性和规范可靠性的问题。