噪声感知下智能体的风险感知决策策略
摘要
本文提出了一个在噪声感知下觅食的人工生命捕食者-猎物模型,表明与盲目信任感知标签相比,不确定性感知决策策略能显著提高生存率,并且随着不确定性增加,智能体会从探索性策略转向保守性策略。
查看缓存全文
缓存时间: 2026/08/10 08:00
# 基于风险感知的噪声感知决策策略
来源:https://arxiv.org/html/2608.06420
David Szczecina 滑铁卢大学,加拿大 david\.szczecina@uwaterloo\.ca
###### 摘要
生物系统的感知本质上是有噪声的,这要求生物体在不确定性下做出决策,而错误分类可能代价高昂甚至致命。我们提出了一个在噪声感知条件下觅食的人工生命捕食者-猎物模型,并比较了智能体在采用不同策略时,利用其噪声预测进行决策的性能表现。通过在对称和非对称感知噪声下的受控实验,我们表明,随着噪声的增加,盲目信任感知标签会导致灾难性失败,而不确定性感知策略则能显著提高生存率并减少致命错误。我们进一步观察到行为上的定性相变:随着不确定性增加,智能体会从探索性策略转变为保守性策略。我们的模型通过展示显式信息收集可以在感知不可靠时提高鲁棒性,将风险敏感觅食、生态信息利用和人工生命联系起来。这些结果强调了不确定性感知决策的重要性,并为噪声标签下的鲁棒学习提供了一个可解释的人工生命类比。
## 引言
生物体很少能确定无疑地感知其环境。感官信息是有噪声的、不完整的且依赖于情境的,受到距离、遮挡、伪装、运动和环境变化等因素的影响(Dallet al\.\(2005 (https://arxiv.org/html/2608.06420#bib.bib3)\);Lima and Dill \(1990 (https://arxiv.org/html/2608.06420#bib.bib16)\))。在捕食者-猎物情境中,感知错误也呈现出强烈的不对称性,因为将食物误认为危险可能会减少能量摄入,但将危险误认为食物则可能是致命的。行为生态学和决策理论长期以来一直强调,这种不确定性不仅仅会降低性能,还会主动塑造行动选择、信息利用和风险敏感性。
人工生命为通过与环境交互的具身智能体来研究这些动态提供了一个自然框架。然而,许多觅食和捕食者-猎物模型假设近乎完美的感知,从而抽象掉了真实生物决策的一个决定性约束(Reynolds \(1987 (https://arxiv.org/html/2608.06420#bib.bib4)\);Ray \(1991 (https://arxiv.org/html/2608.06420#bib.bib5)\))。在本工作中,我们将感知建模为一个有噪声的概率标记过程:智能体不直接观察实体的真实身份,而是接收关于实体是食物还是捕食者的不确定信念。这种框架具有生物学动机,但它也反映了人工智能和机器学习中一个更广泛的问题。在噪声标签学习中,模型通常将观察到的标签视为真实标签,即使标注被错误标记,当预测置信度与给定标签冲突时,这会导致有害的更新(Songet al\.\(2022 (https://arxiv.org/html/2608.06420#bib.bib9)\);Northcuttet al\.\(2021 (https://arxiv.org/html/2608.06420#bib.bib10)\);Pleisset al\.\(2020 (https://arxiv.org/html/2608.06420#bib.bib11)\))。我们的模拟研究了这个问题在行为层面的类似物:智能体何时应该信任噪声标签,何时应该持怀疑态度?
我们不是将感知视为对真实类别的直接访问,而是将其建模为一个推理问题。智能体接收关于实体身份的多个噪声信号,并且必须将这些信号组合起来,形成关于该实体是食物还是捕食者的信念。这可以被视为一种简单的贝叶斯推理形式,其中不同来源的证据对引导行动选择的后验信念做出贡献(Knill and Pouget \(2004 (https://arxiv.org/html/2608.06420#bib.bib23)\))。我们在一个由智能体、食物资源和捕食者组成的二维觅食环境中研究这个问题。智能体维持内部能量状态,并且必须在不确定感知下权衡能量奖励和生存风险。我们比较了三种决策策略:盲目策略直接根据当前感知标签行动;怀疑策略仅当推理出的食物概率足够远离不确定性时才做出接近或回避的承诺,否则放弃行动;验证策略可以在承诺接近或回避之前花费时间和能量来收集额外信息。这使我们不仅能够检查感知噪声是否降低性能,还能检查不同策略如何在生态学上有意义的结果(如存活时长、捕食和饥饿)之间重新分配错误。
我们的结果表明,增加感知噪声会产生明显的行为相变,并暴露出盲目信任不可靠标签的弱点。包含怀疑或验证的策略能更好地避免灾难性的错误接近,尽管通常以降低觅食效率为代价。通过显式地将感知不确定性纳入决策过程,这项工作为鲁棒性、适应性和涌现等人工生命核心主题做出了贡献。更广泛地说,它为标签噪声下的鲁棒学习提供了一个有用的类比:当标签不可靠且错误成本不对称时,谨慎的决策规则可以胜过对损坏信号的盲目优化。
## 相关工作
关于觅食和捕食者-猎物决策的研究一直强调,生物体是在不确定、有噪声且常常具有误导性的感官信息下运作的,而非直接获取真实环境状态。风险敏感觅食理论通过表明行为不仅依赖于预期奖励,还依赖于方差、内部状态和错误的不对称成本来形式化这一点(Stephens and Krebs \(1986 (https://arxiv.org/html/2608.06420#bib.bib15)\);Bateson and Kacelnik \(1998 (https://arxiv.org/html/2608.06420#bib.bib25)\);Houston and McNamara \(1999 (https://arxiv.org/html/2608.06420#bib.bib26)\))。特别是,生态决策系统受到以下事实的塑造:假阴性(未能检测到捕食者)通常比假阳性(不必要地回避食物)代价高得多,这使得不确定性从根本上具有不对称性。
行为生态学的大量工作进一步表明,猎物必须在不确定的威胁感知下行动,当精确分类不可行时,往往依赖启发式方法(Lima and Dill \(1990 (https://arxiv.org/html/2608.06420#bib.bib16)\))。捕食风险分配假说通过表明最优行为取决于危险的时间和组织特性来扩展这一点,这意味着决策必须动态适应不确定性,而不是假设固定的策略(Lima and Bednekoff \(1999 (https://arxiv.org/html/2608.06420#bib.bib17)\))。重要的是,这些框架隐含地假设感知本身是不完美的,但大多数形式和计算模型并未将感知噪声作为主要变量。
信息生态学提供了一个互补的视角,认为行为不仅受环境状态支配,还受生物体如何获取、解释和利用可靠性不同的信息所支配(Dallet al\.\(2005 (https://arxiv.org/html/2608.06420#bib.bib3)\);Schmidtet al\.\(2010 (https://arxiv.org/html/2608.06420#bib.bib18)\))。信息收集通常在时间、能量或暴露方面是有成本的,导致在立即对不确定信号采取行动与延迟行动以提高确定性之间存在权衡。这促使我们将观察或验证建模为一种显式的行为动作,而不是假设感知是被动给定的。
至关重要的是,许多真实的捕食者-猎物交互是由有噪声、模糊或欺骗性的信号所介导的。捕食者经常通过攻击性拟态利用感官偏差,呈现类似食物的线索来引诱猎物,而猎物物种可能采用防御性拟态来模拟危险生物(Dawkins and Krebs \(1979 (https://arxiv.org/html/2608.06420#bib.bib6)\);Bates \(1862 (https://arxiv.org/html/2608.06420#bib.bib7)\);Ruxton and others \(2004 (https://arxiv.org/html/2608.06420#bib.bib19)\))。这些交互突显了感知本质上是概率性的,错误分类不是罕见的噪声,而是一种结构化的生态特征。这种不对称性促使我们将感知建模为一个有噪声的标记过程,其中观察到的类别可能系统地偏离真实身份。
这个问题在涉及伏击或静止捕食者的系统中变得尤为重要,这类系统在生态领域普遍存在(例如,坐等捕食者如蜘蛛、蛇,甚至植物如捕蝇草)(Scharf and others \(2011 (https://arxiv.org/html/2608.06420#bib.bib20)\))。与主动追逐的捕食者不同,伏击捕食者严重依赖伪装、静止和欺骗性信号,这使它们特别难以被发现,并增加了错误安全信号的可能性。在这样的环境中,感知挑战不仅仅是检测运动或接近程度,而是正确解释可能类似无害或有奖励刺激的模糊线索(Perry and Pianka \(1997 (https://arxiv.org/html/2608.06420#bib.bib21)\))。因此,成本不对称被放大:未能检测到静止捕食者通常会导致立即死亡,而过度谨慎的回避主要招致机会成本。这使得基于伏击的系统成为研究感知不确定性下风险敏感行为的特别相关场景,并直接推动了本模型中使用静止捕食者的选择。
尽管有这些生态学见解,许多人工生命和基于智能体的捕食者-猎物模型仍假设智能体能够可靠地识别食物和捕食者,或者将感知视为简化的基于接近度的信号(Reynolds \(1987 (https://arxiv.org/html/2608.06420#bib.bib4)\);Ray \(1991 (https://arxiv.org/html/2608.06420#bib.bib5)\))。虽然这种抽象允许专注于空间动态或集体行为,但它遗漏了真实生物系统的一个决定性约束:智能体基于可能错误的信念行动。这为观察到的类别本身不确定且感知错误直接驱动生存结果的情况留下了研究空白。
本工作建立在以往工作的基础上,将感知建模为一个有噪声的标记过程,该框架同时捕捉了生态信号的概率性质和错误分类的不对称后果。这使我们能够研究一个跨越行为生态学、人工生命和决策理论的核心问题:在什么时候质疑、延迟或验证不确定的感知信息会比直接对其采取行动更具适应性?
## 方法
### 模拟环境
我们实现了一个包含三种实体类型的二维智能体环境:智能体、食物和捕食者。环境是一个固定大小的有界连续空间,每回合初始化时,各实体类型以固定数量均匀随机放置。
每个智能体维持一个位置xi∈R2\\mathbf\{x\}\_\{i\}\\in\\mathbb\{R\}^\{2\}和一个内部能量状态EiE\_\{i\}。在每个时间步,智能体产生代谢成本,并可能朝向或远离附近的实体移动。能量在消耗食物时增加,在移动和时间流逝时减少。智能体要么因与捕食者接触而死亡(立即死亡),要么在能量降至零时因饥饿而死亡。
在每个时间步,智能体检测固定观察半径内的附近实体,并根据接近程度选择一个目标。模拟持续固定步数或直到所有智能体死亡。
### 智能体状态与动作空间
每个智能体由其位置x\\mathbf\{x\}、能量EE以及对附近实体的感知估计定义。在每个时间步,智能体选择一个目标实体并执行三种动作之一:
接近:以固定步长朝向目标移动,如果发生接触可能消耗食物。
回避:远离目标移动,增加与感知威胁的距离。
观察:保持静止并产生能量成本cobsc\_\{\\text\{obs\}\},同时提高感知估计的准确性。
如果智能体放弃行动(例如,在不确定性下),它会朝随机方向移动一步。给定所选动作,移动更新是确定性的,当智能体进入目标周围的小半径区域时,发生交互(食物消耗或捕食者碰撞)。
### 感知模型
智能体不直接观察实体的真实类别。相反,每次观察由两个有噪声的信息源组成:一个可能被错误分类的类别标签,和一个连续特征信号。
我们将感知建模为对潜在类别y∈\{food,predator\}y\\in\\\{\\text\{food\},\\text\{predator\}\\\}的贝叶斯推断。给定由标签l\\ell和特征值zz组成的观察,智能体计算后验信念:
P\(y=food∣l,z\)∝P\(l∣y\)P\(z∣y\)P\(y\)。P\(y=\\text\{food\}\\mid\\ell,z\)\\propto P\(\\ell\\mid y\)\\,P\(z\\mid y\)\\,P\(y\)。这个公式可以被解释为通过向对数似然比的加性贡献来整合多个有噪声信号。
标签模型。观察到的标签l\\ell是真实类别的有噪声版本,带有错误分类概率ε\\epsilon:
P\(l=food∣y=food\)=1−ε,P\(\\ell=\\text\{food\}\\mid y=\\text\{food\}\)=1\-\\epsilon,P\(l=predator∣y=food\)=ε,P\(\\ell=\\text\{predator\}\\mid y=\\text\{food\}\)=\\epsilon,对于y=predatory=\\text\{predator\}同理。在非对称设置中,这些翻转概率在不同类别之间有所不同。
特征模型。特征信号从类别条件高斯分布中抽取:
z∼N\(μy,σ2\),z\\sim\\mathcal\{N\}\(\\mu\_\{y\},\\sigma^\{2\}\),其中μfood=\+μ\\mu\_\{\\text\{food\}\}=\+\\mu且μpredator=−μ\\mu\_\{\\text\{predator\}\}=\-\\mu。参数μ\\mu控制类别之间的分离程度,σ\\sigma控制感知噪声。
先验。我们假设类别上的均匀先验,P\(y=food\)=P\(y=predator\)=0\.5P\(y=\\text\{food\}\)=P\(y=\\text\{predator\}\)=0\.5。
然后对后验进行归一化,以获得标量信念:
pfood=P\(y=food∣l,z\)。p\_\{\\text\{food\}\}=P\(y=\\text\{food\}\\mid\\ell,z\)。
观察动作。观察动作生成一个新的观察\(l′,z′\)\(\\ell^\{\\prime\},z^\{\\prime\}\),其标签噪声降低且特征方差更低,对应于提高的似然可靠性。智能体使用更新的观察重新计算其后验信念。
### 行为策略
我们评估三种固定策略,它们在如何响应感知不确定性方面有所不同。
盲目策略。智能体基于最大概率标签选择动作:
action=\{approachifpfood\>ppredavoidotherwise\\text\{action\}=\\begin\{cases\}\\text\{approach\}&\\text\{if \}p\_\{\\text\{food\}\}\>p\_\{\\text\{pred\}\}\\\\ \\text\{avoid\}&\\text\{otherwise\}\\end\{cases\}该策略假设感知标签是可靠的,并且不考虑不确定性。
怀疑策略。智能体引入置信阈值τ\\tau。智能体计算后验概率pfoodp\_\{\\text\{food\}\},并在不确定性周围应用置信阈值τ\\tau。仅当预测类别超过该阈值时才采取行动:
如果pfood\>τ则接近,如果ppred\>τ则回避\\text\{approach if \}p\_\{\\text\{food\}\}\>\\tau,\\quad\\text\{avoid if \}p\_\{\\text\{pred\}\}\>\\tau
否则,智能体默认采取回避或不行动。这使得行为在不确定下偏向安全。
验证策略。当不确定性较高时,智能体执行观察步骤。相似文章
Interoceptive Attention as Dynamic Homeostatic Prioritization in a Foraging Agent
This paper studies how an agent with limited perceptual bandwidth should allocate interoceptive precision across bodily needs in a foraging task, showing that dynamically attending to the most-needed channel improves survival under a fixed precision budget.
通过世界模型从人类偏好和理由中学习安全智能体行为
本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
Neetyabhas:一种面向理性主体模型的不确定性感知公共政策优化框架
Neetyabhas 是一个利用层次化强化学习主体在基于主体的流行病仿真中实现不确定性感知公共政策优化的框架。该框架对个体行为(佩戴口罩、接种疫苗、外出购物)及不确定条件下的决策者干预进行建模,并展示了其在 COVID-19 疫情管理中的有效性。
动态不确定性下的风险量化:面向安全序列决策的基于信念的鲁棒性
本文提出RATTL,一个使用Wasserstein距离基于贝叶斯信念不确定性调整智能体谨慎程度的框架,用于安全序列决策,适用于基于LLM的系统。