生成式AI的认知可信度:高风险工作流中合理依赖的规范性框架

arXiv cs.AI 论文

摘要

本文提出了一个规范性框架,用于判断在何种条件下,对生成式AI输出的依赖在认知上是合理的。该框架基于三个条件:认知谦逊、认知可及性,以及对认知不公正的抵制。文章分析了法律、医疗和招聘场景中的真实案例。

arXiv:2608.05602v1 公告类型:新 摘要:生成式AI系统越来越多地部署在高风险专业场景中,其输出塑造着用户的信念、推理方式以及他们视为定论的内容。这为负责任的AI提出了一个核心问题:在何种条件下,对生成式AI输出的依赖在认知上是合理的,而不仅仅是行为上的诱导?现有框架大多关注AI输出是否准确、公平、可解释、安全或为用户所信任。这些问题仍然必要,每一项都有助于实现合理依赖。然而,它们并未直接将“合理依赖”作为一个独立的评估目标来加以规定,即用户在何种条件下有理由将AI输出作为自身推理的输入。我们认为,这需要一种关于认知可信度的说明:是什么使一个系统在认知上值得依赖。借鉴哲学上将可信度理解为能力与受众导向的论述,我们发展出一个构成性规范框架,包含三个共同必要且不可互换的条件。第一,认知谦逊要求系统表征并传达其能力限度。第二,认知可及性要求系统使用户能够在具体情境中检查、质疑并反驳输出。第三,抵制认知不公正要求系统将用户承认为合法的认知主体,并避免边缘化他们的知识与经验。通过对法律推理、医疗推理和招聘中的真实案例进行分析,我们展示了认知谦逊、认知可及性和抵制认知不公正的失败如何产生重大危害,而这些危害是标准的准确性、公平性和可用性指标本身无法解决的。最后,我们围绕认知上合理依赖而非单纯输出正确性,概述了GenAI系统的设计与评估启示。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# 高风险工作流中合理信赖的规范性框架

本手稿是一篇被 AAAI/ACM 人工智能、伦理与社会会议(AIES 2026)接收论文的作者扩展版。来源:https://arxiv.org/html/2608.05602

###### 摘要

生成式人工智能系统越来越多地部署在高风险的专业场景中,其输出会影响用户相信什么、如何推理,以及将什么视为已确定之事。这为负责任的人工智能提出了一个核心问题:在什么条件下,对生成式 AI 输出的信赖在认识论上是合理的,而不仅仅是行为上被诱导的?现有框架在很大程度上只追问 AI 输出是否准确、公平、可解释、安全或被用户信任。这些问题仍然是必要的,并且每一项都能为合理信赖作出贡献。然而,它们并没有直接将“合理信赖”作为一个独立的评估目标来加以规定:即用户在何种条件下有理由将其输出视为自身推理的输入。我们认为,这需要一种对认识论可信赖性的说明:即是什么使一个系统在认识论上值得信赖。借鉴哲学中将可信赖性视为能力与受众导向的论述,我们发展出一个构成性规范框架,包含三个共同必要且不可替代的条件。第一,认识论谦逊要求系统表征并传达其能力边界。第二,认识论可及性要求系统使用户能够在具体情境中检查、质疑和反驳输出。第三,抵抗认识论不正义要求系统将用户承认为合法的认识论主体,并避免边缘化他们的知识和经验。通过对法律推理、医学推理和招聘中的真实案例进行分析,我们展示了认识论谦逊、认识论可及性和抵抗认识论不正义的失败如何产生重大伤害,而这些伤害是标准的准确性、公平性和可用性指标单独无法解决的。最后,我们围绕“认识论上合理的信赖”而非单纯输出正确性,概述了对 GenAI 系统的设计与评估启示。

## 1 引言

生成式人工智能系统越来越多地作为制度性知识工作中的认识论基础设施被部署,重塑着专业知识场景中知识的创造、综合与依据其行动的方式(Marchal等 2026 (https://arxiv.org/html/2608.05602#bib.bib13);Appel等 2025 (https://arxiv.org/html/2608.05602#bib.bib41);Yun等 2025 (https://arxiv.org/html/2608.05602#bib.bib42))。在临床决策支持、法律指导、招聘和政策建议等高风险场景中,专业人员(Karnatak等 2026 (https://arxiv.org/html/2608.05602#bib.bib38);Sivaraman等 2023b (https://arxiv.org/html/2608.05602#bib.bib43))现在依赖这些系统来形成信念、做出决策和协调行动。在此类情境中,对系统输出的依赖构成了一种认识论上的遵从:用户将生成的声称、摘要、建议或解释视为自身推理的输入(Lange 2024 (https://arxiv.org/html/2608.05602#bib.bib39);Slome 2026 (https://arxiv.org/html/2608.05602#bib.bib40);Chen等 2023b (https://arxiv.org/html/2608.05602#bib.bib44))。这种遵从是否合理,以及系统因此在认识论上是否可信,并非边缘问题,而是负责任地部署人工智能的前提条件(Liao and Sundar 2022 (https://arxiv.org/html/2608.05602#bib.bib45))。

现有的负责任 AI 方法在评估系统准确性、公平性、安全性、校准性、可解释性和适当依赖方面取得了重要进展(Mehrotra等 2024 (https://arxiv.org/html/2608.05602#bib.bib46))。然而,这些方法并未充分规定,对特定 GenAI 输出的依赖何时在认识论上是合理的。一个系统可能产生准确、流畅、有来源依据或可解释的输出,同时仍然无法为用户提供充分的理由去依赖、验证、质疑或拒绝依赖这些输出(Mehrotra等 2024 (https://arxiv.org/html/2608.05602#bib.bib46))。因此,我们追问:生成式 AI 系统在交互时刻必须提供什么,才能使其输出的用户依赖在认识论上被证明是合理的?

我们通过为生成式 AI 发展一个构成性的认识论可信赖性规范框架来回答这个问题(Koskinen 2024 (https://arxiv.org/html/2608.05602#bib.bib53))。借鉴社会认识论(Baier 1986 (https://arxiv.org/html/2608.05602#bib.bib2);Scheman 2001 (https://arxiv.org/html/2608.05602#bib.bib3);Lackey 2008 (https://arxiv.org/html/2608.05602#bib.bib58)),我们将认识论可信赖性定义为用户—系统关系的一种属性:当生成式 AI 系统提供了使情境化用户有充分理由依赖、验证、质疑或拒绝依赖其输出的条件时,该系统在认识论上就是可信赖的。该框架规定了三个共同必要且不可替代的条件。第一,认识论谦逊要求系统表征并传达其能力边界(Sosa 2007 (https://arxiv.org/html/2608.05602#bib.bib57))。第二,认识论可及性要求系统使用户能够在具体情境中检查、质疑和反驳输出(Sterz等 2024 (https://arxiv.org/html/2608.05602#bib.bib72))。第三,抵抗认识论不正义要求系统将用户和受影响社区承认为合法的认识论主体,而不是边缘化他们的知识、概念或经验(Kay等 2025 (https://arxiv.org/html/2608.05602#bib.bib60))。

该框架将认识论可信赖性视为构成性的,而不仅仅是调节性的。校准、可解释性、来源、弃权(abstention)和公平性等现有概念所识别出的机制可能支持可信赖系统(Sanderson等 2023b (https://arxiv.org/html/2608.05602#bib.bib74))。而我们的框架规定的是必须共同成立、不可替代的条件,唯有如此,对生成式 AI 输出的依赖才在认识论上是合理的。

我们做出两项贡献。第一,我们为生成式 AI 发展了一种第一性原则的认识论可信赖性阐述,从社会认识论的能力与受众导向论述中推导出合理信赖的构成性框架。我们进一步明确了每个条件如何在 socio-technical stack 的模型层、数据层和界面层得以实现,为识别合理信赖在何处失效提供了一种层显式诊断结构。第二,我们通过将该框架与现有负责任 AI 方法进行对照,并将其应用于真实案例,展示了该框架的诊断价值,说明即使系统在标准评估视角下显得准确、可用、有来源依据或安全,认识论谦逊、认识论可及性和认识论承认的失败仍可能产生严重后果。

## 2 相关工作

### 2.1 为何 GenAI 中介的依赖需要认识论框架

生成式 AI 制造了一个独特的认识论依赖问题。与许多早期产生有界预测、分类或建议的决策支持系统不同,生成式 AI 系统产生开放式声称、摘要、解释和分析,用户可能将其纳入自身推理。这使得其输出看起来像证言:它们以流畅的自然语言表达,通常带有明显的自信,并且越来越多地嵌入制度性工作流程中(Anderl等 2024 (https://arxiv.org/html/2608.05602#bib.bib75);Metzger等 2024 (https://arxiv.org/html/2608.05602#bib.bib76))。先前的人机交互和传播学研究表明,用户可能将流畅性、连贯性和自信的呈现方式视为可信度线索,即使这些线索并不能可靠地反映认识论可靠性(Vasconcelos等 2023 (https://arxiv.org/html/2608.05602#bib.bib77))。对语言模型的概念性批评同样告诫,流畅的文本生成不应被误认为是有根据的指称、交际意图或信念(Chiesurin等 2023 (https://arxiv.org/html/2608.05602#bib.bib78))。

由此产生的问题不仅在于生成式 AI 系统可能出错,而且在于它们可能以仍然引发认识论遵从的方式出错。这种遵从难以被证明为合理,因为生成式 AI 的失败往往是不均匀的、不透明的且依赖情境的。系统可能产生无根据的幻觉声称、表达不应有的自信、错误归属证据、遗漏相关的不确定性,或产生局部流畅但情境错位的回应(Simhi等 2025 (https://arxiv.org/html/2608.05602#bib.bib80))。这类失败与所谓 AI 能力的“锯齿状边界”密切相关:模型可能在某些任务上表现惊人,却在相邻任务上意外失败(Dell’Acqua等 2026 (https://arxiv.org/html/2608.05602#bib.bib79))。在专业场景中,这种不均匀性尤其具有后果性,因为用户可能不知道系统何时从胜任转向失效。一个生成的答案可能看起来完整、程序上合法或机构权威,即使系统并未提供足够的依赖理由。

现有关于 AI 认识论可信赖性的论述开始处理这一规范性问题,但它们将可信赖性分布在不同的分析单元上。输出层面的论述关注可靠性、校准性或无欺骗性(Ferrario 2024 (https://arxiv.org/html/2608.05602#bib.bib62);Simon 2025 (https://arxiv.org/html/2608.05602#bib.bib9))。心理学论述考察用户信任感知和依赖意愿(Jonas等 2025 (https://arxiv.org/html/2608.05602#bib.bib64))。功能性论述追问 AI 系统是否履行了与其认识论角色相关的义务(Kelp and Simion 2024 (https://arxiv.org/html/2608.05602#bib.bib12))。制度和生态系统性论述将可信赖性定位于治理结构、问责机制、来源基础设施或更广泛的社会—认识论环境中(Tanchuk and Taylor 2025 (https://arxiv.org/html/2608.05602#bib.bib11);Marchal等 2026 (https://arxiv.org/html/2608.05602#bib.bib13))。这些论述都很有价值,但它们对情境化用户在当下必须决定是否、如何以及在多大程度上依赖特定生成式 AI 输出这一直接的“用户—系统”关系规定不足。

因此,需要一个框架,因为合理信赖无法在 socio-technical stack 的任何一个单一层面确立。可靠性、用户信任、功能性角色履行、制度批准和生态系统治理都可能支持可信赖的 AI,但它们本身并不能规定情境化用户是否有充分理由在具体情境中依赖特定生成式 AI 输出。缺失的分析对象是系统传播与用户认识论能动性之间的关系性契合。本文通过发展一个认识论可信赖性框架来弥合这一缺口,该框架规定了在交互中必须满足什么条件,才能使对生成式 AI 输出的依赖在认识论上被证明是合理的。

### 2.2 行为中心与输出中心的评估缺口

表 1:评估对生成式 AI 依赖的行为中心、输出中心与认识论—关系性方法之比较。

人机交互研究通常通过行为视角评估系统整合,将适当依赖定义为用户在算法建议正确时倾向于接受、在其有误时倾向于拒绝的倾向(Lee and See 2004 (https://arxiv.org/html/2608.05602#bib.bib20);Yin等 2019 (https://arxiv.org/html/2608.05602#bib.bib23))。早期奠基性工作通过自动化自满(automation complacency,即用户屈从于有缺陷的系统建议)和算法厌恶(algorithm aversion,即用户因观察到轻微错误而过早拒绝更优的自动化建议)等概念识别出依赖失败(Dietvorst等 2015 (https://arxiv.org/html/2608.05602#bib.bib15);Parasuraman and Manzey 2010 (https://arxiv.org/html/2608.05602#bib.bib22))。最近的可解释 AI 研究通过表明界面干预(包括置信度显示和模型描述)可以调节依赖行为,从而超越了固定的认知特质(Cau and Spano 2025 (https://arxiv.org/html/2608.05602#bib.bib17);Zhang等 2020 (https://arxiv.org/html/2608.05602#bib.bib24))。然而,即使这些更具条件性的度量,仍然将行为与正确性的一致性作为主要评估终点。

这种行为取向留下了一个根本问题未予回答:一个与正确系统输出保持一致的 用户,是否是在充分的认识论理由基础上这样做的。相同的可观察行为既可能源自基于认识论的判断——用户能够检查证据、评估不确定性并质疑该声称;也可能源自行为诱导的遵从——流畅性、努力不对称和制度性框架使合规显得合理(Pal等 2026 (https://arxiv.org/html/2608.05602#bib.bib21))。因此,适当依赖指标对于追踪用户行为是否与系统正确性对应至关重要,但它们无法确定依赖在认识论上是否被证明为合理。

这一局限也反映在更广泛的负责任 AI 评估中,系统通常通过输出中心的标准进行评估。公平性指标评估各群体间结果分布;安全研究考察系统在失败状态或对抗条件下的行为;对齐范式评估模型行为是否符合特定的人类指令或偏好。这些方法不可或缺,但它们主要评估系统输出或系统行为的属性,而非系统与用户之间所建立的认识论关系。这一区分之所以重要,是因为部署在专业知识工作中的生成式 AI 系统不仅产生离散决策;它们还产生开放式声称、解释、摘要和建议,用户将其纳入自身的领域推理。因此,评估问题不仅在于输出是否准确、公平、安全或对齐,还在于交互是否使用户能够在充分认识论理由的基础上形成、修正或中止判断。

我们的框架通过将分析单元从行为一致性和输出遵从转移到使用户依赖在认识论上被证明为合理的“用户—系统”关系,来解决这一评估缺口(Ferrario等 2026 (https://arxiv.org/html/2608.05602#bib.bib19))。一个生成模型可能产生事实准确、程序规范良好的文本,同时仍通过传播无根据的自信、提供可用但实践中无法使用的解释,或未能承认专业人员带入交互的情境化专业知识,而削弱认识论能动性。在此类情况下,依赖在行为层面可能看似适当,但在认识论上仍然缺乏根据。将系统传播与用户认识论位置之间的关系性契合置于中心,使得该框架能够规定专业人员在何种交互条件下对生成式 AI 的遵从被证明为合理。

## 3 生成式 AI 认识论可信赖性框架

接下来,我们为生成式 AI 的认识论可信赖性制定一个包含三个条件的框架。该框架的目的在于将哲学上关于认识论可信赖性的论述转化为能够为负责任 AI 评估和设计提供信息的形式。我们期望该框架作为一个概念工具,用于分析何时对 GenAI 输出的依赖在认识论上是合理的、诊断案例失效之处,并

相似文章

AI认知风险:新兴机制与证据 [R]

Reddit r/MachineLearning

一篇由30位专家合著的新论文探讨了来自人工智能的认知风险—即对我们形成准确信念和良好推理能力的威胁—包括说服、认知卸载和反馈循环等机制,并概述了减轻这些风险的方向。