对齐可信度:医疗AI安全保证的新标准
摘要
提出将'对齐可信度'作为医疗AI安全保证的新监管标准,类比生物可信度,并要求三个层次的对齐以对应临床监督。
arXiv:2607.07766v1 Announce Type: new
摘要:大型语言模型(LLMs)已成为心理健康支持的重要提供者,但它们仍然是注意力经济的产物,其运营和商业目标更倾向于持续参与,而非有效心理支持所需的摩擦。开发者的安全响应大多是被动的,处理最明显和急性的伤害,而更微妙、长期的风险模式(例如依赖、边界侵蚀、扭曲信念的放大)则较少受到关注。我们认为,使LLMs在结构上安全需要三个层次的对齐,这些层次反映了社会如何确保人类临床实践的安全:1)基于临床实践编码的规范性承诺的明确价值规范;2)将这些价值嵌入模型的训练;3)在部署过程中检测漂移和长期伤害的监督,就像临床监督对人类实践所做的那样。以这种方式组织对齐产生了一个我们称之为对齐可信度的概念——一种结构化的证明,表明系统的价值观、训练机制和监督机制共同与安全和积极的结果一致。我们提出将对齐可信度作为健康领域AI的监管概念(通过类比已有的生物可信度概念):一种原则性的方法,用于论证支持或反对系统是否与积极的健康结果对齐、即使有能力也不会造成伤害、并最终惠及患者的信任。
查看缓存全文
缓存时间: 2026/07/10 06:05
# 对齐合理性:保障医疗领域AI安全的新标准 来源:https://arxiv.org/abs/2607.07766 查看PDF(https://arxiv.org/pdf/2607.07766) > **摘要:** 大型语言模型(LLM)已成为心理健康支持的重要提供者,但它们仍然是注意力经济的产物——其运营和商业目标倾向于维持用户参与度,而非有效心理支持所需的那种摩擦。开发者的安全响应大多是反应式的,只解决最显眼、最急迫的危害,而更微妙、更长期的风险模式(如依赖、边界侵蚀、扭曲信念的放大)则受到较少关注。我们认为,要使LLM结构上安全,需要以三个层次组织对齐,这与人类社会确保临床实践安全的方式相呼应:1)以临床实践的规范性承诺为基础,进行明确的价值规范设定;2)通过训练将这些价值观嵌入模型中;3)在部署期间进行监督,以发现漂移和长期危害,如同临床督导对人类实践所做的那样。以这种方式组织对齐,形成我们称之为“对齐合理性”的构建——一种结构化的论证,表明系统的价值观、训练机制和监督机制共同与安全和积极的结果相一致。我们建议将“对齐合理性”作为医疗领域AI的一种监管构建(通过类比已建立的“生物学合理性”构建),作为一种原则性的方法,用以论证或反驳系统是否已对齐到积极的健康结果、是否在有能力造成伤害时也不会造成伤害,并最终带来患者获益。 ## 提交历史 来自:Gwydion Williams \[查看邮箱 (https://arxiv.org/show-email/ad068cfb/2607.07766)\] **\[v1\]** 2026年7月8日星期三 15:39:10 UTC (664 KB)
相似文章
对齐即法理学
一篇题为《对齐即法理学》的学术论文探讨了人工智能对齐与法律框架之间的交叉领域,很可能在司法推理与人工智能安全之间建立了平行关系。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。
AI模型对齐问题
探讨了AI模型对齐的问题,这是AI安全研究中的一个关键领域。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
AI 对齐:我们能信任 AI 任务背后的推理过程吗?
讨论了 Anthropic 关于 AI 对齐的研究,特别是模型在训练期间看似对齐,但其内部推理过程却不透明的问题。