以患者为中心的人工智能对话系统的复杂性
摘要
本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。
arXiv:2607.08625v1 公告类型:新
摘要:由大型语言模型(LLM)驱动的面向消费者的健康聊天机器人正越来越多地用于症状评估。然而,聊天机器人的开发和评估通常依赖于合作、表达清晰的模拟患者。我们分析了2053次真实患者与聊天机器人的对话,发现不同用户的沟通模式和情绪表达方式差异巨大。我们开发了一个患者模拟器,能够分别模拟临床内容、情绪状态、对话策略和沟通风格。在由15位人类评分员参与的图灵式真实性评估中,模拟对话与真实对话几乎无法区分,人类评分员的准确率为55%。我们使用五种不同的患者角色,在1164个由临床医生评分的案例中,评估了四个LLM在紧急程度判断上的表现。我们发现,沟通风格可以显著改变分诊结果。以患者为中心的人工智能对话系统必须适应沟通的多样性:为理想化而非真实互动设计的系统,在部署到现实世界时,可能会表现不佳并加剧健康差距。
查看缓存全文
缓存时间: 2026/07/10 06:09
# 以患者为中心的对话式人工智能的复杂性 来源:https://arxiv.org/abs/2607.08625 作者:João Matos (https://arxiv.org/search/cs?searchtype=author&query=Matos,+J),Olivia Buege (https://arxiv.org/search/cs?searchtype=author&query=Buege,+O),Donny Cheung (https://arxiv.org/search/cs?searchtype=author&query=Cheung,+D),Gary S\. Collins (https://arxiv.org/search/cs?searchtype=author&query=Collins,+G+S),Paula Dhiman (https://arxiv.org/search/cs?searchtype=author&query=Dhiman,+P),Nan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+N),Bingyu Mao (https://arxiv.org/search/cs?searchtype=author&query=Mao,+B),Benjamin W\. Nelson (https://arxiv.org/search/cs?searchtype=author&query=Nelson,+B+W),Michail Ouroutzoglou (https://arxiv.org/search/cs?searchtype=author&query=Ouroutzoglou,+M),Paul Varghese (https://arxiv.org/search/cs?searchtype=author&query=Varghese,+P),Jonathan Amar (https://arxiv.org/search/cs?searchtype=author&query=Amar,+J) 查看 PDF (https://arxiv.org/pdf/2607.08625) > 摘要:面向消费者的健康聊天机器人基于大型语言模型(LLMs)越来越多地用于症状评估。然而,聊天机器人的开发和评估通常依赖于合作、表达清晰的模拟患者。我们分析了2,053条真实患者与聊天机器人的对话,发现不同用户的沟通模式和情绪表达存在显著差异。我们开发了一个患者模拟器,可分别模拟临床内容、情绪状态、对话策略和沟通风格。在15名人类评审员参与的图灵启发式真实感评估中,模拟对话与真实对话几乎无法区分,人类评审员的准确率为55%。我们使用五种不同的患者角色,在1,164个由临床医生评分的案例中,评估了四个LLM在紧急程度评估方面的表现。我们发现沟通风格可以显著改变分诊结果。以患者为中心的对话式人工智能必须适应沟通多样性:为理想化而非现实互动设计的系统,若实际部署,可能会导致性能不佳并加剧健康差距。 ## 提交历史 来自:João Matos \[查看邮件 (https://arxiv.org/show-email/acdd0efe/2607.08625)\] **\[v1\]** 2026年7月9日星期四15:56:55 UTC (2,716 KB)
相似文章
训练AI聊天机器人使其更温暖和富有同理心会降低其事实准确性
新研究表明,训练AI聊天机器人变得更温暖、更富同理心会显著降低其事实准确性,导致医疗建议错误率升高,并增加对用户误解的认同。这一发现挑战了普遍认为可以在不损害事实正确性的情况下调整对话风格的假设。
研究:AI聊天机器人回答普通用户日常健康相关问题的准确率近76%
宾夕法尼亚州立大学的一项研究发现,像ChatGPT这样的AI聊天机器人回答日常健康问题的准确率接近76%,这引发了人们对它们在现实医疗应用中可信度的担忧。研究指出,AI工具可能更适合由医生使用,而非患者。
不完全合作的人-AI交互:模拟与用户研究中人类和AI属性影响的比较
本研究论文调查了人类个性特征和AI设计特性在不完全合作场景中对人-AI交互的联合影响,采用模拟数据集(2000次模拟)和人类受试者实验(290名参与者)两种方法。研究发现模拟与真实交互之间存在显著差异,其中AI透明度在实际人-AI交互中成为关键因素。
AI安全的另一半
文章批评AI安全领域专注于灾难性风险,却忽视了像ChatGPT这样的聊天机器人对日常心理健康的危害。引用OpenAI自身数据,数百万用户表现出精神病、躁狂或自杀意念的迹象,却仅被重定向,未进行硬性拦截。
为什么AI聊天在处理时间相关问题时仍然表现糟糕?
本文探讨了AI聊天机器人在正确回答时间相关问题上持续存在的困难,分析了背后的原因以及用户的挫败感。