以患者为中心的人工智能对话系统的复杂性

arXiv cs.AI 论文

摘要

本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。

arXiv:2607.08625v1 公告类型:新 摘要:由大型语言模型(LLM)驱动的面向消费者的健康聊天机器人正越来越多地用于症状评估。然而,聊天机器人的开发和评估通常依赖于合作、表达清晰的模拟患者。我们分析了2053次真实患者与聊天机器人的对话,发现不同用户的沟通模式和情绪表达方式差异巨大。我们开发了一个患者模拟器,能够分别模拟临床内容、情绪状态、对话策略和沟通风格。在由15位人类评分员参与的图灵式真实性评估中,模拟对话与真实对话几乎无法区分,人类评分员的准确率为55%。我们使用五种不同的患者角色,在1164个由临床医生评分的案例中,评估了四个LLM在紧急程度判断上的表现。我们发现,沟通风格可以显著改变分诊结果。以患者为中心的人工智能对话系统必须适应沟通的多样性:为理想化而非真实互动设计的系统,在部署到现实世界时,可能会表现不佳并加剧健康差距。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:09

# 以患者为中心的对话式人工智能的复杂性
来源:https://arxiv.org/abs/2607.08625
作者:João Matos (https://arxiv.org/search/cs?searchtype=author&query=Matos,+J),Olivia Buege (https://arxiv.org/search/cs?searchtype=author&query=Buege,+O),Donny Cheung (https://arxiv.org/search/cs?searchtype=author&query=Cheung,+D),Gary S\. Collins (https://arxiv.org/search/cs?searchtype=author&query=Collins,+G+S),Paula Dhiman (https://arxiv.org/search/cs?searchtype=author&query=Dhiman,+P),Nan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+N),Bingyu Mao (https://arxiv.org/search/cs?searchtype=author&query=Mao,+B),Benjamin W\. Nelson (https://arxiv.org/search/cs?searchtype=author&query=Nelson,+B+W),Michail Ouroutzoglou (https://arxiv.org/search/cs?searchtype=author&query=Ouroutzoglou,+M),Paul Varghese (https://arxiv.org/search/cs?searchtype=author&query=Varghese,+P),Jonathan Amar (https://arxiv.org/search/cs?searchtype=author&query=Amar,+J)

查看 PDF (https://arxiv.org/pdf/2607.08625)

> 摘要:面向消费者的健康聊天机器人基于大型语言模型(LLMs)越来越多地用于症状评估。然而,聊天机器人的开发和评估通常依赖于合作、表达清晰的模拟患者。我们分析了2,053条真实患者与聊天机器人的对话,发现不同用户的沟通模式和情绪表达存在显著差异。我们开发了一个患者模拟器,可分别模拟临床内容、情绪状态、对话策略和沟通风格。在15名人类评审员参与的图灵启发式真实感评估中,模拟对话与真实对话几乎无法区分,人类评审员的准确率为55%。我们使用五种不同的患者角色,在1,164个由临床医生评分的案例中,评估了四个LLM在紧急程度评估方面的表现。我们发现沟通风格可以显著改变分诊结果。以患者为中心的对话式人工智能必须适应沟通多样性:为理想化而非现实互动设计的系统,若实际部署,可能会导致性能不佳并加剧健康差距。

## 提交历史

来自:João Matos \[查看邮件 (https://arxiv.org/show-email/acdd0efe/2607.08625)\] **\[v1\]** 2026年7月9日星期四15:56:55 UTC (2,716 KB)

相似文章

不完全合作的人-AI交互:模拟与用户研究中人类和AI属性影响的比较

arXiv cs.CL

本研究论文调查了人类个性特征和AI设计特性在不完全合作场景中对人-AI交互的联合影响,采用模拟数据集(2000次模拟)和人类受试者实验(290名参与者)两种方法。研究发现模拟与真实交互之间存在显著差异,其中AI透明度在实际人-AI交互中成为关键因素。

AI安全的另一半

Hacker News Top

文章批评AI安全领域专注于灾难性风险,却忽视了像ChatGPT这样的聊天机器人对日常心理健康的危害。引用OpenAI自身数据,数百万用户表现出精神病、躁狂或自杀意念的迹象,却仅被重定向,未进行硬性拦截。