你能替我说吗?在本地讨论中通过代理发声

arXiv cs.AI 论文

摘要

SecondVoice是一个混合现实系统,允许犹豫的发言者通过一个具身虚拟代理匿名表达他们的观点,从而参与本地讨论。

arXiv:2608.26185v1 Announce Type: new 摘要:在本地讨论中平等参与对于有效协作很重要,但当人们预期会有负面的人际或职业后果时,他们往往会退缩,尤其是当提出一个观点需要自己大声说出来时。我们提出了SecondVoice,一个混合现实系统,使人们能够通过一个具身虚拟代理发声。通过将所说的内容与说者分离,SecondVoice将犹豫的观点引入实时口头讨论中,而不会让发言者感到尴尬。使用一个私有覆盖层,用户通过结构化规范过程指定他们的意图,而不是编写完整的语句。系统重新组织输入并通过代理将其语音化到对话中。我们描述了社会风险下的参与渠道设计空间。在一个初步的被试内研究(N = 16)中,我们将完整的SecondVoice系统与匿名文本板渠道在两个小组讨论任务中进行比较。一半参与者报告使用SecondVoice来表达他们没有大声说出来的观点,而文本板的比例为18.8%。代理传递的观点进入了口头讨论,并引发了多轮小组参与,这是我们在文本板帖子后没有观察到的。参与者描述该渠道在情境上有价值,但在时间、所有权和对重新组织的信任方面存在权衡。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:31

# 能代我表达吗?在共处讨论中通过代理发声  
来源:https://arxiv.org/html/2608.26185  

## 能代我表达吗?在共处讨论中通过代理发声  
**会议**:第39届ACM用户界面软件与技术年度研讨会;2026年11月2日至5日;美国密歇根州底特律  
第39届ACM用户界面软件与技术年度研讨会(UIST '26),2026年11月2日至5日,美国密歇根州底特律  
DOI:10.1145/3830398.3830707(https://doi.org/10.1145/3830398.3830707)  
ISBN:979-8-4007-2856-3/2026/11  
CCS:以人为中心的计算,协作交互  
CCS:以人为中心的计算,交互系统与工具  
CCS:以人为中心的计算,混合/增强现实  

**沈越**  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:弗吉尼亚理工大学,计算机科学系,布莱克斯堡,弗吉尼亚州,美国  

**热木拉·阿布力克木**  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:弗吉尼亚理工大学,计算机科学系,布莱克斯堡,弗吉尼亚州,美国  

**瑞安·P·麦克马汉**  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:弗吉尼亚理工大学,计算机科学系,布莱克斯堡,弗吉尼亚州,美国  

**陈燕**  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:弗吉尼亚理工大学,计算机科学系,布莱克斯堡,弗吉尼亚州,美国  

2026;© cc  
参见标题  
**图1**:一个小组在海难后对生存物品进行排序。所有人都同意食物应排在首位;一位参与者认为镜子更重要,但不想亲自提出(A)。系统私下显示当前话题及立场选项(B)。她表示不同意,选择一种沟通策略,并通过结构化指定界面确认要点(C)。一个共享的具身代理在语音会话中提出她的观点,但不透露作者身份(D)。  

SecondVoice系统的四面板示意图,描绘了“海难求生”排序任务。左侧面板,标注“犹豫”:四位佩戴MR头显的人围坐桌旁;一位参与者大声说食物应排在前面,镜子似乎没用,而另一位参与者思考镜子可能有助于获救,但大家注意力都在食物上。中间面板,标注“私下指定”:SecondVoice弹出脉冲提示“食物应排首位?”,提供三个立场按钮;下方,参与者看到指定界面,有四个沟通策略选项(同意、质疑、提问、建议),其中“质疑”被选中,预览文本显示“镜子可用于向救援人员发信号”。代理形象以蓝色呈现,坐在桌旁。右侧面板,标注“公开展示”:代理形象举手发言,阐述了关于镜子反射阳光帮助发信号的观点;另一位参与者回应“等等,这确实……”(表明小组已采纳该观点)。  

###### 摘要。共处讨论中的平等参与对有效协作至关重要,但当人们预见到可能带来负面人际或专业后果时,尤其是在必须亲自发声才能提出观点时,往往会保持沉默。我们提出了SecondVoice,这是一个混合现实系统,允许人们通过具身的虚拟代理来表达观点。通过将发言内容与发言者身份分离,SecondVoice使犹豫未言的观点能进入实时语音讨论,而不会让发言者陷入尴尬。用户通过私有覆盖层,在结构化指定过程中表达意图,而非组织完整语句。系统将输入内容重新组织,并通过代理在对话中发声。我们刻画了社交风险下的参与渠道设计空间。在一项初步的被试内研究(N=16)中,我们在两项小组讨论任务中比较了完整的SecondVoice系统与匿名文本板渠道。一半参与者报告使用SecondVoice表达了自己未直接说出口的观点,而文本板的这一比例为18.8%。代理传达的观点进入了语音会话,并引发了多轮小组互动,这在文本板发帖后并未观察到。参与者认为该渠道在特定情境下有价值,但也指出了在时机、所有权和对重新组织的信任方面的权衡。  

###### 关键词:共处讨论,参与支持,通过代理发声,混合现实,AI中介通信  

††cc-license:by  

## 1.引言  
共处小组讨论仍然是人们共同批评想法、权衡利弊和做出决策的最常见场景之一。关于集体智慧的研究表明,讨论中更平等的参与与更强的团队表现相关(48 (https://arxiv.org/html/2608.26185#bib.bib27))。然而,实现面对面讨论中的这种平等已被证明是困难的:在课堂上,许多学生在全班讨论中参与度很低(46 (https://arxiv.org/html/2608.26185#bib.bib30));在工作场所,女性和地位较低的成员尽管具备相关专业知识,却常常发言较少(24 (https://arxiv.org/html/2608.26185#bib.bib29); 40 (https://arxiv.org/html/2608.26185#bib.bib28))。问题往往不在于缺乏想法,而在于不愿表达。人们经常保留自己的担忧、不同意见或建议,因为他们害怕被评判为无知、捣乱或难以合作(36 (https://arxiv.org/html/2608.26185#bib.bib25); 35 (https://arxiv.org/html/2608.26185#bib.bib26); 12 (https://arxiv.org/html/2608.26185#bib.bib24))。这种压力在面对面的环境中尤为明显,因为几乎无法在不主动争取发言权的情况下提出实质性观点。先前的工作主要探讨了拓宽共处讨论参与度的两条路径。一条路径专注于匿名或并行渠道,例如后台通道和匿名文本板,允许人们无需直接发言即可参与(34 (https://arxiv.org/html/2608.26185#bib.bib5); 15 (https://arxiv.org/html/2608.26185#bib.bib6); 2 (https://arxiv.org/html/2608.26185#bib.bib7); 39 (https://arxiv.org/html/2608.26185#bib.bib8))。虽然它们能拓宽参与机会,但言论往往停留在次要层面,可能被他人忽略或永远无法浮出水面(15 (https://arxiv.org/html/2608.26185#bib.bib6); 2 (https://arxiv.org/html/2608.26185#bib.bib7))。在共处环境中使用时,这些保护措施可能进一步减弱,因为即使打字的动作也可能被他人看到。第二条路径强调引导,鼓励人们在持续对话中发言(9 (https://arxiv.org/html/2608.26185#bib.bib9); 26 (https://arxiv.org/html/2608.26185#bib.bib10); 44 (https://arxiv.org/html/2608.26185#bib.bib11); 14 (https://arxiv.org/html/2608.26185#bib.bib13); 23 (https://arxiv.org/html/2608.26185#bib.bib14))。这两种路径都未能在降低发言社交成本的同时,将观点保留在实时的语音讨论中。最近关于小组讨论中智能体的研究指出了第三种可能性。智能体如今以促进者、倡导者或会议教练的身份进入实时小组互动(18 (https://arxiv.org/html/2608.26185#bib.bib16); 28 (https://arxiv.org/html/2608.26185#bib.bib15))。尤其是当具有实体形态时,这类智能体可以像在场的共同发言者一样参与实时讨论的轮次。先前的研究还表明,实体化可以增强融洽关系和信任,并改善小组互动的协同效应(47 (https://arxiv.org/html/2608.26185#bib.bib17); 25 (https://arxiv.org/html/2608.26185#bib.bib18); 33 (https://arxiv.org/html/2608.26185#bib.bib19))。然而,现有的系统通常将这些智能体定位为独立的社会参与者,这可能导致过度依赖,并让一些参与者在讨论中感到自己的重要性降低(21 (https://arxiv.org/html/2608.26185#bib.bib36); 22 (https://arxiv.org/html/2608.26185#bib.bib37))。这留下了一个尚未充分探索的中间位置:一个受限的具身代理,代表犹豫的参与者发言,只说出他们私下指定的内容。我们提出了SecondVoice,这是一个混合现实(MR)系统,允许在共处讨论中犹豫发言的人,通过一个共享的具身代理说出他们想说的话。MR通过结合一个私有的非对称界面和一个共享的具身发言者在同一物理空间内,使得这一功能成为可能。用户无需组织完整的语句,而是通过一个结构化指定过程在意图层面表达他们的言论:选择一个沟通策略,将其锚定在当前活跃的讨论话题上,并精炼其表达。系统将该意图置于持续的讨论中,将其重新组织成适合语境的言语,并通过代理进行传达。这种架构部分分离了决定说什么与公开承担发声暴露的过程。我们将SecondVoice与一个常见的旁路渠道——匿名文本板进行比较,参与者可以在共享显示屏上发帖,供小组查看。在一项跨两个小组讨论场景的被试内研究中,我们考察了犹豫的观点如何通过每个渠道进入讨论,小组如何采纳这些观点,以及参与者在实践中如何使用每个渠道。参与者报告使用SecondVoice表达了他们不愿直接说出口的观点。观察到的三次代理传达后都引发了多轮、多发言者的交流,这在文本板发帖后并未发现。参与者认为代理减少了用自己的声音发言的压力,但也对时机、信任和所有权提出了担忧。他们出于不同目的使用代理,在某些情况下,代理成为重返直接发言的跳板。本文贡献如下:(1) 一个为高社交风险共处讨论设计的代理中介参与系统的设计与实现,以及刻画参与渠道间权衡的设计空间;(2) 一个结构化指定过程,允许用户在意图层面指定言论,然后由系统通过共享具身代理重新组织并传达;(3) 一项比较研究的初步实证发现,探讨了代理中介参与相对于匿名文本渠道的使用方式和体验。  

## 2.相关工作  
### 2.1.参与障碍与并行渠道  
对于面对面讨论中发言的社交成本,一种长期存在的回应是创建并行渠道,让参与者无需立即占据语音会话即可做出贡献。在HCI和CSCW领域,这些渠道包括数字后台通道、匿名文本板以及低干扰后台通道信号,用于在实时讨论中支持提问、评论和低干扰参与(34 (https://arxiv.org/html/2608.26185#bib.bib5); 15 (https://arxiv.org/html/2608.26185#bib.bib6); 2 (https://arxiv.org/html/2608.26185#bib.bib7); 39 (https://arxiv.org/html/2608.26185#bib.bib8))。它们通过创建一条低压力的路径来拓宽提问、添加评论或表示反对的参与机会。然而,大多数系统将贡献保留在单独的文本或信号层,而不是将其返回到实时的语音交流中。例如,在backchan.nl中,观众的问题和投票成为公开的排名信息流,但是否被采纳仍取决于主持人或发言者注意到并表达它们(15 (https://arxiv.org/html/2608.26185#bib.bib6))。像Vote和Be Heard这样的低干扰信号系统同样使参与更清晰,但需要解释才能让细微的想法影响到前台讨论(2 (https://arxiv.org/html/2608.26185#bib.bib7))。在共处环境中使用也使这些渠道提供的保护变得复杂。McCarthy和boyd指出,即使通过后台通道中介,可识别的句柄和可追踪的日志也会削弱匿名性(34 (https://arxiv.org/html/2608.26185#bib.bib5))。因此,并行渠道可能使贡献更容易被忽略,并使其采纳依赖于主持人、教师或主导发言者。它们降低了直接归因压力,但重新整合到共享的语音会话中这一问题在很大程度上仍未解决。  

### 2.2.讨论支持与AI中介表达  
其他系统在持续的对话本身内支持参与,通常通过使发言时间失衡变得可见,或通过指导参与者实现更平衡的互动。实时参与显示系统如Second Messenger(9 (https://arxiv.org/html/2608.26185#bib.bib9))、Meeting Mediator中的可穿戴社会计量传感(26 (https://arxiv.org/html/2608.26185#bib.bib10))、共享的轮次可视化如Conversation Balance(31 (https://arxiv.org/html/2608.26185#bib.bib12))以及会后反思仪表板如MeetingCoach(44 (https://arxiv.org/html/2608.26185#bib.bib11))针对参与支持的不同阶段,但它们共享一个共同假设。参与者仍需要调整自己的行为,并亲自公开表达贡献。这些系统可以使失衡更明显,有时支持更平衡的参与,但它们通常不改变谁必须公开表达一个具有社交风险的贡献。AI中介通信采取了不同的方法。它不是规制谁发言,而是通过代表沟通者增强、重写或生成文本来重塑消息的听觉形式(14 (https://arxiv.org/html/2608.26185#bib.bib13))。AI可以改变消息形式,但这样做也改变了用户感觉保留了多少控制权。工作场所的共同写作研究发现,即使是风格辅助也会影响感知的代理性和所有权(23 (https://arxiv.org/html/2608.26185#bib.bib14))。综观目前回顾的两条路径,现有系统要么规制参与,要么重塑消息形式,但它们很少提供一种渠道,能将用户创作的、具有社交风险的观点重新引入共享的语音会话。  

### 2.3.会话智能体与具身参与  
直接参与小组讨论的智能体扮演了多种角色。在一端,促进者智能体监控参与度并提示发言不足的参与者:Observe, Ask, Intervene在线上会议中这样做(18 (https://arxiv.org/html/2608.26185#bib.bib16)),而ClassMeta在VR演讲厅中部署虚拟同学,打破沉默并提供部分答案,为学生创造发言机会(32 (https://arxiv.org/html/2608.26185#bib.bib44))。倡导者智能体更进一步,生成内容:Amplifying Minority Voices使用一个AI魔鬼代言人,在小组决策中提出反对论点(28 (https://arxiv.org/html/2608.26185#bib.bib15))。在另一端,替代者智能体完全代表用户。Dittos创建了个性化具身智能体,代表用户参加会议,匹配其外貌和声音(29 (https://arxiv.org/html/2608.26185#bib.bib42))。Nam等人重建缺席的参与者,使异步观看者可以向他们提问(37 (https://arxiv.org/html/2608.26185#bib.bib47))。Cheng等人探索了语音通话中的共享自主权,智能体在用户处理多项任务时处理对话的部分内容(3 (https://arxiv.org/html/2608.26185#bib.bib41))。纵观这一谱系,现有系统共享一个共同特性:智能体要么自行决定说什么,要么完全取代用户。关于干预策略的研究强化了相关担忧。智能体私下的、个人化的提示比公开的提示更有效、更受欢迎(10 (https://arxiv.org/html/2608.26185#bib.bib45)),而自主智能体过高的社会显性可能会抑制参与者的批判性思维并降低他们的被需要感(21 (https://arxiv.org/html/2608.26185#bib.bib36); 22...

相似文章

VoxMind:端到端智能体语音对话系统

Hugging Face Daily Papers

VoxMind 推出具备智能体能力的端到端语音对话系统,通过“先思后言”机制与动态工具管理,将任务完成率从 34.88% 提升到 74.57%,同时保持对话质量。

程序问题:面向数据驱动的公民商议的行动感知LLM角色建模

arXiv cs.CL

一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。

"Excuse me, may I say something..." CoLabScience,一个用于生物医学发现和大语言模型-专家协作的主动型AI助手

arXiv cs.CL

CoLabScience介绍了一个用于生物医学研究的主动型大语言模型助手,它使用PULI(正无标签学习干预)这一新颖的强化学习框架,在科学讨论中自主进行干预,决定何时以及如何提供上下文感知的见解。该工作还包括BSDD,一个新的基准数据集,由基于PubMed文章的模拟研究对话和干预点组成。

Hear2Act:评估韵律何时应改变助手行为基准

arXiv cs.CL

本文介绍了Hear2Act,一个统一的基准,用于评估韵律线索如何影响任务导向对话的决策。研究发现,当词汇证据不足时,韵律很重要,并且音频LLM通过显式的动作关注表示能获益。