字里行间:单向对话问题
摘要
本文介绍了单向对话问题(1SC),针对在远程医疗和呼叫中心等现实场景中,仅有一方发言转录的情况下,如何重建缺失的对话内容和生成摘要。作者在多个数据集上评估了提示和微调模型,发现访问未来上下文和话语长度信息能改进重建效果,同时无需完整对话重建即可生成高质量摘要。
arXiv:2511.03056v2 公告类型:替换
摘要:对话AI在许多现实场景中受到限制,这些场景仅能录制一方的对话,如远程医疗、呼叫中心和智能眼镜。我们将此形式化为单向对话问题(1SC):推断和学习对话的一方。我们研究两个任务:(1) 为实时用例重建缺失说话方的转折点,(2) 从单向转录生成摘要。通过在MultiWOZ、DailyDialog和Candor上评估提示和微调模型,并采用人工A/B测试和LLM-as-a-judge指标,我们发现访问一个未来转折点和话语长度信息能改进重建,占位符提示有助于缓解幻觉,大型模型通过提示能生成有前景的重建结果,而较小模型需要微调。此外,无需重建缺失转折点即可生成高质量摘要。我们将1SC作为一个新颖的挑战提出,并报告了有前景的结果,这标志着隐私感知对话AI发展的一大步。
查看缓存全文
缓存时间: 2026/04/20 08:31
# 字里行间:单向对话问题 来源:https://arxiv.org/abs/2511.03056 查看 PDF (https://arxiv.org/pdf/2511.03056) > 摘要:在许多现实应用中,对话式 AI 受到限制,因为只能记录对话的一方,如远程医疗、呼叫中心和智能眼镜。我们将这个问题形式化为单向对话问题(1SC):推断并从对话的一方学习。我们研究两个任务:(1)为实时用例重建缺失发言者的发言,以及(2)从单向对话记录生成摘要。通过在 MultiWOZ、DailyDialog 和 Candor 数据集上评估提示和微调模型,使用人工 A/B 测试和 LLM 作为评判的指标,我们发现:获取一个未来轮次和话语长度信息可以改进重建效果,占位符提示有助于减轻幻觉,虽然大型模型通过提示生成了有希望的重建结果,但较小的模型需要微调。此外,无需重建缺失轮次也能生成高质量摘要。我们将 1SC 呈现为一个新型挑战,并报告了有希望的结果,标志着朝着隐私保护型对话式 AI 迈出了一步。 ## 提交历史 来自:Victoria Ebert [查看邮箱 (https://arxiv.org/show-email/c68990da/2511.03056)] **[[v1]](https://arxiv.org/abs/2511.03056v1)** 2025 年 11 月 4 日星期二 22:53:57 UTC(513 KB)**[v2]** 2026 年 4 月 16 日星期四 17:48:38 UTC(9,889 KB)
相似文章
长期历史感知的医疗对话合成与评估
本文介绍了一种利用大语言模型(LLMs)合成长期医疗对话数据集的框架,并创建了 MediLongChat,包含三个基准任务,用于评估医疗智能体的记忆与推理能力。实验表明,即使是最先进的 LLMs 也难以完成这些任务。
医患对话的鲁棒摘要:TalTech系统在Beyond Transcription挑战赛中的方案
本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。
全双工语音对话模型中的同步与话轮转换
本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。
使用远距观看建模话轮转换:探究人类与AI生成话语中的沉默阈值
本文探讨了话轮转换中的沉默阈值如何在人类与AI生成的话语中有所不同,采用远距观看方法分析对话模式。
Dialogue SWE-Bench:对话驱动编码代理的基准测试
提出了 Dialogue-SWE-Bench,这是一个用于评估编码代理通过与用户对话解决软件工程问题能力的基准测试。该研究还提出了一种基于角色设定的用户模拟器和一个能够提升对话能力的模式引导型代理。