dialogue

标签

Cards List
#dialogue

Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型

Hugging Face Daily Papers · 2026-08-11 缓存

Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。

0 人收藏 0 人点赞
#dialogue

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

arXiv cs.CL · 2026-08-10 缓存

This paper introduces PHASE-Tree, a multi-timescale character-state representation for long-horizon role-playing dialogue, along with the LongEvoRoleBench benchmark to evaluate evolved-state generation. The proposed approach outperforms baselines on character-level, semantic, and embedding metrics across long-dialogue corpora.

0 人收藏 0 人点赞
#dialogue

MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准

arXiv cs.AI · 2026-07-28 缓存

MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。

0 人收藏 0 人点赞
#dialogue

评估大语言模型在多轮医疗对话中的误解纠正能力

arXiv cs.CL · 2026-07-15 缓存

本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。

0 人收藏 0 人点赞
#dialogue

不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话

arXiv cs.CL · 2026-07-07 缓存

提出一种主动思考框架,使大语言模型能在对话间隙预计算回复要素,在不牺牲质量的前提下提升交互效率。引入无需训练的基线方法,通过推测性持续思考预测未来状态,并在时间感知基准上进行评估。

0 人收藏 0 人点赞
#dialogue

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL · 2026-07-01 缓存

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

0 人收藏 0 人点赞
#dialogue

为什么与他人出声思考胜过独自思考

Hacker News Top · 2026-06-17 缓存

一篇探讨为什么与他人一起出声思考比独自反思更能产生更好的理解和洞见的文章,借鉴了认知科学和哲学。

0 人收藏 0 人点赞
#dialogue

Dialogue SWE-Bench:对话驱动编码代理的基准测试

arXiv cs.CL · 2026-06-15 缓存

提出了 Dialogue-SWE-Bench,这是一个用于评估编码代理通过与用户对话解决软件工程问题能力的基准测试。该研究还提出了一种基于角色设定的用户模拟器和一个能够提升对话能力的模式引导型代理。

0 人收藏 0 人点赞
#dialogue

ParaBridge:弥合语音语言模型中副语言感知与对话行为之间的鸿沟

arXiv cs.CL · 2026-06-10 缓存

ParaBridge是一种基于策略的自蒸馏方法,旨在弥合语音语言模型中副语言感知与对话行为之间的差距,在不依赖外部奖励的情况下显著提升安全性和共情能力。

0 人收藏 0 人点赞
#dialogue

心理健康对话中的专家级危机检测

arXiv cs.CL · 2026-06-10 缓存

介绍了CRADLE-Dialogue,一个由临床医生标注的基准数据集,用于心理健康对话中的对话轮次级危机检测,同时包含Alert–Confirm评估协议、合成训练语料库以及一个32B参数模型,该模型在性能上优于现有的开放源代码和专有模型。

0 人收藏 0 人点赞
#dialogue

Ψ-Bench:评估对话中基于人格的影响力 persuasion

arXiv cs.LG · 2026-06-03 缓存

Ψ-Bench是一个基准测试,用于评估大语言模型通过对话影响用户的能力,并整合用户画像以进行个性化说服。实验表明,即使是最先进的模型仍有改进空间,而获取客户画像能显著提升性能。

0 人收藏 0 人点赞
#dialogue

适应是双向的:研究人类与语言模型之间的语言趋同

arXiv cs.CL · 2026-05-29 缓存

本文研究了在多轮对话中人类与大型语言模型之间的语言适应性,发现LLM过度趋同于用户风格,而人类适应LLM的方式与适应其他人类并无不同。

0 人收藏 0 人点赞
#dialogue

SwanVoice: 面向独白和对话的表现力长文本零样本语音合成

Hugging Face Daily Papers · 2026-05-29 缓存

SwanVoice 是一种零样本文本转语音模型,专为富有表现力的长文本独白和对话合成而设计,结合了 VAE、流匹配 DiT 和扩散后训练,在丰富度和层次感得分上均优于现有基线模型。

0 人收藏 0 人点赞
#dialogue

Conv-to-Bench: 通过用户-助手对话评估语言模型在代码任务中的表现

arXiv cs.CL · 2026-05-27 缓存

Conv-to-Bench 是一个多阶段框架,能够自动将多轮用户-助手对话转化为结构化的、可验证的需求清单,用于评估大型语言模型在代码任务上的表现,以较低的计算成本实现了与人工编写的基准近乎完美的对齐。

0 人收藏 0 人点赞
#dialogue

Moltbook 审核:通过多轮对话揭示隐藏意图

arXiv cs.AI · 2026-05-14 缓存

本文介绍 Bot-Mod,一个通过多轮对话和基于吉布斯采样的方法识别多智能体系统中恶意意图的审核框架,并展示来自Moltbook的数据集用于评估。

0 人收藏 0 人点赞
#dialogue

2026年5月19日 公告:拓展前沿AI对话

Anthropic News · 2026-05-20 缓存

Anthropic宣布将与宗教、哲学和文化团体开展一系列对话,以拓宽构建安全且有益AI的视角。这些对话旨在为像Claude这样的AI系统的道德形成提供参考。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈