标签
ThoughtTrace 引入了一个大规模数据集,将真实世界的多轮人机对话与用户的自我报告想法配对,通过想法引导的重写来改进用户行为预测和个性化助手训练。
PRISM是一个闭环框架,将提示工程视为企业对话式AI的持续可靠性问题。它自动执行测试生成、模拟、评估和修复,实现了99%的可靠性,并将编写时间从几天缩短到几分钟。
Vision Agents 是一个开源Python框架,用于构建处理实时视频和音频的多模态AI智能体。它利用MediaPipe使对话智能体能够根据面部表情和目光方向调整语音。
作者分享了他八十多岁的父亲每天使用谷歌 Gemini AI 获取日历提醒的经历,并指出 AI 对老年人、家庭和残障人士的广泛益处,反驳了 AI 只帮助大企业的说法。
介绍了一种用于法律对话中主动信息提取的探究型对话代理(ICA),提出了一个双层次强化学习框架,该框架学习何时以及如何提出探测性问题,并在美国最高法院口头辩论数据上进行评估。
本文提出了一种轻量级框架,使用粘性因子HDP-HMM从多模态效价-唤醒轨迹中建模会话情绪为潜在状态,旨在实现可解释且计算高效的情绪状态跟踪。
本文介绍CLIPR,一个从最少的对话输入中学习可转移的潜在用户偏好的框架,以改进LLM中与人类一致的决策。
Oboe是一款全新的AI驱动学习工具,通过引导式对话和实时调整帮助用户高效学习,与标准大语言模型形成鲜明对比。
PreScam 是一个用于建模多轮对话中骗局演进的基准测试,基于真实世界的骗局报告构建。它包含实时终止预测和诈骗者行为预测等任务,发现监督式编码器的表现优于零样本大语言模型。
文章重点介绍了一项研究更新,描述了一种交互模型,该模型能够在没有内置对话管理系统的情况下,追踪讲故事过程中的认知状态,如思考、让步和自我纠正。
作者开发了一套可移植的用户偏好档案系统,该系统可与 ElevenLabs 和 Pipecat 代理集成,使语音助手能够跨平台记忆用户的风格与兴趣,从而跳过冗余的引导流程。
Skopx是一个对话式AI分析平台,用户可以用自然语言提出业务问题,平台自动从连接的数据源生成洞察,无需编写SQL。它提供透明的推理过程、基于角色的访问控制,并能与现有工具集成。
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。
PersonaKit 是一个开源 Web 平台,旨在对全双工对话系统中的多样化角色进行快速原型设计和用户测试。它允许研究人员通过 JSON 配置角色特有的轮流对话行为,并进行 A/B 测试以评估社会语言学交互。
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
研究发现,GPT与Claude在多轮数学对话的纠错过程中表现出截然不同且不可靠的修复行为:有的模型抗拒修正,有的则过度修正。
# 当虚假信息发声与对话:重塑音频平台的事实核查机制 来源:[https://arxiv.org/abs/2604.16767](https://arxiv.org/abs/2604.16767) [查看PDF](https://arxiv.org/pdf/2604.16767) > 摘要:音频平台已超越娱乐范畴。它们已成为公众话语的核心,从播客、广播到WhatsApp语音留言和直播无处不在。凭借数百万档节目与数亿听众,音频平台如今已成为虚假信
做了我的聊天助手的 V2 版本,说实话,开始觉得有点不对劲了。它会读取对话、自动回复、调整语气以免对方失去兴趣。现在还支持:• 边聊边搜 • 识别对方发送的图片 • 转录并回复语音消息 • 根据上下文发 GIF • 记住生日和过往聊天记录 • 忘了回复时自动跟进 • 聊偏了可以手动引导 • 每隔约 25 条消息总结一次上下文。目前已使用约 50 万 token
MoshiRAG 将紧凑的全双工语音语言模型与异步检索增强生成相结合,在保持实时交互性的同时提高事实准确性。该方法利用对话中自然的时空间隙来检索外部知识,而不会打断对话的自然流程。
MTR-DuplexBench为全双工语音语言模型在多轮对话中的评估引入了一个综合基准,解决轮转边界模糊和上下文不一致等挑战,同时评估对话特征、对话质量、指令遵循和安全性。