标签
Sierra宣布与软银(SoftBank)达成战略合作,向日本企业提供其对话式AI平台,软银将担任独家销售合作伙伴,并在其自有品牌中采用该平台。
对AI语音助手ChatGPT-Live、Pi、Lucy OS1和Gemini-Live的比较,重点关注哪个使用起来最自然,得出的结论是:随着智能水平的提高,对话质量正成为关键差异化因素。
本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。
OpenAI发布GPT-Live-1,这是ChatGPT升级后的语音模式,打断用户更少,支持实时翻译,并能针对天气、体育等话题生成视觉背景。
NapMem是一个框架,将长期用户记忆视为结构化动作空间而非被动检索,通过多粒度记忆金字塔和强化学习训练代理进行记忆导航。实验表明,在记忆密集型任务上表现有竞争力。
一位开发者分享了让LLM生成的播客听起来更自然的技术,包括使用约束条件迫使产生分歧,以及在生成前预先编辑内容。
提出一种主动思考框架,使大语言模型能在对话间隙预计算回复要素,在不牺牲质量的前提下提升交互效率。引入无需训练的基线方法,通过推测性持续思考预测未来状态,并在时间感知基准上进行评估。
一条推文强调提示工程仍然具有相关性,推荐阅读如何通过头脑风暴和规划等技术来丰富与AI智能体的互动。
Google 的 Gemini Omni Flash 模型可以通过对话提示来编辑视频,使用 Interactions API 根据用户描述生成新片段。
本文介绍了Profile-guided Personalized Retrieval Optimization (PPRO),一种通过将用户画像融入记忆检索并利用强化学习优化检索的框架,增强了长期对话智能体的能力,在现有方法上实现了持续改进。
本文提出 TRACE,一种查询处理框架,将对话数据建模为时间证据图,以支持对不断演进的用户状态进行状态感知推理,从而提高长对话问答中的时间推理和多跳推理能力。
本文提出了一种基于参考的评估协议,用于评估语音到语音AI系统的韵律和节奏,通过匹配人类对话数据提供可解释的行为合理性检查。
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。
本文探讨将非暴力沟通(NVC)原则作为轻量级提示约束,用于减少大语言模型在冲突倾向交互中的对话升级。在多个指令微调模型上的实验表明,NVC约束提示能持续降低对话升级,并稳定与高度抵抗用户的互动。
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
Coval宣布完成A轮融资,旨在构建用于测试和部署企业对话式AI代理的基础设施,其灵感来自自动驾驶测试的严谨性。
本文介绍了一种对话语音代理系统,该系统使用轻量级设备端“Talker”模型立即开始响应,然后随着前沿大语言模型“Reasoner”知识的可用而将其融入,实现了7-19倍的首响应时间缩短,同时在笔记本电脑上达到接近前沿水平的性能。