标签
NVIDIA 在 Hugging Face 上发布了 NeMo Gym 对话式工具使用资源,包括用于该管线的黄金策略/工具参考对和提示历史。
Presents FormBharo, a voice agent that uses LLMs with rule-based controls to fill structured forms over phone calls for low-literacy Hindi-speaking users in India, piloted with ARMMAN. The paper also introduces FormVoiceAgentBench, a benchmark of 3,760 multi-turn conversation tests, and shows that end-to-end evaluation is necessary since component-level performance does not predict full form completion.
总部位于雅典的 Omilia 在 Expedition Growth Capital 领投的 B 轮融资中筹集了 6700 万美元,用于扩展其 AI 驱动的客户支持平台,该平台结合了生成式 AI 和更传统的自动化。该公司报告的年经常性收入为 6000 万美元,客户包括 Capital One 和 Taco Bell。
一位工程师提出的框架,用于理解对话式AI系统在能力、控制和延迟之间的权衡,阐释了为什么每个助手都必须选择其中两项,并提出了深思熟虑的设计策略。
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
NVIDIA 开源了 PersonaPlex 7B,一个实时对话模型,能够同时聆听和说话,与大多数语音模型不同,它可以处理自然的打断和重叠。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
微软研究院的AutoGen实现了多智能体LLM对话,使AI系统工程师能够构建具有分层执行能力的可对话智能体,以完成单个LLM难以应对的复杂任务。
这篇arXiv论文提出将能力维持型情感对话(CSED)作为情感支持系统的纵向研究范式,认为当前方法侧重于即时缓解而忽视了用户的长期能力。文献审计显示,大多数系统忽略了纵向结果,从而为数据、模型、评估和治理提出了新的议程。
本文评估了对话式AI审核中的端到端权衡,比较了过滤器放置(输入、响应、两者)和操作(阻止与重写),使用客户结果指标如有用性和有害暴露,而不是组件准确性。
本文探讨了对话式人工智能的心理影响,提出了减少伤害和促进福祉的设计方向,同时指出了尚待研究的开放性问题。
MusiChat 提出了一种用于人机音乐协作创作的对话系统,通过自然语言交互实现迭代优化,在多轮编辑中达到了高准确率。
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。
本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。
J-Pop Analyst 是一个AI对话式工具,提供日本86亿美元音乐市场的实时新闻和分析,涵盖制作、联动经济和粉丝文化。
Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。
Cars24 利用 OpenAI 技术构建了由 AI 驱动的语音和聊天代理,每月处理超过一百万分钟的对话,自动化了购买、销售和融资汽车的完整客户旅程。
Spotify 正在为 Premium 订阅用户推出新的 AI 聊天机器人功能,允许用户通过自然语言对话搜索和控制音乐、有声书和播客,并能参考个人收听历史。
Spotify为Premium用户推出了一项测试版功能,允许用户与应用进行互动对话来选择音乐,该功能结合了其自身的AI和多个提供商的语言模型,初期将在美国、爱尔兰和瑞典上线。