标签
Omio 正利用 OpenAI 的 ChatGPT 和 Codex 构建对话式旅行预订体验并优化内部运营,迈向 AI 原生模式。
探讨人们在与AI或人类讨论个人话题时是否更轻松,指出AI提供无评判、随时可用的倾听者,但缺乏真实的人类体验。
用户报告称,通过 codex agentRuntime 使用 gpt-5.5 时,在较短的对话轮次中,工具调用会被静默丢弃,导致模型虽生成文本但无响应。该问题为 gpt-5.5 特有,切换至 deepseek/deepseek-v4-pro 即可解决,表明可能存在回归故障。
本文挑战了将支持聊天机器人视为无状态FAQ的传统观点,并探讨了通过重新设计,如何打造更高效、具备状态感知能力的对话代理。
Pinterest推出名为‘Ask Pinterest’的实验性AI购物应用,利用对话式AI及其Taste Graph提供个性化产品推荐,同时为营销人员推出新的AI广告工具。
OpenAI计划发布GPT-Bidi-1,其下一代语音模型,可同时听和说,处理中断,并实现更自然的对话。
本文介绍了一种名为Turing-RL的强化学习方法,该方法利用基于图灵测试的奖励来训练语言模型,使其在对话和论坛场景中生成与人类用户无法区分的回复,性能优于基线方法。
T-Mem 是一种新型长程对话记忆架构,能够同时支持描述性回忆和关联性回忆,涵盖查询与记忆共享表面特征的场景以及两者通过潜在语义弧相连的场景。该架构在 LoCoMo 和 LoCoMo-Plus 基准测试上达到了最先进水平。
作者认为,当前的人工智能在处理转录文字方面表现出色,但却忽略了犹豫和语调等非语言线索,凸显了理解语言与理解人类沟通之间的差距。
DoorDash 推出“Ask DoorDash”AI 聊天机器人,允许用户通过文字提示或照片订购食品和杂货,将在部分地区的 iOS 上推出。
该论文提出了一种流水线,利用少样本文本分类器和GPT-4提取的先决条件知识图谱,将学生在对话式AI助教中提出的问题映射到课程主题。在1,340个问题事件上实现了80%的准确率,并与学生自我报告的难度相关。
苹果在WWDC上宣布了“Siri AI”,这是一个更会话式的语音助手,与应用和个人上下文深度集成,将于今年秋季与谷歌驱动的AI模型更新一同推出。
苹果在WWDC 2026揭晓了Siri的重大改版,将其从语音助手转变为名为Siri AI的对话式AI聊天机器人,具备联网能力、设备上下文感知以及专用应用等功能。
得益于对话式AI、可扩展性和性能一致性方面的进步,像 LuMay Voice Agent 和 Voxentis.ai 这样的AI语音代理正在加速取代传统呼叫中心,推动医疗、房地产、电商等行业采用AI与人类混合的模式。
本文介绍了COVA-X,一个用于短信钓鱼检测的扩展合成多轮对话数据集,并表明Longformer现在优于XGBoost,从而证实了Transformer模型受益于更大的训练语料库。
τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。
研究人员推出了BenSyc,这是首个在孟加拉社会语境中评估对话谄媚的基准,发现大语言模型难以区分共情支持与验证及升级行为,仅达到约61%的Macro-F1。
本文提出了一种无需训练、仅使用CPU的检索方法,该方法将BM25词汇分数与后期交互密集分数相融合,用于会话记忆检索,在六个编码器上相比仅使用后期交互,在LoCoMo Hit@1上提升了高达+17.2个点。该研究提供了关于池化操作符、重排序器效果和基准鲁棒性的受控消融实验,将这种提升视为密集信号与词汇信号之间的分工。
来自多伦多大学和 Vector Institute 的研究人员提出了线段树记忆(SegTreeMem),这是一种面向长时域对话智能体的记忆架构,利用层次化线段树结构在在线构建和检索过程中保留时间顺序。在三个数据集上的实验表明,与不考虑时间顺序的树状基线相比,LLM 评判准确率提升了近 20%。