标签
本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。
记录AGI Summit上田渊栋与Holly Zheng关于超越超级智能的对话。
OpenAI展示了GPT-Live的改进,突出了其在实时处理多项任务(如查询航班、天气和制定行程)的同时保持对话的能力。
Dwarkesh Patel宣布将于7月22日与Dr. Fei-Fei Li进行一场不公开的对话,名额有限。
TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。
本文主张传统的提示工程已经过时,现代LLM是意图重构器,应通过自然、丰富的对话而非精简指令来与模型交互。
一位用户报告称,在关于百草枯的科学讨论中,Claude反复假设用户有自杀意图,尽管用户明确否认了超过20次,这降低了服务质量,并引发了对过度敏感的安全机制的担忧。
一位开发者测试了小型边缘模型(LFM2.5、Gemma 变体)在多个对话轮次中保持一个事实的能力,发现模型常常自信地否认知道仍在上下文中的信息,这给智能体架构带来了信任问题,并暗示了记忆与格式规范之间的权衡。
LANTERN 引入了一个轻量级记忆层,能够在对话压缩后归档对话轮次并检索相关细节,恢复了78.3%丢失的事实,且无需任何LLM调用,性能优于基于MemGPT的方法。
Jeff Dean 感谢 Two Minute Papers 主持人进行了一场关于 AI 研究的对话,并在帖子中附带了完整视频的链接。
陶哲轩与Mark Chen讨论了人工智能如何改变数学研究,从文献搜索到代码生成,以及调整工作流程的必要性。
本文介绍了SeDT,一种无需训练、推理时的方法,通过用来自三种信号的累积相关性分数标注对话历史,提高多轮对话中LLM的可靠性,在Lost-in-Conversation基准测试上实现了高达+37.7%的性能提升。
本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。
本文介绍了用于手语对话情感识别的eJSL Dialog数据集,填补了现有数据集缺乏对话上下文的空白。基准测试表明,应用通用多模态模型时存在领域差距,凸显了针对手语的上下文感知视觉提取器的必要性。