标签
本文描述了1911年版的Roget's Thesaurus的数字版,该版本由MICRA Inc.于1988年创建,作为自然语言理解和语义互操作性研究的一部分。
本文通过使用自然叙事研究语言模型和人类中的实体跟踪能力,发现子十亿参数的模型已达到人类水平并超越人类,表明核心语言理解能力在比先前假设更小的规模上涌现。
介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。
本文提出了一种统一的语义建模框架,利用带有多适配器架构的微调小型语言模型,用于Linkedin的大规模职位理解,提升了性能并降低了运营复杂度。
讨论那些人们认为AI代理已经准备好、但实际上并未准备好的任务,重点突出了解读模棱两可的人类输入(例如恼怒但未明确说明的消息)的挑战。
本文研究了大语言模型如何处理否定与比喻语言的组合,发现这种组合构成了特殊挑战,且模型表现高度依赖于提示风格。作者为Fig-QA数据集新增了标注,并通过分析嵌入空间揭示了时态和具体性等额外语言因素的影响。
PragReST 是一个自监督框架,通过生成反事实推理轨迹并利用监督微调和强化学习训练模型,提升大语言模型的语用推理能力,在语用基准测试上取得了显著提升,且无需人工标注数据。
本文认为,真实的搜索查询混乱而复杂,不像AI演示中展示的干净示例,并强调了查询分类和意图拆分对AI智能体及智能客服的重要性。
本文提出了一种模块化方法,通过冻结嵌入并调整模型其余部分,将预训练语言模型适配到低资源语言,在苏格兰盖尔语、爱尔兰语和克丘亚语的NLU任务上展示了改进效果。
来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。
介绍DRInQ,一个用于评估疑问话语中会话含义的基准,揭示了LLMs尽管能够生成合理的语用场景,但在推理时往往无法恢复预期的含义。
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
Google DeepMind 展示了 Gemini Robotics 2 模型,使机器人阿波罗能够在杂乱环境中通过全身控制和具身推理理解自然语言指令、自主协调动作并完成收拾运动装备等多步骤任务,验证了通用机器人的潜力。