标签
本文提出了一种面向制造知识图谱的可组合信任基础设施,专注于跨系统溯源、时间推理和决策可追溯性。
本文通过联想任务和声明任务研究语言模型是否一致编码当前年份,发现由于任务间机制差异,当前年份并未被一致编码。
本文介绍了从法律文件中提取时间依赖图以计算提交截止日期的方法,并表明管道方法在准确性上优于直接的语言模型回答。
本文构建了一个基准来评估LLMs在时序法律推理上的表现,揭示了它们倾向于适用最新颁布的法律的偏见,以及通用推理能力与时序性能之间的反向关系。
CRAFT是一种新的LLM框架,用于对临床叙述中的时间推理进行迭代优化,引入了基于验证器的反馈机制,并提出了用于疫苗不良事件报告的MedTempo基准。
MobileMem 引入了一个基准和框架,用于设备上 AI 系统从长达一年的移动经验中学习,重点关注时序推理、知识更新和偏好推断。
ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
MA-DAR是一个即插即用框架,通过将重放表示和当前表示对齐到共享流形上,并利用动态门控机制进行自适应融合,解决了基于重放的持续时序知识图谱推理中的表示冲突问题。
本文探讨了AI聊天机器人在正确回答时间相关问题上持续存在的困难,分析了背后的原因以及用户的挫败感。
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
本文系统研究了如何将时间元数据结构性地嵌入到面向历史文本的命名实体识别(NER)模型中。通过采用早期或晚期融合机制注入绝对和相对时间表示的实验表明,晚期融合策略在法语和德语历史数据集上展现出更稳健的性能。
本文介绍了HIPE-2026的结果,这是HIPE评测系列的第三版,专注于从法语、德语和英语的多语言历史文档中提取基于时间的人物-地点关系。对17个参赛团队在预测准确性、计算效率和跨领域泛化能力方面进行了评估。
本文指出了当前AI代理记忆系统的四个关键缺陷——脆弱性、缺乏时间推理能力、遗忘困境和评估缺口——并提出了一种受代码代理启发的新型记忆架构,在基准测试中取得了高分,同时强调上下文学习是下一个挑战。
本文提出了基于回忆的提示策略(Self-Recall和Question-Recall),以提升LLM对知识截止的遵循能力,在反事实问题上优于现有方法,并引入多截止历史事件基准(MHEB)用于鲁棒性评估。
研究人员推出了 DoseBench——一个包含 81 个非处方药剂量场景的基准测试,用于评估大语言模型在对乙酰氨基酚和布洛芬使用中面对时间不确定性时的决策能力。结果表明,大语言模型在滚动时间窗口推理方面频繁出现困难,且可能给出看似自信但缺乏医学依据的回答。
本文引入读出-中介角度,证明线性探针可以从语言模型激活中解码出与模型实际因果计算正交的信息,从而削弱了基于探针的可解释性。该发现跨模型规模和系列得到复现,揭示出使用探针进行机制理解或安全监控的一个根本性失败模式。
本文介绍了AsyncTool,一个用于评估基于LLM的智能体在多任务场景下具有延迟工具响应的异步函数调用能力的基准测试。它提出了面向效率的度量指标,并识别了当前工具使用智能体的关键失败模式。