temporal-reasoning

标签

Cards List
#temporal-reasoning

制造知识图谱的可组合信任基础设施:跨系统溯源、时间推理与决策可追溯性

arXiv cs.AI · 2026-08-25 缓存

本文提出了一种面向制造知识图谱的可组合信任基础设施,专注于跨系统溯源、时间推理和决策可追溯性。

0 人收藏 0 人点赞
#temporal-reasoning

语言模型是否一致编码当前年份?

arXiv cs.CL · 2026-08-18 缓存

本文通过联想任务和声明任务研究语言模型是否一致编码当前年份,发现由于任务间机制差异,当前年份并未被一致编码。

0 人收藏 0 人点赞
#temporal-reasoning

时间作为结构:用于法律文件可验证截止日期计算的时间依赖图

arXiv cs.CL · 2026-08-18 缓存

本文介绍了从法律文件中提取时间依赖图以计算提交截止日期的方法,并表明管道方法在准确性上优于直接的语言模型回答。

0 人收藏 0 人点赞
#temporal-reasoning

LLMs何时会适用错误法律?诊断LLMs在时序法律推理中的失败

arXiv cs.AI · 2026-08-18 缓存

本文构建了一个基准来评估LLMs在时序法律推理上的表现,揭示了它们倾向于适用最新颁布的法律的偏见,以及通用推理能力与时序性能之间的反向关系。

0 人收藏 0 人点赞
#temporal-reasoning

CRAFT:基于LLM的临床叙述时间推理迭代优化框架

arXiv cs.CL · 2026-08-14 缓存

CRAFT是一种新的LLM框架,用于对临床叙述中的时间推理进行迭代优化,引入了基于验证器的反馈机制,并提出了用于疫苗不良事件报告的MedTempo基准。

0 人收藏 0 人点赞
#temporal-reasoning

MobileMem:从一年的移动经验中学习

Hugging Face Daily Papers · 2026-08-11 缓存

MobileMem 引入了一个基准和框架,用于设备上 AI 系统从长达一年的移动经验中学习,重点关注时序推理、知识更新和偏好推断。

0 人收藏 0 人点赞
#temporal-reasoning

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers · 2026-08-06 缓存

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

0 人收藏 0 人点赞
#temporal-reasoning

GROVE:从流式视频体验中生长与推理的时间分层记忆

Hugging Face Daily Papers · 2026-08-03 缓存

GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。

0 人收藏 0 人点赞
#temporal-reasoning

基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架

arXiv cs.AI · 2026-07-29 缓存

ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。

0 人收藏 0 人点赞
#temporal-reasoning

MA-DAR:面向持续时序知识图谱推理的流形对齐动态自适应路由

arXiv cs.LG · 2026-07-27 缓存

MA-DAR是一个即插即用框架,通过将重放表示和当前表示对齐到共享流形上,并利用动态门控机制进行自适应融合,解决了基于重放的持续时序知识图谱推理中的表示冲突问题。

0 人收藏 0 人点赞
#temporal-reasoning

为什么AI聊天在处理时间相关问题时仍然表现糟糕?

Reddit r/AI_Agents · 2026-07-09

本文探讨了AI聊天机器人在正确回答时间相关问题上持续存在的困难,分析了背后的原因以及用户的挫败感。

0 人收藏 0 人点赞
#temporal-reasoning

OpenCoF:通过视频生成学习推理

Hugging Face Daily Papers · 2026-07-09 缓存

OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。

0 人收藏 0 人点赞
#temporal-reasoning

从基础到应用:在实践中改进VLA模型

Papers with Code Trending · 2026-07-07 缓存

本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。

0 人收藏 0 人点赞
#temporal-reasoning

历史文本中命名实体识别的时间融合策略研究

arXiv cs.CL · 2026-06-29 缓存

本文系统研究了如何将时间元数据结构性地嵌入到面向历史文本的命名实体识别(NER)模型中。通过采用早期或晚期融合机制注入绝对和相对时间表示的实验表明,晚期融合策略在法语和德语历史数据集上展现出更稳健的性能。

0 人收藏 0 人点赞
#temporal-reasoning

HIPE-2026 概述:从多语言历史文本中抽取人物-地点关系

arXiv cs.CL · 2026-06-25 缓存

本文介绍了HIPE-2026的结果,这是HIPE评测系列的第三版,专注于从法语、德语和英语的多语言历史文档中提取基于时间的人物-地点关系。对17个参赛团队在预测准确性、计算效率和跨领域泛化能力方面进行了评估。

0 人收藏 0 人点赞
#temporal-reasoning

你的AI助手为何总是忘记你:4个根本原因(以及我们的解决方案)

Reddit r/AI_Agents · 2026-06-10

本文指出了当前AI代理记忆系统的四个关键缺陷——脆弱性、缺乏时间推理能力、遗忘困境和评估缺口——并提出了一种受代码代理启发的新型记忆架构,在基准测试中取得了高分,同时强调上下文学习是下一个挑战。

0 人收藏 0 人点赞
#temporal-reasoning

LLMs能否被约束在过往?通过基于回忆的提示改进知识截止

arXiv cs.CL · 2026-06-05 缓存

本文提出了基于回忆的提示策略(Self-Recall和Question-Recall),以提升LLM对知识截止的遵循能力,在反事实问题上优于现有方法,并引入多截止历史事件基准(MHEB)用于鲁棒性评估。

0 人收藏 0 人点赞
#temporal-reasoning

我还能再服一剂吗?评估大语言模型在非处方药剂量问答中面对时间不确定性的决策能力

arXiv cs.CL · 2026-06-04 缓存

研究人员推出了 DoseBench——一个包含 81 个非处方药剂量场景的基准测试,用于评估大语言模型在对乙酰氨基酚和布洛芬使用中面对时间不确定性时的决策能力。结果表明,大语言模型在滚动时间窗口推理方面频繁出现困难,且可能给出看似自信但缺乏医学依据的回答。

0 人收藏 0 人点赞
#temporal-reasoning

何时与多久?时间推理中的读出-中介角度

arXiv cs.LG · 2026-05-29 缓存

本文引入读出-中介角度,证明线性探针可以从语言模型激活中解码出与模型实际因果计算正交的信息,从而削弱了基于探针的可解释性。该发现跨模型规模和系列得到复现,揭示出使用探针进行机制理解或安全监控的一个根本性失败模式。

0 人收藏 0 人点赞
#temporal-reasoning

AsyncTool:多任务场景下异步函数调用能力评估

Hugging Face Daily Papers · 2026-05-27 缓存

本文介绍了AsyncTool,一个用于评估基于LLM的智能体在多任务场景下具有延迟工具响应的异步函数调用能力的基准测试。它提出了面向效率的度量指标,并识别了当前工具使用智能体的关键失败模式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈