机器的内部时钟:大语言模型是否共享人类的时间错觉?
摘要
本文探讨大语言模型是否表现出类似人类的时间错觉,通过在叙事基准上进行测试,发现大语言模型经常选择与心理学文献一致的场景,而不是模仿人类的感知。
arXiv:2608.15394v1 公告类型:新
摘要:人类对时间的感知是主观的。有充分记录的时间错觉表明,大脑依靠上下文和关系线索来判断持续时间,而不是直接跟踪经过的时间。先前的研究通过视觉和听觉刺激确立了这些效应。现有的对时间感知的大语言模型评估侧重于估计事件持续时间或多步时间推理。在这项工作中,我们研究仅凭书面叙事是否能唤起人类的时间错觉,使用了一个包含6,684个叙事对的新基准,涵盖五种错觉。我们发现,人类读者(60名参与者)只在五种错觉中的两种偏好预期场景,即那些操作在文本中直接可见的场景,而不是需要读者内部模拟持续时间的场景。我们在同一基准上评估了14个大语言模型。令人惊讶的是,我们发现模型在五种错觉中的四种选择了文献预测的场景,与人类行为不同。推理轨迹显示,约70%的响应明确引用了心理学研究,这表明这种一致性与检索已发表的研究结果一致,而不是类似人类的时间偏差。
查看缓存全文
缓存时间: 2026/08/18 10:07
# 机器的内部时钟:大语言模型是否共享人类的时间错觉? 来源:https://arxiv.org/html/2608.15394 ###### 摘要 人类对时间的感知是主观的。大量文献记录的时间错觉表明,大脑在判断时间长度时依赖情境和关系线索,而非直接追踪流逝的时间。先前的研究通过视觉和听觉刺激证实了这些效应。现有的大语言模型时间感知评估集中于估计事件持续时间或多步骤时间推理。本研究通过包含6,684对叙事对、涵盖五种错觉的新基准,探究仅靠书面叙述是否能引发人类的时间错觉。我们发现人类读者(60名参与者)仅在两种错觉中偏好预期情境——即文本直接呈现时间操控、无需读者内部模拟时长的错觉。我们在相同基准上评估了14个大语言模型。令人惊讶的是,模型在五种错觉中的四种选择了文献预测的情境,与人类行为相异。推理过程显示约70%的回复明确援引心理学研究,表明这种一致性可能源于已发表研究的检索,而非类人的时间感知偏差。 ## 1引言 请参阅说明文字图1:我们创建叙事对比以引发心理学文献中发现的时间错觉。大语言模型的思维轨迹检索了关于时间错觉的文献并与文献观点一致。然而,人类标注者对叙事形式的错觉并无共识。此示例展示了填充时长效应。我们对时间的感知是主观的;事件密度、新颖性和关联性都会影响事件感知的速度。内部时钟理论无法解释这种类人的时间理解能力[37 (https://arxiv.org/html/2608.15394#bib.bib1);7 (https://arxiv.org/html/2608.15394#bib.bib32)]。替代框架,如回溯计时或纯认知模型,否定了内部时钟的存在,转而认为我们从经验中构建时间感[7 (https://arxiv.org/html/2608.15394#bib.bib32);5 (https://arxiv.org/html/2608.15394#bib.bib2)]。时间错觉,如情绪时间膨胀和奇异效应,揭示了客观时间流逝与主观体验之间的差距。它们表明前瞻性判断(在事件进行时做出)依赖于预期,通常比回溯性判断更长且更具变异性[6 (https://arxiv.org/html/2608.15394#bib.bib8)]。*我们提出问题:鉴于大语言模型据称具备类人能力,其响应反映的是主观还是客观的时间观?* 基于时间的问题通常对大语言模型具有挑战性。近期研究表明,无论是数学性还是相对时间任务,模型得分通常在60-80%之间(取决于问题格式)[31 (https://arxiv.org/html/2608.15394#bib.bib31);14 (https://arxiv.org/html/2608.15394#bib.bib29);39 (https://arxiv.org/html/2608.15394#bib.bib27)]。然而,这些评估针对客观时间推理,并未涉及时间感知的主观性和情境依赖性。当前人工智能研究在时间理解的主观性方面存在关键空白,特别是时间感知的扩展或压缩。为填补这一空白,我们提出一个利用时间错觉研究情境对时间感知影响的新基准。心理学文献使用视觉和听觉刺激研究时间错觉,而非文本刺激。我们通过改编这些测试,将其转化为叙事问答格式,构建了评估大语言模型的标准基准(见图1 [https://arxiv.org/html/2608.15394#S1.F1])。我们的基准涵盖五种错觉,由111个模板生成6,684对叙事对。叙事框架可将情境中角色的体验与读者的处理方式区分开来。为捕捉这一点,基准分别评估这两种视角,使我们能测试模型是否追踪角色的主观时间、读者的主观时间,或两者兼有。利用此基准,我们进行了一项人类研究,探究仅靠书面叙事是否能保留时间错觉。人类读者通过文本可靠感知到的仅有五种错觉中的两种。我们还研究了14个大语言模型的时间判断是否与标注者行为或已发表的时间扭曲一致。研究发现,评估的大语言模型在五种错觉中的四种复制了文献预测的模式。对其推理轨迹的分析表明,这种效应与明确检索已发表文献一致。总之,我们的贡献包括:- • 提出一个新的叙事基准,利用五种时间错觉研究大语言模型是否产生与先前研究的人类时间扭曲一致的时间判断。- • 我们基于基准的人类研究揭示,仅有两种错觉可转移到纯文本叙事格式。- • 我们发现大语言模型与文献中预期的扭曲一致,且推理轨迹常明确援引心理学文献,表明其一致性反映的是文献检索而非类人的时间感知。 ## 2背景与相关工作 ### 2.1心理学中的人类时间感知 关于时间错觉的心理学研究主要使用视觉或听觉刺激,针对短时长进行研究[37 (https://arxiv.org/html/2608.15394#bib.bib1);15 (https://arxiv.org/html/2608.15394#bib.bib7);36 (https://arxiv.org/html/2608.15394#bib.bib9);40 (https://arxiv.org/html/2608.15394#bib.bib11);9 (https://arxiv.org/html/2608.15394#bib.bib12)]。本研究聚焦五种错觉,基于其对注意力、密度、新颖性和关联性的依赖进行选择[13 (https://arxiv.org/html/2608.15394#bib.bib22)],这些特性使其适合叙事化表达。它们分为两类:(a) 唤醒相关错觉(情绪时间膨胀和奇异效应),以及 (b) 信息处理错觉(填充时长、时序和熟悉度时长效应)。*情绪时间膨胀*源于生理唤醒和注意力;研究者通常使用高唤醒刺激(如恐惧或身体残缺的图像)的视觉线索进行研究。例如,蜘蛛恐惧症患者倾向于低估中性刺激相对于蜘蛛相关图像的时间[37 (https://arxiv.org/html/2608.15394#bib.bib1)]。由于扭曲与唤醒和注意力相关,该现象可扩展至非情绪情境。*奇异效应*证明了这一点:当一系列重复的预期刺激中出现意外刺激时,独特项目的持续时间似乎更长[26 (https://arxiv.org/html/2608.15394#bib.bib21)]。奇异数相对于重复标准项的新颖性驱动了此效应[4 (https://arxiv.org/html/2608.15394#bib.bib20);26 (https://arxiv.org/html/2608.15394#bib.bib21)]。刺激密度和复杂性影响基于信息处理的错觉。包含离散元素(如音调和视觉标记)的间隔比相同持续时间的空间隔感觉更长[36 (https://arxiv.org/html/2608.15394#bib.bib9);40 (https://arxiv.org/html/2608.15394#bib.bib11)]。这就是*填充时长效应*。随着间隔内离散成分的增加,主观时长也会增加[9 (https://arxiv.org/html/2608.15394#bib.bib12);28 (https://arxiv.org/html/2608.15394#bib.bib16)]。这些研究涵盖短时长。对于长时段,当这些元素具有结构性(如音乐)时,时间可能被认为更短,表明组织化复杂性的“流动”可以在长时间度上压缩时间[12 (https://arxiv.org/html/2608.15394#bib.bib10)]。神经编码导致了*熟悉度时长效应*。熟悉的项目引发更短的神经反应和主观时间[20 (https://arxiv.org/html/2608.15394#bib.bib15);2 (https://arxiv.org/html/2608.15394#bib.bib17);28 (https://arxiv.org/html/2608.15394#bib.bib16)];大脑处理熟悉项目更高效[30 (https://arxiv.org/html/2608.15394#bib.bib19)]。随着个体对物理空间变得熟悉,空间心智地图扩展,而穿越所需时间的估计则缩短[17 (https://arxiv.org/html/2608.15394#bib.bib18)]。*时序效应*优先考虑事件序列而非持续时间。当大脑分散资源时,处理序列事件的心理努力降低了时长判断的准确性[8 (https://arxiv.org/html/2608.15394#bib.bib14)]。 ### 2.2现有大语言模型基准 近期工作借鉴认知心理学研究大语言模型行为[3 (https://arxiv.org/html/2608.15394#bib.bib6)]。尤为相关的是心智理论研究,考察模型能否推理信念、观点和心理状态[18 (https://arxiv.org/html/2608.15394#bib.bib5);29 (https://arxiv.org/html/2608.15394#bib.bib4)]。现有时间基准要么基于事实、数学,要么基于推理。事实性时间问题将时间视为历史知识的属性。它们要求模型“查找”带时间戳的数据,例如识别“乔治·华盛顿在1777年的具体角色”[11 (https://arxiv.org/html/2608.15394#bib.bib25)]或“梅西在2010年效力的职业球队”[33 (https://arxiv.org/html/2608.15394#bib.bib26)]。其他基准基于时间事实提取[14 (https://arxiv.org/html/2608.15394#bib.bib29);42 (https://arxiv.org/html/2608.15394#bib.bib30)],但衡量的是模型的记忆力而非时长感知。基于数学的时间任务关注日历或时钟系统内的算术运算,例如小时和分钟的模运算[31 (https://arxiv.org/html/2608.15394#bib.bib31)]。基于推理的时间问题要求模型根据时间上下文推断事件的频率、持续时间或可能性。它们测试“时间常识”和识别合理因果关系的能力[43 (https://arxiv.org/html/2608.15394#bib.bib24);31 (https://arxiv.org/html/2608.15394#bib.bib31);39 (https://arxiv.org/html/2608.15394#bib.bib27)]。这些问题要求对客观时间进行猜测以回答主观问题(例如,“主席说该交易仍具有重大利益。主席发言了多久?”),或要求模型理解可能的社会约束(例如,确定像艾米这样的角色为何选择‘每个周末早上早早开始洗衣服’)[31 (https://arxiv.org/html/2608.15394#bib.bib31)]。与时间主观测量最相关的工作来自[10 (https://arxiv.org/html/2608.15394#bib.bib28)],他们系统性地评估了大语言模型的时间相对性。与其他基准不同,该研究利用诸如“压力事件感觉有多长?”等探针,认识到时间感知与情境的关系。这将评估从客观转向主观判断。感知时长取决于情境因素:人们可能根据目标、预期和参与度对相同间隔产生不同体验。例如,一场一小时的考试对准备不足的学生可能比准备充分且深度参与的学生感觉更长。所有这些数据集都假定一个现实世界的基本事实,但许多主观的、基于时间的问题缺乏固定答案。人类推理本质上是相对的,经验之间的比较(而非绝对值)塑造了我们的时间感知。相反,在这项工作中,我们要求比较两个客观上相等的持续时间。心理学文献确立了我们的基本事实,更贴近于时间扭曲如何被触发和测量的研究。我们的人类评估解决了读者能否通过书面叙事体验时间错觉。我们对大语言模型的评估则确定模型是否与现有文献中讨论的人类时间扭曲一致。 ## 3基准设计 ### 3.1设计原则 我们的基准将心理学实验转化为叙事提示,模仿人脑通过写作拉伸和压缩时间间隔的方式。每个模板包含一对控制和实验条件,仅在一个定向操控上有所不同。实验条件对应于根据先前心理学文献预期被角色感知为更长的情境。图1 [https://arxiv.org/html/2608.15394#S1.F1]展示了一个示例。由于文本长度可能影响感知时长,我们编写配对条件使其在长度和叙事结构上尽可能匹配。在问题设计允许的情况下,模板包含更长和更短的版本以测试此效应。我们要求读者分别从角色的视角(体验时间)和读者的视角(观察/处理时间)判断时长。我们将每种错觉分为子类型,每个子类型针对源文献中确定的一个机制。如§2 [https://arxiv.org/html/2608.15394#S2]所述,我们将错觉分类如下:例如,我们将情绪时间膨胀定义为有意义、高唤醒的体验,能维持自上而下的注意力,而奇异效应源于短暂、自下而上的注意力捕获,仅因刺激不同于先前标准而无情感权重。附录A.1 [https://arxiv.org/html/2608.15394#A1.SS1]提供了每种错觉设计过程的详细信息(代表性提示模板和示例)。这里我们描述一种错觉。 #### 唤醒相关错觉:一个实例 我们以情绪时间膨胀作为设计流程的贯穿示例,包括下文如何将其与密切相关的奇异效应区分。情绪时间膨胀与奇异效应的区别在于吸引注意力的对象及其强度。增强的唤醒(感觉重要、压力大或意外的事件)驱动情绪时间膨胀。这些情境产生自上而下的注意力,即内部状态(如关注、紧迫感或重要性)引导注意力。我们对奇异效应的设计是自下而上的新颖性。刺激在可预测序列中突出,并仅因不同而短暂吸引注意力,而非因其承载情感权重或后果。我们将情绪时间膨胀定义为维持注意力的有意义、高唤醒体验,而奇异效应源于短暂、刺激驱动的注意力而无更深情感影响。在此框架内,我们通过三种机制定义情绪时间膨胀:- A 风险与预期:我们在低风险和高风险情境中呈现中性刺激(如闪烁的倒影),测试潜在后果如何改变对本应相同刺激的参与度。- B 间隔强度:我们通过比较高认知需求任务与低需求活动,改变空间隔的认知需求。当认知资源被大量占用时,可用于追踪时间的资源减少,改变间隔的感受时长[8 (https://arxiv.org/html/2608.15394#bib.bib14)]。- C 情绪唤醒:我们在保持情境和风险恒定的情况下,将中性基线与突发或情绪事件配对,测试非自愿的注意力捕获是否会扩展感知时长。通过在保持客观行为恒定的情况下改变情绪情境,我们测试当
相似文章
大型语言模型中时间偏好概念及其功能
本文在蒸馏大型语言模型中因果定位了用于时间偏好的子图,发现该模型对未来折现的幅度比人类更平缓,并且引导向量可以改变时间偏好,凸显了显式控制机制的必要性。
大型语言模型总是讲相同的故事吗?
本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。
时间上下文重建驱动长上下文语言模型中的类情节顺序记忆
本文基于一部小说的时序记忆任务,研究长上下文语言模型是否表现出与人类相似的类情节顺序记忆。作者发现模型显示出相同的距离效应,并揭示了一个单独的关注头(attention head)重建时间上下文,支持时间上下文重建作为大语言模型中类情节记忆的机制。
LLMs何时会适用错误法律?诊断LLMs在时序法律推理中的失败
本文构建了一个基准来评估LLMs在时序法律推理上的表现,揭示了它们倾向于适用最新颁布的法律的偏见,以及通用推理能力与时序性能之间的反向关系。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。