NeuroCogMap揭示大型语言模型的认知组织结构

Hugging Face Daily Papers 论文

摘要

NeuroCogMap是一个受认知神经科学启发的框架,将大型语言模型的内部特征映射为功能性脑区,并将其与可解释的认知功能联系起来,揭示模型失败(如幻觉和偏见)的迹象。

理解复杂认知功能在人工系统中的组织方式,对于解读大型语言模型(LLM)并将其与生物认知联系起来至关重要。尽管LLM展现出广泛的类认知行为,但其内部表征是否构成可复现的功能系统,并能解释行为、失败以及与人类认知的关联,仍不清楚。在此,我们提出NeuroCogMap——一个受认知神经科学启发的框架,将LLM的内部特征组织为功能分区,并将其与可解释的功能、认知能力及认知层级相关联。这些分区形成稳定且语义一致的组织结构,该结构在不同模型间部分保守,并与模型输出存在功能关联。在此组织内部,主要的LLM失败模式(包括幻觉、偏见、拒绝失败和谄媚)对应着表征系统和行为控制系统的不同扰动,从而为机制引导的检测和针对性干预提供了内部特征。除模型行为外,NeuroCogMap在自然语言理解过程中提高了对人类皮层反应的预测能力,其中与高级联合皮层的对应最为强烈。在认知层面,其内部特征揭示了潜在策略,这些策略指导了对经典人类决策模型的改进。综合来看,这些发现确立了NeuroCogMap作为一个系统级框架,用于映射人工系统的功能组织,并将这种组织与人类皮层功能和认知行为联系起来。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

论文页面 - NeuroCogMap 揭示大语言模型的认知组织架构

来源:https://huggingface.co/papers/2607.00397
发布于 7月1日

·

由 https://huggingface.co/Jeryi 提交

SunZX (https://huggingface.co/Jeryi) 于 7月14日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

理解复杂认知功能在人工智能系统中的组织方式,对于解释大语言模型(LLMs)并将其与生物认知相关联至关重要。尽管LLMs展现出广泛的类认知行为,但其内部表征是否形成了可复现的功能系统,从而能够解释行为、失败以及与人类认知的联系,目前仍不明确。本文提出 NeuroCogMap——一种受认知神经科学启发的框架,它将LLMs的内部特征组织成功能分区,并将这些分区与可解释的功能、认知能力以及认知层级体系相关联。这些分区构成了稳定且语义连贯的组织结构,该结构在部分模型间得以保留,并在功能上与模型输出相关联。在此组织结构中,LLMs的主要失败模式——包括幻觉、偏见、拒绝失败和谄媚——均对应着表征和行為控制系统中的特定扰动,从而为基于机制的检测和针对性干预提供了内部信号特征。超越模型行为层面,NeuroCogMap 还能提升对自然语言理解过程中人类皮层反应的预测能力,其中与高阶联合皮层的对应关系最强。在认知层面,其内部信号特征揭示了潜在策略,从而为经典人类决策模型的改进提供了指引。综上,这些发现确立了 NeuroCogMap 作为一个系统级框架的地位,可用于绘制人工智能系统的功能组织架构,并将该架构与人类皮层功能和认知行为相关联。

查看 arXiv 页面 (https://arxiv.org/abs/2607.00397)
查看 PDF (https://arxiv.org/pdf/2607.00397)
项目页面 (https://neurocogmap.site/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.00397)

引用本文的模型 0

没有模型链接本文

请在模型 README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。

引用本文的数据集 0

没有数据集链接本文

请在数据集 README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。

引用本文的 Spaces 0

没有 Space 链接本文

请在 Space README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。

包含本文的收藏 0

没有收藏包含本文

请将本文添加到收藏 (https://huggingface.co/new-collection) 中,以便从本页面链接到它。

相似文章

大语言模型中涌现模块化认知架构

arXiv cs.AI

本文研究模块化认知架构是否在大语言模型中涌现,发现大语言模型发展出专门化的神经网络,反映了人脑在认知领域的组织结构,表明模块化是智能系统的一个基本属性。

自然理解过程中语言模型的异质性神经预测性

arXiv cs.CL

本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。

大语言模型的记忆

arXiv cs.CL

本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。