NeuroCogMap揭示大型语言模型的认知组织结构
摘要
NeuroCogMap是一个受认知神经科学启发的框架,将大型语言模型的内部特征映射为功能性脑区,并将其与可解释的认知功能联系起来,揭示模型失败(如幻觉和偏见)的迹象。
查看缓存全文
缓存时间: 2026/07/14 04:13
论文页面 - NeuroCogMap 揭示大语言模型的认知组织架构
来源:https://huggingface.co/papers/2607.00397
发布于 7月1日
·
由 https://huggingface.co/Jeryi 提交
SunZX (https://huggingface.co/Jeryi) 于 7月14日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
理解复杂认知功能在人工智能系统中的组织方式,对于解释大语言模型(LLMs)并将其与生物认知相关联至关重要。尽管LLMs展现出广泛的类认知行为,但其内部表征是否形成了可复现的功能系统,从而能够解释行为、失败以及与人类认知的联系,目前仍不明确。本文提出 NeuroCogMap——一种受认知神经科学启发的框架,它将LLMs的内部特征组织成功能分区,并将这些分区与可解释的功能、认知能力以及认知层级体系相关联。这些分区构成了稳定且语义连贯的组织结构,该结构在部分模型间得以保留,并在功能上与模型输出相关联。在此组织结构中,LLMs的主要失败模式——包括幻觉、偏见、拒绝失败和谄媚——均对应着表征和行為控制系统中的特定扰动,从而为基于机制的检测和针对性干预提供了内部信号特征。超越模型行为层面,NeuroCogMap 还能提升对自然语言理解过程中人类皮层反应的预测能力,其中与高阶联合皮层的对应关系最强。在认知层面,其内部信号特征揭示了潜在策略,从而为经典人类决策模型的改进提供了指引。综上,这些发现确立了 NeuroCogMap 作为一个系统级框架的地位,可用于绘制人工智能系统的功能组织架构,并将该架构与人类皮层功能和认知行为相关联。
查看 arXiv 页面 (https://arxiv.org/abs/2607.00397)
查看 PDF (https://arxiv.org/pdf/2607.00397)
项目页面 (https://neurocogmap.site/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.00397)
引用本文的模型 0
没有模型链接本文
请在模型 README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。
引用本文的数据集 0
没有数据集链接本文
请在数据集 README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。
引用本文的 Spaces 0
没有 Space 链接本文
请在 Space README.md 中引用 arxiv.org/abs/2607.00397,以便从本页面链接到它。
包含本文的收藏 0
没有收藏包含本文
请将本文添加到收藏 (https://huggingface.co/new-collection) 中,以便从本页面链接到它。
相似文章
大语言模型中涌现模块化认知架构
本文研究模块化认知架构是否在大语言模型中涌现,发现大语言模型发展出专门化的神经网络,反映了人脑在认知领域的组织结构,表明模块化是智能系统的一个基本属性。
CogArena:大语言模型中认知能力结构的多元方法评估
CogArena 引入了一个程序化生成的 13 范式基准,用于评估大语言模型是否展现出可分离的认知能力还是单一的通用能力,结果仅发现对 55 个模型稳定五维特征的支持较弱。
自然理解过程中语言模型的异质性神经预测性
本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。
解构并引导大型语言模型中的功能性元认知
本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。
大语言模型的记忆
本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。