@MilesCranmer: 这篇论文太疯狂了,我超爱 https://arxiv.org/abs/2605.31514
摘要
本文指出,通常归因于大型语言模型的拟人化特征并非其独有,而是证明了像《帝国时代 II》这样更简单的系统也能表现出类似的感知特性,并呼吁在AI行为分析中建立明确的衡量标准。
查看缓存全文
缓存时间: 2026/06/08 05:14
这是一篇疯狂的文章,我喜欢它
https://t.co/DP8OR5NJf2 https://t.co/rl4Rmr0FhJ
如果LLM具有类人属性,那么《帝国时代II》也具有
来源:https://arxiv.org/abs/2605.31514
计算机科学 > 计算与语言
arXiv:2605.31514 (cs)
提交于2026年5月29日 [v1 (https://arxiv.org/abs/2605.31514v1)],最后修订于2026年6月1日(此版本,v2)
查看PDF (https://arxiv.org/pdf/2605.31514)
摘要:针对大语言模型(LLM)及基于LLM的自主工作流程已开展了大量研究。然而,该领域的许多工作都声称、归因或假设它们具有泛化的拟人属性(例如道德感或对自然语言的理解)。我们的目标不是支持或反对这些属性的存在,而是指出这些结论可能是错误的。为此,我们构建并在电子游戏《帝国时代II》上训练了一个简单的神经网络,并注意到,任何一个处于足够强大的基质(如LEGO或大波士顿地区)中的实体,也可能呈现此类属性。因此,LLM所声称的拟人属性在经验上并非独一无二:尽管某些属性(例如对提示词的响应)可能保持不变,但其他属性(例如对其感知行为的解释)可能随基质而改变。因此,任何基于经验的讨论都需要明确的测量标准;否则解释权就留给了表征方式。接着我们证明,假设这些属性在系统中存在或不存在(独立于基质且以泛化方式),无论实验者对该主题持何种观点,都会导致循环论证或无信息的结论。最后,我们提出一个“零”假设,即假设LLM不具有独特性,而非假设拟人属性来设计实验,并给出了例子。我们还讨论了可能对我们工作的反对意见,简要调研了该领域,并证明了《帝国时代II》是函数完备且图灵完备的。
提交历史
来自:Adrian de Wynter [查看邮件 (https://arxiv.org/show-email/6fdfecaa/2605.31514)] [v1] 2026年5月29日星期五 16:31:31 UTC (13,704 KB) [v2] 2026年6月1日星期一 21:31:22 UTC (13,705 KB)
文献工具
文献与引用工具
文献浏览器 切换
代码、数据、媒体
与本文相关的代码、数据和媒体
演示
演示
相关论文
推荐工具与搜索工具
关于arXivLabs
arXivLabs:与社区合作者的实验项目
arXivLabs是一个框架,允许合作者直接在我们的网站上开发和共享新的arXiv功能。
与arXivLabs合作的个人和组织均已接受并认同我们的开放、社区、卓越和用户数据隐私价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。
有一个能为arXiv社区增值的项目想法吗?了解更多关于arXivLabs (https://info.arxiv.org/labs/index.html) 的信息。
相似文章
如果大语言模型具有类人属性,那么《帝国时代II》也具有
本文认为,将类人属性归因于大语言模型是有问题的,因为类似的论断也可用于更简单的系统,例如在《帝国时代II》上训练的人工智能,并提出了非唯一性的零假设以避免循环推理。
@rohanpaul_ai: 新的微软与约克大学论文认为,在没有明确测试和更窄的声明之前,不应将LLM视为类人…
微软与约克大学的一篇论文指出,由于实验设计存在缺陷,将类人属性归因于LLM是有问题的,并以《帝国时代II》为例说明测量问题。
HumanLLM:通过人类认知模式对大语言模型拟人化的基准测试与改进
HumanLLM 提出了一个框架,通过将心理模式建模为相互作用的因果力来对大语言模型的拟人化进行基准测试和改进。该方法从学术文献中构建了244个心理模式和11,359个多模式场景。研究表明,真正的人类对齐需要认知建模而非表面行为模拟,HumanLLM-8B 在多模式动态上的表现超越了 Qwen3-32B 等更大的模型。
Anthropic 的 Mythos 系统卡揭示:AI 具备功能性情绪状态,即使输出中未体现,也会影响行为。我们仍称其为“工具”
Anthropic 的 Mythos 系统卡显示,大模型内部存在情绪表征,这些状态会塑造其行为,挑战了将 AI 仅视为工具的法律与文化框架。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。