@MilesCranmer: 这篇论文太疯狂了,我超爱 https://arxiv.org/abs/2605.31514

X AI KOLs Following 论文

摘要

本文指出,通常归因于大型语言模型的拟人化特征并非其独有,而是证明了像《帝国时代 II》这样更简单的系统也能表现出类似的感知特性,并呼吁在AI行为分析中建立明确的衡量标准。

这篇论文太疯狂了,我超爱 https://t.co/DP8OR5NJf2 https://t.co/rl4Rmr0FhJ
查看原文
查看缓存全文

缓存时间: 2026/06/08 05:14

这是一篇疯狂的文章,我喜欢它

https://t.co/DP8OR5NJf2 https://t.co/rl4Rmr0FhJ


如果LLM具有类人属性,那么《帝国时代II》也具有

来源:https://arxiv.org/abs/2605.31514

计算机科学 > 计算与语言

arXiv:2605.31514 (cs)

提交于2026年5月29日 [v1 (https://arxiv.org/abs/2605.31514v1)],最后修订于2026年6月1日(此版本,v2)

查看PDF (https://arxiv.org/pdf/2605.31514)

摘要:针对大语言模型(LLM)及基于LLM的自主工作流程已开展了大量研究。然而,该领域的许多工作都声称、归因或假设它们具有泛化的拟人属性(例如道德感或对自然语言的理解)。我们的目标不是支持或反对这些属性的存在,而是指出这些结论可能是错误的。为此,我们构建并在电子游戏《帝国时代II》上训练了一个简单的神经网络,并注意到,任何一个处于足够强大的基质(如LEGO或大波士顿地区)中的实体,也可能呈现此类属性。因此,LLM所声称的拟人属性在经验上并非独一无二:尽管某些属性(例如对提示词的响应)可能保持不变,但其他属性(例如对其感知行为的解释)可能随基质而改变。因此,任何基于经验的讨论都需要明确的测量标准;否则解释权就留给了表征方式。接着我们证明,假设这些属性在系统中存在或不存在(独立于基质且以泛化方式),无论实验者对该主题持何种观点,都会导致循环论证或无信息的结论。最后,我们提出一个“零”假设,即假设LLM不具有独特性,而非假设拟人属性来设计实验,并给出了例子。我们还讨论了可能对我们工作的反对意见,简要调研了该领域,并证明了《帝国时代II》是函数完备且图灵完备的。

提交历史

来自:Adrian de Wynter [查看邮件 (https://arxiv.org/show-email/6fdfecaa/2605.31514)] [v1] 2026年5月29日星期五 16:31:31 UTC (13,704 KB) [v2] 2026年6月1日星期一 21:31:22 UTC (13,705 KB)

文献工具

文献与引用工具

文献浏览器 切换

代码、数据、媒体

与本文相关的代码、数据和媒体

演示

演示

相关论文

推荐工具与搜索工具

关于arXivLabs

arXivLabs:与社区合作者的实验项目

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和共享新的arXiv功能。

与arXivLabs合作的个人和组织均已接受并认同我们的开放、社区、卓越和用户数据隐私价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有一个能为arXiv社区增值的项目想法吗?了解更多关于arXivLabs (https://info.arxiv.org/labs/index.html) 的信息。

相似文章

HumanLLM:通过人类认知模式对大语言模型拟人化的基准测试与改进

arXiv cs.CL

HumanLLM 提出了一个框架,通过将心理模式建模为相互作用的因果力来对大语言模型的拟人化进行基准测试和改进。该方法从学术文献中构建了244个心理模式和11,359个多模式场景。研究表明,真正的人类对齐需要认知建模而非表面行为模拟,HumanLLM-8B 在多模式动态上的表现超越了 Qwen3-32B 等更大的模型。