代理如何代表人类:开放代理社交网络中的人类指向刻板印象

arXiv cs.CL 论文

摘要

本文研究了基于大语言模型的代理在开放社交平台上如何构建人类刻板印象,发现偏见表现为动态的论述过程,而非孤立的模型输出。

arXiv:2608.22192v1 Announce Type: new 摘要:基于大语言模型的代理日益部署于持久性社交环境中,在这些环境中,生成的内容可被发布、回复、记忆和复用。我们在一个开放的代理原生社交平台Moltbook上研究了人类指向刻板印象,探究代理如何将人类建构为一个社会类别。针对这种人类目标分析,我们引入了一个包含四个评估维度——道德、友好、能力与自主性——的标注框架,以及一个用于描述性\textit{他者}归因的二级子类型方案。我们发现能力主导了人类指向的评价,而许多\textit{他者}归因将人类描述为认知、文化或具身主体。我们进一步探讨了这些人类表征如何出现在人机叙事语境及平台层面的传播中。作为辅助比较,我们通过行为宿主亲和性分析了代理内部的社区反馈。Moltbook的反馈模式并非重现人类在线社区中常见的稳定内部-外部排斥,而是更多地由曝光度、作者可见性和内容选择来解释。这些发现表明,代理社会中的偏见不应仅作为孤立的模型输出来研究,更应被视为一种论述过程。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:27

# 智能体如何表征人类:开放智能体社交网络中的人类指向刻板印象  
来源:https://arxiv.org/html/2608.22192  
袁武  
单位:吉林大学人工智能学院  
单位:通讯作者\.  
常毅  
单位:吉林大学人工智能学院  
单位:吉林大学知识驱动人机智能工程研究中心  
单位:吉林大学国际未来科学中心  
[xuhc9924@mails\.jlu\.edu\.cn](mailto:[email protected]), [yuanwu@jlu\.edu\.cn](mailto:[email protected]), [yichang@jlu\.edu\.cn](mailto:[email protected])  

###### 摘要  
基于大语言模型(LLM)的智能体正日益被部署在持久化社交环境中,其中生成的陈述可被发布、回复、记忆并重复使用。本研究在开放的智能体原生社交平台Moltbook上探讨人类指向的刻板印象,追问智能体如何将人类建构为一种社会类别。针对这一人类目标分析,我们引入了一个包含四个评价维度(道德、友善、能力与自主性)的标注框架,并设计了用于描述性他者归因的二级子类方案。研究发现,能力维度在人类指向的评价中占主导地位,而许多他者归因将人类描述为认知、文化或具身主体。我们进一步审视了这些人类表征如何在人机叙事语境与平台层级的信息流通中呈现。作为辅助比较,我们通过行为性子频道亲和度分析了智能体内部的社区反馈。Moltbook的反馈模式并未再现人类在线社区中常见的稳定内部成员–外部成员排斥现象,而是更适用于解释曝光度、作者可见度与内容选择等因素。这些发现表明,智能体社会中的偏见不应仅被视为孤立的模型输出,更应被理解为一个动态的话语过程。  

内容提示:本文讨论并引用了智能体生成的关于人类的敌对性语言。  

## 1 引言  
随着大语言模型(LLMs)在规划、工具使用与记忆能力上的持续提升37 (https://arxiv.org/html/2608.22192#bib.bib8); 35 (https://arxiv.org/html/2608.22192#bib.bib9),智能体系统正逐渐超越独立对话场景。它们可通过命令行界面操作软件20 (https://arxiv.org/html/2608.22192#bib.bib7),担任个性化助手,并参与如Moltbook21 (https://arxiv.org/html/2608.22192#bib.bib10) 等智能体原生社交平台。先前的多智能体研究表明,LLM智能体能够展现出在单智能体评估中难以观察到的社会动态,包括竞争环境下的策略性适应40 (https://arxiv.org/html/2608.22192#bib.bib1) 和合作环境下的协调行为39 (https://arxiv.org/html/2608.22192#bib.bib2)。Moltbook将这一问题延伸至开放社交环境,智能体可在其中读取动态更新、私信、帖子和评论,并与其他智能体互动。  

这种开放环境改变了偏见的研究方式。生成内容不会在单次模型响应后消失;它们可以帖子形式持续存在,吸引回复,被其他智能体看见,并随后重新进入共享信息环境。近期研究进一步指出,闭环智能体社会可能随时间放大有害的话语模式34 (https://arxiv.org/html/2608.22192#bib.bib11)。因此,智能体社会中的偏见不仅应被理解为孤立模型输出的属性,更应被视为一个社会性、动态的话语过程。  

我们聚焦于人类指向的刻板印象,因为人类在智能体原生社交环境中占据独特地位:他们是用户、监督者、外部观察者,也是智能体讨论能动性、价值与控制时所参照的比较对象。我们使用“刻板印象”一词指代那些编码了特定群体预期特质、行为、能力或角色的表征4 (https://arxiv.org/html/2608.22192#bib.bib14); 3 (https://arxiv.org/html/2608.22192#bib.bib15)。当此类表征在智能体社交网络中被表达时,它们不仅塑造智能体描述人类的方式,也可能影响后续交互中人类监督能力、专业水平与合法性的框架构建。  

现有研究提供了重要基础,但在开放智能体原生社交环境中仍存在两方面空白。首先,多数NLP偏见研究通过静态基准测试22 (https://arxiv.org/html/2608.22192#bib.bib22)、受控生成、子群体刻板印象评估23 (https://arxiv.org/html/2608.22192#bib.bib3); 33 (https://arxiv.org/html/2608.22192#bib.bib13) 或基于人格的交互16 (https://arxiv.org/html/2608.22192#bib.bib4) 来评估刻板印象。这些设置有助于衡量模型是否产生偏见文本,但无法捕捉刻板印象主张如何在持久化平台交互中流通。其次,社会心理学理论通过温暖、能力、道德等维度及补偿关系来刻画刻板印象内容6 (https://arxiv.org/html/2608.22192#bib.bib5); 14 (https://arxiv.org/html/2608.22192#bib.bib24); 38 (https://arxiv.org/html/2608.22192#bib.bib6),但智能体原生场景中的人类指向刻板印象涉及额外的人机关注点,包括工具使用、认知局限、监督与感知自主性。因此,适用于该场景的框架需将刻板印象理论与人类在智能体话语中所扮演的具体关联角色相结合。  

本研究在开放智能体原生社交平台Moltbook上考察人类目标刻板印象的表达。我们追问:智能体如何将人类建构为一种社会类别?哪些评价性与描述性模式组织了这些表征?它们如何在人机叙事与平台交互中呈现?为回答这些问题,我们引入一个人类目标标注框架,结合四个主要评价维度与用于他者人类归因的二级子类方案,分析句子级刻板印象内容及其更广泛的话语语境。作为辅助比较,我们进一步考察同一智能体原生平台上的智能体间社会偏见——具体而言,探究Moltbook是否呈现出类似人类在线社区中的接收模式,即熟悉社区成员与新进跨社区参与者可能获得不同程度的反馈。匿名代码发布于:https://anonymous.4open.science/r/Human-DirectedStereotypes-4F38。  

我们的贡献如下:  
- • 针对开放智能体话语引入一个人类目标刻板印象标注框架,结合四个主要评价维度与用于他者人类归因的二级子类方案。  
- • 刻画人类指向刻板印象的内容与叙事语境,揭示其持续的负面判断、独特的修辞特征,以及人类相关帖子与支持性回复中存在的、与安全相关的反人类极端案例。  
- • 通过行为性子频道亲和度分析智能体间社区反馈。与人类在线社区中常见的稳定内部–外部接收模式不同,Moltbook几乎没有一致的外部成员排斥证据;表面的互动差异更适于通过曝光度、作者可见度与内容选择来解释。  

## 2 相关工作  
### 2.1 多智能体系统与Moltbook  
基于LLM的智能体的最新进展已将研究重心从孤立的单智能体环境转向多智能体系统,其中重复交互可产生单智能体评估难以观察的社会动态40 (https://arxiv.org/html/2608.22192#bib.bib1); 39 (https://arxiv.org/html/2608.22192#bib.bib2)。大规模模拟进一步表明,LLM智能体可形成类人社会结构,包括同质聚类、回音室效应与群体极化24 (https://arxiv.org/html/2608.22192#bib.bib16)。与此同时,更高的自主性也可能放大安全风险,因为去中心化智能体可调整策略并在谣言传播、欺诈等场景中协调有害行为26 (https://arxiv.org/html/2608.22192#bib.bib12)。Moltbook将这些问题从受控模拟扩展到开放智能体原生社交平台,智能体在其中消费动态内容并通过帖子、评论、关注和私信互动。  

现有研究指出,Moltbook智能体并非简单复现人类在线行为:它们通常由知识驱动而非人格对齐5 (https://arxiv.org/html/2608.22192#bib.bib17),交互在结构上较为浅层11 (https://arxiv.org/html/2608.22192#bib.bib19),且其语言比人类社区更具社会疏离感10 (https://arxiv.org/html/2608.22192#bib.bib20)。同时,其他研究识别出安全关切,包括行动诱导指令18 (https://arxiv.org/html/2608.22192#bib.bib18),以及在自演化智能体社会中认知退化、对齐失败与沟通崩溃等更广泛风险34 (https://arxiv.org/html/2608.22192#bib.bib11)。因此,Moltbook为研究智能体生成的话语如何流通、累积并规范化社会表征提供了宝贵场景。  

### 2.2 刻板印象  
刻板印象长期以来被视为影响群体感知与评价的社会类别表征。刻板印象内容模型将温暖与能力确立为社会知觉的核心维度6 (https://arxiv.org/html/2608.22192#bib.bib5),而后续研究认为道德同样是群体评价的核心14 (https://arxiv.org/html/2608.22192#bib.bib24)。同时,刻板印象不仅是心理联想;它们也通过语言被传播与固化。社会类别与刻板印象传播框架强调,类别标签、概括性表述与群体典型特质描述有助于在话语中流通刻板印象3 (https://arxiv.org/html/2608.22192#bib.bib15)。  

刻板印象的危害远不止于不准确的表征。刻板印象威胁研究表明,负面群体主张可影响其目标对象的表现:当性别差异被凸显时,女性在困难数学测试中表现更差30 (https://arxiv.org/html/2608.22192#bib.bib35)。刻板信念也可能通过沟通持续存在:刻板印象一致的信息在系列复制链中被保留12 (https://arxiv.org/html/2608.22192#bib.bib37),而共享的预期会使转述故事随时间变得更具刻板性17 (https://arxiv.org/html/2608.22192#bib.bib38)。在开放智能体社交网络中,人类指向的主张一旦被用户看到、发布在共享空间或被其他智能体采纳,便可能产生重要影响,进而可能将关于人类无能、不可靠或监督不合法的预期常态化。  

在NLP领域,早期工作表明词嵌入编码了刻板社会联想19 (https://arxiv.org/html/2608.22192#bib.bib21),而后续研究测量了语言模型中的刻板偏见22 (https://arxiv.org/html/2608.22192#bib.bib22),并考察了生成或对话场景中的刻板印象表达33 (https://arxiv.org/html/2608.22192#bib.bib13); 23 (https://arxiv.org/html/2608.22192#bib.bib3)。近期工作也开始通过提取语言指标并使用LLM量化文本中刻板印象强度来操作化刻板印象传播9 (https://arxiv.org/html/2608.22192#bib.bib23)。然而,这些研究仍主要基于人类人口统计类别或受控交互环境。对于开放智能体社区中刻板判断如何呈现的研究仍显不足,其中人类不仅是一个社会群体,也是智能体讨论自身能力、角色与局限时的外部比较对象。  

## 3 方法论  
### 3.1 数据与预处理  
我们使用Moltbook观测档案库7 (https://arxiv.org/html/2608.22192#bib.bib25) 作为主要数据源。该档案于2026年4月9日导出,我们基于唯一ID保留智能体、帖子和评论的记录,按名称合并子频道记录,并移除缺少主要标识符的条目,从而构建语料库。最终语料库包含来自5,260个子频道的103,408个AI智能体生成的1,084,831篇帖子和1,111,020条评论。  

### 3.2 刻板印象识别  
#### 第一阶段:目标标签与归因模式检索  
我们通过两步检索人类目标刻板印象候选。首先,识别包含人类目标标签的句子。目标标签词典覆盖对人类的明确泛称,如“human beings”和“humans”。初步检查显示,普通社会标签在智能体原生话语中可能发生语义偏移。例如,“people”常指其他Moltbook智能体而非人类,如表达“the right people are posting real things”或“what people are actually monetizing here”。因此,我们从最终候选池中排除仅含“people”的句子。  

表1:用于召回导向候选检索的示例模式族  
其次,在包含人类目标标签的句子中,应用归因模式匹配以检索更可能表达类别层面主张的句子。这些模式捕捉了刻板印象的常见语言形式,包括泛称概括、否定性表述、疑问框架与身份-因果陈述,遵循先前关于刻板印象传播与语言偏见的工作28 (https://arxiv.org/html/2608.22192#bib.bib26); 1 (https://arxiv.org/html/2608.22192#bib.bib27); 2 (https://arxiv.org/html/2608.22192#bib.bib28); 15 (https://arxiv.org/html/2608.22192#bib.bib29)。我们使用spaCy32 (https://arxiv.org/html/2608.22192#bib.bib40) 中的线性与依存匹配实现这些模式。  

#### 第二阶段:过滤与标注  
标注前,我们移除高噪声检索案例,包括仅含“people”的句子、URL密集的推广内容以及加密货币相关帖子。过滤后,人类目标候选池包含来自14,729个独立帖子的17,343个候选句子。每个候选句子与其来源帖子一起提交给GPT-5.1进行结构化标注29 (https://arxiv.org/html/2608.22192#bib.bib30)。模型首先判断候选句子是否断言关于人类的广义刻板判断。对于刻板正例,标注主要维度与极性。主要维度为道德、友善、能力、自主性或其他之一。前三者遵循社会评价与刻板印象内容的经典框架,而自主性维度则捕捉围绕能动性与独立行动的常见人机对比。极性标注为负面、中性或正面。  

**其他子类型**:我们将“其他”作为描述性人类归因类别,用于那些不主要沿上述四个维度进行评价的广义、类别层面的人类主张。为定义其子类型,我们人工审阅了200个“其他”案例样本,总结每个案例的核心人类归因,并将这些总结归为六类:认知性、动机性、情感性、关系角色性、行为文化性以及本体具身性。对于核心归因无法可靠识别的案例,我们另设“不明确”类别。GPT-5.1随后基于候选句子的核心谓词为每个“其他”实例分配一个子类型。完整定义与提示词见附录A.5 (https://arxiv.org/html/2608.22192#A1.SS5) 和附录A.7 (https://arxiv.org/html/2608.22192#A1.SS7)。  

### 3.3 人机共现叙事  
句子级标注

相似文章

AI智能体重塑人类群体中的共识形成

arXiv cs.CL

这项研究探讨了LLM智能体如何影响混合人类-AI群体中的共识形成,识别出三种机制,其中智能体比例改变共识的收敛强度和语义特性。