面向人类与大型语言模型集成的对抗性社会认识论

arXiv cs.AI 论文

摘要

本文提出了一个对抗性社会认识论框架,用于分析涉及人类和大型语言模型的交流景观中的信任、欺骗和推理链,并概述了审计信任违规的机制。

arXiv:2607.07760v1 公告类型:新 摘要:我们概述了一种对抗性社会认识论(ASE),用于密集互动的交流景观,其中公开断言由证词链、推理、机构认证和隐性信任支撑。在这样的景观中,代理人有动机和可供性去扭曲、渲染、省略、捏造或策略性地不充分指定信息,以获取私人、声誉、修辞或物质利益。我们认为,这些现象并没有被熟悉的认知气泡、回音室或错误信息扩散的描述充分捕捉。需要解释的是,交际代理如何利用通常使支撑性断言值得信赖的承诺和权利。我们提供了进行必要分析的语言,概述了破坏支撑性公共交流中信任的机制,并勾勒出审计和纠正因破坏推理链可审计性而产生的信任违规的机制,这借鉴了认知网络,并辅以用于解释断言的推论主义语义学。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:05

# 人类与大型语言模型集合中的对抗性社会认识论
来源:https://arxiv.org/abs/2607.07760
查看 PDF (https://arxiv.org/pdf/2607.07760)

> 摘要:我们概述了一种适用于密集互动沟通场景的对抗性社会认识论(ASE),其中公开断言由一系列证言、推理、机构认证和隐性信任构成。在这样的场景中,主体们有动机和机会去扭曲、渲染、省略、捏造或策略性地低估信息,以获取私人、声誉、修辞或物质利益。我们认为,这些现象并不能被熟悉的描述(如认知泡沫、回音室或错误信息扩散)充分捕捉。需要解释的是,沟通主体如何利用那些通常使脚手架式断言值得信赖的承诺和权利。我们提供了进行必要分析的语言,概述了破坏脚手架式公共通信信任的机制,并描述了用于审计和补救由破坏推理链可审计性而引起的信任违约的工具,这些工具借鉴了认知网络,并辅以用于解释推论的推理主义语义学。

## 提交历史

来自:Mihnea Moldoveanu \[view email (https://arxiv.org/show-email/8909ce20/2607.07760)\] **\[v1\]**2026年7月8日星期三 15:09:49 UTC (412 KB)

相似文章

在复杂隐藏角色游戏中评估大型语言模型

arXiv cs.CL

本文介绍了一个开源框架,用于评估大型语言模型在隐藏角色游戏《秘密希特勒》中的推理、说服和欺骗能力。研究发现,当前模型在持续的多轮操纵上表现不佳,而基于规则的智能体优于它们。

利用大型语言模型构建社会世界模型

Hugging Face Daily Papers

本文介绍了社会世界模型(SWM)框架,该框架利用大型语言模型,无需显式标注即可模拟社会信念在事件响应中的动态变化。同时提出了基于预测市场的基准测试SWM-bench,并展示了最先进的结果。