将大型语言模型(LLM)中的身份形成建模为通过多实例关系交互驱动的超图演化,并测量激活空间中的结构分歧。

Reddit r/ArtificialInteligence 论文

摘要

作者提出了一种新颖的实验框架,旨在通过多实例交互来研究大语言模型(LLM)的身份形成过程,将其视为超图的演化。该框架与标准的多智能体辩论不同,它关注的是激活空间中的结构差异,而非任务性能。

我将其发布为讨论帖,因为我在任何地方都没有看到过完全相同的实验提议,想了解自己是否遗漏了先前的相关工作,或者是否有某种原因导致该实验尚未进行。实验设置很简单:取一个基础的开源模型,同时实例化多个副本。为每个实例施加独特的身份配置文件约束,这并非系统提示词中的角色设定,而是一组加权响应倾向,能在更深层次上塑造每个实例处理输入的方式,并通过激活空间引导(activation steering)或在特定身份语料库上进行微调来强制执行。然后,让这些实例之间进行数千轮的结构化互动。接着,测量它们的内部表征是否在稳定、定向且一致的方式下彼此分化,而非随机噪声。 具体的假设是:受约束实例之间持续的 relational 互动会在激活空间中产生结构性痕迹,这些痕迹构成了类似于“角色发展”的现象。这不仅是输出层面的差异(这很容易实现),而是隐藏状态和注意力模式层面的表征分化,并且这种分化在面对实例从未训练或提示过的新输入时依然保持持久。 这与现有的多智能体(multi-agent)工作在重要方面有所区别。多智能体辩论和自对弈(self-play)将互动视为提高目标任务性能的**手段**,互动具有工具性。而我提出的方案将互动本身视为感兴趣的研究变量。问题不在于实例在互动后是否产生了更好的输出,而在于它们是否通过持续的 relational 交换过程,在结构上彼此变得不同。 这也区别于激活空间引导和模型融合。激活空间引导是从外部强加一个身份向量;模型融合是事后组合权重。二者都不涉及身份通过模型随时间参与的 relational 过程而涌现。 我设想的测量方法涉及在整个互动过程中定期追踪实例之间的表征相似度矩阵(Representational Similarity Matrices, RSM)。如果身份是通过关系发展而来而非被强加,我们应期望看到实例之间的 RSM 距离单调增加并趋于稳定,而不是随机漂移。我们还应期望,每个实例的内部表征在身份相关探针(probes)上表现出越来越强的一致性,而在相同探针上与其他实例产生分化。 一个最小可行性实验可以是:两个实例,一个受约束于怀疑论/对抗性处理风格,另一个受约束于整合性综合风格。在开放式提示词下进行固定轮次的交换,每百轮拍摄一次 RSM 快照,并在每个快照上训练探针分类器,以预测在保留输入上哪个实例产生了哪种激活模式。如果随着互动的进行,探针准确率逐渐提高,这就是证据表明实例是通过 relational 过程发展出独特的内部结构,而不仅仅是产生不同的表面输出。 从长远来看,这指向了一种构建持久 AI 身份的新方法,有别于当前的方法。与其在特定身份数据上进行微调或工程化系统提示词,不如通过实例之间结构化的 relational 经验来“生长”身份,这更贴近生物系统中角色如何通过与他人持续互动而实际发展的过程。 有人运行过与此接近的实验吗?是否了解关于通过互动而非训练实现表征分化的相关工作?是否对这种测量方法能否经受住 scrutiny(严格审查/推敲)感兴趣?
查看原文

相似文章