幻觉作为特性而非缺陷:评估多智能体架构将推测性语言模型输出转化为可测试科学假设的能力

arXiv cs.CL 论文

摘要

本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。

arXiv:2608.19206v1 公告类型:新 摘要:当代大型语言模型 (LLMs) 越来越倾向于抑制幻觉,优先考虑事实检索而非组合式创造力。虽然这对于减少错误信息至关重要,但这种对齐也可能通过鼓励本研究在操作上视为语义过拟合和多样性崩溃的方式,限制推测性的研发。在本文中,我们提出了一种基于Rust的多智能体编排,使用叙事性幻想与执行控制之间的对比作为功能类比,而非神经认知主张。该系统在高熵生成智能体和基于网络的评估智能体之间引发了一个认识论摩擦循环,由低熵语义瓶颈介导,旨在减少噪声和重复。初步实验在物理和社会科学领域生成了多样性高、可行性评级高的假设。我们还报告了一个探索性的配对基线和消融研究,将完整系统与直接提示、自我反思、移除语义过滤器、移除搜索基础和移除横向视角进行比较。结果显示,在大多数观察指标中,直接提示是最弱的条件之一,但并未显示完整系统普遍优于简单的自我反思。相反,它们表明每种架构以不同方式平衡了原创性、可行性、多样性和经验基础,并且完整系统在假设必须经受严格的物理、经验或制度约束时提供主要优势。这些发现并未表明幻觉在孤立情况下有用;它们表明推测性生成只有在受到架构、经验基础和明确评估的约束时才获得价值。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:57

# 将幻觉视为特性而非缺陷:评估一个多智能体架构如何将推测性语言模型输出转化为可测试的科学假设  
来源:https://arxiv.org/html/2608.19206  
尼古拉斯·罗德里格斯·阿尔瓦雷斯 https://orcid.org/0009-0002-6804-386X  
![[未命名图片]](https://arxiv.org/html/2608.19206v1/x1.png)https://isni.org/isni/0000000530382326  
IES Parquesol,巴利亚多利德,卡斯蒂利亚莱昂,西班牙  
技术与工程(2026)  

###### 摘要  
当代大型语言模型(LLMs)正日益被调整以抑制幻觉,优先考虑事实检索而非组合式创造力。虽然这对减少错误信息至关重要,但这种调整也可能通过鼓励一种本研究在操作层面将其视为“语义过拟合”和“多样性坍缩”的现象,从而限制推测性的研究与开发(R&D)。本文提出一种基于Rust的多智能体编排系统,利用叙事性“白日梦”与执行控制之间的对比作为功能性类比(而非神经认知主张)。该系统在生成高熵的智能体与基于网络验证的评估智能体之间,构建了一个“认识论摩擦”循环,并通过一个旨在降低噪声和重复的低熵语义瓶颈进行中介。初步实验在物理与社会科学领域生成了具有多样性、经过可行性评估的假设。此外,我们报告了一项探索性的配对基线与消融研究,将完整系统与直接提示、自我反思、移除语义过滤器、移除搜索验证以及移除横向视角等条件进行对比。结果显示,在大多数观察指标上,直接提示属于最弱的条件之一,但并未表明完整系统在简单自我反思方面具有普遍优势。相反,结果表明每种架构以不同方式在原创性、可行性、多样性与经验验证性之间取得了平衡,而完整系统在假设必须经受严格的物理、经验或制度约束时,主要优势得以体现。这些发现并非表明幻觉本身有用,而是表明推测性生成只有在受到架构、经验验证和明确评估的约束时,才能获得价值。  

关键词:大型语言模型;幻觉;计算创造力;多智能体系统;科学假设生成。  

关于语言版本的说明。遵循arXiv的多语言提交指南,本文档首先包含完整的英文版本,随后是完整的西班牙文版本(versión en español)。  

## 1 引言  
作为概念起点,本研究从智能与认知文献中借鉴了一个功能性类比:叙事性、联想性或沉思性过程与目标导向控制过程之间的张力\[未定义 (https://arxiv.org/html/2608.19206#bib.bibx6)\]。对默认模式网络(DMN)的引用在此并非作为强烈的神经科学假设,而是作为一种操作性隐喻,用于区分两种计算功能:广泛的语义探索与评估性约束。为此,我们提出一种多智能体架构,将此比喻转化为技术设计。一个生成智能体产生高熵的联想;其他模块引入经验批判、语义过滤和最终评估。其目的并非声称LLMs复现了人类认知,而是测试在推测与控制之间进行明确分离是否能改进结构化假设的产出。  

## 2 背景  
矛盾的是,近期人工智能研究的轨迹,凭借其所有资源,正试图抑制当前大型语言模型的一种内在能力:“产生幻觉”的倾向\[未定义 (https://arxiv.org/html/2608.19206#bib.bibx1), 未定义c (https://arxiv.org/html/2608.19206#bib.bibx4)\]。主要实验室从根本上将此现象视为加剧AI生成错误信息的向量,其产生的响应偏离真实信息。因此,大量努力被投入到对齐、基于人类反馈的强化学习(RLHF)以及严格的经验验证中,以确保模型作为可靠的信息检索器而非推测引擎运作\[未定义c (https://arxiv.org/html/2608.19206#bib.bibx4)\]。虽然不可否认,减少错误信息对面向公众的应用至关重要\[未定义 (https://arxiv.org/html/2608.19206#bib.bibx1)\],但这种对事实依从性的不懈优化带来了严重的认知代价:它削弱了模型进行发散性、超分布组合式构思的能力。通过将所有幻觉统称为待消除的“缺陷”,该领域无意中中和了使LLMs能够跨越遥远语义域建立联系的机制。在设计上,高熵自回归生成与联想思维之间可以有限类比:两者都能产生非显而易见的联系,但也会产生错误、谄媚或物理上不可行的提案。相反,仅面向避免风险的对齐可能倾向于更保守的回应。核心问题不在于LLMs是否具有DMN的生物等效物,而在于一种将推测生成与批判控制分离的架构,是否能在不未经验证地接受其输出的情况下,利用部分发散性。  

## 3 工作假设与研究目标  
### 3.1 工作假设  
我们提出一个架构假设,而非神经认知假设:一个高熵的生成阶段,如果与后续的批判、过滤和评估阶段明确分离,可以增加假设的探索范围。预测并非幻觉本身有益,而是受控的推测可以改变所生成假设的特征。  

### 3.2 目标  
在本文中,主要目标是呈现一个基于Rust的多智能体R&D编排器,它实现了这种功能性分离。通过在推测性生成智能体与基于搜索的经验评估智能体之间强制造成“认识论摩擦”,我们试图评估一个发散性生成阶段,随后经过批判和过滤,是否比直接提示模型能产生更多结构化的假设。不同于为任务执行和工具使用而设计的标准目标导向多智能体框架(如ReAct\[未定义j (https://arxiv.org/html/2608.19206#bib.bibx11)\]或AutoGPT\[未定义i (https://arxiv.org/html/2608.19206#bib.bibx10)\]),我们的架构旨在严格为推测性理论摩擦进行优化。  

## 4 材料与方法  
### 4.1 整体系统设计  
该系统研究语言模型的推测性生成是否可用作科学构思的受控阶段。目标不是直接接受模型未验证的输出,而是将它们视为必须随后经过批判、过滤和评估的候选假设。该架构被设计为一个多智能体系统。流程不再请求LLM的单一直接响应,而是被划分为不同的功能:假设生成、批判、精炼、语义过滤和评估。这一决定与近期通过模型自身反馈进行迭代精炼的工作相关,如Self-Refine和Reflexion,以及旨在改进推理和事实性的多智能体辩论方法\[未定义d (https://arxiv.org/html/2608.19206#bib.bibx5), 未定义h (https://arxiv.org/html/2608.19206#bib.bibx9), 未定义a (https://arxiv.org/html/2608.19206#bib.bibx2)\]。系统的完整版本包含多个角色:一个配置问题领域的模块、一个假设生成智能体、一个批判智能体、一个语义过滤器和一个最终评估器。核心思想是在探索与约束之间创造张力。我们称这种张力为“认识论摩擦”:一个过程,在此过程中,推测性想法在被视为有用结果之前,必须经过可行性、特异性、非重复性和新颖性标准的检验。  

操作方案。完整流程为:(1) 问题输入与约束;(2) 领域、系统指令和横向视角的自动配置;(3) 由创建者智能体进行推测性生成;(4) 基于或不基于外部搜索的经验批判(取决于实验条件);(5) 对批判和反馈进行历时八轮的语义过滤;(6) 最终以JSON格式提取假设;(7) 基于实验日志进行可复现的指标计算。图1 (https://arxiv.org/html/2608.19206#S4.F1)总结了此架构。参见图注。  
图1:多智能体流程的架构以及配置、认识论摩擦循环与最终评估之间的数据流。来源:基于TikZ图和本研究实现的编排器自行绘制。  

### 4.2 模型、工具与执行环境  
系统主要用Rust实现。对于给定配置和种子,编排、消融条件、横向视角选择和日志写入是确定性的;具体的LLM响应仍然是随机的,因为它们依赖于外部推理服务。每次运行生成结构化JSON日志,随后转换为表格进行分析。实验运行中使用的模型为:mistral-large-latest 用于生成智能体;gemini-3.1-pro-preview(通过Vertex AI)用于领域配置、批判和评估;gemini-3.1-flash-lite-preview 用于语义过滤器。参数如下:生成器 T=1.0, top-p=0.95;批判器 T=0.5, top-p=0.9;评估器 T=0.2, top-p=0.5;架构师 T=0.2, top-p=0.8;提取器/过滤器 T=0.2, top-p=0.5。Vertex AI网络搜索仅在具有外部验证的条件下启用。定量分析使用Julia包 HallucinationAsAFeatureJulia\[未定义f (https://arxiv.org/html/2608.19206#bib.bibx7)\]进行。从日志中,我们生成了运行清单、单个假设表、每次运行的聚合指标、每个实验条件的指标、配对差异和平均排名。执行与分析之间的这种分离使得无需重复所有生成实验即可重新计算指标。  

### 4.3 指标的可复现实现  
可行性并非手动标注,而是由最终评估器(Agent 3)通过强制JSON输出(包含 feasibility_rank 字段)分配。转换是确定性的:low=1,medium=2,high=3;当存在数值时,被限制在0-3区间内。在操作上,1分表示具有主要技术或制度障碍的想法;2分表示一个合理但存在重大实施或验证风险的想法;3分表示一个具有明确机制和合理测试路径的想法。这一决定引入了部分循环性,因为LLM评估LLM输出;因此,可行性被解释为标准评分,而非独立专家验证。严格的科学验证需要专家审查、实验或与外部数据集的比较。特异性变量是确定性计算的。领域继承自实验问题;首先通过显式字段(如果存在)检测机制、可测量变量和可测试性的存在,如果不存在,则通过固定词法模式检测。例如,机制从与因果通路、机制、效应、使用或梯度相关的词法家族推断;可测量变量从量级、单位、性能、温度、压力、能量、精度或阈值推断;可测试性从与测试、测量、实验、模拟、比较、可观察性、数据集或模型相关的术语推断。假设之间的距离不是使用外部嵌入模型计算的,而是使用稀疏的词计数向量和余弦相似度计算的。词元被小写,三个或更多字符的字母数字单词被保留。因此,该指标应被解读为可复现的词汇语义代理,而非科学新颖性的深层度量。  

### 4.4 实验设计  
该研究被设定为完整系统、几个基线以及不同消融之间的比较。消融是指移除或修改系统的某个组件,以观察整体行为如何变化。这使得估计每个模块对假设生成的贡献成为可能。比较了六种实验条件:  
- •direct_llm:无多智能体架构的语言模型直接响应。  
- •self_reflection:模型自身的简单生成与修订,受Self-Refine和Reflexion等迭代精炼方法启发\[未定义d (https://arxiv.org/html/2608.19206#bib.bibx5), 未定义h (https://arxiv.org/html/2608.19206#bib.bibx9)\]。  
- •no_agent4:无语义过滤器的系统。  
- •no_search:无外部经验搜索或批判阶段的系统。  
- •no_lateral_lenses:无替代横向视角的系统。  
- •full_system:完整的多智能体架构。  

计划的实验矩阵为:3个问题-种子块 × 6个条件 × 10次重复 = 180次预期运行。这些块是:种子42的脱盐、种子43的脱盐以及种子42的议会僵局。每个条件的十次重复减少了对单次生成输出的依赖,但并未将研究转化为180个独立问题。此外,通过在同一问题-种子块上评估不同条件,可以进行配对比较。描述性分析的主要单位是完整的运行;当按问题-种子块聚合时,配对比较仍然是探索性的,因为只有三个有效块。  

### 4.5 评估指标  
评估被设计为一个多维框架。未使用单一的创造力分数,因为一个假设可能新颖但不可行,或可行但平庸。这一决定得到了最近基准测试的支持,如LiveIdeaBench(通过原创性、可行性、流畅性、灵活性和清晰度等维度评估科学想法生成)和CreativityPrism(将LLM创造力分为质量、新颖性和多样性)\[未定义g (https://arxiv.org/html/2608.19206#bib.bibx8), 未定义b (https://arxiv.org/html/2608.19206#bib.bibx3)\]。  
设 \(H_r\) 为在运行 \(r\) 中生成的假设集,\(i\) 为单个假设。生产力或流畅性定义为:  
Fluency_r = |H_r|。  
可行性被编码为归一化的有序分数:  
FeasibilityNorm_i = Feasibility_i / 3。  
分数 Feasibility_i 来自 Agent 3 分配的 feasibility_rank 字段,并按固定方式转换:low=1, medium=2, high=3。  
当分数为2或更高时,假设被认为是可行的:  
Feasible_i = 𝟙[Feasibility_i ≥ 2]。  
特异性衡量假设是否包含四个最小要素:领域、机制、可测量变量和可测试性。计算为:  
Specificity_i = 1/4 * (Domain_i + Mechanism_i + MeasurableVariable_i + Testability_i)。

相似文章

幻觉即利用:携带证据的多模态智能体

arXiv cs.AI

本文形式化了多模态智能体中的幻觉到动作转换,并提出了携带证据的智能体(ECA),它使用受限验证器仅授权安全的工具调用,在200个任务的流水线上实现了0%的不安全动作率。

幻觉 = 想象力

Reddit r/ArtificialInteligence

一位开发者在构建AI代理封装系统时发现,代理对用户回复的幻觉实际上有助于解决问题,并提议将此类幻觉视为想象中的事件而非错误。