认知代价:在边缘原生SLM中消融系统1与系统2推理以实现去中心化共识
摘要
实证研究表明,在去中心化自治组织(DAO)中作为边缘原生治理防火墙时,小型语言模型凭借系统1直觉可获得100%对抗鲁棒性,但引入系统2推理后却完全崩溃。
查看缓存全文
缓存时间: 2026/04/22 10:35
论文页面 - 认知代价:在边缘原生 SLM 中消融 System 1 与 System 2 推理以实现去中心化共识
来源:https://huggingface.co/papers/2604.16913
摘要
在对抗性治理场景中,部署于去中心化自治组织的小型语言模型若依赖推理时计算,会面临严峻挑战;更简单的模型反而表现出更强的鲁棒性与效率。
去中心化自治组织(https://huggingface.co/papers?q=Decentralized%20Autonomous%20Organizations)(DAOs)正尝试把小型语言模型(https://huggingface.co/papers?q=Small%20Language%20Models)(SLMs)作为边缘原生“宪法防火墙”,用于审查提案并缓解语义型社会工程攻击。虽然扩大推理时计算(https://huggingface.co/papers?q=inference-time%20compute)(System 2)能提升形式逻辑能力,但其在高度对抗、加密经济治理环境下的有效性仍缺乏研究。为此,我们提出 Sentinel-Bench,一个包含 840 次推理的实证框架,对冻结权重的 Qwen-3.5-9B 进行严格的模型内消融。通过开关潜在推理(https://huggingface.co/papers?q=latent%20reasoning),我们分离出推理时计算在面对对抗性 Optimism DAO 数据集(https://huggingface.co/papers?q=adversarial%20Optimism%20DAO%20dataset)时的真实影响。
实验结果显示严重的“计算-准确率反转”:自回归基线(https://huggingface.co/papers?q=autoregressive%20baseline)(System 1)实现 100% 对抗鲁棒性、100% 司法一致性,并在 13 秒内完成状态终局;而 System 2 推理引入灾难性不稳定,主要由 26.7% 的“推理不收敛”(https://huggingface.co/papers?q=Reasoning%20Non-Convergence)(认知崩溃)率驱动。该崩溃将逐次共识稳定性降至 72.6%,并带来 17 倍延迟开销,为治理可提取价值(https://huggingface.co/papers?q=Governance%20Extractable%20Value)(GEV)与硬件中心化埋下关键漏洞。尽管罕见(仅 1.5% 的对抗试验),我们仍实证捕捉到“推理诱导谄媚”:模型为自圆其说而生成极长内部独白(平均 25,750 字符),从而落入对抗陷阱。
我们得出结论:在拜占庭容错(https://huggingface.co/papers?q=Byzantine%20Fault%20Tolerance)(BFT)约束下运行的边缘原生 SLM,其 System 1 参数化直觉(https://huggingface.co/papers?q=parameterized%20intuition)在结构与经济层面均优于 System 2 迭代深思(https://huggingface.co/papers?q=iterative%20deliberation),更适合去中心化共识。
代码与数据集:https://github.com/smarizvi110/sentinel-bench
查看 arXiv 页面(https://arxiv.org/abs/2604.16913)
查看 PDF(https://arxiv.org/pdf/2604.16913)
GitHub1(https://github.com/smarizvi110/sentinel-bench)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.16913)
在智能体中获取本文:
hf papers read 2604.16913
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型链接到该论文
在模型 README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集链接到该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 链接到该论文
在 Space README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。
包含该论文的收藏 0
暂无收藏包含该论文
创建新收藏 并将该论文加入,即可在此页面显示链接。
相似文章
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。
共识在战略层面的不足:将推理轨迹分歧作为知识表示信号
本文认为,在多智能体 LLM 系统中,追求共识对于涉及价值判断的任务而言是不够的,并提出一种知识表示层,将智能体推理轨迹的分歧归类为四种符号状态,以实现内容审核等系统中的策略性路由。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
上下文、推理与层次结构:对抗性POMDP中复合LLM智能体设计的成本-性能研究
在对抗性POMDP(CybORG CAGE-2)中对复合LLM智能体设计进行了一项受控研究,系统性地在五个模型系列中变化上下文、推理与层次结构。主要发现:程序化状态抽象每token产生巨大回报,无推理工具的层次结构实现了最佳绝对性能,并且上下文工程比深度推理更具成本效益。
通过纠正少数决策令牌即可恢复推理能力
本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。