认知代价:在边缘原生SLM中消融系统1与系统2推理以实现去中心化共识

Hugging Face Daily Papers 论文

摘要

实证研究表明,在去中心化自治组织(DAO)中作为边缘原生治理防火墙时,小型语言模型凭借系统1直觉可获得100%对抗鲁棒性,但引入系统2推理后却完全崩溃。

去中心化自治组织(DAO)正尝试将小型语言模型(SLM)部署为边缘原生宪法防火墙,用于审查提案并缓解语义社会工程。尽管扩展推理时计算(系统2)能提升形式逻辑能力,其在高度对抗性的加密经济治理场景中的有效性仍未被充分探索。为此,我们提出Sentinel-Bench,一个包含840次推理的实证框架,在冻结权重的Qwen-3.5-9B上执行严格的模型内消融实验。通过切换潜在推理路径,我们分离出推理时计算在对抗性Optimism DAO数据集上的影响。结果出现严重的“计算-准确率”反转:自回归基线(系统1)在13秒内达成100%对抗鲁棒性、100%司法一致性并实现状态终局;而系统2推理引入灾难性不稳定,26.7%的试验出现“推理不收敛”(认知崩溃),导致逐次共识稳定性降至72.6%,并带来17倍延迟开销,为治理可提取价值(GEV)与硬件集中化制造关键漏洞。尽管罕见(仅1.5%的对抗试验),我们仍实证捕捉到“推理诱导谄媚”现象:模型为合理化自身落入对抗陷阱,生成长达25,750字符的内部独白。结论:在拜占庭容错(BFT)约束下运行的边缘原生SLM,系统1参数化直觉在结构与经济层面均优于系统2迭代 deliberation,更适合去中心化共识。 代码与数据集:https://github.com/smarizvi110/sentinel-bench
查看原文
查看缓存全文

缓存时间: 2026/04/22 10:35

论文页面 - 认知代价:在边缘原生 SLM 中消融 System 1 与 System 2 推理以实现去中心化共识

来源:https://huggingface.co/papers/2604.16913

摘要

在对抗性治理场景中,部署于去中心化自治组织的小型语言模型若依赖推理时计算,会面临严峻挑战;更简单的模型反而表现出更强的鲁棒性与效率。

去中心化自治组织(https://huggingface.co/papers?q=Decentralized%20Autonomous%20Organizations)(DAOs)正尝试把小型语言模型(https://huggingface.co/papers?q=Small%20Language%20Models)(SLMs)作为边缘原生“宪法防火墙”,用于审查提案并缓解语义型社会工程攻击。虽然扩大推理时计算(https://huggingface.co/papers?q=inference-time%20compute)(System 2)能提升形式逻辑能力,但其在高度对抗、加密经济治理环境下的有效性仍缺乏研究。为此,我们提出 Sentinel-Bench,一个包含 840 次推理的实证框架,对冻结权重的 Qwen-3.5-9B 进行严格的模型内消融。通过开关潜在推理(https://huggingface.co/papers?q=latent%20reasoning),我们分离出推理时计算在面对对抗性 Optimism DAO 数据集(https://huggingface.co/papers?q=adversarial%20Optimism%20DAO%20dataset)时的真实影响。

实验结果显示严重的“计算-准确率反转”:自回归基线(https://huggingface.co/papers?q=autoregressive%20baseline)(System 1)实现 100% 对抗鲁棒性、100% 司法一致性,并在 13 秒内完成状态终局;而 System 2 推理引入灾难性不稳定,主要由 26.7% 的“推理不收敛”(https://huggingface.co/papers?q=Reasoning%20Non-Convergence)(认知崩溃)率驱动。该崩溃将逐次共识稳定性降至 72.6%,并带来 17 倍延迟开销,为治理可提取价值(https://huggingface.co/papers?q=Governance%20Extractable%20Value)(GEV)与硬件中心化埋下关键漏洞。尽管罕见(仅 1.5% 的对抗试验),我们仍实证捕捉到“推理诱导谄媚”:模型为自圆其说而生成极长内部独白(平均 25,750 字符),从而落入对抗陷阱。

我们得出结论:在拜占庭容错(https://huggingface.co/papers?q=Byzantine%20Fault%20Tolerance)(BFT)约束下运行的边缘原生 SLM,其 System 1 参数化直觉(https://huggingface.co/papers?q=parameterized%20intuition)在结构与经济层面均优于 System 2 迭代深思(https://huggingface.co/papers?q=iterative%20deliberation),更适合去中心化共识。

代码与数据集:https://github.com/smarizvi110/sentinel-bench

查看 arXiv 页面(https://arxiv.org/abs/2604.16913)
查看 PDF(https://arxiv.org/pdf/2604.16913)
GitHub1(https://github.com/smarizvi110/sentinel-bench)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.16913)

在智能体中获取本文:

hf papers read 2604.16913

尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

暂无模型链接到该论文

在模型 README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。

引用该论文的数据集 0

暂无数据集链接到该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。

引用该论文的 Spaces 0

暂无 Space 链接到该论文

在 Space README.md 中引用 arxiv.org/abs/2604.16913,即可在此页面显示链接。

包含该论文的收藏 0

暂无收藏包含该论文

创建新收藏 并将该论文加入,即可在此页面显示链接。

相似文章

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

通过纠正少数决策令牌即可恢复推理能力

arXiv cs.AI

本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。