几何金丝雀:通过表征稳定性预测可操控性与检测漂移
摘要
# 论文页面 - 几何金丝雀:通过表征稳定性预测可操控性与检测漂移 来源:[https://huggingface.co/papers/2604.17698](https://huggingface.co/papers/2604.17698) ## 摘要 几何稳定性指标既能预测语言模型的可控性,也能检测其结构退化;其中监督版在操控预测上表现优异,无监督版在漂移检测上更胜一筹。
查看缓存全文
缓存时间: 2026/04/21 07:21
论文页面 - The Geometric Canary:通过表征稳定性预测可操控性与检测漂移
来源:https://huggingface.co/papers/2604.17698
摘要
几何稳定性指标既能预测语言模型的可控性,也能检测其结构退化:有监督变体擅长操控预测,无监督变体擅长漂移检测。
可靠部署语言模型需要两项看似独立却共享几何基础的能力:预判模型能否接受目标行为控制,以及及时发现其内部结构是否退化。我们发现,几何稳定性(表征的成对距离结构一致性)可同时解决这两个问题。
有监督 Shesha 变体通过测量任务对齐的几何稳定性,在 35–69 个嵌入模型、三大 NLP 任务上,以近乎完美的准确率(ρ=0.89–0.97)预测线性可操控性,且能捕捉到类别可分性之外的独特方差(偏 ρ=0.62–0.76)。
关键分离现象出现:无监督稳定性在真实任务操控上完全失效(ρ≈0.10),表明任务对齐对可控性预测至关重要;然而,无监督稳定性在漂移检测中表现卓越,在后训练对齐阶段测得的几何变化几乎是 CKA 的 2 倍(Llama 上高达 5.23 倍),在 73% 的模型中提供更早预警,且误报率比 Procrustes 低 6 倍。
有监督与无监督稳定性共同构成 LLM 部署生命周期的互补诊断工具:前者用于部署前可控性评估,后者用于部署后监控。
查看 arXiv 页面 (https://arxiv.org/abs/2604.17698)
查看 PDF (https://arxiv.org/pdf/2604.17698)
GitHub0 (https://github.com/prashantcraju/geometric-canary)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17698)
在智能体中获取本文:
hf papers read 2604.17698
CLI 不是最新版?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 1
pcr2120/shesha-geometry Other • 约 5 小时前更新 (https://huggingface.co/pcr2120/shesha-geometry)
引用该论文的数据集 0
暂无数据集链接
在数据集 README.md 中引用 arxiv.org/abs/2604.17698 即可在此显示。
引用该论文的 Spaces 0
暂无 Space 链接
在 Space README.md 中引用 arxiv.org/abs/2604.17698 即可在此显示。
收录该论文的合集 0
暂无合集收录
将该论文加入新建合集即可在此显示。
相似文章
完美检测,控制失效:语言模型中认知与引导的几何关系
本文研究了语言模型激活中检测行为的向量与控制行为的向量之间的几何关系,发现对于幻觉检测,它们几乎正交(余弦约0.12),而对于输出格式,它们完美对齐,这对机械可解释性中的一个常见假设提出了挑战。
驾驭潜在空间:从引导向量到模型校准器,实现控制与信任
本文提出使用引导向量控制语言模型行为,并基于潜在空间构建校准器以评估可信度,旨在揭开内部表征的神秘面纱,构建更可靠的AI系统。
语义漂移与推理类决策支持系统中操作员控制的稳定性
本文研究了混合决策支持系统中推理类大语言模型的语义上下文漂移问题,提出了一个数学模型和一个稳定性度量。为期两个月的实验揭示了潜在的目标导向漂移,并制定了控制稳定性的工程建议。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。
神经群体编码的几何稳定性:区域差异、行为相关性与回路依赖性
本文引入几何稳定性作为衡量刺激对间距离在多次试验中重现可靠性的指标,展示了其在大脑各区域的行为相关性与回路依赖性,并通过吸引子网络模型解释其产生机制。