Safin-1: 通过记忆原生状态演化的内在安全
摘要
Safin-1引入了一个基础模型家族,具备记忆原生状态演化,以实现内在安全能力,并使用MARCH架构进行选择性记忆检索和持久状态适应。
arXiv:2609.00092v1 公告类型:新
摘要:长期复杂任务要求基础模型积累信息、维持内部状态,并在长时间交互中进行适应。安全性应是模型本身的固有属性,而非仅依赖外部保障或事后对齐(如监督微调)的行为约束。这激发了‘内在安全’的概念,其中安全相关能力通过模型的原生计算来表示和调用。我们推出了Safin-1,一个基础模型家族,通过记忆路由和状态演化实现这一原则。Safin-1基于跨上下文历史的记忆锚点路由(MARCH),这是一种网络架构,通过内容条件路由维护结构化记忆状态并选择性地检索相关历史信息。它支持测试时对持久能力状态的适应,而无需反复修改骨干网络,从而在共享基础上实现受控的专门化。我们通过安全状态研究了该接口在下游安全任务中的应用,展示了基于状态的有效适应和显著的安全改进。更广泛地说,路由状态接口在模型的原生计算中统一了上下文记忆和持久能力适应,将记忆从先前上下文的被动记录重新定义为维护和演化模型行为的主动基质。在通用能力、长上下文理解、检索和效率方面的评估进一步验证了Safin-1。这些发现为实现作为状态原生和适应性可维护能力的安全性提供了一条路径。本工作仅是对‘内在安全’的初步架构探索,需要大量后续工作来实现这一更广泛的愿景。
查看缓存全文
缓存时间: 2026/09/02 06:09
# Safin-1:通过记忆原生状态演进实现内在安全
来源:https://arxiv.org/html/2609.00092
\\setleftlogo
\[180pt\]imgs/logo\_lab\.png\\setrightlogo\[180pt\]\\tl\_set:Ne\\artifactbuttonartifactbutton
###### 摘要
长周期复杂任务要求基础模型积累信息、维持内部状态并在扩展交互中持续适应。在此类场景中,安全应是模型本身的内在属性,而非仅依赖外部防护或事后对齐程序(如监督微调)的行为约束。这引出了“内在安全”的概念——安全相关能力通过模型原生计算来表示和调用,而非仅依赖外部防护。我们提出 **Safin-1**,一系列通过记忆路由与状态演进实现该原则的基础模型。Safin-1 基于 **跨上下文历史的记忆锚点路由**(Memory-Anchor Routing across Context History, **MARCH**)构建,这是一种新型网络架构,通过内容条件路由维持结构化记忆状态并选择性检索相关历史信息。Safin-1 进一步支持在测试时自适应调整持久能力状态,无需反复修改主干模型,从而在共享通用基础上实现可控特化。我们通过 **安全状态** 在下游安全任务中验证这一持久记忆接口,展示了基于状态的自适应能力,并显著提升了安全性。更广泛地,路由状态接口将上下文记忆与持久能力自适应统一于模型原生计算中。这将模型记忆从被动的上下文记录,转变为随时间维持与演进模型行为的主动基底。在通用能力、长上下文理解、检索与效率等方面的评估进一步验证了 Safin-1。这些发现共同为将安全构建为状态原生且可自适应维护的能力提供了具体路径。我们强调,本研究仅代表“内在安全”的初步架构探索,要实现这一更广阔的愿景仍需大量后续工作。
参考标题 图 1:Safin-1 架构与代表性结果。左:0.8B 架构验证与 35B-A3B 缩放结果。4B 安全面板对比了 Qwen3.5 与配备学习到的安全状态的 Safin-1。右:Safin-1 架构路由上下文派生与持久记忆状态以选择性读出。
## 1 引言
长周期智能需要两种连续性。模型必须在扩展上下文中保留已发生的信息,并可靠调用适合当前情境的能力。语言模型通常通过不同基底实现这些功能:上下文保存在令牌级键值缓存或循环状态中,而可复用行为(如安全)则常通过模型更新或适配器编码,或在推理时通过学习到的前缀和表示干预来施加\[bianchi2024safetytuned,li2025salora,yu2026singletoken,wang2024inferaligner\]。在更广层面上,R2AI 观点\[sun2026r2ai\]主张可扩展的安全应随模型能力共同演进\[yang2024towards,lab2025safework\],结合对已知威胁的抵抗力与对未预见风险的韧性\[wen2026jailbreakskill,qi2026darwin,li2026evodefense,zeng2026trace,wen2026magic\]。这些观察引出了一个更广泛的问题:模型状态能否不仅作为上下文的瞬时压缩,还能作为持久且可选择性调用能力的原生基底?我们通过记忆与安全研究此问题——这两个场景都要求模型在不加抑制地抑制有用响应的前提下\[rottger2024xstest\],恢复相关历史信息并调用适当的行为约束。
自注意力保留了对先前令牌的细粒度访问,但带来二次训练成本以及随序列长度增长的键值缓存\[vaswani2017attention\]。循环与线性注意力模型则将因果前缀压缩至固定大小状态,实现高效常数内存解码\[katharopoulos2020transformers,dao2024transformers\]。选择性状态空间模型与 Delta 规则循环显著改进了状态的写入、修正与遗忘方式\[gu2023mamba,schlag2021lineartransformersselfretrievalcompressive,yang2025gateddelta\]。然而传统循环设计仅暴露最新状态供直接读取。一旦早期关联被削弱或覆盖,其先前表示可能无法仅从当前状态恢复\[arora2024zoology,arora2024simple\]。近期工作通过扩大循环内存、在多状态间路由或保留时间有序的状态集合来缓解这一*单状态瓶颈*\[pan25SSE,cabannes26SDM,du2025mom,guo2026loglinear,wang2026dynamic,behrouz26memory\]。但保留额外状态引入了第二个挑战:历史状态必须以紧凑方式表示并根据当前上下文检索。因此,可扩展的循环记忆不仅需要状态保存,还需要高效的状态寻址接口。
我们提出 **Safin-1**,一系列旨在探索长周期智能与安全的状态原生表述的基础模型。Safin-1 构建于 **跨上下文历史的记忆锚点路由(MARCH)**\[zhang2026march\]之上,该架构将模型演化循环状态的早期版本保留为可寻址的内部记忆。除上下文派生的记忆外,同一路由接口还可承载学习到的持久能力状态。我们将此接口实例化为可分离的 **安全状态**,使 Safin-1 能通过测试时模型状态的自适应获得安全特化,同时保持共享的语言模型主干冻结。
在架构层面,循环主干定期将演化状态创建检查点,形成可寻址的 **状态锚点**。每个锚点配对一个紧凑的状态感知路由密钥,使每个令牌能够检索相关历史状态,或在不需要历史记忆时选择学习到的空选项。检索到的状态与当前循环路径融合,保持底层循环行为。此设计保留模型自身状态轨迹作为循环计算原生的因果端到端可训练记忆。
此可寻址状态库还为 Safin-1 提供了持久能力特化的接口。该库既可包含从当前上下文派生的动态锚点,也可包含编码可复用特化的学习持久状态。我们首先以安全为例研究后者。在冻结语言模型主干的情况下,我们学习一个持久 **安全状态**,并将其逐层状态置于与上下文派生锚点相同的状态库中;现有路由器随后决定每个令牌的贡献。记忆可附加或移除而无需重写共享主干。通过有害与良性样本学习\[wang2026star1\],安全状态将安全特化置于模型原生循环状态系统内,同时保持共享通用基础。我们将这种状态原生且选择性调用的安全能力视为 *内在安全*(亦称 *制造安全的 AI*)的具体实现\[sun2026r2ai,dalrymple2024towards,fornasiere2026scientist,tan2025towards\]。
我们通过两个互补阶段评估 Safin-1 及其底层架构。首先,受控的 0.8B 研究通过预训练匹配模型(50B 令牌)并将 MARCH 应用于 Gated DeltaNet、Kimi Delta Attention 和 Gated DeltaNet-2\[yang2025gateddelta,kimi2025linear,hatamizadeh2026gateddeltanet2\],隔离了 Safin-1 的架构基础。这些实验分离了所提记忆路由架构的贡献,并在通用语言建模、LongBench\[bai2024longbench\]、真实世界上下文内检索与 RULER NIAH\[hsieh2024ruler\](包括超出训练上下文的外推)上确立了一致改进。
其次,我们使用混合 Qwen3.5 主干\[qwen2026qwen35\]通过匹配的持续预训练与监督微调将 Safin-1 扩展至 4B 与 35B-A3B。所得变体将十项能力基准的宏平均分别从 66.79 提升至 69.20 和从 76.25 提升至 78.35。这些提升在具有挑战性的推理与竞赛级数学方面最为显著。这些结果共同表明,状态路由增强了模型在长推理周期内维持与恢复有用计算的能力,同时不牺牲广泛的通用能力。密集 4B 与专家混合 35B-A3B 配置中相同模式的出现进一步表明,这些益处跨模型规模与主干组织持续存在。
在缩放 Safin-1 研究中,我们进一步从 Safin-1 SFT 检查点出发,冻结语言模型主干,并研究持久安全状态的有效性。此状态原生特化在 4B 时将平均越狱攻击成功率降低 42.3%,在 35B-A3B 时降低 52.3%,同时产生的过度拒绝明显少于训练匹配的 rank-8 LoRA 控制\[hu2022lora\]。因此,本研究代表了 *内在安全* 的初步架构级探索,为实现安全原生于模型计算的替代与互补架构开辟了更广泛的研究议程。
我们进一步开发了融合的密集与稀疏路由实现,并评估其在最高 128K 令牌时的效率。稀疏状态路由提供了稀疏注意力的状态级类比:它在压缩的循环记忆而非令牌级密钥间选择,使历史检索在长序列长度下可行\[lu2025moba,yuan2025native\]。
我们的主要贡献总结如下:
- • **Safin-1 及其状态原生架构。** 我们引入 Safin-1,一系列构建于 MARCH 之上的基础模型。其架构将循环计算的瞬时轨迹转化为不断增长的可寻址状态锚点库,支持在不改变底层循环更新的情况下选择性访问早期模型状态。
- • **内在安全的持久能力状态。** 我们通过学习到的持久能力状态扩展记忆状态库,并将此接口实例化为可分离的安全状态。此机制通过原生状态路由通路特化冻结的 Safin-1 主干,使安全成为模型原生且可选择调用的能力。
- • **受控与缩放的经验验证。** 我们通过跨多个循环主干的受控 0.8B 预训练研究验证底层记忆路由架构,然后通过持续预训练与监督微调将 Safin-1 扩展至 4B 与 35B-A3B。在通用能力、长上下文、检索、安全与效率评估中,结果显示一致的架构改进与良好的安全–过度拒绝权衡。
## 2 技术方法
图 2:支撑 Safin-1 的 MARCH 状态路由主干。左:持续演化的循环状态定期创建检查点,形成可寻址的状态锚点。每个令牌在因果可见的锚点密钥与学习到的空选项间路由,检索到的历史读出与当前状态路径融合。右:状态路由机制应用于每个循环层,状态感知路由密钥跨层重建。Safin-1 通过统一、可路由的模型内部状态库增强循环计算。其状态路由主干由 MARCH 实例化,包含三个组件:保留演化循环状态早期版本的上下文派生状态锚点、选择相关状态或学习到空选项的令牌条件路由、以及独立于当前序列保持可用的持久能力状态。对于每个令牌,选定的状态读出通过残差方式与当前状态路径融合,保留底层循环更新。图 2(https://arxiv.org/html/2609.00092#S2.F2)展示了动态锚定与历史读取通路;持久能力状态在第 2.3 节(https://arxiv.org/html/2609.00092#S2.SS3)中介绍。
### 2.1 上下文派生的状态锚点
##### 锚点放置。
设 T=\[t1,...,tL\]\\mathcal\\{T\\}=\[t\\_\\{1\\},\\ldots,t\\_\\{L\\}\] 为长度 L 的文本令牌序列。锚点策略指定有序文本边界集 B=\{bm\}m=1M\\mathcal\\{B\\}=\\{\\{b\\_\\{m\\}\\}\\}\\_\\{m=1\\}^\\{M\\},其中 0=b0<b1<⋯<bM≤L0=b\\_\\{0\\}<b\\_\\{1\\}<\\cdots<b\\_\\{M\\}\\leq L。我们在每个边界后插入一次共享的学习锚点嵌入:
T^=∥m=1M\(\[tbm−1+1,...,tbm\]∥\[ξm\]\)∥\[tbM+1,...,tL\]。\\widehat\\{\\mathcal\\{T\\}\\}=\\mathop\\{\\mathbin\\{\\|\\}\\}\\_\\{m=1\\}^\\{M\\}\\Big\(\[t\\_\\{b\\_\\{m-1\\}\\+1\\},\\ldots,t\\_\\{b\\_\\{m\\}\\}\]\\mathbin\\{\\|\\}\[\\xi\\_\\{m\\}\]\\Big\)\\mathbin\\{\\|\\}\[t\\_\\{b\\_\\{M\\}\\+1\\},\\ldots,t\\_\\{L\\}\]。\\quad (1)
其中 ∥\\\| 表示序列连接,ξm\\xi\\_\\{m\\} 是共享锚点嵌入 ξ\\xi 的第 m 次出现。文本与锚点位置具有不同的计算角色。文本位置应用基础循环更新,允许状态跨边界连续演化。处理完 tbmt\\_\\{b\\_\\{m\\}\\} 后,架构立即将结果累积状态创建检查点。随后的锚点位置 ξm\\xi\\_\\{m\\} 不修改循环状态;而是读取对齐的检查点以构建紧凑路由元数据。因此每个边界产生一个耦合对:循环状态快照和可通过该快照寻址的表示。
##### 累积循环状态检查点。
在每个承载状态的层 l\\ell,基础循环更新保持不变,将状态 St\(l\)∈Rdv×dk\\mathbf\\{S\\}^\\{\\(\\ell\\)\\}\\_\\{t\\}\\in\\mathbb\\{R\\}^\\{d\\_\\{v\\}\\times d\\_\\{k\\}\\} 跨锚点边界连续传递。在每个边界 bmb\\_\\{m\\},它对当前状态创建快照:
A\(m,l\)=S\(l\)bm∈Rdv×dk,m=1,...,M。\\mathbf\\{A\\}^\\{\\(m,\\ell\\)\\}=\\mathbf\\{S\\}^\\{\\(\\ell\\)\\}\\_\\{b\\_\\{m\\}\\}\\in\\mathbb\\{R\\}^\\{d\\_\\{v\\}\\times d\\_\\{k\\}\\},\\qquad m=1,\\ldots,M。\\quad (2)
由于循环在锚点边界未重置,A\(m,l\)\mathbf\\{A\\}^\\{\\(m,\\ell\\)\\} 代表截至位置 bmb\\_\\{m\\} 的累积前缀,而非仅最近片段。因此我们称其为 *状态锚点*。有序库 \{A\(1,l\),...,A\(M,l\)\}\\{\\mathbf\\{A\\}^\\{\\(1,\\ell\\)\\},\\ldots,\\mathbf\\{A\\}^\\{\\(M,\\ell\\)\\}\\} 保留单个循环记忆的时间轨迹,防止后续更新削弱或覆盖早期内容。
##### 内容条件锚点元数据。
设 um\(l\)\mathbf\\{u\\}^\\{\\(\\ell\\)\\}\\_\\{m\\} 表示层 l\\ell 下锚点位置 ξm\\xi\\_\\{m\\} 的归一化输入表示。锚点位置仅读取其对齐的状态检查点:
qm\(l\)=Wq\(l\)um\(l\),om\(l\)=A\(m,l\)qm\(l\)。\\mathbf\\{q\\}^\\{\\(\\ell\\)\\}\\_\\{m\\}=\\mathbf\\{W\\}^\\{\\(\\ell\\)\\}\\_\\{q\\}\\mathbf\\{u\\}^\\{\\(\\ell\\)\\}\\_\\{m\\},\\qquad \\mathbf\\{o\\}^\\{\\(\\ell\\)\\}\\_\\{m\\}=\\mathbf\\{A\\}^\\{\\(m,\\ell\\)\\}\\mathbf\\{q\\}^\\{\\(\\ell\\)\\}\\_\\{m\\}。\\quad (3)
相同的输入表示被投影为紧凑路由密钥:
κm\(l\)=Wk\(l\)um\(l\)∈Rdr。\\boldsymbol\\{\\kappa\\}^\\{\\(\\ell\\)\\}\\_\\{m\\}=\\mathbf\\{W\\}^\\{\\(\\ell\\)\\}\\_\\{k\\}\\mathbf\\{u\\}^\\{\\(\\ell\\)\\}\\_\\{m\\}\\in\\mathbb\\{R\\}^\\{d\\_\\{r\\}\\}。\\quad (4)相似文章
Safin-1:通过记忆原生状态演进实现内部安全
Safin-1 提出了一种记忆路由架构,将安全作为基础模型中的内部演进状态嵌入,无需外部约束即可实现自适应安全改进。
面向主动具身安全的Self-Evolving Just-In-Time Memory框架
本文介绍了一种用于主动具身安全的Self-Evolving Just-In-Time Memory框架,结合了Risk-Sufficient Topological Belief Graph、Agency-Grounded Factual Memory和Experience Memory,以在不阻碍任务进展的情况下减轻危险。在IS-Bench上的实验显示Safe-Success率显著提升(例如,在Qwen3-VL-8B上提升30.3%)。
在SAFi中构建和管理AI代理
作者介绍了SAFi,这是一个用于AI代理的开源运行时治理引擎,详细说明了其内存系统(伦理记忆、对话记忆、个人资料记忆、项目记忆)以及实际用例,例如由DeepSeek V4驱动的工作助手。
基于电路锚点的安全进化
本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。
内存安全是生死攸关的问题
作者认为,内存不安全的开源软件极易受到即将到来的人工智能漏洞查找代理的攻击,这使内存安全成为道德义务,并且Rust必须作为领先且零开销的内存安全语言取得成功。