CANONIC:治理即编译

arXiv cs.CL 论文

摘要

本文介绍了CANONIC,一个将内容准入视为类似编译过程的治理框架,通过映射到编译器理论的公理,但基准测试表明,结构检查无法可靠地检测出“slop”(劣质内容)——领域专业知识仍然至关重要。

arXiv:2607.05410v1 Announce Type: cross Abstract: 我们提出了CANONIC:一种受治理的智能系统,能够大规模地将数字制品编译成证据账本。大型语言模型生成散文的速度比任何人检查的速度都快,这种失败被牛津语言命名为'slop',即其2025年年度词汇。CANONIC以编译器决定程序是否格式良好的方式管理内容是否可以进入语料库:机械地,通过语法,在准入边界处。治理简化为三个公理(Triad, Inheritance, Introspection),它们一对一地映射到编译器理论的语法、作用域解析和类型系统层,并且准入是一个可判定的、线性时间的检查。然后,我们通过一个预先注册的跨提供者基准测试,在四种体制下,询问结构准入是否能够阻止slop。结果是否定的:没有散文阅读门能够可靠地区分可靠和不可靠的内容。Slop不是算法计算的属性。它是领域专业知识的判断。因此,治理层不决定slop;它保持记录可审计——每个声明都锚定在一个定义、一个提交和一个证据窗口上,可端到端重现和检查。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:43

# CANONIC:治理即编译
来源:https://arxiv.org/html/2607.05410
Dexter Hadley, MD/PhD,CANONIC 基金会创始人兼主席 · 美国精准医学委员会 AI 主任
founder@canonic\.org (https://arxiv.org/html/2607.05410v1/mailto:[email protected])
(2026 年 6 月)

## 摘要

我们提出 CANONIC:一种受治理的智能,能够将数字制品大规模编译为证据账本。大型语言模型生成文本的速度远超人类核查能力——这种失败被牛津语言命名为 *slop*(劣质内容),并选为 2025 年度词汇。CANONIC 以编译器决定程序是否结构良好的方式——机械地、通过语法、在准入边界——来治理内容是否可以进入语料库。治理可归结为三条公理(三元组、继承、自省),它们与编译器理论的语法层、作用域解析层和类型系统层一一对应,并且准入是一个可判定的线性时间检查。然后,我们通过一个跨四个制度的预注册跨提供商基准测试,询问结构性准入是否能将 slop 拒之门外。答案是否定的:没有任何基于文本阅读的门控能可靠地区分可靠与不可靠内容。Slop 不是算法可以计算出的属性,而是领域专业知识的裁决。因此,治理层并不判定 slop;它只确保记录可审计——每一项主张都锚定于一个定义、一次提交和一个证据窗口,可端到端复现和核查。

### 1 引言

大型语言模型现在生成文本的速度已超越人类核查能力,产生了一类制品——牛津语言 (https://languages.oup.com/word-of-the-year/2025/)\[1\] 于 2025 年 12 月将其正式化,将名词 *slop* 提升为 2025 年度词汇。其根本机制并非异常行为,而是异质语料库上下一词元预测的预期结果——这是 Vaswani 于 2017 年提出的目标 [2],并由 Brown 于 2020 年扩展 [3]:输出针对可信度而非真实性进行优化,当训练数据稀疏、有争议或缺失时,这两个目标便会分叉 [4]。当训练分布包含相关事实时,生成倾向于正确;若不含,则倾向于脱离指称的文体熟练度。这种不对称已在摘要生成、引文生成和临床问答中得到记录 [5]。

这种不对称的下游成本随部署领域的重要性而扩大。一篇错误生成的学生论文可凭单个成绩恢复,而临床医生误读的研究摘要可能传播为治疗决策,未经验证的机器输出拼凑而成的政策分析则可能影响人群 [6]。当前的读者模型中,信任依次扩展至作者、模型、审稿人和出版机构——这一模型是为内容稀缺且可验证的机制校准的;在当代生成速率下,这两个条件均不复存在 [7]。产出现已以数量级超越验证,学术沟通的瓶颈已从综合转向审计。

本文在两种意义上使用 *slop*,而两者之间的差距正是其组织性发现。*结构性*意义是机械性的:从未锚定于指称的内容(而非仅仅是错误信息)。错误信息可被纠正,因为存在一个真实的指称;结构上未锚定的内容则无法纠正,因为它从未被锚定过。*操作性*意义——§5 中的评估以此为核心——是口语化的:专家读者判定为无根据或不实的内容。结构性锚定是可实现的,我们也进行了测量,但它并未捕捉到操作性意义,因为流畅的捏造和伪造数据完全可以被锚定。这一差距是本文的核心。内容是否是操作性意义上的 slop,属于领域专业知识的裁决——是品味问题,而非任何算法可以计算的属性。机器所能做的,是让这种专业知识有一个可汇聚的收敛点:一个 *真相源*,其中每一项主张都可解析为一个已定义的术语、一条已提交的证据和一个已声明的窗口。这个真相源就是 *证据账本*——一条仅附加的、基于 git 的工作记录,且具有分布式特性,任何人都可以克隆并核查——而框架的任务是维护这个账本,而不是做出裁决。

现有的防御手段仅在制品产生后起作用,并且每一种都因结构性原因而失败(表 1):

**表 1 | 针对 AI slop 的事后防御为何失败**。每种常见防御手段都是在生成后应用的,以及它为何无法将 slop 拒于语料库之外。

| 防御手段 | 机制 | 失败原因 |
| --- | --- | --- |
| 检测工具 | “这是 AI 写的吗?” | 轴心错误——标记的是作者身份,而非来源;合法工作也可能是 AI 写的 |
| 披露政策 | 作者声明:“我负责任地使用了 AI” | 无法证明任何事 |
| 人工审查 | 人工检查 | 能捕捉 slop,但无法预防 |
| 风格指南 | 表面格式 | 表面功夫;不涉及证据 |

表中的每一行都在制品已经存在后对其进行事后操作,所列机制均未限制哪些内容被准入语料库。每一行还提出了一个 *错误问题* 的变体。检测询问内容是否为 AI 所写;披露询问作者是否承认;审查和风格询问内容是否读起来好。只要合法学术工作本身也是机器辅助的,这些问题便无一幸存:作者身份不再能区分可靠内容与 slop,因为最好的工作和最差的工作现在是用同一种方式写成的。唯一幸存的问题是更狭窄、更具结构性的:*每一项主张是否都锚定于一个真相源?*

CANONIC 基于 *来源* 而非作者身份进行门控。它从不询问某段落是否由模型撰写;它询问该段落中的每一项主张是否能解析为一个已定义的术语、一条已提交的证据和一个已声明的窗口——这些都是 §3 构建的同一仅附加账本中的条目,是一个读者可以克隆并核查的真相源。锚定并非真实:正如 §5 所示,一个捏造的主张也可以被完美地锚定。但这是机器可以保证的部分,它让领域专业知识有了一份可核查的记录来汇聚,而非面对无法验证的文本。证明这种锚定——机械地、在准入之前——是框架所保证的全部,而 §5 表明,一旦内容无法再根据由谁或由什么产生来分类,这是唯一站得住的轴心。

将验证步骤从读者重新定位到准入处的门控,已有部分先例,而本工作则对其进行泛化。策略即代码引擎(如 Open Policy Agent 和 HashiCorp Sentinel)根据声明式规则准入或拒绝基础设施变更 [8];来源标准(如 C2PA)在捕获瞬间将密码学断言绑定到媒体上 [9];模型和数据卡 [10] 以及研究预注册 [11] 在结果已知之前将声称提交到固定记录中。每一种都是对单一切片、配置变更、媒体文件、披露、实验协议进行门控。CANONIC 的不同之处在于,它依据形式化语法,在已发表语料库的边界处对 *内容制品本身* 进行治理。

有一个先例值得直接承认,因为它与本文的形容词共享:Constitutional AI [12],由 Bai 等人(Anthropic 公司,Dario Amodei 联合创立并领导)提出的对齐方法。名称相近,但机制不同。Anthropic 的宪法是一个 *训练信号*。模型根据一组自然语言原则对自己的输出进行批判和修订,这些由 AI 生成的偏好通过来自 AI 反馈的强化学习蒸馏到权重中。那个宪法是模型范围内的,被吸收到参数中,并且在发生变化时不留下审计轨迹。CANONIC 让模型不受约束;它治理的是 *内容* 是否可被准入语料库,通过形式化的、版本化的约束,在编译器边界处进行检查,并且对其宪法的每一次更改都是一个任何人都可以检查的 git diff。Anthropic 的宪法训练模型,而 CANONIC 的宪法治理机构 [13]。控制点位于语料库边界,而非解码器。我们在 §6 中将 CANONIC 与此及其他相关系统进行定位。

我们的贡献包括:

1. 1. **一种重构**。我们将 *治理视为编译*:准入是在出版前于语料库边界处做出的关于结构良好性的可判定决策,与事后关于真实性或质量的判断在性质上分离。
2. 2. **三条公理与编译器对应关系**。我们给出了一个三公理的治理基础(三元组、继承、自省),并展示它们与编译器理论的三大支柱一一对应:语法、作用域解析、类型系统(§4,定理 1 至 3),且这些公理相互独立(定理 4)且各自承担重要功能(定理 5)。
3. 3. **一个可判定的准入过程**。我们指定了 `validate(scope)`(算法 1)并证明作用域有效性在线性时间内可判定(定理 6),因此准入是机械的通过/失败,而非审稿人的判断。
4. 4. **一个基于 git 的构建**。我们报告了一个月内构建的十个代码库和二十个受治理作用域,其中每一项计数都可解析为一个公共提交,并明确标记了门控不能做什么:它们限定的是不可问责的内容,而非虚假的内容(§3, §7)。
5. 5. **对门控能做什么和不能做什么的对抗性评估**。我们构建了一个预注册、跨提供商的基准测试,并展示,在非对抗合成内容、对抗内容、新领域内容和真实世界内容中,结构性准入、检索基础化和语义判断各自在统计上与真实性无关或可被击败,因此框架的保证是 *可问责性*,而非过滤(§5)。这使 §3 的边界从断言转变为测量,并提供了一张自动真实性过滤失败的地图。

### 2 背景:治理即编译

编译器理论在半个多世纪前就解决了一个结构上类似的验证问题:当时观察到看似正确执行的程序会静默地损坏数据、在意外输入下失败或终止时无诊断,而针对程序员错误的组合空间,临时性的运行时检查扩展性很差。通过 Chomsky 的形式语法层级 (https://doi.org/10.1016/S0019-9958(59)90362-6) [14] 形式化,并由 Knuth 及其机械化的 LR 分析传统 (https://doi.org/10.1016/S0019-9958(65)90426-2) [15] 操作化的回应,将程序有效性重新定义为一种在语言层面而不是在执行过程中发现的属性。缺少必要词元、引用未定义标识符或违反类型或作用域约束的程序在编译时被拒绝,永远不会进入运行时;Aho、Lam、Sethi 和 Ullman 的经典著作 (https://suif.stanford.edu/dragonbook/) [16] 将词法分析、语法分析、语义分析和中间表示检查确立为标准流水线,任何执行语义应用之前,结构有效性在此流水线中被强制执行。

同样的构造也可用于治理。如果有效内容的结构性要求被指定为对类型化制品的形式语法,并且在任何制品被准入语料库之前插入实现该语法的验证器,那么结构上有缺陷的内容不会进入一个需要事后检测、质疑或撤回的退化状态;它在精确的编译器理论意义上是 *畸形的*,拒绝是机械性的而非评价性的。在此重构下,治理是对一种内容语言的编译,其结构良好性条件编码了历史上由事后审阅负责执行的机构要求。CANONIC 是该重构的编译器理论实例化(最初在一篇关于编译器洞察的早期笔记 [17] 中提出),其语法简化为 §3 中发展的三条公理。

### 3 方法:三条公理

CANONIC 的框架源自三条规则,我们在本文中称之为 **三元组 (Triad)**、**继承 (Inheritance)** 和 **自省 (Introspection)** 公理,它们共同构成了系统所有其他属性所依赖的宪法基础。我们称它们为公理而非规则或原则,是因为它们在框架本身内无法从任何更基础的东西推导出来;它们必须作为基础被断言,如同牛津语言这样的词典无法从组成单词的字母推导出单词的含义,而必须将意义锚定于外部的定义行为。图 1 展示了这三条公理共同诱导的四元素闭包模型。

**图 1:受治理作用域的三元组和 SPEC 闭包模型。** 每个作用域包含 *三元组* 的三个必需文件:`CANON.md`(规则)、`VOCAB.md`(定义)和 `README.md`(描述)。可选的第四个文件 *SPEC*(项目根目录下名为 `CANONIC.md`,或本文档的 `PAPER.md`)闭合 `CANON.md` 并可能扩展生成细节。箭头源自自省公理:`CANON.md` 和 `VOCAB.md` 相互闭合,`README.md` 跨越 `VOCAB.md` 并可添加术语,而 *SPEC* 闭合 `CANON.md` 并可添加生成规则。缺少任何 *三元组* 元素的作用域在结构上无效,无法编译。

**公理 0,三元组。** 一个受治理单位必须包含三个文件:`CANON.md`(治理)、`VOCAB.md`(语义)和 `README.md`(描述)。

**公理 1,继承。** 每个 `CANON.md` 必须声明其父作用域。继承链必须在根处终止。继承的规则是最终的。

**公理 2,自省。** `VOCAB.md` 必须定义 `CANON.md` 中使用的每一个概念以及 `VOCAB.md` 本身中的每一个概念。

这三条公理被提出作为本文报告的语料库的 *充分* 治理基础,而非经过证明的完备基础。我们声明它们的两个性质在附录 B 中通过显式反例得到验证:它们是 *独立的*(定理 4,没有任何一条可以从其他几条推导出来)和 *极小的*(定理 5,移除任何一条都会破坏下面发展的闭包性质)。第三个性质 *穷尽性*,即每一条进一步的治理规则都可归结为这三条公理的推论,这是一个在我们大约一个月窗口内的经验观察,而非定理;我们将其表述为一个设计假设,并在 §7 中指出,如果存在一条在三条公理之外的规则,则会证伪该假设。

现在逐一展开每条公理。

#### 三元组公理

一个受治理单位称为一个作用域,而作用域就是文件系统中的一个目录。三元组是使治理成为可能的最小文件集(表 2):

**表 2 | 受治理作用域的三个必需文件(三元组)**。`CANON`, `VOCAB` 和 `README`,以及每个文件的作用。

| 文件 | 角色 | 包含内容 |
| --- | --- | --- |
| `CANON.md` | 治理 | 公理:必须为真的内容 |
| `VOCAB.md` | 语义 | 定义:术语的含义 |
| `README.md` | 描述 | 文档:这是什么 |

需要三个文件是因为治理需要关注点分离。规范文件是规范性的,规定了规则;自述文件是描述性的,解释了作用域的目的;词汇文件则通过确保规则使用已定义的术语来桥接两者。将这些角色合并到一个文档中会引发可预见的失败模式:文档意外地治理、治理意外地描述,或者同一术语在树的不同部分具有不同含义。因此,三元组通过构造强制分离。缺少这三个文件中任何一个的作用域不仅是不完整或已弃用;它在结构上是畸形的,编译器拒绝构建它。

#### 继承公理

作用域存在于层级结构中。位于 `/services/writing/` 的作用域继承自

相似文章

通用智能体的构建式治理

arXiv cs.AI

本文介绍了CUGA的策略系统,一个模块化的策略即代码层,在LLM智能体执行的多个检查点实施治理,无需模型微调即可实现可预测和可审计的行为。