本体增强蒸馏与情境性审计用于主权企业语言模型:一种结合机制验证与负面结果方法的研究
摘要
本文结合了机制验证研究,针对主权企业语言模型的本体增强蒸馏以及一种情境性审计方法,使用了经过监督微调和DPO适配的Qwen3.6-27B学生模型。结果统计功效不足且为负面,显示未优于前沿基线,且路由中情境性为零。
arXiv:2607.11948v1 公告类型:新
摘要:在数据驻留规则下运营的受监管金融机构需要租户拥有的语言模型,这些模型能够在机构内部运行。本文将两项相关的FAOS研究合并为一篇机制与控制文章。首先,它报告了一项低统计功效的本体增强蒸馏机制验证研究:一个Qwen3.6-27B学生模型通过前沿教师轨迹的监督微调和基于本体的直接偏好优化(DPO),在单个Apple M5 Max上本地训练,使用47个合成英语跨领域偏好对,适配到Foundation AgenticOS本体。在40个留出的越南金融领域任务中,蒸馏学生模型对40个任务中的36个进行了接地(接地率为0.90;在指标下限为0.50的情况下,平均本体术语覆盖度r_onto=0.95),与GPT-5前沿基线持平,该基线也接地了36/40。该结果统计功效不足,无法建立等价性:配对差异的95%置信区间跨度为正负4个任务,且该运行未测试或显示预先注册的放大预测,即学生模型应超越前沿。其次,本文整合了一种用于企业智能体路由的情境性审计方法。在一个单独的负面结果试点中,在本地Qwen运行和明确标记的Gemma复制检查中,所有Phase 1.3组的修正标准Contextuality-by-Default度量为零;有用信号是直接影响和构念耦合,而非残留的情境性。总之,这些研究将一种基于本体的模型构建机制与一种治理诊断相结合,用于决定何时明显的分歧应触发提示标准化、多智能体综合或人工审查。证据不支持可部署性、安全性、优越性、统计等价性,也不支持情境性正向路由规则。
查看缓存全文
缓存时间: 2026/07/15 04:19
# 基于本体增强的蒸馏与情境审计用于主权企业语言模型:一项结合机制验证与负结果方法的研究
来源:https://arxiv.org/html/2607.11948
Thanh Luong Tuan Foundation AgenticOS \(FAOS\)
(2026年7月)
###### 摘要
受数据驻留规则约束的受监管金融机构需要使用租户自有的语言模型,且这些模型必须运行在机构内部边界内。本文将 FAOS 的两项相关研究合并为一篇机制与控制文章。首先,报告了一项低功效的*本体增强蒸馏*机制验证研究:通过前沿教师轨迹的监督微调和基于本体的直接偏好优化 (DPO),将 Qwen3.6-27B 学生模型适配至 Foundation AgenticOS 本体,并在单个 Apple M5 Max 上基于 47 个合成、英文、跨领域偏好对本地训练。在 40 个保留的越南语金融领域任务上,蒸馏后的学生模型在 40 个任务中完成了 36 个任务的落地(落地率 0.90;平均本体术语覆盖率 \(r_{\mathrm{onto}}=0.95\),指标下限为 0.50),与 GPT-5 前沿基线持平(同样在 40 个任务中落地 36 个)。该结果功效不足,无法建立等价性:配对差异 95% 置信区间跨越 \(\pm 4\) 个任务,且该实验未测试或显示预先注册的增强预测(即学生模型应超越前沿模型)。其次,本文整合了一种用于企业智能体路由的情境审计方法。在另一项负结果预实验中,本地 Qwen 运行和明确标注的 Gemma 复制检查中,所有 Phase 1.3 组的修正后规范默认情境度均为零;有用信号是直接影响与结构耦合,而非残留的情境性。两项研究共同将基于本体构建机制的模型与一项治理诊断工具配对,用于判断当出现明显分歧时应触发提示标准化、多智能体综合还是人工审查。该证据既不支持可部署性、安全性、优越性、统计等价性,也不支持情境性正向路由规则。
## 1 引言
越南的金融机构受数据驻留和行业特定规则约束,限制客户数据的处理地点\[越南国会, 2025 (https://arxiv.org/html/2607.11948#bib.bib15),越南政府, 2025 (https://arxiv.org/html/2607.11948#bib.bib16)\]。对于受监管的租户而言,将账户记录或承保文件发送至国外前沿模型 API 并非采购决策,而是合规违规。因此,可在机构内部边界内运行的模型成为部署需求,而前沿模型则充当质量上限而非部署替代方案。这一框架逆转了通常的成本-质量权衡。问题不在于较小模型是否运行成本更低,而在于本地可部署模型能否达到受监管工作所需的落地质量。
早期研究表明,向前沿模型提供领域本体可提高其领域保真度\[Luong 和 Sanyal, 2026 (https://arxiv.org/html/2607.11948#bib.bib19), Sharma 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib6), Liu 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib7)\]。这些研究测量了前沿模型上的效果,但留下了对主权部署至关重要的问题:相同的本体落地能否将更小、可本地部署的学生模型提升至前沿模型在受监管领域任务上的水平?蒸馏后的学生模型在专业领域的参数覆盖面较薄,其本体落地效果可能比前沿模型更重要——从较低基数获得更大相对增益——但未必能在最困难的任务上缩小绝对差距。配套的神经符号研究将这种模式命名为逆参数知识效应 (Inverse PKE):随着模型对领域参数覆盖度的下降,落地价值上升\[Luong 和 Sanyal, 2026 (https://arxiv.org/html/2607.11948#bib.bib19)\]。
本文通过*本体增强蒸馏*(一种两阶段适应方法)研究该问题。学生模型首先在携带注入本体切片的前沿教师轨迹上进行监督微调,然后使用基于本体的直接偏好优化进行调整\[Rafailov 等, 2023 (https://arxiv.org/html/2607.11948#bib.bib22), Hinton 等, 2015 (https://arxiv.org/html/2607.11948#bib.bib23)\]。偏好信号将基于本体的前沿回答(标记为偏好)与未落地的基模型回答(标记为不偏好)配对,使学生模型学习重现基于本体的行为,而非模仿前沿模型的全部参数知识。学生模型为 Qwen3.6-27B 模型\[Yang 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib2)\];训练和评估在 Apple 的 MLX 框架上本地运行于单个 M5 Max\[Apple 机器学习研究, 2025 (https://arxiv.org/html/2607.11948#bib.bib27)\],训练后的学生模型融合为约 14 GB 的四比特检查点,用于部署一致的推理。
在 40 个保留的越南语金融领域任务上,蒸馏后的学生模型在 40 个任务中落地了 36 个——落地率 0.90,平均术语覆盖率 \(r_{\mathrm{onto}}=0.95\)(指标下限为 0.50)——与 GPT-5 前沿基线持平(同样在 40 个任务中落地 36 个)。\(n=40\) 的二元结果无法建立等价性:配对差异 95% 置信区间跨越 \(\pm 4\) 个任务。训练侧测量结果与预期的偏好偏移一致:在单一 epoch 内,偏好准确率从 0 升至 1.0,奖励边际从 0 升至 0.307(基于五对验证划分)。该结果被视为低功效的机制验证,而非部署声明,也非预先注册的增强——该增强预测学生模型*超越*而非等于前沿模型。仅运行了一个绑定门——本体符合性——基于一项指标记录回答是否包含至少一个任务的 ontology 术语(这是一个退化代理,而非已注册的四组件复合指标),且不衡量回答是否完整或正确。偏好数据为合成、仅英文,且来自非目标领域;前沿模型以最低推理努力运行;学生模型匹配而非超越前沿模型;成本、弃权安全性、模型规模以及越南语与英语落地对比等问题均留待全功效评估。
本研究作出四项贡献。首先,明确将本体增强蒸馏定义为一种面向主权企业模型的训练配方,其偏好构建将基于本体的行为与一般前沿模仿区分开来。其次,定义了一项本体符合性指标,在学生模型和前沿模型上通过共享本体切片本地、一致地评分,从而消除了比较中的评判模型方差。第三,诚实地报告验证结果,明确列出当前证据支持的声明以及等待全功效确认的声明。第四,整合了一种用于企业智能体路由的情境审计方法:当同一受监管任务因角色框架、提示顺序或构建措辞而发生变化时,该审计能在平台将任务路由至单响应、提示标准化、辩论、综合或人工审查之前,区分直接影响与结构耦合以及残留情境性。
第 2 节 (https://arxiv.org/html/2607.11948#S2) 将本研究定位于蒸馏、偏好优化和基于本体生成的相关工作中。第 3 节 (https://arxiv.org/html/2607.11948#S3) 描述学生模型、本体切片器、蒸馏管道、评估门系统和符合性指标。第 4 节 (https://arxiv.org/html/2607.11948#S4) 报告保留结果和训练侧机制。第 5 节 (https://arxiv.org/html/2607.11948#S5) 报告整合后的情境审计方法及其负结果。第 6 节 (https://arxiv.org/html/2607.11948#S6) 讨论范围、有效性威胁及后续的全功效评估。
### 联合投稿说明
本稿件将两篇相关的 arXiv-ready FAOS 研究笔记合并为一篇文章。第一篇是主实证部分报告的本体增强蒸馏机制验证。第二篇是企业 LLM 智能体路由的情境审计方法笔记。它们共享相同的应用背景——受监管部署约束下的基于本体企业智能体——此处合并为一篇模型构建加治理文章,而非作为同一主题的变体分别提交。
### 双重用途披露
本研究报告来自一条双重用途实验管线的结果,该管线服务于两个输出:FAOS 平台的内置最小可行主权模型以及本文报告的学术贡献。首席研究员是平台供应商的联合创始人,对可部署工件拥有商业利益。第 6 节 (https://arxiv.org/html/2607.11948#S6) 陈述了这一研究者兼实践者的立场及所采用的缓解措施,包括锁定的保留集、确定性评分以及无需评判模型计算的符合性指标。
该方法还涉及一个明确陈述的反对方立场。微软 AI 的 MAI-Thinking-1 报告认为能力应通过学习而非继承获得,认为通过蒸馏获得的智能缺乏从头训练能力的可操控性和鲁棒性\[微软 AI 团队, 2026 (https://arxiv.org/html/2607.11948#bib.bib28)\]。该反对意见表面上适用于本体增强蒸馏,因此有必要明确说明。三点限制了这一矛盾。该反对意见针对的是对第三方教师的依赖,而非蒸馏本身;同一报告使用了自蒸馏。目标也不同:MAI 项目旨在构建前沿模型,而本工作交付一个必须在数据驻留边界内运行的合规模型,这使得蒸馏成为部署约束的结果而非捷径。然而,可操控性问题确实存在,而用于测试该问题的弃权门——学生模型是否以受控率拒绝分布外提示——属于此处理性暂缓的全功效评估,而非本机制验证。
## 2 相关工作
### 2.1 蒸馏与高效学生模型
知识蒸馏训练紧凑型学生模型以重现较大教师模型的行为\[Hinton 等, 2015 (https://arxiv.org/html/2607.11948#bib.bib23)\]。该技术从分类扩展到语言模型,包括 DistilBERT\[Sanh 等, 2019 (https://arxiv.org/html/2607.11948#bib.bib24)\],以及用于指令遵循的基于偏好的蒸馏(如 Zephyr,它从教师模型的排序输出中蒸馏对齐)\[Tunstall 等, 2023 (https://arxiv.org/html/2607.11948#bib.bib25)\]。工业管线现已发布 Qwen 系列中蒸馏后的开源学生模型\[Wang 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib26)\],低秩适配器使得在商用硬件上实现低成本学生模型适应成为可能\[Hu 等, 2022 (https://arxiv.org/html/2607.11948#bib.bib1)\]。这一系列工作集中于通用能力:学生模型应在广泛基准上跟踪教师模型。本研究提出一个更窄的问题——蒸馏能否将一种特定行为(遵守领域本体)转移到必须在受监管边界内运行的学生模型中。
### 2.2 偏好优化
从偏好中学习始于基于人类反馈的强化学习\[Christiano 等, 2017 (https://arxiv.org/html/2607.11948#bib.bib10)\]及其对齐变体\[Bai 等, 2022 (https://arxiv.org/html/2607.11948#bib.bib11)\]。直接偏好优化 (DPO) 移除了单独奖励模型,直接在偏好和不偏好回答对上进行策略训练\[Rafailov 等, 2023 (https://arxiv.org/html/2607.11948#bib.bib22)\]。本研究的偏好目标既非人类相似性,也非一般有用性,而是本体遵循。偏好回答是基于本体的前沿回答;不偏好回答是同一基模型在无本体切片情况下的回答。该信号将落地行为从教师更广泛的参数知识中分离出来,这正是主权学生模型需要获得的属性。
### 2.3 基于本体的生成
越来越多的研究将语言模型与结构化知识结合。调查报告了大型语言模型与知识图谱的整合\[Pan 等, 2024 (https://arxiv.org/html/2607.11948#bib.bib5)\],神经符号程序则阐述了结合学习与符号表示的更广泛目标\[Garcez 和 Lamb, 2023 (https://arxiv.org/html/2607.11948#bib.bib3), Hitzler 和 Sarker, 2022 (https://arxiv.org/html/2607.11948#bib.bib4)\]。近期系统通过基于本体的检索在推理时实现落地生成\[Sharma 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib6)\],或通过自训练将模型与本体对齐\[Liu 等, 2025 (https://arxiv.org/html/2607.11948#bib.bib7)\];语言模型也被用于构建本体\[Babaei Giglou 等, 2023 (https://arxiv.org/html/2607.11948#bib.bib8)\]。该问题可追溯至符号落地问题\[Harnad, 1990 (https://arxiv.org/html/2607.11948#bib.bib9)\]。本项目的配套神经符号研究测量了前沿模型上的本体落地效果,并报告了逆参数知识效应 (Inverse PKE):当模型对领域的参数覆盖最薄弱时,落地的帮助最大\[Luong 和 Sanyal, 2026 (https://arxiv.org/html/2607.11948#bib.bib19)\]。该结果激发了当前问题。如果落地能补偿薄弱的参数覆盖,那么参数覆盖比前沿模型更薄的蒸馏学生模型,应至少从同一本体中获得同样多的增益——这正是本研究旨在测试的机制。
### 2.4 数据驻留下的主权部署
越南金融监管限制了客户数据的处理地点。2025 年《人工智能法》引入了具有行业过渡期的分层风险制度\[越南国会, 2025 (https://arxiv.org/html/2607.11948#bib.bib15)\],银行沙盒法令规范了 AI 赋能的金融服务\[越南政府, 2025 (https://arxiv.org/html/2607.11948#bib.bib16)\],反洗钱和保险规则对模型中介决策施加了尽职调查和偿付能力义务\[越南国会, 2022 (https://arxiv.org/html/2607.11948#bib.bib17), 越南财政部, 2023 (https://arxiv.org/html/2607.11948#bib.bib18)\]。在这些约束下,租户不能将客户数据路由至国外前沿 API,因此可部署模型必须运行在机构控制的硬件上。设备端框架使得中型模型的本地推理在商用加速器上变得实用\[Apple 机器学习研究, 2025 (https://arxiv.org/html/2607.11948#bib.bib27)\]。受监管买家所映射的治理框架——欧盟 AI 法案、NIST AI 风险管理框架和 ISO/IEC 42001——将可追溯性和控制视为一级要求\[欧洲议会和理事会, 2024 (https://arxiv.org/html/2607.11948#bib.bib12), 美国国家标准与技术研究院, 2023 (https://arxiv.org/html/2607.11948#bib.bib13), 国际标准化组织, 2023 (https://arxiv.org/html/2607.11948#bib.bib14)\]相似文章
使用QQ等式审计大语言模型中的问题顺序效应:机制刻画与饱和警告
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
EDGE-OPD:利用证据引导的在线策略蒸馏内化特权上下文
本文提出了EDGE-OPD,一种针对大语言模型的在线策略自蒸馏改进方法,通过引导式采样和证据掩码来内化特权上下文,同时不损害通用能力,在稀有标记身份设定中取得了成功。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
面向人类与大型语言模型集成的对抗性社会认识论
本文提出了一个对抗性社会认识论框架,用于分析涉及人类和大型语言模型的交流景观中的信任、欺骗和推理链,并概述了审计信任违规的机制。