规范增量驱动的数据治理:以规范增量作为湖仓一体数据平台中的变更单元的实证研究

arXiv cs.AI 论文

摘要

本文形式化了规范增量在湖仓平台数据治理中的概念,并展示了一项实证研究,比较了规范增量驱动的工作流程与传统的基于代码的方法。

arXiv:2608.19838v1 Announce Type: new 摘要: 规范驱动开发 SDD 已巩固了规范而非代码应作为管理 AI 辅助工作的主要工件的观点。GitHub Spec Kit 等工具以及 Constitutional SDD 等提案已在软件领域形式化了这一原则,而可执行数据契约文献已将其扩展到运行时模式和质量强制执行。然而,将规范增量(OpenSpec 的核心思想,即每个变更都应产生可审查的需求增量作为数据平台中的变更单元)作为变更单元的处理在实证上尚未被探索,尽管许多数据平台变更是契约性的(新数据集、服务等级协议、指标语义、访问策略)而非纯粹的代码变更。本工作形式化了规范增量概念,根据数据平台变更对增量规范的适用性提出了一个分类法,并定义了一个受控实验,比较规范增量驱动的工作流程与传统的无增量代码拉取请求工作流程。响应变量包括从发现到部署的时间、到达 Silver 和 Gold 湖仓层的缺陷密度、跨工具指标差异以及使用 NASA TLX 测量的审查者认知负荷。本文明确保留了一个演示和实验室部分,用于在真实湖仓环境上的实例化。其贡献不是工具,而是可重现的证据和适用性指南,有助于避免前期过度规范反模式。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:06

# 基于规范增量驱动的数据治理:以湖仓平台变更单元«规范增量»为主题的实证研究  
来源:https://arxiv.org/abs/2608.19838  
查看PDF(https://arxiv.org/pdf/2608.19838)

> 摘要:规范驱动开发(SDD)已巩固了“规范而非代码应作为主导人工智能辅助工作的核心工件”的理念。GitHub Spec Kit等工具及《规范性SDD》等提案已在软件领域形式化该原则,而可执行数据契约文献则将其扩展到运行时模式与质量保障。然而,将规范增量(OpenSpec的核心思想:每次变更都应产生可审查的需求增量)作为数据平台变更单元的实践,至今仍未经过实证检验——尽管许多数据平台变更具有契约性质(新数据集、服务等级协议、指标语义、访问策略),而非纯粹的代码变更。本研究形式化了规范增量概念,提出按增量规范适用性对数据平台变更进行分类的体系,并设计对照实验比较规范增量驱动工作流与传统无增量的代码拉取请求工作流。响应变量包括:从发现到部署的时间、渗透到白银/黄金湖仓层的缺陷密度、跨工具指标分歧度,以及采用NASA TLX量表测量的审查者认知负荷。论文特别设置演示与实验室章节,以展示该方法在真实湖仓环境中的实例化应用。本文贡献并非工具本身,而是可复现的实证证据与应用指南,旨在帮助避免前期过度规范化的反模式。

## 提交历史记录  
作者:Pablo Ramírez Amador Mg [查看邮箱(https://arxiv.org/show-email/be91f171/2608.19838)] **[v1]** 2026年8月20日 星期四 09:38:48 UTC(314 KB)

相似文章