Agentic Data Environments

arXiv cs.AI 论文

摘要

本文介绍了Agentic Data Environments(代理数据环境),重点讨论了从只读代理到可读写代理的转变,这些代理会改变环境并产生后果。文章探讨了代理自动化的价值主张,以及收益与失败带来的灾难性成本之间的不对称性。

arXiv:2607.07397v1 Announce Type: new 摘要:自主代理有望在速度、规模和劳动力效率方面带来显著提升,但其失败可能造成突发的、往往不可逆转的损失。因此,代理自动化的核心挑战是在增加自动化收益的同时限制失败的影响范围。 虽然数据库在现代计算中依然占据核心地位,但代理在更广泛的数据环境中运行,涵盖文件、API、应用程序和系统状态。在本次演讲中,我将概述关于Agentic Data Environments(代理数据环境)的早期工作——即代理运行的执行基础。该环境既能增强代理能力,又能强制执行安全保证。这一视角将数据系统从被动的状态存储重新定义为安全、可靠执行的主动基础。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:56

# 自主数据环境
来源:https://arxiv.org/html/2607.07397
Elaine Ang, Chenxi Huang, Georgios Liargkovas, Jerry Liu, Jinhui Liu, Nikos Pagonas, Charlie Summers, Haonan Wang, Jiakai Xu, Tianle Zhou, Yusen Zhang, Zhou Yu, Zhuo Zhang, Tianyi Peng, Kostis Kaffes, Eugene Wu [![[无标题图片]](https://arxiv.org/html/2607.07397v1/images/daplab-h.png)](https://dap.cs.columbia.edu/), 哥伦比亚大学 \{ra3448, ch4023, gl2902, jl6235, jl7309, np2948, cgs2161, hw2983, ax2155, mz2998, yz5296, zy2461, zz3474, tp2845\}@columbia\.edu, \{kkaffes, ewu\}@cs\.columbia\.edu

## 1 引言

自动化一直以来都是计算领域的承诺。现代大型语言模型[Vaswani2017AttentionIA](LLM)的引入改变了谁(或什么)执行这种自动化。LLM,结合"氛围编程"(vibe coding)、智能体框架和丰富的API生态系统,使非程序员能够部署自主智能体,这些智能体可以操作终端[Merrill2026TerminalBenchBA]、调用API和工具[anthropic2024mcp,anthropic2025claudeskills,google2025a2a]、导航GUI[Xie2024OSWorldBM]、编写代码[Suris2023ViperGPTVI]以及查询数据库[Li2023CanLA,Lei2024Spider2E]。与为用户推荐行动的副驾驶不同,智能体自主地观察数据、规划和执行行动,并观察其效果。这种从读取数据到对数据采取行动的转变,是未来数据管理的核心挑战。

当今的数据智能体主要是只读的。NL2SQL、检索增强型问答和分析智能体观察数据、综合数据并返回答案。一个税务报告智能体可能会检索财务报表和交易记录来估算上个季度的收入;其行动不会对环境产生长期的副作用。这种设计简化了评估,提高了容错性,并限制了潜在的危害。

相比之下,自主自动化会改变环境,并带来真实的后果。当智能体还负责核对财务报表之间的差异、应用税务逻辑并提交正式申报时,同样的税务场景就变得根本不同。每一步既是数据写入,也是一个有后果的行动,例如,修改会计记录、覆盖先前提交的文件、以及提交具有法律约束力的文件。由于突变和后果是耦合的,错误不仅仅是错误的答案:它们可能导致监管处罚、诉讼或合规违规。自主自动化归根结底是一个读写问题:当智能体能够修改数据时,自动化的价值从智能体能完成什么转变为当它们失败时会发生什么。

### 1.1 自动化的价值主张

为了精确地描述这种权衡,考虑自主自动化的核心价值主张:

Value=Benefits−Costs\\displaystyle\\text\{Value\}=\\text\{Benefits\}\-\\text\{Costs\}(1)自动化承诺通过速度、规模和劳动力节省带来巨大的好处。然而,失败的成本在性质和规模上有所不同。好处通过多次成功逐渐累积,但成本是突然的、灾难性的且难以逆转:删除生产数据库[pcmag\_replit\_vibe\_coding\_2025]、触发云服务中断[guardian\_aws\_ai\_outage\_2026]、以及泄露数据[forbes\_samsung\_chatgpt\_ban\_2023,verge\_chatgpt\_gmail\_shadow\_leak,register\_salesforce\_prompt\_injection\_2025,codeintegrity\_notion\_ai\_security]。由于智能体操作的是记录系统,失败可能在检测到之前就已传播。因此,从感知和实践来看,智能体自动化的潜在成本似乎是无限的。

这种不对称性影响了采用。用户并非基于整体表现来校准信任,一个显著的失败案例可能会不成比例地抑制采用[parasuraman1997humans]。前景理论也证实了这一点,该理论发现人类对损失的看重远超过同等收益[kahneman1979prospect]。因此,那些评估自动化的人关注的是最坏情况的结果而非预期性能,那些仅在常见情况下安全的系统对于重要任务仍然不合适。

这意味着“尽力而为”的安全性是不够的,因为如果灾难性后果仍然存在,更高的平均可靠性并不会影响采用。我们既要增加自动化的好处,也要限制失败的后果。这不仅仅是智能体设计的问题,更是一个系统问题:智能体在其中执行的环境以及该环境提供的保证。

### 1.2 从数据库到数据环境

数据库仍然是现代计算的核心组成部分。然而,自动化远不止简单地查询数据库或执行分析。现实世界的任务需要与更广泛的计算栈进行交互,包括应用程序、API、文件、配置系统、命令行工具和外部服务。

###### 示例 1

一个智能体向一个网络服务发送HTTP请求,该请求触发服务器端业务逻辑,进而启动后台任务、调用外部API、写入文件系统并修改数据库。通过这个链条,智能体间接地与多个子系统以及大量不断变化的状态进行交互:服务器进程中的应用程序变量、配置文件、后台任务产生的任务队列和日志、写入磁盘的文件、外部服务的响应以及数据库中的持久记录。结果和影响取决于数据库内容以及周围环境的配置和状态。

这表明,面向自主自动化的“数据管理”必须扩展到数据库之外,包含*数据环境*:即智能体运行和交互的异构资源集合——包括数据湖、文件系统、内存、API、派生产物、进程和系统元数据——以及控制这些状态如何被访问、修改和允许流动的机制。与经典的数据库管理系统(DBMS)不同,数据环境涵盖广泛的数据模型和软件组件,而非单一数据存储。与专注于集成异构数据源的数据空间[Halevy2006PrinciplesOD]不同,数据环境是智能体在其中执行的*有状态基底*。

### 1.3 迈向自主数据环境

一个为智能体而非人类设计的数据环境应该是什么样的?

参见标题图1:本文描述了从面向当今分析型智能体的系统到自主数据环境的转变。现代计算系统已经可以被视为一种*数据环境*。文件系统、数据库、服务和API共同形成了一个共享的状态空间,程序在其中运行。然而,这些环境基本上是*被动的*:它们提供数据并处理计算请求,但并不主动组织信息、指导决策或约束数据流和数据使用。

自主自动化有更高的要求。智能体持续观察、行动并适应数据环境,并且能够推理远超人类能力的大量技术内容。然而,智能体归根结底是数据的消费者和生产者:其决策取决于所用信息的质量以及安全探索其行动空间的能力。因此,支持智能体要求数据环境本身不再仅仅是状态的被动存储。这些*自主数据环境*主动准备信息并管理智能体交互,以支持可靠和安全的自动化。它们的作用是:

- •提升能力。环境必须主动发现、物化、组织并向智能体展示来自异构源(文档、数据库、数据湖、API和系统本身)的信息,其形式能够赋能智能体,而无需开发人员手动构建每个数据管道。
- •限制风险。环境必须提供当今计算栈所缺乏的保证:用于限制失败的隔离和沙箱、跨组件的原子语义和版本控制、用于投机性探索的分支和回滚,以及控制智能体如何使用和转换信息的策略执行。

本文概述了*自主数据环境*的基础。我们根据信息如何变得可用,描述了三个信息管理挑战:在巨大的数据湖中发现智能体相关数据、将数据转换为智能体就绪的表示、以及从环境中收集/生成潜在信号。然后,我们讨论了安全智能体探索所需的基础设施,包括分支和数据安全机制。这些相同环境能力对于训练更好的智能体也至关重要(第4节 (https://arxiv.org/html/2607.07397#S4))。

## 2 自主数据环境以提升智能体能力

为了增加自动化的好处,智能体必须能够访问和推理正确的信息。智能体失败越来越多地是信息失败而非推理失败,即使是最强大的模型,当相关信号缺失、结构不良或无法发现时,也无法解决任务。

数据环境的责任是管理、查找、引出并提供正确的信息、以正确的表示、在正确的时间、为正确的任务。

对于一类新型智能体构建者——那些能够"氛围编程"(vibe code)智能体但没有正式软件开发培训的领域专家——来说,这种需求尤为迫切。虽然他们能够识别相关的数据源或分享领域知识,但将这些信息转化为智能体就绪的表示仍然遥不可及。最终,挑战在于开发者的人机工程学:如何在隐藏数据管理复杂性的同时利用领域专业知识?

关键观察在于,数据消费者不再是人类。传统的数据产品旨在为分析人员忠实地呈现现实。而智能体则将数据视为达到目的的手段:任务成功。数据环境必须从呈现现实转向为智能体准备任务相关的信号。

参见标题图2:AIR为EQA或目标智能体查找相关的数据源,AIM将数据源转化为能力,ADE将缺失的信号物化为新的数据源。参见标题策划信息以改进参见标题。不同场景的主要变量在于所需信息的可用程度。在某些情况下,相关的数据源已知,但对任务而言结构不佳。在其他情况下,信息存在但必须在庞大的异构数据湖中进行发现。最后,所需的信号可能仅环境隐式存在,必须进行推断或物化。

这些场景催生了三个互补的方向。*自主信息管理(AIM)* 将已知的数据源转化为智能体就绪的能力。*自主信息检索(AIR)* 为任务寻找包含所需证据的数据源。*自主数据引出(ADE)* 揭示尚未物化为产物的潜在信号。

### 2.1 自主信息管理:瞄准数据

目前,使数据对智能体可访问的主流方法是将原始数据源转换为向量嵌入以用于检索增强生成(RAG)[longmemeval],或者将它们存储到默认的日志系统[chhikara2025mem0]、文档存储[zhang2025agentic]或文本文件[anthropic2025effective]中。许多人将此类过程称为智能体上下文或智能体记忆整理。这些通用表示强加了一个固定的模式,忽略智能体的任务,并丢失了可能对下游推理至关重要的结构。例如,对对话语料库使用RAG会丢失时间顺序、说话者身份以及跨会话关系,而这些对于问答智能体至关重要。

任务、数据和模型会随时间演变,静态表示很快就会过时。因此,我们提出*自主信息管理(AIM)*,以自动管理信息表示,从而惠益领域专家的目标智能体。给定一个数据源和高层次的专家指导,AIM会提出一个数据模型、模式和提取管道,以捕获那些它认为最能支持目标智能体任务的结构。

###### 示例 2

LoCoMo[locomo]是一个多会话对话数据集,其中两个说话者(例如,Caroline和Melanie)在几个月内进行了19次会话。对话涵盖事件、职业规划、爱好、家庭活动以及不断变化的个人兴趣。AIM智能体不是将这个语料库嵌入到向量存储中,而是读取对话并提出一个针对其预期需求定制的关联模式。例如,智能体可能设计用于Users、Sessions、Messages、Events、Interests\_Activities和Relationships的表。然后,它将会话事实(例如,“Caroline于2023年5月7日参加了一个LGBTQ支持小组”)提取并加载到数据库中,并将SQL技能暴露给该数据库。在查询时,目标智能体只需针对此数据库编写SQL查询。要回答“Melanie用什么爱好来放松?”,它会查询按活动类型过滤的Interests\_Activities,而不是过滤数百条原始对话。

参见标题图3:AIM接收目标智能体、指导、一组工具和数据源作为输入,并生成管道和产物以提升目标智能体的任务质量。具体来说,AIM是一个多智能体系统,它逐步添加结构和任务专业化,同时保持演变能力(图3 (https://arxiv.org/html/2607.07397#S2.F3))。学习阶段分析数据源并为目标用例假设数据模型。模式建模然后在具体的数据系统(例如,RAG、关系数据库等)中实例化模式和约束。数据加载生成一个提取-转换-加载管道,将数据源加载到数据系统中,而精炼执行物理设计以生成视图和索引,实现快速访问。生成的数据库作为一个*数据导向工具*或*技能*暴露给目标智能体,用于检索任务相关信息。每个阶段都由领域专家的高层指导(例如,“最后一个用户应该有用”)提供信息,并且可以使用一组可扩展的工具,这些工具运行在自主数据环境基础设施之上(第3节 (https://arxiv.org/html/2607.07397#S3))。该管道是自主生成的,因此阶段会根据新的指导、任务反馈和源变更而修改。

###### 示例 3

在LoCoMo[locomo]上,AIM的准确性与将完整对话添加到前沿模型上下文中相当,但仅使用了约∼10%\\{\\sim\}10\\%的上下文长度。与专门的智能体记忆系统如Mem0[chhikara2025mem0]和最先进的基于RAG的Octen[octen2025rteb]相比,AIM的准确率分别高出49.8%49.8\\%和15.82%15.82\\%。AIM比最先进的自主记忆系统GAM[gam]快4.18×4.18\\times倍,平均相对准确率高出13.54%13.54\\%。特别是,AIM在时间推理问题上准确率高11.53%11.53\\%,在开放域推理问题上高24%24\\%,因为其结构化表示比文本文件和RAG表示更有效。

#### 2.1.1 研究方向

AIM与自动化数据集成管道的相似性是有意为之。关键区别在于目标:AIM不是预先创建高质量的模式,而是快速引导出一个*智能体可消费的能力*并随时间演变。然而,使用智能体来管理模式和表示引入了挑战。没有“正确”的模式:同一个对话对一个任务可以建模为事件时间线,对另一个任务则可以建模为关系图,不同的提取策略可能表现不一。此外,最优表示并非静态——模型、提示和工具

相似文章

金融服务业中代理型AI的数据准备就绪

MIT Technology Review

本文讨论了金融服务公司如何确保数据质量、安全性和可访问性以成功部署代理型AI,强调该技术的有效性更多取决于强大的数据基础而非系统复杂性。