代理事务:迈向符合ACID的代理系统

arXiv cs.CL 论文

摘要

本文介绍了代理事务的概念,并提出了一个面向LLM代理的符合ACID的代理系统框架,通过实验改进提升了可靠性和一致性,优于最先进的代理。

arXiv:2608.13900v1 公告类型:交叉 摘要:大型语言模型(LLM)代理正在从对话助手演变为通过推理、工具使用、代码生成和工作区操作执行长周期任务的自主系统。随着代理越来越多地在持久环境和多步工作流中运行,它们面临类似于事务数据库系统解决的问题:可靠执行、一致结果、安全并发和持久状态管理。我们引入了代理事务的概念,并提出了一个符合ACID的代理系统框架,通过四个语义保证重新解释经典ACID属性在代理执行中的意义:语义原子性、语义一致性、语义隔离性和语义持久性。这些属性共同为构建可靠的代理系统提供了原则性基础,尽管存在模型不确定性和动态执行环境。为了实例化该框架,我们开发了一个符合ACID的数据代理,通过事务性探索-执行-验证循环、事务性技能中心、基于置信度分歧的验证、语义依赖感知隔离和事务感知语义状态管理来实现这些保证。在广泛使用的基准上的实验结果表明,我们的系统比最先进的代理(包括Claude Code)提高了10.6%。这项工作开启了一个更广泛的研究议程,即扩展事务原则和系统架构,以构建可信赖、可扩展和自进化的AI代理系统。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:06

# 代理式事务:面向符合ACID标准的智能体系统
来源:https://arxiv.org/html/2608.13900
###### 摘要。

大型语言模型智能体正在从对话助手演进为自主系统,通过推理、工具使用、代码生成和工作空间操作来执行长周期任务。随着智能体在持久环境和多步工作流中的操作日益增多,它们面临着类似于事务性数据库系统所解决的挑战:可靠执行、一致结果、安全并发和持久状态管理。我们引入了*代理式事务*的概念,并提出了一个*符合ACID标准的智能体系统*框架,该框架通过四个语义保证重新诠释了经典的ACID属性:语义原子性、语义一致性、语义隔离性和语义持久性。这些属性共同为构建可靠的智能体系统提供了原则性基础,即使面临模型不确定性和动态执行环境。为实例化该框架,我们开发了一个符合ACID标准的数据智能体,通过事务性探索-执行-验证周期、事务性技能中心、基于置信度偏差的验证、语义依赖感知隔离以及事务感知的语义状态管理来实现这些保证。在广泛使用的基准测试上的实验结果表明,我们的系统比包括Claude Code在内的最先进智能体性能提升了10.6%。这项工作为一个更广泛的研究议程开辟了道路,即扩展事务性原则和系统架构,以构建可信赖、可扩展和可自我进化的AI智能体系统。

## 1. 引言

大型语言模型的最新进展展示了其在指令遵循、规划、推理、编码、工具使用和数据处理方面的强大能力[17](https://arxiv.org/html/2608.13900#bib.bib4); [18](https://arxiv.org/html/2608.13900#bib.bib11); [21](https://arxiv.org/html/2608.13900#bib.bib3); [7](https://arxiv.org/html/2608.13900#bib.bib10); [20](https://arxiv.org/html/2608.13900#bib.bib14); [25](https://arxiv.org/html/2608.13900#bib.bib13); [24](https://arxiv.org/html/2608.13900#bib.bib12); [19](https://arxiv.org/html/2608.13900#bib.bib15)。因此,LLM的使用正从单轮对话交互转向长周期生产任务,其中智能体在仓库级工作空间上操作,并在较长时间内自主协调迭代推理、代码执行和基于反馈的优化。我们将这种LLM与执行环境之间以多轮、以任务为中心的交互称为*代理式事务*(参见图1),其中执行操作的是语义任务状态,而非结构化的数据库状态。尽管智能体系统与数据库有本质区别,但它们在确保可靠执行、一致结果、安全并发和持久状态管理方面面临着类似的挑战。受这些相似性的启发,我们设想了一种*符合ACID标准的智能体系统*,该系统重新诠释了经典的ACID属性[5](https://arxiv.org/html/2608.13900#bib.bib7)用于代理式事务:

参见图注 图1\. 符合ACID标准的数据智能体示例。\ 表1\. 代理式事务的ACID属性。与传统的数据库事务不同,智能体事务将非确定性推理与异构的、可能非事务性的影响相结合。所提出的语义约束提交的影响,而不是要求确定性的执行轨迹。
| 属性 | 代理-事务语义 | 系统挑战 | 技术 |
| :--- | :--- | :--- | :--- |
| **原子性** | 一个依赖感知的模型调用、工具调用、文档变更和外部操作的集合。其效果仅在所有必需的操作和后置条件成功时才可见;否则,所有可恢复的效果将被回滚或补偿。 | 智能体工作流是长时间运行的、动态生成的,并且可能调用外部工具。因此,故障可能导致部分更新的工作空间、重复的外部操作或由未完成执行支持的输出。 | 将每个探索-执行-验证周期视为一个语义事务单元,采用提交或重试语义,仅验证效果的提交,以及测试驱动的事务性技能中心。 |
| **一致性** | 执行轨迹可能是非确定性的,但其提交的结果必须满足事务的前置条件、后置条件和证据义务。 | LLM生成的计划在语法上可执行,但在语义上可能无效,原因包括工具选择不正确、主张不被支持、模式或策略违规、观察结果过时,以及用户意图与提交结果之间的偏差。 | 基于置信度的验证机制,集成多种可靠性信号,包括执行错误、决策/代码置信度偏差以及基于LLM的反思反馈,并结合物化的技能重用。 |
| **隔离性** | 并发的代理式事务不得观察或产生语义无效的干扰。它们提交的效果应等效于由声明的隔离级别所允许的执行,同时允许安全的信息共享和协作。 | 冲突不仅限于读和写,还包括提示、内存、中间制品、工具预算、外部副作用和派生的语义状态。此外,冲突通常无法提前识别,因为智能体在执行过程中动态发现资源。 | 通过依赖感知的隔离策略、隔离环境、版本化工作空间和基于验证的状态控制来隔离智能体和操作上下文。 |
| **持久性** | 一旦提交,事务的效果、证据和恢复元数据将跨故障持久化,使其状态能够独立于瞬时LLM上下文进行重建和审计。 | 智能体状态分布在对话上下文、模型输出、工具响应、文件、数据库和外部服务中。模型和提示的演进使确定性重放和先前执行的长期解释变得复杂。 | 通过LLM管理的图谱演进、溯源追踪和版本感知恢复,维护事务感知的内存和仅追加的工作空间。 |

**语义原子性。** 类似于数据库系统将重复的应用程序逻辑封装为可复用的过程和事务抽象,智能体系统越来越依赖于将工具、工作流和领域知识打包成连贯操作单元的可复用技能[1](https://arxiv.org/html/2608.13900#bib.bib2)。我们将*语义原子性*定义为智能体事务将依赖感知的模型调用、工具调用、文档变更和外部操作序列视为单个语义执行单元的属性:其效果仅在所需操作和验证成功后才可见;否则,可恢复的效果将被回滚或补偿。挑战在于智能体工作流是长时间运行的、动态生成的,并且通常涉及非事务性外部资源,部分执行可能导致不一致的工作空间或不支持的结果[3](https://arxiv.org/html/2608.13900#bib.bib8); [12](https://arxiv.org/html/2608.13900#bib.bib9)。例如,如图1所示,传统的编码智能体(如Claude Code)可能直接传播中间决策。相比之下,ACID-Agent将每个探索-执行-验证周期视为一个语义事务,只有*经过验证的更新*才会被提交并传播到后续步骤。

**语义一致性。** 类似于数据库中的一致性保证,智能体系统必须确保提交的结果与预期语义保持一致,尽管可能存在非确定性执行[6](https://arxiv.org/html/2608.13900#bib.bib1)。我们将*语义一致性*定义为智能体事务产生满足任务目标、执行约束和可用证据的结果的属性,即使中间推理轨迹在不同执行中有所变化。这一属性具有挑战性,因为LLM驱动的智能体可能生成语法上可执行但语义上无效的计划,原因包括工具选择不正确、主张不被支持、观察结果过时或用户意图与执行结果之间的偏差。例如,如图1所示,我们的ACID-Agent采用了一种基于置信度的验证机制,该机制集成多种可靠性信号,包括执行错误、决策和代码置信度的偏差以及基于LLM反思的反馈。该机制将其评估建立在探索过程中收集的证据基础上,并在置信度低于阈值时触发优化。

**语义隔离性。** 类似于数据库系统中的并发控制,现代智能体系统越来越多地并行执行多个子智能体以解决复杂任务[21](https://arxiv.org/html/2608.13900#bib.bib3)。我们将*语义隔离性*定义为并发的代理式事务不得观察或产生语义无效的干扰的属性:它们提交的效果应等效于由声明的隔离策略所允许的执行,同时仍然允许安全的信息共享和协作。例如,如图1所示,ACID-Agent将失败重试的中间工作空间状态和交互历史进行隔离,确保不成功的尝试不会传播到后续执行或智能体记忆中。挑战在于,智能体冲突不仅限于传统的数据访问,还扩展到提示、内存、中间制品、工具预算、外部副作用和派生的语义状态,而资源依赖通常在执行过程中动态发现。

**语义持久性。** 类似于数据库系统如何保存事务状态以及AI原生数据库如何利用历史事务来改进未来的执行[23](https://arxiv.org/html/2608.13900#bib.bib5); [11](https://arxiv.org/html/2608.13900#bib.bib6); [17](https://arxiv.org/html/2608.13900#bib.bib4),智能体系统必须将语义状态保留于单次执行之外。我们将*语义持久性*定义为维护提交的执行状态、支持性证据和恢复元数据的能力,这些数据在事务生命周期之后仍然存在,使得未来的执行能够独立于瞬时LLM上下文来重建和解释先前的结果。例如,如图1所示,ACID-Agent维护一个仅追加的工作空间,记录已提交的事务状态,仅使用经过验证的执行单元更新记忆,同时丢弃失败的尝试。这一属性具有挑战性,因为智能体状态分布在对话、模型输出、工具交互、文件、数据库和外部服务中,而不断演进的模型和提示使可靠的重放和长期解释变得复杂。

参见图注 图2\. 符合ACID标准的数据智能体系统概述。\ **贡献。** 总之,我们做出以下贡献:(1) 我们引入了*代理式事务*的新概念和一个*符合ACID标准的智能体系统框架*,该框架将经典的ACID属性扩展到智能体执行,并为设计可靠的智能体系统提供了原则性基础。

(2) 我们提出了一个符合ACID标准的数据智能体系统:(A) 通过将探索-执行-验证周期建模为具有提交或重试语义的事务单元来引入语义原子性,并由事务性技能中心和分阶段执行支持;(C) 通过对关键决策和生成代码的基于置信度偏差的验证来确保语义一致性,集成执行信号和LLM反馈以检测不支持的行为并触发基于证据的重试;(I) 通过自适应协调策略、隔离执行环境和版本化工作空间来调节智能体、上下文和操作之间的依赖关系,从而实现语义隔离性;(D) 通过事务感知的内存、仅追加的工作空间管理以及用于恢复和长周期推理的持久化执行轨迹来实现语义持久性(参见第2节)。

(3) 我们的初步实验结果展示了事务性设计的智能体系统的潜在优势(参见第3节)。我们还提供了将代理式事务扩展到智能体系统全生命周期的开放研究问题(参见第4节)。源代码可在 https://github.com/TsinghuaDatabaseGroup/ACID-Agent 获取。

## 2. 代理式事务

### 2.1. 预备知识

基于LLM的智能体可以通过LLM推理、工具/技能调用和执行反馈的长周期循环来解决任务。我们将这种LLM与环境之间以多轮、以任务为中心的交互称为*代理式事务*。

###### 定义 2.1 (代理式事务)。

一个代理式事务 τ 是一个有界的智能体执行单元,包含智能体与其执行环境之间的一系列有限的LLM驱动交互,旨在完成一项任务。形式上,给定工具集 T 和技能集 S,一个代理式事务 τ=⟨r₁,...,rₙ⟩ 包含 n 个步骤。每个步骤 rᵢ=(cᵢ,aᵢ,fᵢ) 由LLM上下文 cᵢ(包括该步骤可用的 T 中的工具和 S 中的技能)、调用工具或技能的智能体动作 aᵢ 以及来自环境的反馈 fᵢ 组成。事务 τ 仅在执行满足所需任务条件并保持所有语义不变式时才提交。否则,其中间效果将被回滚或补偿,以确保没有无效的副作用残留。

例如,图1展示了一个数据智能体事务。它始于LLM驱动的数据集和模式探索,随后是调用工具、更新工作空间并根据反馈优化决策的迭代分析步骤。每个探索-执行-验证周期构成一个语义事务单元,其效果仅在验证后传播。失败的单元被丢弃或恢复,而不影响已提交的状态。

表1总结了实现代理式事务ACID属性的代表性挑战和技术。

### 2.2. 符合ACID标准的数据智能体系统

数据智能体旨在自动化数据科工作流、从异构数据中提取洞见并管理系统。基于代理式事务原则,我们提出了一个*符合ACID标准的数据智能体系统*,如图2所示,为探索、执行和事务状态演化提供可靠性保证。

图3\. 在10个AgenticDataBench[18](https://arxiv.org/html/2608.13900#bib.bib11)任务上智能体性能在三次运行中的一致性。条形图显示平均性能;误差条显示各任务在多次运行中的方差平方根。SA=Smolagents, DA=DA-Agent, CC=Claude Code, CX=CodeX。➀=Qwen3.5-397B-A17B, ➁=Kimi-K2.5, ➂=Claude Sonnet 4.6。

#### 2.2.1. 语义原子性

我们为语义原子性提出两种机制:一个离线技能中心,将事务保障嵌入可复用技能;以及一个在线分阶段执行框架,通过验证门强制执行提交或重试语义。

**离线技能中心创建。** 在语义原子性下,工具和技能成为具有生命周期的一等事务对象,

相似文章

智能体交易:当LLM智能体遇上金融市场

arXiv cs.AI

本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

TradingAgents:多智能体 LLM 金融交易框架

Papers with Code Trending

本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。