智能体框架的演进(10分钟阅读)
摘要
这篇文章探讨了AI模型与框架的同步演进如何显著提升智能体能力,使框架角色转向聚焦人类注意力接口。
当模型能力与智能体框架同步发展时,AI模型得到显著改进。最初,像ChatGPT这样的模型仅依赖下一个词元预测,但更新框架系统使其能与数字环境交互。随着模型吸收更多框架能力,焦点转向优化人类注意力,创建一个辅助人类交互和决策的接口,无需模型过度依赖框架。
查看缓存全文
缓存时间: 2026/08/24 15:46
# 智能体框架的演进
来源:https://www.latent.space/p/attention-interface
2025年圣诞前后,AI工程师们注意到智能体发生了变化。它们开始真正运作了!原因难以确切追溯。也许是因为终于有了假期时间来测试搭载最新模型的智能体;也许是模型跨越了某个**能力阈值**;又或许是**模型外围框架**已经成熟。
本文将论证:这是后两种因素共同作用的结果。**模型与框架同步改进**,它们的提升曲线恰在关键时刻相交。这种动态发展预示着接下来的趋势:模型不断将框架功能吸收进自身权重,工程师持续删除已被吸收的模块,**最终留存的是面向人类注意力的框架,而非服务于模型的框架。**
Transformer发明者之一Lukasz Kaiser在六月的《无监督学习》节目中提到:
> “去年冬天——圣诞节前后的变革确实难以明确界定。我是说,框架有所改变,后训练方式也有调整,随后新的预训练模型出现了……但这感觉像是一次**巨大跃迁**,难以简单归因。”
**“发生了什么”**的答案不仅存在于模型权重中,更在于围绕权重建立的整个系统。
**答案就在智能体框架中。**
回想2022年11月,当时ChatGPT是最先进的AI工具。它仅具备下一token预测能力,以及一些让它表现得像有用助手的基于人类反馈的强化学习(RLHF)。没有工具,没有搜索,也没有推理功能。
最初的ChatGPT受限于其训练数据和你输入的提示词。仅此而已。**它如同培养皿中的大脑。**
智能体框架是让大语言模型**突破这种限制**,与真实数字信息空间交互的机制。
**智能体框架包含模型权重之外使智能体运作的所有要素。**环绕模型的环境、工具、上下文和安全边界。没有框架,模型就像培养皿中的大脑。它能进行认知决策,但需要框架在真实数字空间中执行这些决定。
**框架赋予模型思维以躯体。**有了框架,模型才能感知(上下文)、行动(工具)、保持信息(记忆与压缩),并执行其边界规则(权限与安全边界)。
两条曲线贯穿模型/框架的演进历程。**框架对模型的期待,与模型实际能交付的能力之间的差距,决定了智能体的有效性。**而这种差距的缩小,正是Lukasz Kaiser提到的智能体实现显著提升的关键。
差距分阶段缩小的过程如下:
1. **ReAct——“纸面框架”**(2022年10月):ReAct(https://arxiv.org/pdf/2210.03629)是一种引导模型通过提示进行推理的技术。它是纸面上的智能体循环,独立于模型权重。它定义了“智能体循环”的概念:模型推理→行动→观察→重复。**ReAct循环仅作为提示方法存在。**提示是当时唯一的推理手段,尚未被称为“框架”。同一年的Toolformer(Meta,2023年2月)暗示工具使用可以通过训练而非提示来实现。这有点像艾伦·图灵在计算机被物理实现之前提出的想法。一个强大的理念直到后来才得以显现。(ReAct比ChatGPT早一个月——2022年10月对比2022年11月)。此时两条曲线都接近零。差距很小,因为我们才刚刚开始。
2. **AutoGPT/BabyAGI——“过早的自主性”**(2023年春季):AutoGPT/BabyAGI出现时,框架曲线远超模型能力曲线。两者都赋予模型完全自主权,要求模型扮演“自主员工”,但当时的模型本质上仍是脆弱的下一token预测器。**循环不会为模型增加能力。**循环只能放大模型已有的能力,而在能力阈值之下,循环会放大错误而非可靠性。考虑复利的负面效应:95%的单步可靠性在20步任务中仅有约36%的平均成功率。框架赋予模型一项它不可能完成的任务。**此时差距达到最大**,接下来的18个月都是为缩小这一差距而进行的调整尝试。
3. **Cursor/Copilot——“退回人机协同”**(2023-2024年):首批AI驱动的IDE认识到了给予模型过多自主权的失败模式。它们通过降低框架曲线至模型曲线下方来缩小差距。**不让模型直接掌控循环;而是让人类掌握循环**,在模型加速人类工作的同时,由人类来协调整个循环。Devin的第一版试图将自主权交还给模型。Answer.AI团队(https://www.answer.ai/posts/2025-01-08-devin.html)的测试显示这仍为时过早,成功率仅约15%。这证明了从IDE转向放弃完全自主并非怯懦,而是正确的策略。然而,在主流策略是降低框架的同时,**模型持续改进**。2024年底,随着o1(首个推理模型)的发布,差距首次**反转**,我们开始看到模型能力出现盈余的迹象。
4. **Claude Code——“曲线相交”**(2025年2月):2024年底的反转创造了必须被抓住的机遇:如果模型已领先于框架,那么有意限制模型的框架就是在浪费能力。**Claude Code是第一个为抓住这一机遇而构建的编码智能体。**它放弃IDE转向终端,赋予模型bash和文件读写权限,并用**权限规则**取代了对每次变更的人工审批。模型重新掌控了循环,而这一次它理解了任务。**Boris Cherny及其团队在构建Claude Code时,考虑的是下一代模型的能力,而非当前模型。**它的成功并非因为它是首个赋予模型自主权的产品,而是因为它在**正确的时间**做到了这一点。这个时间点就是**模型足够可靠以在自主状态下成功的交叉点**。Claude Code在六个月内增长至约10亿美元年经常性收入,这一切都源于Anthropic抓住了曲线开始相交时的机遇。
接下来的发展是:曲线不仅相交,而且开始**交织**。
**如今框架很重要,并且我们可以量化其重要性。**Harness-Bench(https://arxiv.org/html/2605.27922v1)在相同106项任务上对同一模型使用不同框架进行测试,得分范围从52.4到76.2:在模型零改动的情况下产生了23.8分的差距。**智能体的一半是框架。**
OpenAI在ARC-AGI-3测试中通过框架调整取得了类似结果(https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/)。仅添加保留推理和压缩功能,GPT-5.6 Sol在ARC-AGI-3的得分就从13.3%提升至38.3%,实现了三倍增长。
底层发生的是,强化学习(RL)已迁移到**框架内部**。正如OpenAI在2025年5月codex-1发布公告中所说:“codex-1是通过在多种环境中的真实编码任务上进行强化学习训练的。”
**两条曲线合二为一,开始作为一个统一系统交织发展。**
这正是Toolformer理念在现实中的实现。工具调用不再是从外部提示,而是通过模型的**环境**内部训练获得。
随后,当模型在框架环境中被训练时,**它们开始将框架能力吸收进模型权重**,例如学习如何根据自身上下文窗口进行自动压缩。
GPT-5.1-Codex-Max发布公告:
> “首个通过压缩原生训练以跨多个上下文窗口运行的模型。”
**一旦模型吸收了框架能力,框架就可以剥离脚手架。**这是通过简化实现的生产化。Anthropic的Thariq Shihipar表示,团队最近删除了Claude Code系统提示词的80%(https://x.com/trq212/status/2080710971228918066?s=20)。
衡量智能体框架演进速度的标准是**能够删除多少框架组件**,同时保持相同能力水平。这是我们AI工程师需要努力构建的未来。
这就是模型/框架演进的循环:**训练**→**吸收**→**剥离**→**重复**。模型不断攀登向下一个尚不能完成的任务跃迁。
Kaiser指出的跃迁之所以难以界定,是因为它不是离散事件。预训练跃迁之所以明显,是因为你可以在模型卡片中阐明它。而模型/框架的共同演进跃迁则不那么明显,因为没有记录这一演进过程的文档。这就是去年冬天跃迁的答案:**它发生在模型与框架协同工作的空间之中。**
我们需要思考:如果每个框架能力最终都会被模型吸收,这会给我们留下什么?
持续删除一切模型能吸收的东西。想象那个过程结束时你的智能体会是什么样子。当你删除了一切,手中还剩下什么?
模型权重接下来会吸收什么?多智能体编排、工具选择、记忆……仅举几例可能性。研究人员正在构建可自我改进的框架(https://arxiv.org/html/2606.09498v1),这些框架本身可以以类似模型的方式进行训练。
在这一删除与吸收过程最终留存的,是**以人类为中心的智能体能力**。诸如**权限、身份、信任和可理解性**等。将权限吸收进自身的模型实际上溶解了权限。吸收不会终结框架,而是反转了框架。
***框架成为了智能体与操作它的人类之间的接口。***
框架最初是人类与模型之间的接口。我们从聊天框发展到IDE,再到终端。如果模型吸收了面向计算机的能力,下一阶段的演进将上升到更高的抽象层次。框架成为模型与我们人类注意力之间的接口。
它成为了**注意力界面**。
Ryan Lopopolo在Latent Space的“为Token亿万富翁打造的极致框架工程(https://www.latent.space/p/harness-eng)”一集中说道:
> “唯一根本稀缺的东西,是我团队同步的人类注意力。”
Token变得丰富且可靠,然而**我们仍然受限于稀缺的人类注意力**。
我们已经看到这方面的苗头,例如Anthropic的长期运行的智能体进度文件和智能体审批队列。
当模型吸收框架后,模型与框架曲线之间的差距并不会消失。它跨越人类边界迁移,形成了新的曲线对与新的差距。**新差距**存在于智能体对*人类*的期待与**人类能够回应的能力**之间。
我预测在一年内,**每家构建智能体AI的公司都将发布人类注意力策略界面**,就像每家智能体AI公司都发布了AGENTS.md(http://agents.md/)一样。
AGENTS.md告知智能体如何与你的代码库协作。**注意力界面将告知智能体如何与*你*协作。**它将规定何时可以打扰你,何时应继续工作,哪些决定可以独自做出,哪些需要你的批准。并且像智能体系统中的其他所有事物一样,**它将成为系统中一个可通过更多数据学习的组件。**每一次修正都会成为有用的数据。
模型最初是培养皿中的大脑。框架赋予大脑一具躯体,随后躯体开始溶解于大脑之中。我们需要构建的是任何未来模型都永远无法吸收的东西:通向唯一真正稀缺资源的接口:***人类注意力。***
相似文章
什么是Harness?
本文通过将AI代理的'Harness'与登山安全带进行比较,来解释其概念,详细介绍了系统提示和工具等组件,这些组件使AI模型能够作为代理运行。
重新思考智能体工具框架进化的评估
本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。
Own the Loop:Agent Harnesses 现场指南(5分钟阅读)
随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。
HarnessX:可组合、自适应且可演进的智能体夹具工坊
HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。
AI 工具问题的答案(2分钟阅读)
文章认为,AI 工具服务于两个不同的目的——提供关于用户想要什么(意图)的上下文和如何实现它的指令(执行)——并且这两者会随着时间推移而价值变化:随着模型改进,执行指令的价值下降,而意图上下文的价值上升。