@omarsar0:关于AI代理如何重塑知识工作的新论文。这是一篇不错的关于代理实际改变知识工作的经济学文章。
摘要
本研究使用Perplexity的生产数据来分析AI代理如何重塑知识工作,发现代理将时间和成本降低超过87%,提高质量,并扩大自动化任务的范围。
查看缓存全文
缓存时间: 2026/06/08 23:28
AI智能体如何重塑知识工作:自主性、效率与范围
通讯作者:Jeremy Yang ([email protected]) 和 Jerry Ma ([email protected])
来源:https://arxiv.org/html/2606.07489
摘要
前沿AI系统正从对话式助手转向端到端执行任务的自主智能体,从而弥合智能与实用性之间的差距。利用Perplexity的Search和Computer产品的生产数据,我们通过研究AI智能体如何加速和重塑知识工作来考察这一转变。我们采用基于个体任务的分析框架,该框架中智能体具有较高的固定委托成本,但每一步的边际执行成本较低。该框架预测:智能体接入将可负担的任务边界扩展到更高价值的任务,并弱增加已实现价值;当智能体前的预算约束生效时,剩余价值和价值成本比也会弱增加。转向数据后,我们得到了三个关键实证发现。首先,利用近乎相同的初始查询对作为同一底层任务的自然实验,Computer每次用户会话执行26分钟的自主工作,而Search仅为33秒。Computer自动执行Search用户可能手动编排和实现的子任务分解与执行。因此,Computer将后续查询的分布转向更高级的工作,如验证和扩展。自主性还提高了执行质量,Computer每次查询的不满率比Search低55%。其次,由于自主性优势,Computer在匹配任务上将完成时间从269分钟缩短至36分钟,与仅用Search的人类相比,预估时间和成本分别降低了87%和94%。第三,Computer改变了用户尝试的工作范围:Computer查询更常跨越职业界限,需要更高层次的认知,利用更广泛的专业知识,以复合任务的形式将相互依赖的子任务捆绑到单一查询中,并解锁了同一用户在Search使用中基本不存在的活动。综合证据表明,AI智能体加速工作流程、提升输出质量、降低成本,并拓展自动化工作的广度和深度。
1 引言
AI经济学的核心问题之一是如何重塑知识工作 (agrawal2026economics)。随着模型能力的提升,AI产品正在缩小智能与实用性之间的差距,改变它们融入真实工作流的方式,并创造新的价值来源和新的工作结构。AI与用户行为也在共同演化,产生一个动态变化的格局——AI能做什么、如何被使用以及其下游经济影响是什么。在过去几年里,前沿产品已经从对话式助手发展到副驾驶,再演进到智能体。对话式助手(如聊天机器人)主要支持孤立的信息交互,上下文有限或行动能力不足。副驾驶将这些能力嵌入到现有工具和工作流中,与用户协作在这些工具的界面内完成任务。智能体更进一步:它们在后台连接更广泛的工具,并以很少的人工干预返回完成的工件。这一转变是从AI作为对话式助手到AI作为端到端工作执行引擎,其特点是更高的自主性和更深层次地融入用户的整个数字环境。
我们利用Perplexity的数据,通过比较知识工作在对话式助手与智能体下的完成方式,研究这一转变的影响。作为背景,图1 (https://arxiv.org/html/2606.07489#S1.F1) 将Perplexity的产品组合定位在自主性和上下文的二维空间中。自主性衡量系统在最小人工干预下代表用户规划和执行行动的程度。上下文集成衡量系统从用户环境中读写的能力,包括外部工具和连接服务。我们使用三个Perplexity产品来说明更广泛的图景:
- Perplexity Search 代表基线。2022年发布的Perplexity Search引入了“答案引擎”产品类别:用户提问后,系统从包含数十亿文档的知识库中返回带引用的综合答案。
- Comet Assistant 在自主性和上下文两方面都有进步。2025年,Perplexity发布了Comet浏览器。其旗舰功能Comet Assistant是一个帮助用户在浏览器中获取知识和执行工作的智能体。Comet Assistant通过将交互转移到应用层(大量知识工作已在此发生)使人机集成更加连续,允许AI通过推理和作用于开放网络环境来与用户协同工作。
- Perplexity Computer 在自主性和上下文两方面更进一步。2026年发布的Computer是一个通用智能体编排系统,能够在越来越广泛的环境和时间跨度内执行工作。Computer用户指定一个结果,系统便自主搜索、浏览、编程、创建文档、访问外部服务、将任务委托给下级智能体,并持续努力直到通过现实行动或交付物完成结果。
图1:按自主性和工作流上下文集成划分的AI产品演进。Perplexity的Search代表信息检索与综合的基线;Comet Assistant在交互式浏览器界面上引入更深层的上下文集成和执行;Computer结合了长周期异步执行与更深更广的上下文集成,作为智能体编排器。
本文提供了首个关于从对话式助手向智能体编排转变对广泛知识工作的任务级经济影响的现场证据。我们首先定义一个简单的个体级任务框架,以突出关键经济力量并支撑我们的实证分析。每个任务按其所需步骤数索引,每步代表一个原子工作单元,较长的任务产生弱更大的价值。模型以成本结构变化为中心:相对于对话式助手,智能体通过用自主执行替代手动执行来降低每步的边际成本,但通过委托和验证增加了固定成本。该框架预测,智能体接入将可负担的任务边界扩展到弱更高价值的任务,并弱增加总实现价值;当智能体前的预算约束生效时,总剩余和总价值成本比随之增加。然后,我们通过将Search和Computer分别对应到对话式助手和智能体类别,将框架与我们的实证设置联系起来。
我们围绕四个主题组织实证分析:
- 采用率(第5节 (https://arxiv.org/html/2606.07489#S5))。Computer增长迅速:在研究期(2026年2月27日至5月27日)内,累计查询量达到首周总量的84倍。对10万个分类查询的随机样本进一步描述了用例分布:研究与分析(25.8%)和文档与资产创建(18.6%)占主导,结构化产物(如文档、网站、代码库、电子表格)约占预期输出的三分之一。
- 自主性(第6节 (https://arxiv.org/html/2606.07489#S6))。由于同一用户在同一时期内与两种产品互动,我们利用匹配的会话作为自然实验来控制用户和任务异质性。在1万个初始查询近乎相同(余弦相似度>0.99)的会话对中,Computer每会话执行26分钟的自主规划和执行,而Search仅为33秒,机器工作量增加48倍。对来自1千个多轮匹配会话的后续查询进行分类显示,Computer用任务验证和扩展取代了手动指令。更高的自主性并未以质量下降为代价:在下一轮不满意信号上,Computer在1.3%的查询中引发中高程度不满意,而Search为2.9%,降低55%。
- 效率(第7节 (https://arxiv.org/html/2606.07489#S7))。在相同的匹配会话中,仅使用Search的人类平均需要269分钟完成一项任务。用自动执行替代手动执行后,Computer+人类工作流将平均任务完成时间缩短至36分钟,时间和成本分别降低87%和94%。盈亏平衡分析表明,要匹配Computer+人类的成本,一个Search辅助的专业人类需要将所有手动步骤完成时间控制在20分钟以内。敏感性分析进一步证实了对人类时间估计变化的稳健性。这些结果通过独立的LLM驱动程序和用户访谈进行了交叉验证。
- 范围(第8节 (https://arxiv.org/html/2606.07489#S8))。自主执行还扩展了用户尝试的工作范围。横向:基于8000名用户(跨8个职业集群)及其所有查询的样本,Computer查询比同一用户的Search查询更常涉足用户的主要职业之外。这一模式在所有8个职业集群中均成立,平均差距为9个百分点。纵向:任务难度也不同。对来自5000名双产品用户的1万个Computer和Search查询进行分类表明:
- (a) Computer查询认知复杂度更高:71%为抽象非例行任务,而Search为53%;76%为高层次的Bloom认知分类,而Search为55%;Create级工作占Computer查询的50%,而Search仅为26%。
- (b) Computer查询所需能力范围更广:每次Computer查询平均需要2.40个不同的O*NET知识领域,而Search为1.74(+38%),Computer需要三个或更多领域的可能性是Search的近三倍(51%对17%)。
- (c) Computer将更多任务组合到单一查询中:在任务活动层面,Computer查询平均涉及2.95个O*NET广义工作活动,而Search为2.24(+32%);中等工作活动为4.01对2.87(+40%);在更细粒度上差距更大,详细工作活动多59%(3.64对2.29),特定职业任务陈述多60%(3.81对2.38)。
- (d) Computer为用户解锁了新的任务可能性:23%的Computer查询涉及至少一个从未出现在同一用户Search查询中的O*NET任务陈述。在较粗粒度上比例较小(详细工作活动为5%,中等和广义工作活动不到1%),表明Computer的独特性在于细粒度的执行工作,而非粗略的主题范围。随着容忍阈值的放宽,这些比例也会增加。
综合来看,这些发现表明自主任务执行加速了现有工作流、提高了质量、降低了成本,并扩展了用户承担的工作范围。通过自动化需要专业技能的任务中的生成性组件,智能体使用户更容易涉足其核心能力之外的领域,并承担生产成本高但相对容易验证的任务。随着个体工人吸收以前跨越职业界限和专业技能水平的任务,这些发现还表明协调成本降低,对职业和组织结构具有更广泛的影响。
论文结构如下。第2节 (https://arxiv.org/html/2606.07489#S2) 将我们的贡献定位在AI生产率影响、自主智能体能力和任务重组方面的先前研究中。第3节 (https://arxiv.org/html/2606.07489#S3) 发展一个个体级基于任务的概念框架,以推导福利预测并为实证分析提供动机。第4节 (https://arxiv.org/html/2606.07489#S4) 描述在2026年2月至5月研究期间从Perplexity的Search和Computer产品中抽取的样本。第5、6、7和8节依次呈现四个实证主题:采用增长与用例;匹配会话上的自主性收益;任务时间与成本的减少;以及工作范围的扩展。第9节 (https://arxiv.org/html/2606.07489#S9) 讨论局限性和启示。证明、说明命题的数值例子以及补充分析和用户访谈资料收集在附录中。
2 相关工作
AI助手的生产率影响。越来越多的实验证据记录了生成式AI助手对生产率的影响。例如,noy2023experimental发现,在对453名专业人士的随机实验中,ChatGPT将写作时间减少40%,并将输出质量提高18%,其中能力较低的工人受益最大。brynjolfsson2025generative研究了5172名客户支持代理,报告每小时解决问题数量增加14%,同样新手工人受益不成比例。dellacqua2023navigating发现,使用GPT-4的BCG顾问在模型能力前沿内的任务上提高了高达40%的表现,但在超出能力前沿的任务上表现更差,这是一个“锯齿状前沿”,凸显了任务与工具匹配的重要性。在更大规模上,cui2024effects在4867名软件开发人员中进行了三项现场实验,发现GitHub Copilot将完成的任务增加了26%,初级开发人员受益最大。一个值得注意的反例来自becker2025measuring,其随机试验发现,使用AI工具的经验丰富的开源开发人员速度慢了19%,表明生产率提升可能取决于任务熟悉度和开发者专长。相关的是,vendraminelli2025genai记录了一种“GenAI墙效应”,其中AI辅助未能缩小职业内部人员与外部人员之间的表现差距,突显了通过交互式工具进行横向专业知识转移的局限性。超越对照实验,tamkinmccrory2025productivity直接从大规模Claude使用日志中估算生产率提升,发现在一系列更广泛的任务上节省了80%的时间。这些研究的重点是人与AI助手交互式工作,AI助手增强每个步骤。我们的设置不同,因为Computer用异步委托取代了交互循环。
从辅助到自主AI智能体。从交互式助手到自主智能体的演进是由工具使用和多步骤推理的进步推动的。schick2023toolformer示范了…
相似文章
AI 代理如何重塑知识工作(18 分钟阅读)
本文介绍了 Perplexity 与哈佛商学院合作研究的结果,探讨了像 Perplexity 的 Computer 这样的 AI 代理如何重塑知识工作,显示出在降低成本的同时提高了自主性、效率和范围。
AI代理如何重塑知识工作:自主性、效率与范围
本研究使用Perplexity的生产数据,比较AI代理与对话式助手,发现代理将完成任务时间减少87%,成本降低94%,同时扩展了知识工作的范围和质量。
AI 代理是否不仅改变了你的工作速度,还改变了你的工作方式?
作者反思了 AI 代理如何通过减少前期规划并鼓励更多实验来改变工作习惯,从而影响思考和决策。
AI智能体可能成为自互联网以来最大的生产力转变
本文认为,AI智能体通过从回答问题转变为完成任务,代表了生产力的重大转变,并讨论了当前的使用案例和瓶颈。
@omarsar0: 关于代理超越代码生成的好报告。以下是它为何重要:编程代理提高了代码产出量。T…
一份报告综合了现场研究,论证了虽然AI编程代理增加了代码产出,但在交付可靠软件方面,收益因审查、集成和成本管理的瓶颈而缩减。