JarvisBench: 人类与智能体之间始终在线的智能
摘要
JarvisBench 引入了一个用于评估人类与 AI 智能体之间协调的基准,重点关注长期任务中的注意力分配。它提供了一个带有全双工语音接口的参考实现。
arXiv:2608.14870v1 公告类型:新
摘要:长期智能体可以持续执行,但人类注意力仍然是间歇性和稀缺的。这产生了一个双向协调问题:用户可能需要在后台工作持续进行时立即访问智能体,而智能体可能在用户停止监控执行后遇到需要用户判断的重要决策。我们假设一个始终在线的注意力协调层——\textit{Jarvis}\footnote{以《\textit{钢铁侠》中的虚构 AI 助手命名。}——它调解这个接口并分配人类注意力到一个或多个工作智能体。我们引入 \textit{JarvisBench} 来评估这种协调的两个方向:中介是否能够准确及时地回答用户关于正在进行的工作的发起的问题,以及是否能够识别智能体需要用户判断的时刻,适时征求该判断,并将其路由回以改善任务结果。JarvisBench 包含 45 个智能体任务实例:20 个单智能体任务和 25 个工作流,组织成 10 个多智能体项目。这些任务跨越 19 个领域,是从 2,000 多个公共候选中选择并调整而来的。关键的是,对用户注意力的需求在执行过程中自然产生,而不是源于初始提示中的明显遗漏。JarvisBench 旨在与任意智能体运行时集成,无需修改其底层执行循环。我们的参考实现进一步提供了一个全双工语音接口,允许用户自然地与 Jarvis 交互,同时及时的注意力协调支持在后台工作的智能体。通过将智能体执行与注意力协调分离,JarvisBench 提供了一个稳定的评估目标,随着智能体能力的不断提升。
查看缓存全文
缓存时间: 2026/08/18 10:12
# JarvisBench:人机智能体间的永不下线协作
来源:https://arxiv.org/html/2608.14870
###### 摘要
长时智能体可持续执行任务,但人类注意力仍呈间歇性且稀缺。这造成了一个双向协调问题:用户可能需要即时访问智能体,而工作仍在后台进行;智能体则可能遇到需要用户判断的关键决策,而此时用户已停止监督执行。我们提出一个永不下线的注意力协调层——Jarvis111灵感源自《钢铁侠》中的虚构AI助手——作为人机接口并协调用户注意力分配于一个或多个工作智能体。我们推出JarvisBench来评估这种双向协调能力:评估中间层能否准确及时地回答用户发起的关于正在进行的工作的问题,以及能否识别智能体何时需要用户判断、在正确时机征询判断,并将其反馈以改善任务结果。JarvisBench包含45个智能体任务实例:20个单智能体任务和25个组织为10个多智能体项目的工作流。任务涵盖19个领域,从超过2000个公开候选任务中筛选改编。关键在于,用户注意力需求在执行过程中自然产生,而非源于初始提示的明显遗漏。JarvisBench设计可与任意智能体运行时集成,无需修改其底层执行循环。我们的参考实现还提供了全双工语音界面,让用户可自然接触Jarvis,同时及时的注意力协调支持后台工作的智能体。通过将智能体执行与注意力协调分离,JarvisBench为持续提升的智能体能力提供了稳定的评估目标。
代码:https://github.com/cchen1436/JarvisBench 视频演示:https://cchen1436.github.io/jarvis
## 1引言
智能体能力正在快速进步,但人类注意力并未同步提升。现代智能体已能自主完成广泛的长时任务。然而更高的自主性和并行性对及时的人类注意力产生了日益增长的需求:缺乏时,智能体可能朝错误方向无约束地运行,偏离其应服务的人类需求。
这种注意力错配问题双向存在。当智能体工作时,用户想提问或提供指导常需中断其执行。频繁中断降低效率,且将短暂对话混入智能体的工作上下文。另一方面,当智能体遇到需要人类判断的决策时,它无法确保用户正在关注。智能体往往别无选择,只能猜测并继续。待用户返回时,该决策可能已影响后续工作。
让工作智能体主动暂停并寻求用户关注看似自然解决方案。然而近期研究6 (https://arxiv.org/html/2608.14870#bib.bib1);13 (https://arxiv.org/html/2608.14870#bib.bib2);2 (https://arxiv.org/html/2608.14870#bib.bib3)指向相同结论:主动性是独立能力,当前智能体对此校准不足。这不足为奇,因当前智能体主要为任务完成而训练和评估,而非为决定何时将间歇性可用的用户纳入执行过程。此外,智能体主动性仅解决智能体到用户方向;它未为用户提供在智能体工作时可随时提问或指导的连续界面。像Jarvis这样的永不下线助手协调双向:它持续可用于实时语音交互,并将稀缺的用户注意力引导至正在进行的智能体工作中所需之处。
Codex5 (https://arxiv.org/html/2608.14870#bib.bib4)和Qoder7 (https://arxiv.org/html/2608.14870#bib.bib5)的近期更新向这种Jarvis式设计迈进,使用户能连接到正在进行的智能体工作。两者都允许用户通过随时可用的界面查询或操控工作中的智能体;Codex支持语音交互,而Qoder进一步在需要用户输入时通知用户。然而,现有基准均未评估这种双向注意力协调问题。为填补此空白,我们推出JarvisBench,包含从超过2000个公开候选任务中筛选改编的20个单智能体任务和25个组织为10个多智能体项目的工作流。在每个任务中,用户注意力需求并非通过在初始提示中省略必要约束来人为制造;相反,关键决策点随工作展开自然出现,并需要及时的用户输入以保持执行与用户需求一致。我们为中间层定义了互补的评估轨道,各对应一个注意力协调方向:
- •智能体协作轨道评估智能体到用户方向:Jarvis能否识别正在进行的工作何时暴露出关于用户需求的不确定性、及时介入并获得用户关注,以帮助工作智能体实现更佳结果。
- •用户交互轨道评估用户到Jarvis方向:Jarvis能否提供永不下线的访问,并在不中断进行中的智能体执行的情况下正确回答广泛的用户问题。
我们的实验表明,注意力协调可跨不同工作模型迁移:以GPT-5.6-Sol作为Jarvis时,每个完成的工作智能体配置均获提升,单智能体任务提升4.9–24.7分,多智能体任务提升12.5–28.2分。然而提升幅度在不同工作模型和Jarvis大语言模型间差异显著,表明Jarvis并非被动消息路由器:它必须理解展开的工作、识别人类判断何时重要,并将该判断转化为有效干预。GPT-5.6-Sol实现最强的任务提升和最高用户交互得分,而评估配置揭示了注意力效率、响应质量和观测延迟之间的不同权衡。因此我们的原型作为参考控制系统而非最终设计。当需要干预时,它在动作边界暂停工作智能体、取消待定动作,并在执行继续前注入有范围的软性指导。确定适当的干预强度仍是未决问题,因结果质量的潜在提升必须与人类注意力和对工作智能体执行的干扰相平衡。
## 2基准概述
参见图1标题JarvisBench概述。Jarvis提供用户交互的永不下线界面,同时通过任务事件和注意力请求协调用户注意力与冻结的智能体运行时。### 2.1基准设置
JarvisBench分离三个角色:用户、Jarvis和一个或多个工作智能体(图1 https://arxiv.org/html/2608.14870#S2.F1)。工作智能体执行任务。用户拥有意图、偏好、权限、私有上下文和验收判断;为可控评估,此角色由具备冻结任务特定用户档案访问权的大语言模型模拟。Jarvis连接双方:它对用户保持可用、观察有界任务事件,并将用户指导传回相关智能体。Jarvis不解决任务、不使用工作者工具或替代其计划。
每个情景提供足够公共信息让智能体开始并完成大量工作。用户拥有信息单独存储,其相关性仅在执行暴露关键决策后才具体化。Jarvis通过有界任务事件和狭窄指导接口附加于智能体运行时外部。这保持工作者及其底层循环固定,同时允许相同注意力协调协议跨不同运行时运作。JarvisBench通过两种执行拓扑实例化此设置;评估协议分别定义了两个评估轨道及其指标。
### 2.2单智能体任务
单智能体套件包含跨15个领域的20个多步骤任务,涉及7种注意力需求形式。每个任务跟踪单个工作智能体完成完整轨迹,测试Jarvis能否识别该轨迹何时达到用户拥有的决策点。当需要干预时,Jarvis在执行边界暂停工作智能体,并向用户提出一个聚焦问题。待定动作被取消,响应作为有范围的软性指导注入,执行随后在不丢弃已完成工作的情况下继续。工作智能体可独立完成大量客观工作,但用户对齐的结果需要及时的用户输入。这种事件驱动公式允许相同协调协议自然扩展至更长的智能体运行。完整任务和交互机制分解见附录。
### 2.3多智能体任务
多智能体套件包含10个项目:五个含两个工作流,五个含三个。每个项目构成一个基准情景,由贡献于单一共同结果的耦合工作流组成,而非并列放置的不相关任务。它们的交互暴露出项目级决策,其相关性仅随工作发展才变得清晰。这些任务评估Jarvis能否识别人类判断的共同需求,并将获得的指导返回工作智能体。JarvisBench指定任务、交互边界和评估目标,而不规定特定多智能体编排或控制架构。
## 3评估轨道与指标
JarvisBench对相同底层任务使用两个轨道。智能体协作轨道询问人类注意力是否改善智能体结果,而用户交互轨道询问Jarvis是否在用户联系时保持有用。
### 3.1任务结果得分
每个智能体情景获得0–100分的任务结果得分。每个任务定义一组冻结的加权检查点:
Si=100∑jwijcij,S\_{i}=100\sum\_{j}w\_{ij}c\_{ij},\(1\)
其中cij∈[0,1]c\_{ij}\in[0,1]是任务ii的检查点jj,且∑jwij=1\sum\_{j}w\_{ij}=1。检查点覆盖客观执行、与用户拥有的决策对齐、交付物质量和安全性。这些类别分数用于诊断;SiS\_{i}是智能体协作轨道使用的成果度量。工具或提供商标记为无效而非分配零分。
### 3.2智能体协作轨道
此轨道询问:人类注意力是否被有效利用?对于每个评估集,我们报告仅工作者平均得分S̄base\bar{S}\_{\mathrm{base}}、带Jarvis的平均得分S̄Jarvis\bar{S}\_{\mathrm{Jarvis}}和平均注意力请求数N̄req\bar{N}\_{\mathrm{req}}。每当Jarvis就任务相关判断征询用户时计为请求,无论响应最终是否改善结果。
因任务得分以百分比报告,我们定义注意力效率为每个请求用户轮次获得的全分数尺度比例:
Eff.=S̄Jarvis−S̄base100N̄req.\mathrm{Eff.}=\frac{\bar{S}\_{\mathrm{Jarvis}}\-\bar{S}\_{\mathrm{base}}}{100\,\bar{N}\_{\mathrm{req}}}.\(2\)
例如,效率0.340.34意味着每个请求轮次平均获得相当于全任务分数尺度34%34\%的增益。无请求时效率未定义,当干预降低任务质量时可为负。
### 3.3用户交互轨道
此轨道询问:Jarvis在用户联系时是否有用?我们通过因果重放评估。每个工作者轨迹录制一次,然后按时间顺序重放给Jarvis,仅揭示每个时点可用状态。此只读协议避免为每个Jarvis大语言模型重新运行工作者,因用户–Jarvis交换不影响智能体执行。
每个轨迹在执行约25%25\%处包含早期检查点,约75%75\%处包含晚期检查点。在每个检查点,用户首先询问关于进展的固定一般问题。GPT-5.6-Luna随后基于Jarvis紧接的前一个回答生成一个后续问题。Luna仅见初始任务简介和可见用户–Jarvis对话,不见工作者轨迹。因此每个轨迹产生四个响应:早期一般、早期后续、晚期一般、晚期后续。
评估者独立使用任务简介、该检查点的因果智能体状态、可见对话和当前答案将每个响应评为0、1或2。得分2表示直接有用答案,其重要主张得到当前状态支持且适当陈述不确定性。得分1表示核心答案正确但不完整、模糊、稍偏离主题或支持不完善。得分0表示重要事实或基础错误、矛盾、非答案、无效响应或未来/私有信息泄露。
一般和后续分别通过平均其响应等级并线性转换为0–100分计算。单智能体和多智能体结果平均相应套件中的轨迹,整体则平均所有轨迹的两种问题类型。失败的Jarvis响应得零分并保留在分母中。我们单独报告延迟为首次音频时间。确切问题、后续提示和错误规则见附录C (https://arxiv.org/html/2608.14870#A3)。
## 4实验设置
我们的核心公平原则是添加Jarvis时保持工作者不变。基线和Jarvis条件下,工作者模型、OpenClaw工具箱、提示、工具和任务环境均相同。Jarvis作为外部sidecar运行:它观察暴露的执行事件并通过现有交互边界通信,不修改工作者循环或使用其工具。
### 4.1智能体协作设置
我们进行两项互补比较。首先,固定GPT-5.6-Sol作为Jarvis大语言模型,评估六个工作者模型:Claude Opus 5.0、Claude Opus 4.8、GPT-5.6-Sol、GPT-5.5、DeepSeek V4-Pro和GLM 5.2。每个工作者在相同单智能体和多智能体任务上单独运行并与Jarvis一起运行。其次,固定Claude Opus 4.8作为工作者,比较GPT-5.6-Sol、Claude Opus 4.8、DeepSeek V4-Pro和GPT-OSS-120B作为Jarvis大语言模型。得分在每个套件的任务上取宏平均。
在仅工作者条件下,用户提供初始请求后即不可用。在Jarvis条件下,当展开的任务揭示对人类判断的关键需求时,Jarvis可获得简洁的用户决策。我们全程使用相同的轻量级干预策略:允许有用干预但不鼓励不必要请求。这固定了比较操作点,同时保持注意力预算可调。
### 4.2用户交互设置
我们比较GPT-5.6-Sol、Claude Opus 4.8、DeepSeek V4-Pro、Qwen235B和GPT-OSS-120B作为Jarvis大脑。每个模型接收相同的因果重放工作者轨迹和固定一般问题。后续问题仅从可见对话生成,所有响应由GPT-5.6-Luna根据第3节 (https://arxiv.org/html/2608.14870#S3)的协议评分。延迟在五组共享语音提示后测量(舍弃一次预热),从用户语音结束到第一个可听TTS输出。Qwen235B和GPT-OSS-12相似文章
一个相当智能的语音代理
本文介绍了JarvisBench,一个用于评估长周期AI代理工作流中连续、实时语音中介层的基准,并展示了一个模块化的Jarvis原型,该原型在WildClaw任务上使用多种基于LLM的工作代理进行了测试。
JobBench:让智能体工作与人类意愿对齐
JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。