一个相当智能的语音代理
摘要
本文介绍了JarvisBench,一个用于评估长周期AI代理工作流中连续、实时语音中介层的基准,并展示了一个模块化的Jarvis原型,该原型在WildClaw任务上使用多种基于LLM的工作代理进行了测试。
arXiv:2607.16610v1 公告类型:新
摘要:长周期AI代理正变得越来越强大,但它们与用户的交互仍然出奇地薄弱。在大多数工作流中,用户给出初始指令,只收到选择性的文本更新,并且对代理正在做什么或何时介入失去清晰的认识。这导致当前代理生态系统中缺失了一个部分:一个始终在线的Jarvis式中介,使代理持续对用户可达。这样的中介应支持与用户的实时语音交互,在不打断工作代理的情况下回答问题,主动报告进度或困惑,并在有用时将用户指导注入代理的执行中。在这项工作中,我们引入了JarvisBench,一个用于衡量长周期代理工作流中中介双重价值的基准。JarvisBench包含两个互补的轨道:一个代理协作轨道,衡量中介是否改善了下游任务完成情况;一个用户交互轨道,衡量中介是否使持续执行对用户更易理解、响应更快、更易访问。我们用一个模块化的参考Jarvis原型实例化了该基准,并在OpenClaw中执行的34个仅文本的WildClaw任务上进行了评估。使用GPT-5.5、Claude Opus 4.7、基于Gemini和基于GPT的工作代理的初步结果表明,Jarvis式的中介可以为用户问题提供基于跟踪的响应,并在适当时刻注入稀疏用户指导时提高任务性能。结果还表明,有效性强烈依赖于中介的LLM大脑,突显了这一缺失中间层的潜力以及需要更广泛的社区努力。演示页面 https://cchen1436.github.io/jarvis
查看缓存全文
缓存时间: 2026/07/21 06:38
# Just A Rather Very Intelligent Spoken Agent 来源:https://arxiv.org/html/2607.16610 ###### 摘要 长周期AI智能体的能力不断增强,但它们与用户的交互方式仍然出奇地薄弱。在大多数工作流程中,用户给出初始指令后,只能收到零星的文本更新,对智能体正在做什么或何时该介入缺乏清晰感知。这导致当前智能体生态中缺失了一个关键部分:一个始终在线的贾维斯式中介,能够保持用户与智能体的持续连接。这样的中介应支持与用户的实时语音交互,在不打断工作智能体的情况下回答问题,主动报告进展或困惑,并在有用时将用户引导注入智能体的执行过程中。在本工作中,我们提出了*JarvisBench*,一个用于衡量长周期智能体工作流程中中介双重价值的基准。JarvisBench包含两个互补的轨道:一个智能体协作轨道,衡量中介是否提升下游任务完成度;一个用户交互轨道,衡量中介是否使持续执行过程对用户更易理解、响应更快、更易访问。我们用一个模块化的参考Jarvis原型实例化该基准,并在OpenClaw中执行的34个纯文本WildClaw任务上进行评估。使用GPT-5.5、Claude Opus 4.7、Gemini和GPT工作智能体的初步结果表明,贾维斯式的中介可以为用户问题提供基于轨迹的回应,并在恰当时机注入稀疏用户引导时提升任务性能。结果还显示,有效性强烈依赖于中介的LLM大脑,这既凸显了这一缺失中间层的潜力,也表明需要更广泛的社区努力。演示页面:https://cchen1436.github.io/jarvis ![[未标注图片]](https://arxiv.org/html/2607.16610v1/fig_abstract.png) ## 1 引言 近期AI智能体的进步迅速扩展了其在各个领域的能力,从解决复杂编程任务到协助用户的日常活动(Huang等人, 2024 (https://arxiv.org/html/2607.16610#bib.bib1))。尽管它们的能力和部署潜力不断增长,但交互范式基本保持不变。大多数现有智能体以轮次方式运行:用户发出指令,智能体长时间自主工作,通信仅通过稀疏的文本更新(如果有的话)进行。这种延迟且断续的交互常常让用户处于循环之外,导致难以理解智能体进展、及早纠正错误或在智能体偏离用户意图之前引导执行。 科幻小说早已想象了人机交互的不同范式。在《钢铁侠》中,J.A.R.V.I.S.作为一个始终在线的智能协作者,通过语音与用户交流:主动分享进展,随时回答问题,并通过自然语音交互执行命令。这种免提、实时的体验使得用户无需暂停正在进行的活动就能实现出色的协作。相比之下,今天的智能体仍然主要是轮次驱动、受限于屏幕:用户可以启动一个智能体,但很难与其保持连接。 我们认为,这种对比揭示了当前长周期智能体工作流程中缺失的一个接口。问题不仅仅是智能体需要更强的模型或更大的智能体团队。更根本的是,用户和智能体之间需要一个持续的通信层。在用户端,这一层应使智能体的执行能够通过自然语音访问:用户应该能够询问正在发生什么,请求澄清,并在无需检查完整执行轨迹的情况下接收进度报告。在智能体端,这一层应监控工作智能体的工作轨迹,在可能需要引导时向用户呈现困惑或失败,并将简洁的用户反馈带回工作智能体持续进行的ReAct时序中。 在本工作中,我们提出了*JarvisBench*,一个用于衡量用户与长周期工作智能体之间贾维斯式中介价值的基准。JarvisBench分为两个轨道。*用户交互轨道*评估中介在执行过程中是否能向用户提供及时、基于轨迹且与任务一致的回应。*智能体协作轨道*评估中介是否能通过咨询用户并将简洁的引导注入持续过程,帮助工作智能体从易失败状态中恢复。这种双轨设计使得在同一中介角色下,可以测试不同的LLM大脑、语音模块、工作智能体、监控策略或记忆设计。为了实例化该基准,我们构建了一个模块化的参考Jarvis原型。面向用户的一侧支持语音交互,而面向智能体的一侧接收来自工作智能体的文本ReAct样式更新,维护执行上下文,并在用户提问或需要专家引导时打开交互检查点。该原型并非贾维斯的唯一可能实现;它是一个用于运行基准并暴露所需日志的参考系统。 我们在OpenClaw或Hermes平台上执行的34个纯文本WildClaw(Ding等人, 2026a (https://arxiv.org/html/2607.16610#bib.bib3))案例上实例化JarvisBench,涵盖需要规划、工具使用、恢复和安全意识决策的实际长周期任务。使用模拟的非专家用户,Jarvis在执行过程中提供有用的进度和主题相关回应,表明中介可以使智能体工作更透明,无需用户检查完整轨迹。使用模拟的专家用户,Jarvis还通过报告易失败状态并将简洁的用户引导传回工作智能体来改善任务结果。效果强烈依赖于Jarvis大脑的能力:使用GPT级别的中介,基于Claude Opus 4.7的工作智能体在WildClaw上的总体得分从64.01提升至75.79。案例进一步分析表明,有用的引导不需要高度专业化;即使专家用户无法访问完整的ReAct轨迹,基于Jarvis报告的简单建议也能帮助工作智能体摆脱局部失败模式。 ## 2 JarvisBench:用户-智能体中介基准 我们将贾维斯式的中介表述为一个即插即用的基准,而非固定的智能体架构。JarvisBench评估放置在用户与长周期工作智能体之间的中介。中介可以观察工作智能体的执行轨迹,通过语音与用户通信,并可选地将用户引导注入工作智能体的持续上下文。在JarvisBench下测试的系统可以替换中介的LLM大脑、语音接口、监控策略、记忆设计或工作智能体,只要它暴露评估协议所需的日志。 该基准围绕两个问题设计。第一,中介是否帮助工作智能体更成功地完成任务?第二,中介是否使智能体的持续执行对用户更易理解和访问?因此,我们将JarvisBench组织为两个轨道:*智能体协作轨道*和*用户交互轨道*。第一个轨道衡量中介对任务完成的价值;第二个轨道衡量中介对实时用户体验的价值。 ### 2.1 轨道1:智能体协作 智能体协作轨道评估中介是否改善下游任务完成。同一工作智能体在两种设置下进行评估:原始的OpenClaw执行循环,以及相同的循环但加入Jarvis中介。在执行过程中,Jarvis监控工作智能体的ReAct轨迹,识别稀疏的故障敏感检查点,例如重复的工具失败、进展停滞、模糊的观察、有风险不可逆的动作或低置信度的结束。当触发此类检查点时,Jarvis总结相关执行状态,向专家用户请求简洁引导,并将反馈注入工作智能体的上下文。 该轨道故意与评估多智能体系统不同。Jarvis不允许独立解决问题、与工作智能体辩论或用其自己的计划替换工作智能体的轨迹。其作用是向用户暴露工作智能体的困难,并将用户反馈带回持续执行中。我们报告以下指标: - •总体得分(%):工作智能体的WildClaw任务完成分数,根据原始WildClaw评估协议判断。 - •相对增益(Δ):相对于没有Jarvis中介的同一工作智能体的绝对改进。 - •满分次数:获得最大任务分数的任务数。 - •干预次数:Jarvis在执行过程中注入的用户引导干预次数。 表1 (https://arxiv.org/html/2607.16610#S5.T1)报告该轨道。 ### 2.2 轨道2:用户交互 用户交互轨道评估中介是否能在工作智能体继续解决问题的同时,向非专家用户提供有用的实时交互。为了隔离中介面向用户的能力,我们固定工作智能体,改变Jarvis大脑或其他中介组件。非专家用户知道原始请求,但不提供解决问题的引导。相反,用户在执行过程中提出简短的自然语言问题,交替提出进度导向问题和主题导向问题。 进度问题测试Jarvis是否能基于可见的执行轨迹解释工作智能体当前正在做什么。主题问题测试Jarvis是否能基于原始用户请求和可用任务上下文回答任务相关的背景或上下文问题。对于每个答案,我们保存Jarvis在回应时可用的证据,并使用单独的LLM评判提示进行进度和主题评估。我们报告: - •进度:答案是否基于当前执行轨迹的平均1-5分评分。 - •进度≥4:被评分至少4分的进度答案比例。 - •主题:答案是否与原始任务请求和任务上下文一致的平均1-5分评分。 - •主题≥4:被评分至少4分的主题答案比例。 - •延迟:从用户语音提问结束到Jarvis语音回复开始所经过的时间。 表2 (https://arxiv.org/html/2607.16610#S5.T2)报告该轨道。 ### 2.3 即插即用评估协议 JarvisBench支持组件级替换。要测试新的LLM作为Jarvis大脑,保持工作智能体、用户模拟器、检查点计划、评判提示和语音栈固定,只替换中介LLM。要测试新的工作智能体,在固定Jarvis中介的情况下运行同一任务集,分别比较有无中介。要测试新的语音或对话模块,保持Jarvis大脑固定,报告用户交互质量及延迟。要测试新的监控或干预策略,保持工作智能体和用户模拟器固定,衡量策略是否在不引入不必要干预的情况下改善任务完成。 该协议将Jarvis从单个提出的系统转变为一个可基准化的用户-智能体中介接口。不同的系统可以以级联语音管道、全模态模型、更强的文本LLM、不同的记忆设计或新的检查点策略来实例化中介。只要它们遵循相同的双轨协议并暴露所需的交互日志,它们的增益就可以沿着两个最重要的维度进行比较:用户是否与执行更好地连接,以及工作智能体是否更成功地完成任务。 ## 3 Jarvis原型 我们构建了一个模块化的参考Jarvis原型。该原型并非意图定义用户-智能体中介的单一必需架构。相反,它提供了一个实用的实现,暴露了两个基准轨道所需的日志、检查点和交互通道。每个模块可以独立替换,包括Jarvis大脑、语音接口、监控策略或工作智能体,同时保持评估协议不变。 ### 3.1 级联全双工语音接口 我们将面向用户的接口实现为一个级联语音管道。流式ASR模块将用户语音转换为部分转录,语义语音活动检测模块决定用户是否说完、意图打断还是仍在发言。在我们的原型中,我们使用SoulX-Duplex(Yan等人, 2026 (https://arxiv.org/html/2607.16610#bib.bib2))作为语义VAD模块,使用Chatterbox(Resemble AI, 2025 (https://arxiv.org/html/2607.16610#bib.bib4))进行流式文本到语音生成。一旦语义VAD检测到完整的用户话语,Jarvis大脑接收转录并生成回应,通过语音回放给用户。 这种设计使Jarvis能够在智能体执行期间保持始终在线的监听状态。用户无需手动打开智能体轨迹即可提问,Jarvis可以在不停止工作智能体的情况下回答,除非基准检查点要求暂停。同一接口也支持主动语音:当Jarvis检测到工作智能体轨迹中的故障敏感状态时,它可以启动与用户的简短语音交互。在用户交互轨道中,延迟从用户语音提问结束到Jarvis语音回复开始之间测量。尽管我们使用级联管道以确保可靠性和可控性,语音接口是可替换的;未来的提交可以在相同的评估协议下使用全模态模型或不同的ASR/VAD/TTS栈。 ### 3.2 轨迹监控与上下文管理 Jarvis面向智能体的一侧接收来自工作智能体的文本执行更新,包括ReAct风格推理摘要、工具调用、观察、错误和建议的下一步动作。Jarvis大脑使用此流进行两个目的。第一,回答用户关于工作智能体进度或任务上下文的问题。第二,检测用户引导可能帮助工作智能体从易失败轨迹中恢复的时刻。Jarvis不独立执行工具或解决问题;其对工作智能体的输出仅限于在选定检查点处注入简洁的、基于用户的引导。 为了保持此过程的稳定性,原型将对话上下文与执行上下文分离。对话上下文存储最近的用户-Jarvis交流及用户偏好。执行上下文存储工作智能体最近的动作、观察、失败和当前计划。一个小的控制状态记录Jarvis是在回答用户问题、等待专家引导,还是准备为工作智能体注入指令。这种分离很重要,因为面向用户的对话和面向智能体的监控施加了不同的上下文需求:前者应自然简洁,而后者应保持基于执行轨迹。 ### 3.3 交互检查点 实时交互会引入延迟,特别是当用户由LLM模拟且回应通过TTS语音播放时。为了使评估可重复,我们将交互检查点实现为协作暂停机制。在选定的边界处,Jarvis记录工作智能体当前可观察状态,并暂时保持下一个动作。然后用户可以提问、提供引导或选择不介入。交互结束后,Jarvis恢复工作智能体,并在适当时注入一条短的、基于用户的指令。
相似文章
WildClawBench:真实世界长周期智能体评估基准
WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。
@0x0SojalSec: OpenJarvis:构建可在本地运行的个人AI代理 - http://github.com/open-jarvis/OpenJarvis…
OpenJarvis 是一个开源框架,用于构建可在设备本地运行的个人AI代理,支持本地LLM,并注重能效和隐私保护。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。