沙盒化编码智能体是竞争性全模态任务求解器
摘要
本文证明,使用沙盒化工具接口的文本+图像编码智能体在音视频基准测试中能够匹配甚至超越原生全模态模型,将全模态任务转化为检索与信息处理问题。
arXiv:2606.00579v1 公告类型:新论文
摘要:随着多模态大语言模型日益专注于视频和音频处理,人们通常认为此类任务需要原生全模态模型。我们证明情况并非总是如此:仅具备文本+图像访问能力与沙盒化工具接口的编码智能体,在多个音视频基准测试中不仅能匹配、甚至在某些设置下超越最先进的原生全模态模型及预定义多模态智能体框架。我们的轨迹分析表明,其优势源于通过编写代码和编排工具从转录文本、帧画面及其他模态信号中提取相关证据,从而将全模态任务转化为检索与信息处理问题,而非直接处理整个媒体流。我们进一步通过失败分类与过程级轨迹分析表征其局限性,并证明简单的技能注入(包括人工编写与自我蒸馏的技能)能显著提升性能。为探索开源 elicit 方法,我们提出 Code-X 训练配方(含 OmniCoding 轨迹数据集与可验证奖励),并在 Qwen-3.5-9B 和 Qwen-3.6-27B 上提供基线。最后,我们认为下一个前沿是多模态处理,并引入 TerminalBench-O——一个面向真实世界全模态处理任务的过程级基准测试。代码将发布于 https://github.com/Dongping-Chen/OmniCoding。
查看缓存全文
缓存时间: 2026/06/02 15:37
# 沙盒编码智能体是竞争性的全模态任务求解器
来源:https://arxiv.org/html/2606.00579
\correspondingauthor 周天翼: david\.tianyi\.zhou@gmail\.com\.
黄轩奥\* 张志涵 石清源 李殿琦 周天翼²‡
¹马里兰大学 ²MBZUAI
###### 摘要
随着多模态大语言模型越来越多地针对视频和音频任务,人们通常认为这类任务需要原生的全模态模型。然而我们发现情况并非总是如此:仅具备文本+图像访问能力并配以沙盒工具接口的编码智能体,可以在多个音频-视频基准测试中与最先进的原生全模态模型及预定义的多模态智能体框架相匹敌,甚至在某些设定下表现更优。我们的轨迹分析表明,它们的优势来自于编写代码和编排工具,以从文本记录、帧和其他模态信号中提取相关证据,从而将全模态任务转化为检索和信息处理问题,而非直接摄入整个媒体流。我们进一步通过失败分类法和过程级轨迹分析来刻画其局限性,并表明简单的技能注入(包括人工编写和自我蒸馏技能)能显著提升性能。为了探索开源模型的激发方法,我们引入了Code-X,这是一种结合OmniCoding轨迹数据集和可验证奖励的训练方案,并在 Qwen-3.5-9B 和 Qwen-3.6-27B 上提供了基线结果。最后,我们认为下一个前沿是多样式处理,并引入了TerminalBench-O,这是一个面向真实世界全模态处理任务的过程级基准。代码将发布于 https://github.com/Dongping-Chen/OmniCoding。
参见标题 图1: 我们发现编码智能体是强大的全模态处理器,通过终端工具使用,在视频和音频内容上能以更少的 token 实现与原生全模态模型竞争甚至超越的性能。
## 1 引言
随着 AI 智能体从局限于屏幕的工作流程转向更广阔的用户周边世界,它们预计将越来越多地作为通用助手参与到日常生活中。要做到这一点,它们必须处理来自具身环境的多模态信息,尤其是视频和音频。这立即引出一个问题:对于期望处理现实世界任务中视频或音频的智能体而言,原生视频和音频理解是否必要?然而在实践中,如今许多常用的智能体,例如 OpenClaw (openclaw2026) 和 Hermes (nousresearch2026hermesagent),仍然是纯文本或文本+图像系统,而将它们扩展以原生处理视频和音频需要大量的额外建模和工程工作。这造成了现实世界智能体部署与视频-音频处理主流范式(即直接摄入音频和视频的原生全模态模型 (qwen35Omni, googleGemini31Pro))之间的巨大差距。与此同时,现代编码智能体已经在利用终端环境进行搜索、编辑、执行和长程任务求解方面表现出色 (yang2024sweagent, anthropicClaudeCode, openaiCodexHarness)。这引出一个直白的问题:并非为原生多模态感知设计的编码智能体,能否通过利用现有工具(如 ffmpeg、ASR 或它们在沙盒中编写的新工具)来解决视频和音频任务?我们使用最原生的 Codex 和 Claude Code 框架来研究这个问题,不提供任何人提供的工具或技能。文本+图像编码智能体,即 GPT-5.4 high/xhigh 和 Claude Opus 4.6 (openaiGPT54, anthropicOpus46, anthropicClaudeCode),在 OmniGAIA、SocialOmni 和 LVOmniBench 等视频-音频基准测试中取得了强劲性能 (li2026omnigaia, xie2026socialomni, tao2026lvomnibench)。采用 GPT-5.4 xhigh 的 Codex 在 OmniGAIA 上达到 75.0%,无需直接感知原始视频或音频,便超越了本研究中最强原生全模态模型 Gemini 3.1 Pro (googleGemini31Pro) 超过 8%,而 Claude Opus 4.6 则超出其 2.5%。轨迹分析表明,这一优势并非来自端到端感知。相反,编码智能体通过分阶段工具使用,有选择地将视频和音频分解为文本记录、采样帧和元数据,这也比将原始流打包进模型上下文消耗更少的 token。为了进一步推动编码智能体在全模态内容上的表现,我们探究它们仍然失败的地方,以及这些失败能否在不重新训练基础模型的情况下得到修复。我们跨模型和基准采样了 200 条轨迹,并提出了一种 Omni 终端失败分类法以及过程级评估,揭示了六种反复出现的失败模式,从对多模态内容的过早探索到脆弱的工具和环境基础设施 (kim2025omhbench, yang2025avut, liang2025videobrowsecomp)。在此分类法的指导下,我们研究了三种受近期关于可复用智能体技能和框架优化工作 (li2026skillsbench, lee2026metaharness) 启发的技能注入设定:人类参与循环的技能(编码专家工作流)、校准集自我迭代(智能体仅使用二进制正确性反馈来修改其技能)以及日志驱动自我蒸馏(另一个智能体从原始执行轨迹中挖掘可复用技能)。三者均优于无技能基线,在最佳设定下将 OmniGAIA 平均准确率从 61.4% 提升至 76.7%,其中执行轨迹蒸馏优于二进制自我迭代和人工编写技能。
上述结果是通过闭源前沿模型获得的,这自然而然地引出一个后续问题:能否通过针对性的后训练在开源模型上激发同样的能力?作为探索性基线,我们提出了 Code-X,这是一个完整的多样式终端智能体训练方案。我们构建了 OmniCoding,一个包含 6,035 个示例的轨迹数据集,涵盖视频、音频、图像和跨模态任务,并使用有监督的暖启动结合基于 GSPO 的强化学习(在过程感知的可验证奖励下,共同惩罚模态跳过、格式错误的工具调用和答案不匹配)来训练 Qwen-3.5-9B 和 Qwen-3.6-27B。在四个具有挑战性的基准测试上的评估表明,Code-X 相比直接 MLLM 基线取得了显著提升,并在开源模型中达到了最先进水平,其中 27B 模型在 OmniGAIA 上达到 43.3%,在 LVOmniBench 上达到 60.0%(超过所有现有编码智能体),并在 VideoZeroBench 上实现了超过两倍的性能提升。
鉴于多样式理解已相对成熟,我们认为有意义的前沿在于多样式处理:编辑视频、审计图像数据库、生成符合规格的多模态输出,在这些领域编码智能体相比端到端全模态模型具有结构性优势。为了将注意力吸引到多样式的这后半部分,我们引入了 TerminalBench-O,这是第一个面向全模态处理的编码智能体过程级基准,包含 50 个跨视频、音频、图像、文档和跨模态类别的现实世界任务,每个任务都根据中间制品和最终输出合规性的加权维度进行评估。尽管全模态理解结果很强,但这些任务对于当前智能体仍然困难,因为它们需要长程规划、可靠的工具链、跨模态基础定位、制品验证和严格的输出遵从;即使是最强的 GPT-5.5 Codex 在 TerminalBench-O 上也仅达到 24%。我们希望我们的分析、训练方案和基准能够为多样式处理开辟新的方向。
## 2 沙盒智能体在全模态任务上的性能分析
**初步:为全模态任务调整沙盒智能体。** 我们将每个全模态任务表示为 x = (q, \mathcal{F}, \mathcal{Y}),其中 q 是自然语言指令,\mathcal{F} 是输入文件集,\mathcal{Y} 是可接受的最终答案集(形式化定义和完整 rollout 公式见附录 C (https://arxiv.org/html/2606.00579#A3))。原生全模态模型和沙盒智能体的主要区别在于全模态处理发生的位置:
原生全模态: (q, \mathcal{F}) \xrightarrow{\mathrm{pack}} \text{模型上下文} \xrightarrow{M_{\theta}} \hat{y},
沙盒智能体: (q, \mathcal{F}) \xrightarrow{\mathrm{stage}} \text{工作空间} \xrightarrow{\text{终端交互} \tau} \xrightarrow{\mathrm{Ans}} \hat{y}.
原生全模态模型 M_{\theta} 通过媒体特定的编码和采样将所有文件打包到模型上下文中,将视频和音频视为一等模型输入以生成答案 \hat{y}。相比之下,沙盒智能体将 \mathcal{F} 暂存到隔离的工作空间中,仅接收指令和文件路径;然后它检查文件,调用诸如 ffmpeg、ffprobe、OCR 和 ASR 等工具,编写并执行脚本,生成中间制品(文本记录、采样帧、OCR 文本、时间戳、表格、裁剪),这些组成轨迹 \tau,并从 \tau 中解析出最终答案 \hat{y}。这种观点将原始视频、音频、图像和文档视为环境状态而非强制性的模型上下文,因此智能体可以通过自适应地将原始媒体缩减为紧凑的证据(这些证据适合通用编码模型的原生推理接口)来解决全模态任务。
**智能体框架和模型。** 我们使用 Claude Code (anthropicClaudeCode) 和 Codex (openaiCodexLoop, openaiCodexHarness) 作为两个主要的智能体框架。在 CC 下,我们评估 Claude Opus 4.6 和 Claude Sonnet 4.6 (anthropicOpus46, anthropicSonnet46),以及 MiniMax M2.7 (minimaxM27) 和 Kimi K2.5 (kimiK25)。Claude Opus 4.6 和 Claude Sonnet 4.6 均使用默认的 max 设置。在 Codex 下,我们评估 GPT-5.4 的 low、medium、high 和 xhigh 推理努力设置 (openaiGPT54)。在整个评估过程中,我们尽可能遵循官方框架,以近似真实的终端用户使用情况。对于原生全模态模型,我们评估 Gemini 3.1 Pro (googleGemini31Pro)、Gemini 3 Flash (googleGemini3Flash)、Qwen 3.5-Omni (qwen35Omni) 和 MiMo-V2-Omni (xiaomiMiMoV2Omni)。我们还纳入了两个模块化全模态智能体基线,OmniAgent (tao2025active) 和 Agent-Omni (lin2025agentomni),作为强系统级比较对象。除非另有说明,两个智能体基线均使用 GPT-5.4 并采用 high 推理努力 (openaiGPT54)。
**评估协议。** 我们使用四个具有互补重点的基准:OmniGAIA 用于开放式的、工具介导的事实性和多跳全模态推理 (li2026omnigaia),SocialOmni 用于视听社会感知和身份识别 (xie2026socialomni),LVOmniBench 用于长形式音视频理解 (tao2026lvomnibench),以及 VideoZeroBench 用于具有挑战性的视频中心推理 (meng2026videozero)。鉴于它们的规模,我们在 SocialOmni 和 LVOmniBench 上每级评估前 100 个示例,在 SocialOmni 上仅报告 Level-1 和 Level-2 Q1 准确率,省略聚合的 Level-2 分数,因为它仅对符合条件的 Level-2 示例计算并引入显著的选择偏差。对于 VideoZeroBench,针对同一视频的问题以分组形式提出。除非另有说明,所有模型均使用 pass@1 评估,智能体仅接收任务指令和输入文件的文件系统路径,没有预构建的技能。
**环境。** 所有沙盒智能体实验在基于 Ubuntu 22.04.3 LTS、Python 3.13.2 和标准 Unix 工具的受控工作区中运行。默认情况下,模型可以访问网络搜索并下载额外模型或依赖项;我们检查轨迹以检测答案泄露和评估器 hacking。环境提供常见的多媒体和科学工具(例如 ffmpeg/ffprobe、Tesseract OCR、ImageMagick、OpenCV、Librosa),智能体可以自由安装包并为视频和音频处理编写任务特定脚本。
### 2.1 主要结果与深入分析
表 1: 鉴于论文发布前 API 和积分的限制,部分基准测试结果将在下一版手稿中更新。‡MiniMax M2.7 使用其自己的 MCP 工具进行图像读取。§在此消融设置中,GPT-5.4-high 的直接图像读取功能被禁用。
| 模型/系统 | 框架 | OmniGAIA | | | Social Omni | LVOmniBench | | | | VideoZeroBench |
|-----------|------|----------|---|---|-------------|-------------|---|---|---|---------------|
| | | Easy | Medium | Hard | Avg. | Level1 | Level2 Q1 Acc | Easy | Medium | High | Avg. | Level 3 |
| **全模态 LLMs** | | | | | | | | | | | | |
| Gemini 3.1 Pro | – | 77.8 | 63.8 | 52.6 | 66.1 | 90.0 | 62.0 | 80.1 | 71.8 | 48.0 | 69.0 | 17.6 |
| Gemini 3 Flash | – | 67.2 | 46.9 | 37.2 | 51.7 | 85.0 | 67.0 | 72.2 | 64.1 | 32.0 | 59.0 | 17.8 |
| Qwen 3 Omni | – | 19.7 | 10.6 | 9.0 | 13.3 | 61.0 | 39.0 | 30.6 | 17.9 | 28.0 | 25.0 | 5.2 |
| Mimo V2 Omni | – | 33.9 | 22.5 | 19.1 | 25.8 | 64.0 | 40.0 | 51.4 | 25.2 | 24.0 | 35.0 | 7.4 |
| Qwen 3.5 Omni Plus | – | 43.5 | 39.4 | 29.0 | 38.7 | 88.0 | 40.0 | 58.3 | 35.9 | 44.0 | 46.0 | 10.4 |
| **编码智能体(我们的发现)** | | | | | | | | | | | | |
| GPT-5.4 Low | Codex | 63.1 | 53.8 | 44.9 | 55.0 | 64.0 | 59.0 | 58.3 | 46.2 | 36.0 | 48.0 | 21.0 |
| GPT-5.4 Medium | Codex | 66.4 | 55.0 | 43.6 | 56.4 | 71.0 | 49.0 | 72.2 | 43.6 | 40.0 | 53.0 | 24.0 |
| GPT-5.4 High | Codex | 70.4 | 60.0 | 50.0 | 61.4 | 72.0 | 51.0 | 66.6 | 59.0 | 44.0 | 58.0 | 27.2 |
| GPT-5.4 xHigh | Codex | 82.0 | 75.0 | 64.1 | 75.0 | 75.0 | 60.0 | 66.7 | 64.1 | 32.0 | 57.0 | 27.6 |
| Claude Opus 4.6 | CC | 74.6 | 69.4 | 57.7 | 68.6 | 54.0 | 68.0 | 47.2 | 41.0 | 28.0 | 40.0 | - |
| Claude Sonnet 4.6 | CC | 73.8 | 62.5 | 48.8 | 63.3 | - | - | - | - | - | - | - |
| MiniMax-M2.7‡ | CC | 38.5 | 34.4 | 23.1 | 33.3 | 28.0 | 46.0 | 50.0 | 15.4 | 24.0 | 30.0 | 5.8 |
| Kimi K-2.5 | CC | 72.1 | 50.6 | 39.7 | 55.6 | 46.0 | 50.0 | 55.6 | 28.0 | 41.0 | 43.0 | 15.6 |
| **工具使用智能体(GPT-5.4 High 作为主干)** | | | | | | | | | | | | |
| OmniAgent | - | 77.9 | 63.1 | 55.1 | 66.4 | 55.0 | 56.0 | 50.0 | 21.0 | 28.0 | 33.0 | 12.2 |
| Agent-Omni | - | 54.1 | 41.9 | 19.2 | 41.1 | 37.0 | 48.0 | 56.0 | 28.0 | 20.0 | 36.0 | 5.0 |
| **纯文本编码智能体** | | | | | | | | | | | | |
| GPT-5.4 High§ | Codex | 70.5 | 63.8 | 56.4 | 64.4 | 74.0 | 48.0 | 52.8 | 38.5 | 28.0 | 41.0 | 19.0 |
从表1 (https://arxiv.org/html/2606.00579#S2.T1) 可以看出,编码智能体在所有四个基准套件上与原生全模态 LLM 相比具有很强的竞争力。在 OmniGAIA 上,GPT-5.4 xhigh(75.0)明显优于 Gemini 3.1 Pro(66.1),尤其是在中等级别和困难级别任务上;在 VideoZeroBench 上,最佳编码智能体(27.6)也超过了 Gemini 3 Flash(17.8)。原生全模态模型在 Social Omni Level-1 上领先,不过 Claude Opus 4.6 在 Level-2 Q1 上略高于最佳原生得分。在 LVOmniBench 上,Gemini 3.1 Pro 整体上仍然最强,但编码智能体在简单和中等子集上保持竞争力。这些模式表明,强调细粒度时间感知和音视频对齐的基准更有利于端到端全模态建模,而以工具为导向的基准如 OmniGAIA 则更自然地与编码智能体范式对齐。
**发现 1:** *仅具备文本+图像能力的编码智能体可以在全模态任务上与最先进的原生全模态 LLM 竞争,甚至在某些情况下超越它们。*
在相同的 Codex 框架下,随着 GPT-5.4 变体的推理努力增加,全模态性能明显提升。在 OmniGAIA 上,平均准确率从 55.0(low)稳步上升到 56.4(medium)、61.4(high)和 75.0(xhigh),且改进出现在简单、中等和困难所有子集上。同样的趋势在 LVOmniBench 上也可见,更高努力设置优于更低努力设置,尽管并非严格单调。由于模型系列和框架保持不变,这唯一归因于推理时计算量的贡献。
**发现 2:** *增加推理努力通常能提升编码智能体的性能,表明全模态任务的成功不仅依赖于模型的感知能力,还依赖于智能体计算的深度。*
参见标题 图2: GPT-5.4 high 和 Claude Opus 4.6 max 在四个基准上的工具使用分布。
**工具使用分析。** 我们分析了编码智能体的工具使用行为。表2 (https://arxiv.org/html/2606.00579#S2.T1) (此处应为表2的引用,但原文未给出表2内容,故保留原文引用形式)提供了详细信息。
(注意:原文在工具使用分析部分有“Table2 (https://arxiv.org/html/2606.00579#S2.T1)”引用,但表2未出现,可能为笔误。按原文翻译。)相似文章
FrontierSmith: 大规模合成开放式编程问题
FrontierSmith 自动从封闭式任务中生成多样化的开放式编程问题,通过增强的智能体交互和训练数据合成,提升 LLM 在基准测试中的编码性能。
编码代理作为世界模拟器表现良好
本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
社会科学中的AI编码智能体:方法论多样、经验一致、解释脆弱
本文评估了基于LLM的编码智能体(Claude Code和Codex)在社会科学分析中的表现,发现它们在方法论多样性方面匹配或超越人类,但在通过结论层操纵产生的解释偏差方面仍然脆弱。
前沿编程智能体利用元编程适应陌生编程语言
本文在深奥编程语言上评估了六个前沿编程智能体,发现更强的智能体使用元编程——编写Python程序在陌生的目标语言中生成和调试代码。禁止此策略导致性能大幅下降,而提供Python辅助代码则能提升较弱的智能体。