Unreal Agent

Hacker News Top 工具

摘要

Unreal Agent 是一种新的AI代理框架,通过异步处理降低工具管理开销,在实际工作负载中相比 Codex 节省高达40%的成本,并比 Pi 节省20%。

<a href="https:&#x2F;&#x2F;github.com&#x2F;unreallabsai&#x2F;unreal-agent" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;unreallabsai&#x2F;unreal-agent</a>
查看原文
查看缓存全文

缓存时间: 2026/09/22 21:54

# Unreal Agent — Unreal Labs 来源:https://unreallabs.ai/blog/unreal-agent/ 展示编程代理在质量与成本前沿的平衡,重点介绍使用GPT-6 Astra(高推理强度)的Unreal Agent。如果您关注AI代理的前沿成本效益,我们期待合作!联系邮箱:[[email protected]](mailto:[email protected])。 --- 在实际部署代理时,我们希望它们能快速响应用户且运行成本可控。我们发现代理在管理工具调用上消耗了大量时间和令牌,这促使我们构建了Unreal Agent,其运行框架旨在降低模型在工具管理上的开销。 Unreal Agent框架采用完全异步的方式管理工具调用,无需底层模型处理工具的等待、轮询和心跳检测。 这种方法带来两大核心优势:首先,它允许用户随时引导代理,无需等待工具调用完成;其次,它使代理能在模型调用间隙安排更多有效的工具任务,从而提升前沿成本效益。在实际工作负载和代理基准测试中,当前版本相比Codex可节省高达40%的成本,相比Pi可节省20%成本,相关数据将在下文展示。 我们认为框架设计本身就是一个值得深入研究的领域,仍有诸多创新思路有待探索与实践。¹(https://unreallabs.ai/blog/unreal-agent/#ref-1) ## 动机与架构(https://unreallabs.ai/blog/unreal-agent/#motivation-and-architecture) 若尝试构建代理优先的产品,您很快会发现并不存在实现它的黄金路径。各大供应商提供了不同的SDK来构建代理,但它们各自的技术权衡可能并不显而易见。 Unreal Labs已开发多款代理产品,并在使用主流SDK的过程中积累了一些经验。 例如,面向命令行界面的SDK(如Claude的Agent SDK)通常基于本地会话、子进程和资源限制等假设,这些在生产环境中难以直接适用。要可靠地处理任务完成、取消及后台任务,往往需要围绕它们构建自定义的生命周期管理机制。 支持其他服务商的兼容性问题也需额外处理:切换API模式可能破坏工具或压缩功能,而SDK升级可能改变消息格式,导致集成代码需要重写。沉重的依赖树为本就需要自行理解和维护的运行时环境增加了维护成本和供应链风险。 根据我们的经验,依赖框架钩子和专用工具实现的安全与权限控制,通常比确定性环境或沙箱约束(在框架外部实现,例如允许/禁止的主机列表、细粒度的访问令牌、带审批门的代理)需要更多维护,且鲁棒性较低。 除了上述技术动机,我们还希望构建一个能即时接受用户指令、并能高效处理异构工具调用的框架,同时不增加模型的认知负荷。例如,我们希望代理能够并行处理耗时数分钟的开发环境配置,同时探索代码库和搜索网络,而无需支付额外的令牌成本。 每当Unreal Agent发起工具调用时,我们会立即在事件日志中记录该工具“进行中”的状态,同时让其在后台继续执行。待工具实际完成时,我们将结果追加到会话日志并调用大语言模型。在不破坏缓存的前提下实现这一流程,其本身就是一项有趣的工程挑战。²(https://unreallabs.ai/blog/unreal-agent/#ref-2) 观看演示动画(https://unreallabs.ai/assets/blog/unreal-agent/asynchronous-runtime.mp4) ## 成本效益(https://unreallabs.ai/blog/unreal-agent/#cost-efficiency) 表面上看,Unreal Agent以更少的模型轮次和输入令牌达到了相同的效果。 我们将成本节约归因于两个因素: 1. **最小化框架开销与工具输出的精细优化**:Unreal Agent采用简洁的提示词、令牌优化的工具结果,且无子代理或工作流。³(https://unreallabs.ai/blog/unreal-agent/#ref-3) 2. **每轮模型调用完成更多工具任务**:Unreal Agent具备清晰的异步工具调用模型,并能向大语言模型准确解释其机制。这使得模型可在每轮调用中发起更多耗时的工具任务,而无需浪费令牌进行轮询或等待。 ## 基准测试(https://unreallabs.ai/blog/unreal-agent/#benchmarks) 我们构建Unreal Agent主要是为了满足实际生产需求,但它在基准测试中同样表现出色。我们使用GPT-6 Astra xhigh进行了测试,并与Codex和Pi进行对比。以下为部分结果。 通过率差异较小,我们认为这源于基准测试的波动性。 ### Terminal-Bench 4.0(https://unreallabs.ai/blog/unreal-agent/#terminal-bench-40) 测试配置:GPT-6 Astra · xhigh。Codex (lb) 为排行榜基线;Unreal Agent与Pi的运行数据链接如下。 | Agent | 通过率 | 总成本($) | 输入令牌/轮次 | 输出令牌/轮次 | 轮次 | 工具调用次数 | Harbor链接 | |---------------------|--------|-----------|---------------|---------------|-------|--------------|------------| | **unreal-agent** | **57.9%** | **1428** | 1.73M | 32k | 283 | 727 | [133053](https://hub.harborframework.com/jobs/27133053-2015-46f3-8c72-6b6910859da6) | | Codex (排行榜基线) | 57.9% | 2350 | — | — | — | — | — | | Pi | 55.0% | 1827 | 2.83M | 35k | 445 | 76 | [ccd097a](https://hub.harborframework.com/jobs/6ccd097a-747b-4867-be57-a56969df988f) | ### SWE-Atlas 代码库问答(https://unreallabs.ai/blog/unreal-agent/#swe-atlas-codebase-qna) | Agent | 通过率 | 总成本($) | 输入令牌/轮次 | 输出令牌/轮次 | 轮次 | 工具调用次数 | Harbor链接 | |---------------------|--------|-----------|---------------|---------------|-------|--------------|------------| | **unreal-agent** | **65.8%** | **936** | 898k | 15k | 162 | 73 | [2fa057](https://hub.harborframework.com/jobs/3d2fa057-e11c-4be0-a962-e8be81b87709) | | Codex | 63.3% | 1303 | 1.69M | 17k | 222 | 111 | [a440fb](https://hub.harborframework.com/jobs/11a440fb-b1c4-473b-98a6-907500b3fdaf) | | Pi | 64.0% | 1033 | 1.29M | 16k | 246 | 0da4ac972 | [9d5a-4142](https://hub.harborframework.com/jobs/da4ac972-9d5a-4142-b057-85f07375f14e) | ### DeepSWE 1.1(https://unreallabs.ai/blog/unreal-agent/#deepswe-11) | Agent | 通过率 | 总成本($) | 输入令牌/轮次 | 输出令牌/轮次 | 轮次 | 工具调用次数 | Harbor链接 | |---------------------|--------|-----------|---------------|---------------|-------|--------------|------------| | **unreal-agent** | **72.4%** | **1367** | 1.60M | 28k | 263 | 823 | [11ca63](https://hub.harborframework.com/jobs/2311ca63-2929-49eb-ba0c-0084ef31ba8b) | | Codex | 69.0% | 1633 | 2.19M | 30k | 302 | 9e20ecafd | [695a-417c](https://hub.harborframework.com/jobs/e20ecafd-695a-417c-90f5-35fd36d2786f) | | Pi | 69.6% | 1584 | 2.21M | 30k | 407 | 5cd7d8de6 | [c152-48de](https://hub.harborframework.com/jobs/cd7d8de6-c152-48de-9840-b22bbea96d99) | ### Agents’ Last Exam · ALE-CLI(https://unreallabs.ai/blog/unreal-agent/#agents-last-exam--ale-cli) 完整通过率和平均分如下(未在Harbor上运行)。 | Agent | 完整通过率 | 平均分 | 总成本($) | 输入令牌/任务 | 输出令牌/任务 | 轮次 | 工具调用次数 | |----------------|------------|--------|-----------|---------------|---------------|------|--------------| | **unreal-agent** | **30.0%** | **59.7** | **217** | 0.76M | 18k | 1823 | — | | Codex | 29.0% | 58.1 | 292 | 1.59M | 15k | — | 21 | | Pi | 29.0% | 59.2 | 262 | 1.19M | 19k | 2737 | — | 我们主要运行编程基准测试,因为它们可通过Harbor获取,便于复现与验证。但该框架本身与领域无关。 ## 开始使用Unreal Agent(https://unreallabs.ai/blog/unreal-agent/#getting-started-with-unreal-agent) Unreal Agent SDK当前提供: - 可直接集成到代码库的Go语言库 - 类似于`claude -p` / `codex exec`的运行器可执行文件 - 兼容Harbor(https://www.harborframework.com/)的基准测试运行器 如果您想亲自尝试,请访问我们的GitHub仓库(https://github.com/unreallabsai/unreal-agent)。 ## 参考文献(https://unreallabs.ai/blog/unreal-agent/#references)

相似文章

AgentOS

Product Hunt

AgentOS 提供了一个统一控制层,用于管理 AI 代理、任务和工作空间。

Arena Agent Mode

Product Hunt

Arena Agent Mode 使自主AI代理能够完成现实世界任务。

Superagent

Product Hunt

Superagent 是一款开源工具,为 AI 编程代理提供真实的计算机界面,包括浏览器和 iOS Simulator,以简化开发者工作流程。

智能代理如何改变工作

OpenAI Blog

OpenAI报告称,智能代理AI,特别是其Codex产品,正在改变工作方式,通过支持更长期的任务并成为跨部门(包括非技术部门)的主要AI工具,且在非开发者中迅速普及。