@rohanpaul_ai: 最近许多工作和研究论文都指向同一个结论:“框架”正在成为真正的能力层。…
摘要
Offloop的多智能体框架在GDPval、GDP.pdf和JobBench基准测试中取得了最先进的成果,每任务成本仅为Claude Code和Codex的三分之一到十分之一,性能却超越二者,目标瞄准美国知识工作者市场,规模达2.4万亿美元。
查看缓存全文
缓存时间: 2026/07/24 09:05
最近大量工作和研究论文都指向同一个结论:“管理系统”正在成为真正的能力层。
@Offloop 的4人团队展示了多智能体管理系统在GDPval基准测试中优于Claude Code和Codex的表现,目标瞄准美国2.4万亿美元的知识工作市场。
- 团队以每次任务1.65美元的成本获得84.9分。
- Claude Code中的Opus 4.8获得82.4分,Codex中的GPT 5.6 Sol获得83.3分,但每次任务成本远高于前者,分别为14.38美元和5.20美元。
GDPval衡量的是一系列涵盖44个职业和9个主要行业的人工智能处理实际工作的能力。模型被赋予Shell访问和网页浏览权限,然后与人类专家进行盲测配对比较。
这些任务对应着美国年薪总额约2.4万亿美元的工作岗位。
Offloop (@Offloop): 在我们的内部评估中,Offloop在三个评估专业知识工作的基准测试上取得了最新最佳结果:
GDPval上84.9分,GDP.pdf上44分,JobBench上67.2分——每一项都领先于Codex和Claude Code,且每次任务成本仅为它们的1/3到1/10。
每次任务成本更低
相似文章
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
Own the Loop:Agent Harnesses 现场指南(5分钟阅读)
随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。
@rohanpaul_ai: 本文表明,智能体的表现更少依赖于提示词本身,更多依赖于其周围的控制层。“Agent intel…
本文认为,AI智能体的性能更多地取决于控制层(harness)而不是仅靠提示词,并提出了自然语言智能体控制层,使得设计选择可检查且可移植。