@rohanpaul_ai: 最近许多工作和研究论文都指向同一个结论:“框架”正在成为真正的能力层。…

X AI KOLs Following 工具

摘要

Offloop的多智能体框架在GDPval、GDP.pdf和JobBench基准测试中取得了最先进的成果,每任务成本仅为Claude Code和Codex的三分之一到十分之一,性能却超越二者,目标瞄准美国知识工作者市场,规模达2.4万亿美元。

最近许多工作和研究论文都指向同一个结论:“框架”正在成为真正的能力层。 @Offloop 的4人团队展示了一个多智能体框架,在GDPval基准测试中超越了Claude Code和Codex,目标瞄准美国知识工作者市场,规模达2.4万亿美元。 - 该团队得分为84.9,每任务成本1.65美元。 - Claude Code中的Opus 4.8得分为82.4,Codex中的GPT 5.6 Sol得分为83.3,但每任务成本远高,分别为14.38美元和5.20美元。 GDPval衡量AI处理实际工作的能力,涵盖44个职业和9大行业。模型获得Shell访问权限和网页浏览能力,然后与人类专家进行盲法成对比较。 而这些任务对应的是美国年薪资总额约2.4万亿美元的工作岗位。
查看原文
查看缓存全文

缓存时间: 2026/07/24 09:05

最近大量工作和研究论文都指向同一个结论:“管理系统”正在成为真正的能力层。

@Offloop 的4人团队展示了多智能体管理系统在GDPval基准测试中优于Claude Code和Codex的表现,目标瞄准美国2.4万亿美元的知识工作市场。

  • 团队以每次任务1.65美元的成本获得84.9分。
  • Claude Code中的Opus 4.8获得82.4分,Codex中的GPT 5.6 Sol获得83.3分,但每次任务成本远高于前者,分别为14.38美元和5.20美元。

GDPval衡量的是一系列涵盖44个职业和9个主要行业的人工智能处理实际工作的能力。模型被赋予Shell访问和网页浏览权限,然后与人类专家进行盲测配对比较。

这些任务对应着美国年薪总额约2.4万亿美元的工作岗位。

Offloop (@Offloop): 在我们的内部评估中,Offloop在三个评估专业知识工作的基准测试上取得了最新最佳结果:

GDPval上84.9分,GDP.pdf上44分,JobBench上67.2分——每一项都领先于Codex和Claude Code,且每次任务成本仅为它们的1/3到1/10。

每次任务成本更低

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。

Own the Loop:Agent Harnesses 现场指南(5分钟阅读)

TLDR AI

随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。