@rohanpaul_ai: 最近许多工作和研究论文都指向同一个结论:“框架”正在成为真正的能力层。…

X AI KOLs Following 工具

摘要

Offloop的多智能体框架在GDPval、GDP.pdf和JobBench基准测试中取得了最先进的成果,每任务成本仅为Claude Code和Codex的三分之一到十分之一,性能却超越二者,目标瞄准美国知识工作者市场,规模达2.4万亿美元。

最近许多工作和研究论文都指向同一个结论:“框架”正在成为真正的能力层。 @Offloop 的4人团队展示了一个多智能体框架,在GDPval基准测试中超越了Claude Code和Codex,目标瞄准美国知识工作者市场,规模达2.4万亿美元。 - 该团队得分为84.9,每任务成本1.65美元。 - Claude Code中的Opus 4.8得分为82.4,Codex中的GPT 5.6 Sol得分为83.3,但每任务成本远高,分别为14.38美元和5.20美元。 GDPval衡量AI处理实际工作的能力,涵盖44个职业和9大行业。模型获得Shell访问权限和网页浏览能力,然后与人类专家进行盲法成对比较。 而这些任务对应的是美国年薪资总额约2.4万亿美元的工作岗位。
查看原文
查看缓存全文

缓存时间: 2026/07/24 09:05

最近大量工作和研究论文都指向同一个结论:“管理系统”正在成为真正的能力层。

@Offloop 的4人团队展示了多智能体管理系统在GDPval基准测试中优于Claude Code和Codex的表现,目标瞄准美国2.4万亿美元的知识工作市场。

  • 团队以每次任务1.65美元的成本获得84.9分。
  • Claude Code中的Opus 4.8获得82.4分,Codex中的GPT 5.6 Sol获得83.3分,但每次任务成本远高于前者,分别为14.38美元和5.20美元。

GDPval衡量的是一系列涵盖44个职业和9个主要行业的人工智能处理实际工作的能力。模型被赋予Shell访问和网页浏览权限,然后与人类专家进行盲测配对比较。

这些任务对应着美国年薪总额约2.4万亿美元的工作岗位。

Offloop (@Offloop): 在我们的内部评估中,Offloop在三个评估专业知识工作的基准测试上取得了最新最佳结果:

GDPval上84.9分,GDP.pdf上44分,JobBench上67.2分——每一项都领先于Codex和Claude Code,且每次任务成本仅为它们的1/3到1/10。

每次任务成本更低

相似文章

驾驭之道

Hacker News Top

作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。