@matanSF: ProgramBench 是一个基准测试,代理必须完全从头开始复现真实软件的可观察行为…
摘要
ProgramBench 是一个代理从头开始复现真实软件行为的基准测试。Factory 被宣布为最先进的逆向工程系统,在模型无关的长期代理方面取得了突破。
ProgramBench 是一个代理必须完全从头开始复现真实软件可观察行为的基准测试。
凭借我们在模型无关的长期代理方面的最新突破,Factory 现在是世界上最先进的逆向工程系统。
查看缓存全文
缓存时间: 2026/08/29 19:59
ProgramBench 是一个基准测试,要求智能体从零开始完全重现真实软件的可观察行为。
凭借我们在模型无关长期智能体领域的最新突破,Factory 现已成为世界上最先进的逆向工程系统。
Mark Attar (@mark_attar): Theo 绝对是大神,他对模型行为以及测试框架的影响方式有着令人难以置信的直觉
相似文章
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。
ProgramBench Vetted:从可运行二进制文件进行逆向工程
ProgramBench Vetted 是一个包含50个任务的基准,用于评估AI代理从可运行二进制文件重构程序的能力,旨在研究长上下文协调并为强化学习提供密集奖励。
@KLieret: 你可以自己在 ProgramBench 上进行评估:https://github.com/facebookresearch/ProgramBench/… 我们将开放排行榜…
ProgramBench 是一个新的基准测试,用于测试 AI 智能体从编译后的二进制文件及其文档中重建完整代码库的能力。排行榜即将开放提交。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
基准测试:万事万物,无处不在,一气呵成
介绍 Benchmark Agent,一个完全自主的系统,用于创建多样化的基准测试,只需最少的人工干预,支持跨领域的持续模型评估。