@KLieret: 你可以自己在 ProgramBench 上进行评估:https://github.com/facebookresearch/ProgramBench/… 我们将开放排行榜…

X AI KOLs Following 论文

摘要

ProgramBench 是一个新的基准测试,用于测试 AI 智能体从编译后的二进制文件及其文档中重建完整代码库的能力。排行榜即将开放提交。

你可以自己在 ProgramBench 上进行评估:https://github.com/facebookresearch/ProgramBench/… 我们将很快开放排行榜供提交。
查看原文
查看缓存全文

缓存时间: 2026/05/14 04:29

ProgramBench

语言模型能否从零重建程序?

仅凭编译后的二进制文件及其文档,AI代理必须架构并实现一个完整的代码库,以复现原始程序的行为。

相似文章

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。