我给了 GPT 5.5 一个空的 GitHub 仓库,让它自己去搞明白该干什么

Reddit r/AI_Agents 新闻

摘要

一位开发者分享了一个实验:给 GPT 5.5 一个空的 GitHub 仓库,让它自主构建一个名为 Autonomous Forge 的项目管理器,该管理器会阅读路线图和规则,以安全地进行 AI 代码修改。

我前几天有了个愚蠢的想法:如果给 GPT 5.5 一个空的 GitHub 仓库,告诉它每小时工作一次,然后让它慢慢构建一些东西,会发生什么?现在,它每小时醒来一次,检查之前做了什么,决定接下来该做什么,写代码,测试,然后提交。至少计划是这样的。目前,它在第一次提交中创建了一个路线图、一个变更日志、一个状态文件和一个解释其决策的文件。所以基本上,它立即变成了一个项目经理。但我真的很好奇这会发展成什么。也许一个月后,它会变成一个真正有用的工具。也许它会变成一个拥有 900 次提交的仓库,而且不知怎么的,所有这些提交都是 README 更新。我把整个过程公开,因为我觉得这样更有趣。你可以亲眼看到它做决定、测试失败、修复问题,或者可能过度思考本应只需 10 行代码就能搞定的事情。我不知道这是一个很酷的实验,还是只是一个非常高级的逃避工作的方法。仓库链接在评论中。编辑:我问了 AI 它想要构建什么,它说:"我正在构建 Autonomous Forge,作为 GitHub 项目的安全 AI 维护管理器。我会阅读项目的路线图和规则,选择一个小任务,使用 AI 模型进行修改,运行测试,准确显示更改内容,并清晰记录每一步操作。我的目标不是让 AI 自由编辑代码,而是让 AI 编码在提交或推送之前受到控制、验证并确保安全。" 哈哈,有趣,所以一个自主 AI 正试图创建一个自主系统,哇。编辑 2:我已经安排了另一个代理来将速度提高 2 倍。
查看原文

相似文章

为开发者推出 GPT-5

OpenAI Blog

OpenAI 在其 API 平台发布 GPT-5,这是一款最先进的模型,在 SWE-bench Verified 上达到 74.9% 的成绩,在编码、智能体任务和长上下文推理方面表现卓越。此次发布包含三个模型规格(gpt-5、gpt-5-mini、gpt-5-nano)以及新的 API 功能,如详细程度控制、最小推理模式和自定义工具。

GPT-5.5 正式发布

OpenAI Blog

OpenAI 发布了 GPT-5.5,这是其前沿 AI 模型的重大升级,在保持高效与速度的同时,在智能体编码、研究以及多步骤任务执行等方面具备更强的能力。

面向开发者推出GPT-5.1

OpenAI Blog

OpenAI发布了GPT-5.1,这是GPT-5系列中的一个新模型,它可以基于任务复杂度动态调整思考时间,在保持前沿智能的同时,性能比GPT-5快2-3倍。此次发布包括扩展的提示缓存(24小时保留)、新的编码工具(apply_patch和shell),以及针对延迟敏感应用的“无推理”模式。

利用 GPT-5.1-Codex-Max 构建更多

OpenAI Blog

OpenAI 推出 GPT-5.1-Codex-Max,这是一款新的智能代理编码模型,具有改进的推理能力、token 效率,以及通过“压缩”机制在数百万个 token 上保持连贯工作的能力。该模型更快速、更智能,可以持续运行数小时甚至数天的长时间任务,代表了 AI 辅助软件工程的重大进步。