我将一个真实产品交给AI系统,让它自我改进,这是实际发生的情况
摘要
作者构建了一个自主AI系统,运行真实产品,生成工作内容、进行质量把关、发起拉取请求,并基于分析结果自我改进。主要挑战在于让系统值得信赖,而非让模型更聪明。
我构建了一个系统,几乎无人干预地运行真实产品。它生成工作内容,依据评分标准进行质量把关,为每项工作发起拉取请求,分发被合并的内容,然后读取生成的分析结果,并为自己的流程提出改进建议。它自身的代码变更也以相同方式提交。我唯一做的就是决定合并哪些内容。让我惊讶的是,困难之处很少与模型的智能程度有关。写作和决策都很好。真正需要下功夫的是让自主性值得信赖:确保每次运行不会默默等待人工介入,每次运行都能报告成功或失败,每个有风险的变更都有回滚机制。产品本身几乎无关紧要。该项目实际产出是一个可复用的机器,能够观察、决策、行动和验证。完整文章:[如何构建一个自主编码、运行并自我改进的AI系统](https://fatihkoc.net/posts/ai-system-that-improves-itself/) 如果你曾将真实工作流交给自主系统,是什么让你确信可以放心地不再监控它?
相似文章
我构建了一个自我改进的AI,你也能做到
作者使用Claude和AutoResearch等工具实验自我改进AI循环,表明递归自我改进不仅限于前沿实验室,还可以自动化新闻通讯的杂务。
我构建了一个不仅能完成任务,还能自我改进管道的智能体
作者构建了一个自主智能体,不仅能完成任务,还能通过观察结果、通过拉取请求进行更改,并使用账本验证每个更改来改进自身的代码和产品。关键洞察在于,一个严格的验证步骤——得出确认、拒绝或不确定的结论——对于系统真正学习至关重要。
尝试让AI代理根据一个产品简报构建整个亚马逊listing。结果超出我的预期,但我仍然不会在最终审查前信任它。
一个AI代理成功地从产品简报创建了完整的亚马逊listing包,展示了自动化电子商务工作流程的潜力,但仍需要人工审查。
@nikunj: 老兄,/goal 就是 AGI,如果有合适的工具的话…… 你说什么?你遍历了整个包含两千多个条目的数据库……
一位用户描述了一个AI代理,它自主修复了数据库中的产品图片、前端错误和描述,使用了浏览器自动化和网络搜索,并在用户与创始人会面的两小时内运行,突显了令人印象深刻的类似AGI的能力。
我以为是产品问题,结果发现是信任问题。
作者发现,改进AI功能需要通过提供来源链接和标记不确定输出来关注用户信任,而不仅仅是提高模型准确性。