AI生成的软件需要独立于模型置信度的完成信号
摘要
介绍Flows,一个面向软件构建代理的执行与验证层,主张代理需要与模型置信度并行的独立完成信号,并通过一个59/59检查全部通过的多模块应用加以验证。
我正在构建 **Flows**,一个面向软件构建代理的执行与验证层。核心规则:代理不应在缺乏佐证的情况下,将“我认为完成了”转化为“已验证完成”。一个Flows项目可以包含实现步骤、检查、修复指令、审查和发布条件。https://flows.oortstack.com 一个独立代理使用单一计划构建了一个真实的多模块应用,59/59项自动化检查全部通过。目标指标是:**在真实流量上,未经支持的必要声明交付数为0。** 证据执行应该放在代理框架、仓库CI、应用平台,还是跨代理工作区中?
相似文章
为创建软件的 AI 智能体构建证据层
作者介绍了 Flows,一个用于构建软件的 AI 智能体的执行与验证层,它要求在将任务标记为完成之前提供证明,并在一个真实的多模块应用上成功进行了测试。
给AI编码智能体一个确定性的“架构检查器”,使其不再假装“完成”
本文描述了给AI编码智能体一个确定性的架构检查器,该检查器检查事件风暴图中的机械性缺口和未决问题,确保智能体不会假装完成。
一次成功的代理运行并不等同于验证。我们的一项相同模型消融研究完成了60/60个任务,但正确率为0/60。
本文基于一项消融研究,指出AI代理中成功完成任务并不保证正确性的一种失败模式,并介绍了AdaptOrch作为在代理工作流中实现外部验证和可靠性的工具。
智能体需要控制流,而非更多提示词
文章认为,可靠的 AI 智能体需要在软件中具备确定性的控制流和程序化验证机制,而不能仅仅依赖复杂的提示词链。
外部验证一直是我编码代理运行中缺失的关键环节
作者指出,在有效使用 AI 编码代理时,外部验证是一个关键缺失的组成部分。