@marfinxx:微软研究人员发表了一项里程碑式研究,定义了从 Harness Engineering 到 Loop Engineering 的转变,在编码…

X AI KOLs Timeline 论文

摘要

微软研究人员发表了一项里程碑式研究,介绍了 LoopsBench,一个用于评估自纠正编码智能体循环的框架,并概述了从 Harness Engineering 到 Loop Engineering 的转变,以实现可靠的自主开发。

微软研究人员发表了一项里程碑式研究,定义了编码智能体中从 Harness Engineering 到 Loop Engineering 的转变 对于部署自主开发者、Claude Code 循环和生产执行封装器的软件架构师来说至关重要 在静态 harness 封装器上评估编码智能体从根本上是有缺陷的:随着任务范围扩大,一次性提示会失败,因为不受管理的循环会遭受状态漂移和不可恢复的执行错误 他们的 LoopsBench 框架为自纠正智能体循环建立了一个动态评估栈 生产循环栈的六大内部机制: 01 证据门控重试控制 → 评估中间执行日志,以触发有针对性的重试,而不是在完整提示重跑上消耗 token 02 零睡眠连续执行 → 在执行步骤间调度非阻塞工具调用,无需开发者延迟等待 03 上下文隔离的循环状态 → 在验证后剥离中间错误膨胀,以在 50+ 次执行轮次中保持工作记忆清洁 04 执行状态检查点 → 在每次成功的子任务后保存已验证的 AST 树快照,以便在失败时实现即时回滚 05 自动诊断探测 → 向候选代码路径注入有针对性的测试探针,以隔离编译器和运行时异常 06 确定性收敛门 → 当所有 lint 规则和单元测试断言通过时,自动终止执行循环 将 harness engineering 与自纠正循环控制相结合,可将非确定性编码模型转变为可靠的生产级软件工程师 在下方文章中阅读完整分析 ↓
查看原文
查看缓存全文

缓存时间: 2026/08/10 07:27

Microsoft 研究人员发布了一项里程碑式研究,定义了编码智能体从 Harness 工程到 Loop 工程的转变

对于部署自主开发者、Claude Code 循环以及生产执行 harness 的软件架构师至关重要

在静态 harness 包装器上评估编码智能体存在根本性缺陷:随着任务范围的扩大,一次性提示会失效,因为不受管理的循环会遭遇状态漂移和无法恢复的执行错误

他们的 LoopsBench 框架为自校正智能体循环建立了一个动态评估栈

生产循环栈的六大内部机制:

01 证据门控重试控制 → 评估中间执行日志以触发有针对性的重试,而不是在完整的提示词重跑上浪费 token

02 零等待连续执行 → 跨执行步骤调度非阻塞工具调用,无需开发者的延迟等待

03 上下文隔离的循环状态 → 在验证后剥离中间错误冗余,使工作内存在 50+ 个执行回合中保持干净

04 执行状态检查点 → 在每个成功的子任务后保存经过验证的 AST 树快照,以便在失败时即时回滚

05 自动化诊断探测 → 向候选代码路径注入有针对性的测试探针,以隔离编译器和运行时异常

06 确定性收敛门 → 当所有 linter 规则和单元测试断言通过时,自动终止执行循环

统一 Harness 工程与自校正循环控制,将非确定性编码模型转变为可靠的生产级软件工程师

在下方文章中阅读完整解析 ↓

相似文章