我构建了一个开源技能,防止编程智能体对简单任务过度思考

Reddit r/AI_Agents 工具

摘要

一个开源智能体技能将编程任务分为 S/M/L/XL 复杂度等级,以设置适当的执行深度,防止对简单修复的过度思考,并支持基于证据的重新分类。

你好,我构建了 Code Complexity Router,一个开源的智能体技能,可在执行前将编程任务分类为 S、M、L 或 XL。目标很简单:两行代码的修复不应获得架构级探索,而高风险迁移也不应只获得笔误级验证。这些复杂度等级定义了智能体的起始执行深度——并非对其可调查范围的硬性限制。基于现有证据,该技能会调整:上下文收集、规划深度、验证深度、推荐模型层级、token 及工具使用纪律。示例:小任务——重命名一个按钮。智能体从聚焦检查开始:检查目标文件以及一个相关文件(如有用);做出最小且安全的更改;运行聚焦验证;除非有证据表明影响范围更广,否则避免广泛搜索。如果首次检查发现额外的调用点、共享值、生成文件、间接依赖或敏感行为,任务会在任何代码更改之前立即重新分类。该技能区分:基于检查的升级(当仓库证据推翻初始范围时)和基于失败的升级(当首个实现假设或验证失败时)。它还维护一份紧凑的“任务范围契约”(Task Scope Contract),包含已接受的范围、支持证据、已知排除项、聚焦验证和升级条件。这有助于在模型切换和恢复会话时保持连续性。当自动模型切换不可用时,该技能控制工作流深度,而不是声称改变所选模型。GitHub 仓库链接见评论区。我期待以下反馈:错误的 S/M/L/XL 分类;缺失的升级触发器;Codex 兼容性;任务范围契约的有用性;该技能是否在不隐藏复杂性的前提下减少了不必要的上下文、工具调用和验证工作。我还正在准备 A/B 基准测试,比较有无该技能时完成任务的情况。
查看原文

相似文章