我构建了一个开源技能,防止编程智能体对简单任务过度思考
摘要
一个开源智能体技能将编程任务分为 S/M/L/XL 复杂度等级,以设置适当的执行深度,防止对简单修复的过度思考,并支持基于证据的重新分类。
你好,我构建了 Code Complexity Router,一个开源的智能体技能,可在执行前将编程任务分类为 S、M、L 或 XL。目标很简单:两行代码的修复不应获得架构级探索,而高风险迁移也不应只获得笔误级验证。这些复杂度等级定义了智能体的起始执行深度——并非对其可调查范围的硬性限制。基于现有证据,该技能会调整:上下文收集、规划深度、验证深度、推荐模型层级、token 及工具使用纪律。示例:小任务——重命名一个按钮。智能体从聚焦检查开始:检查目标文件以及一个相关文件(如有用);做出最小且安全的更改;运行聚焦验证;除非有证据表明影响范围更广,否则避免广泛搜索。如果首次检查发现额外的调用点、共享值、生成文件、间接依赖或敏感行为,任务会在任何代码更改之前立即重新分类。该技能区分:基于检查的升级(当仓库证据推翻初始范围时)和基于失败的升级(当首个实现假设或验证失败时)。它还维护一份紧凑的“任务范围契约”(Task Scope Contract),包含已接受的范围、支持证据、已知排除项、聚焦验证和升级条件。这有助于在模型切换和恢复会话时保持连续性。当自动模型切换不可用时,该技能控制工作流深度,而不是声称改变所选模型。GitHub 仓库链接见评论区。我期待以下反馈:错误的 S/M/L/XL 分类;缺失的升级触发器;Codex 兼容性;任务范围契约的有用性;该技能是否在不隐藏复杂性的前提下减少了不必要的上下文、工具调用和验证工作。我还正在准备 A/B 基准测试,比较有无该技能时完成任务的情况。
相似文章
我构建了一个开源技能,在生成UI之前为编程代理提供持久的设计系统
作者构建了一个开源技能,在生成UI之前为编程代理提供持久的设计系统
我是如何构建一个开源技能,强制AI智能体进入principal-architect模式的
一位开发者描述了他如何创建一个开源技能,强制AI智能体采用principal-architect模式,从而增强其推理和设计能力。
我用一个 Codex skill 替换了一个相当复杂的 Reddit 研究智能体。我开始觉得很多“智能体”其实就应该做成 skill。
作者认为许多研究型智能体项目可以用在现有 harness(如 Codex)中运行的“skill”来替代,并分享了他们将一个 Reddit 客户研究流程实现为 Codex skill 的经验,其中只使用了确定性的 Python 辅助函数,同时对何时真正需要自定义智能体运行时提出了质疑。
@liumengxinfly: 试了下 improve-codebase-architecture 这个 skill,作者说定期跑这个可以清理 AI Slop,我跑了一下清理的都是用 AI 前我手写的代码
This article shares a developer's experience using the improve-codebase-architecture skill from mattpocock/skills, which claims to clean up AI-generated slop but apparently also removes code written before using AI. The skill set is a collection of small, composable agent skills for real engineering.
我开源了一个Codex技能,将模糊的提示转化为保留意图的执行循环
作者开源了一个名为'prompt-to-loop-engineer'的Codex技能,它能够将模糊的提示转化为结构化的、保留意图的执行循环,并带有防漂移检查,旨在让智能体在现实任务中更可靠。