@dzhng:刚刚发现我的软件工厂技能仓库在GitHub上获得了约1k星标。为庆祝,我添加了一个Karpathy风格的自动研究技能…

X AI KOLs Timeline 工具

摘要

本文宣布GitHub仓库'dzhng/skills'获得了1,000星标,并介绍了一种新的Karpathy风格自动研究技能,用于自主软件开发,强调了一种基于工厂的方法,利用AI代理构建软件。

刚刚发现我的软件工厂技能仓库在GitHub上获得了约1k星标 😬 为庆祝,我添加了一个Karpathy风格的自动研究技能,用于在典型软件工厂流程之外攻克特定技术瓶颈。 我还能添加什么? https://t.co/WcLfM9NhP6
查看原文
查看缓存全文

缓存时间: 2026/09/26 15:03

刚发现我的软件工厂技能库现在有约1k个GitHub星标了 😬 为了庆祝,我新增了一个Karpathy风格的自动研究技能,用于在典型软件工厂循环之外快速解决特定技术瓶颈。还需要添加什么吗?https://t.co/WcLfM9NhP6

dzhng/skills

来源:https://github.com/dzhng/skills

技能

skills.sh (https://skills.sh/dzhng/skills)

用于构建软件工厂的AI技能。 我个人的领域无关代理技能库,在每个项目中重复使用。小巧、可组合且可定制——适用于任何支持技能的运行框架:Claude Code、Codex、opencode、Cursor、duet (https://duet.so) 和其他70多种工具 (https://github.com/vercel-labs/skills)。

npx skills add dzhng/skills

添加 --list 选择单个技能,或将任何 skills/// 文件夹复制到您的运行框架技能目录(例如 .claude/skills/)。从克隆仓库运行 npm run install-skills 无需注册表即可完成同样操作:

npm run install-skills # 安装到 ~/.agents/skills,从 ~/.claude/skills 创建链接
npm run install-skills -- ../my-app # 安装到仓库而非主目录
npm run install-skills -- --only write-spec,review ../my-app # 仅安装指定技能
npm run list-skills # 显示名称和分类

.agents/skills// 存放实际文件(扁平化,无分类,跨类别链接已重写以匹配);.claude/skills/ 是指向它的相对符号链接,因此两个运行框架读取同一份副本。重新运行会覆盖已安装的副本——如果您保留 .claude/skills/ 作为真实目录则不会受影响,已是符号链接的 .claude/skills 也保持不变。添加 --dry-run 可先查看计划。

为什么

软件正在从任务转向工厂:代理自主追求目标,直到输出可被信任。难点不在于将目标拆解为任务——而在于将其分解为可独立验证的部分,并知道这些部分位于何处。这些技能正是运行这个循环。

将未知视为战争迷雾:绘制地形,将其划分为可独立构建和验证的区域,并对任何隐藏更多地图的区域进行递归重切。重新规划不会在计划结束时停止——规范是一份活文档,在实现过程中每当工作表明计划已过时时,就会更新和重新切分。每个部分都必须证明自己——通过架构评审、代码评审以及与基线的视觉评审——然后循环才会继续进行。每次迭代都比上一次少一些错误,直到目标完成。

一次自主运行——1天,16小时专注于一个目标> 证明:一次无人值守的Codex运行,基于这些技能,专注于一个目标 1天16小时,不断切分和迭代直至完成。

如何使用

使用链式流水线构建功能,使用研究循环探索有效方法,或根据需要使用单个技能。每个技能都可独立使用。

完整循环——大型功能,从头到尾

完整循环——探索、规范、无人值守构建、评审选择

  1. 绘制迷雾地图。 对想法使用 /explore-unknowns。它会逐个象限地询问您,并为您提供渲染的选项、模型和决策表以供反应,而不是让您凭空想象。最终您将清楚这个功能是做什么的。

  2. 编码规范。 对该地图使用 /write-spec。大多数决策已在上游做出,因此这一步只是转录——我不阅读规范。对于遇到的任何真正新问题,它会询问而非自行决定。

  3. 构建。 启动循环:

/goal /implement-spec specs/

/goal 是使运行框架进入循环模式的指令——在 Claude Code 或 Codex 中是相同操作——然后由规范驱动执行。小型功能需要几小时,大型功能需要两到三天。添加适合的描述:在xyz分支上,或 使用 /codex 作为执行者,而您保持为父级编排器和评审者。

  1. 评审选择,而非差异。 运行通过整合 specs//choices.md 结束——代理在规范未明确说明时所做的每个决策,按置信度从低到高排序。这是评审界面。将更改发送回去,下一轮会重新审计:每次AI编写代码时,您审计它所做的选择。其余部分自动触发:每个切分结束时的 /review 流程,任何可视化内容的 /screenshot-critique 和 /compare-screenshots,最后一个切分完成时的 /close-spec,以及每当实现证明计划过时时对计划的重新切分。

预算:步骤1-2需要30分钟到几小时,步骤4需要30分钟到几小时。运行两天的案例,两端各约2-3小时。您的时间花在两端;中间是无人值守的。

研究——通过快速实验学习

当下一个决策需要实验证据时使用 自动研究。它从一个快速、有启发性的任务开始,测试一小批假设,检查组合,并随着方法改进扩大覆盖范围。新的失败成为焦点;早期任务成为回归检查。

/auto-research 将每个任务的成本相对于保存的基线至少降低15%,同时不降低任务成功率。从一个快速开发任务开始。

如果评估器、指标、基线或所需改进不明确,该技能会在实验前进行询问。通过评估与达到改进目标是独立的要求。输出包括经过验证的最佳工件和参数效应图:测试了什么,在哪里有帮助或伤害,以及更改如何相互作用。当研究准备好实现时,使用该证据来指导规范。

自选模式——自发路径

  • 头脑风暴变成了一个功能。 /explore-unknowns 在讨论结束时与开始时同样有效——运行它以扫描你们都没想到的角度,然后在步骤2继续循环。
  • 任何未来自规范的代码更改。 一个临时修复触及了预期之外的内容:首先使用 /review(重构清理 → 代码评审 → 编写文档),然后使用 /audit-choices。当差异太大无法阅读时,选择账本是您仍然了解代码库中现在内容的方式。

技能

工程——切分、构建、验证、重复

技能功能
explore-unknowns引导用户逐象限绘制任务未知部分的地图——先绘制已知的已知部分,然后进行访谈、可反应工件和盲点扫描——最终完成完整的四象限地图。
auto-research通过快速、渐进的实验进行优化,产出经验证的候选方案和参数效应及权衡图。
write-spec将大型功能分解为可独立验证、可供人类评审的切片,具有API接缝和可执行的检查点。
implement-spec一次评审通过地构建现有规范至完成,并行委派独立切片。
implement-spec-with-codex运行implement-spec,由Codex编写代码——您进行编排、集成和评审每次通过。
close-spec归档已发布的规范,并将其从构建计划重写为持久的理由记录,指向代码。
refactor-clean通过将所有权移至一个清晰概念而非在问题旁边堆叠兼容性沉积物来进行重构。
write-tests逐个追踪弹编写测试,固定真实行为——而非实现细节、配置值或幸运样本。
audit-performance查找放大或重复而没有进展的热路径,按实际失败风险排序,并优先选择最小化有界修复以保持修复能力。
write-docs将文档编写为原则和指针的词汇表,而非会腐烂的代码的镜像。
code-review审计差异中的过时名称、无效引用、不必要的复杂性和叙述而非解释的注释——最终给出干净/不干净的判定。
audit-choices审计执行者所做的选择,而非其差异——一个纯粹、永不阻塞的审计,其账本披露了架构和代表用户做出的决策,评审而非代码。
eli5用通俗语言解释规范或更改而不失精确性——其他技能用于独立、分步场景解释时借鉴的ELI5语域。
review作为一次流程完成已完成的更改——重构清理,然后代码评审,然后编写文档——顺序形成单一判定。
codex使用本地 Codex CLI 作为独立的第二代理进行评审和(明确要求时)委派实现。
claude使用 Claude Code (claude -p) 作为独立的第二代理进行咨询和(明确要求时)委派实现。
marketing-pages按页面类别编写、更新和审计营销页面的规则手册——活动着陆页保持未索引和未链接状态并带有一个CTA;其他所有内容都为其站点地图条目、爬虫轨道链接和规范副本来源赢得位置。

视觉评审——绝不凭感觉接受视觉效果

技能功能
compare-screenshots根据您设定的目标判断哪张图像错误更少——使用遥测技术定位分歧,而非基线匹配。提供一个可重复使用的差异脚本,也可测量单个截图的平淡、空白或构图错误。
screenshot-critique使用未预先提示的子代理作为视觉工作的第二双眼睛,然后再接受;在宣布报告的视觉错误修复之前必须执行此操作。
preview-shots在一个macOS预览窗口中打开一组精选的图像截图供用户目视检查。

创作——保持技能本身精炼

技能功能
write-skills创建或修订代理技能:触发器、引导词、渐进式披露以及需要修剪的失败模式。
eval-skills根据黄金案例评估技能——在新子代理中进行盲测、独立判断和基于差距的编辑。

图形

技能功能
renderer构建、调试或评审WebGPU渲染器工作——three.js/TSL场景层、节点材质、WGSL通道、深度语义和浏览器验证的视觉效果。

许可证

MIT

相似文章