@RayFernando1337: 导致用户流失的错误几乎从不出现在差异对比中,只有当你停止审查代码时才能真正捕捉到它们……
摘要
一位开发者分享了在Cursor中使用Opus 4.8 Max Thinking模型与子代理框架的工作流,并介绍了一个包含可安装技能文件的GitHub仓库,其中包含一个名为'running-bug-review-board'的技能,可进行实时QA测试。
查看缓存全文
缓存时间: 2026/06/02 01:53
Opus 4.8 Max Thinking in Cursor with Multitask 工作流在长上下文理解、速度和用 Swift 实现大型功能方面堪称一流。每个子代理都有自己的上下文窗口,这在处理复杂工作流时非常有用。以下是我利用他们顶级子代理框架的一些方式:1. 在规划时,我倾向于让代理启动子代理进行全面研究。对于我不熟悉的新库,我会这样做,这有助于我学习如何将其集成到我的应用中。我还会告诉代理克隆该仓库,并将其用作未来功能的参考。1a. 此外,我进行研究任务时最喜欢的是 Exa code(它会查看比内置 Exa 搜索更多的来源)和 ref tools MCP。2. 我喜欢让代理生成一个全面的分阶段计划,我将在每个阶段后进行验收测试,以便审查集成结果,并为后期阶段中需要处理的更改或错误日志腾出空间。(我会在帖子里分享我的 QA 和 Bug 审核技巧。)3. 让代理根据你的计划为你的工作阶段制作一个交接提示,这样它会提前告诉你它打算实现什么。这样你就可以提出问题或引导代理的工作。这是在与代理一起即时学习且不让思维退化的关键。4. 在手动测试或完成一个阶段的工作后,告诉代理你想要更新计划,以跟踪所需的工作,并帮你界定问题的范围——是在当前阶段修复,还是将其纳入另一个工作阶段。我尝试过很多高度放手的工作流,比如 /goal 或 droid 的 missions,但我更喜欢坐在驾驶座上,学习并将我的代理工程标准提升到新高度。归根结底,作为一名工程师,你对最终进入代码库的内容负责,你会很快感受到你的框架、模型和其他因素的“味道”。Cursor 最新的代理工作流与模型集成得非常好,我迫不及待地想分享在最新版本中将工作流交给云端是多么容易。我目前正在启动一个对 UIKit 的大规模重构,稍后会报告进展。—
RayFernando1337/rayfernando-skills 源码:https://github.com/RayFernando1337/rayfernando-skills
rayfernando-skills
一个 AI 编码代理的可安装 技能文件 集合。目前附带一个——而且这正是大多数团队所缺少的那个。
running-bug-review-board— 将 AI 代理指向你的 运行中 应用,它就会像真实且略显挑剔的客户一样进行 QA:驱动 UI,提交结构化的 P0/P1/P2 错误报告(含复现步骤),并给你一个 YES/NO “可以发布了吗?”的裁决——外加一个可自包含的 HTML 报告,供团队成员共享。
跳转至: 你获得什么 · 查看输出 · 示例提示 · 快速开始 · 安装 · 工作原理 · 内含内容 · 贡献
你获得什么
大多数 AI 工作流都指向代码审查,但忽略了用户实际遇到 bug 的地方:运行中的应用,真实手机上,带有昨天遗留的过期存储以及单元测试从未遇到过的脆弱认证提供者。这个技能文件编码了一套经过实战考验的 QA 节奏,让代理为你找到这些 bug。
- 真正的用户 QA 检查,而非代码审查。 代理通过 URL 和点击来驱动应用——它被禁止通过阅读源码来标记任何内容为“通过”。它寻找用户首先遇到的故障:跨流程的过期状态、移动端溢出、认证与路由之间的竞态条件、错误的文案、在引导过程中返回 404 的路径。
- 结构化的错误报告。 每个缺陷都以
BUG-NNN-*.md格式呈现,包含严重程度(P0/P1/P2)、影响、实际与期望对比、复现步骤以及证据(截图、控制台、网络)。 - 发布/推迟决策。 每次检查都以该阶段的 YES/NO 签收结束,列出未解决的 P0/P1 阻塞项,以及一个可粘贴的交接提示供下一个代理使用。
- 一个可编辑的 HTML 仪表板,利益相关者可以打开和分享——包含 bug 列表和每个 bug 报告,每次检查都会重新生成。(见下文)
- 与你已有的工具兼容。 仓库无关且浏览器工具无关;支持 Web 和 iOS/iPadOS 应用;可选地与 Linear、GitHub Issues、Jira 或 Notion 进行双向同步。只需一个浏览器驱动即可在云 VM(例如 Cursor 云)中正常运行。
查看输出
代理在每次检查结束时重新生成一个自包含的 HTML 报告——设计得像一本杂志,而非看板(编辑印刷风格、纸上油墨色调,没有标签或胶囊)。以下是你立刻获得的内容:
| QA 仪表板 | 单个 bug 报告 |
|---|---|
| QA 仪表板 — 裁决,然后是优先级化的 bug 列表 | Bug 详情 — 影响,实际 vs 期望,步骤,证据 |
| 先显示裁决,然后是优先级化的 bug 列表和最近的运行记录。 | 一个 bug,面向工程师讲述: 影响 → 实际 vs 期望 → 步骤 → 证据。 |
它也是响应式的——在手机上,仪表板会折叠成单列,并带有一个粘性主要操作。(移动端示例 · 设计说明)
示例提示
技能安装后,只需用自然语言告诉你的代理:
QA 这个应用。在移动端运行手动测试计划,告诉我哪里坏了。
阶段 3 可以发布了吗?给我一个 YES/NO 以及未解决的 P0/P1 列表。
像一个拥有过期存储的新用户一样驱动注册流程,并归档你发现的任何 bug。
在最新构建上重新测试已修复的 bug BUG-007 和 BUG-012,并更新报告。
和我一起对未完成的积压工作运行互动式 Bug 审核板。
该技能会在短语如 “QA this”、“is this ready to ship?”、“find the bugs” 或 “run a test plan” 时激活——你无需提及它的名字。
快速开始
安装后,代理会自动执行:
- 发现应用 — 阅读产品规格 / README / 阶段文档、打开的错误和公共路由。
- 计划 — 根据规格和门控条件推导出真实用户场景。
- 准备 — 环境、测试账户、主视口。
- 执行 — 像客户一样驱动应用,捕获证据。
- 归档 bug —
BUG-NNN-*.md包含优先级 + 复现步骤。 - 签收 — YES/NO 裁决、未解决的 P0/P1 列表和可粘贴的交接。
还没有 QA 文件夹? 该技能附带一个脚手架工具。安装后它位于技能文件夹中(例如 ~/.claude/skills/running-bug-review-board/scripts/scaffold-qa.sh)。如果不安装就直接运行,请克隆并直接调用:
git clone https://github.com/RayFernando1337/rayfernando-skills.git
bash rayfernando-skills/plugins/running-bug-review-board/skills/running-bug-review-board/scripts/scaffold-qa.sh \
/path/to/your/repo PHASE_NUMBER
这将在 docs/qa/ 中创建 bug 模板、运行报告骨架、门控检查清单以及一个按阶段划分的手动测试计划。该操作是幂等的,不会覆盖现有文件。
安装
选择你使用的代理对应的部分。每个部分安装的都是同一个技能文件;区别仅在于代理如何发现它。
Claude Code
/plugin marketplace add RayFernando1337/rayfernando-skills
/plugin install running-bug-review-board@rayfernando-skills
要固定特定发布标签,请将其附加到 marketplace add 命令(例如 @v0.4.0)。文档:code.claude.com/docs/en/plugin-marketplaces (https://code.claude.com/docs/en/plugin-marketplaces)。
Factory Droid
droid plugin marketplace add https://github.com/RayFernando1337/rayfernando-skills
droid plugin install running-bug-review-board@rayfernando-skills
Factory Droid 读取与 Claude Code 相同的 .claude-plugin/marketplace.json。文档:docs.factory.ai/cli/configuration/plugins (https://docs.factory.ai/cli/configuration/plugins)。
Codex(应用、桌面、IDE 和 CLI)
在 Codex CLI 上,添加 marketplace 并安装:
codex plugin marketplace add RayFernando1337/rayfernando-skills
codex plugin add running-bug-review-board@rayfernando-skills
如果旧版 Codex CLI 没有 plugin add,打开 Codex,输入 /plugins,切换到 rayfernando-skills 选项卡,然后点击 Install。在应用/桌面中,使用插件 / 技能安装器,然后重启 Codex 以使技能缓存重新加载。文档:developers.openai.com/codex/plugins/build (https://developers.openai.com/codex/plugins/build)。
Codex 显示 “invalid description: exceeds maximum length of 1024 characters”?你可能运行的是缓存的 running-bug-review-board 0.3.0 安装。更新或重新安装 running-bug-review-board@rayfernando-skills,然后重启 Codex(应用、桌面、IDE 或 CLI)以刷新插件缓存。(0.3.1+ 版本提供了符合 Codex 验证的元数据,发布管道现在也会验证它。)
Cursor
Cursor 的 /add-plugin 只保留给 cursor.com/marketplace (https://cursor.com/marketplace) 列表,因此对于本仓库,请使用跨供应商安装器——它会将技能文件夹写入 ~/.cursor/skills/,Cursor 在启动时会读取该文件夹:
npx skills add https://github.com/RayFernando1337/rayfernando-skills/tree/main/plugins/running-bug-review-board/skills/running-bug-review-board -a cursor
文档:cursor.com/docs/skills (https://cursor.com/docs/skills)。
跨供应商:npx skills add
vercel-labs/skills (https://github.com/vercel-labs/skills) 安装器会检测你机器上每个受支持的代理 CLI,并将技能文件夹写入每个代理期望的位置(Claude Code、Cursor、Codex、Factory Droid、Windsurf、Zencoder 等约 50 个):
npx skills add https://github.com/RayFernando1337/rayfernando-skills/tree/main/plugins/running-bug-review-board/skills/running-bug-review-board
添加 -a <工具> 以针对一个工具(-a cursor、-a codex、-a droid)或 --all 以针对所有检测到的代理。
claude.ai(设置 → 功能 → 技能)
从最新发布 (https://github.com/RayFernando1337/rayfernando-skills/releases/latest) 下载 running-bug-review-board.zip 并上传。要从本地克隆构建 zip 文件(claude.ai 期望 zip 根目录包含 SKILL.md):
cd plugins/running-bug-review-board/skills
zip -r ../../../running-bug-review-board.zip running-bug-review-board
手动安装(任何其他代理)
克隆一次,然后将技能文件夹符号链接到你的代理读取的任意目录:
git clone https://github.com/RayFernando1337/rayfernando-skills.git ~/Code/rayfernando-skills
ln -sf ~/Code/rayfernando-skills/plugins/running-bug-review-board/skills/running-bug-review-board \
~/./skills/running-bug-review-board
将 ~/./skills/ 替换为你的代理路径(~/.cursor/skills/、~/.codex/skills/、~/.factory/skills/……)。同一个符号链接可以提交到项目内部(例如在 .claude/skills/ 或 .cursor/skills/ 下),这样任何克隆该项目的人都能获得该技能。
技能文件工作原理
- 驱动运行中的应用。 代理通过 URL 和点击工作;仅通过代码检查就标记 PASS 是被禁止的。
- 三种角色,一次检查。 每次检查都扮演 PM(产品是否仍兑现承诺?)、QA(运行带证据的用户场景)和工程师(捕获无效假设)。找出漏洞是目的所在。
- BRB(Bug 审核板)节奏。 Bug 存在于版本化文件夹中,带有状态转换(
open → in-progress → fixed → verified)。P0/P1/P2 告诉团队要发布什么以及推迟什么。分诊在单独的互动式 Bug 审核板会话中进行,这样分诊偏见绝不会污染发现过程。 - 工具和仓库无关。 它采用已有的任何约定,并在没有文件夹时创建脚手架。支持并行或串行 QA 模式。
浏览器和计算机使用
代理使用你环境中最好的驱动来驱动 UI,并优雅降级——因此无论你是在 Cursor、另一个 IDE 还是无头云 VM 中,一次检查都能成功:
- cursor-ide-browser MCP(Cursor 默认)
- Chrome DevTools for agents (https://github.com/ChromeDevTools/chrome-devtools-mcp)(
chrome-devtools-mcp)——自动等待结果(更少的脆弱竞态),并添加网络/控制台/Lighthouse/无障碍性检查;可以附加到你的真实登录态 Chrome,这样认证流程不会被机器人标记。 - browser-use MCP / Playwright
- Codex Computer Use(macOS)——一种人类保真度的检查,能看到、点击和键入真实应用,也是到达原生 macOS 应用的唯一方式。
- 使用截图/控制台中继进行手动驱动
详细信息和“像人一样驱动(不要触发测试)”的方法请参考 浏览器手册 和 计算机使用手册。
对于 iOS/iPadOS 应用,该技能编排并将模拟器驱动工作委托给 iOS 社区专门构建的技能——并且绝不会为一个纯 Web 应用启动 iOS 模拟器。
技能文件内含内容
每个技能文件采用渐进式披露:一个精简的 SKILL.md 入口点,引用仅在需要时加载。审计该技能(或让您自己的代理进行安全检查)从以下位置开始:
SKILL.md— 入口点:工作流、界面、模式、交付物。references/— 详细的手册(发现、测试计划、浏览器、计算机使用、iOS、跟踪器、分诊、HTML 报告、扩展)。scripts/— 小型 shell 辅助脚本(创建 QA 文件夹脚手架、列出需要跟踪器同步/拉取的 bug)。没有魔法;工作由代理完成。
仓库结构
rayfernando-skills/
├── .claude-plugin/
│ └── marketplace.json # 市场目录
├── plugins/
│ └── running-bug-review-board/
│ ├── .claude-plugin/
│ │ └── plugin.json # 插件清单
│ └── skills/
│ └── running-bug-review-board/
│ ├── SKILL.md # 精简入口点;按需加载引用
│ ├── references/ # 按需加载
│ │ ├── workflow.md
│ │ ├── discovering-the-app.md
│ │ ├── test-plan.md
│ │ ├── test-accounts.md
│ │ ├── session-hygiene.md
│ │ ├── browser-playbook.md
│ │ ├── computer-use-playbook.md
│ │ ├── ios-simulator-playbook.md
│ │ ├── parallel-coordinator.md
│ │ ├── sequential-wrapup.md
│ │ ├── bug-filing.md
│ │ ├── gate-merge.md
│ │ ├── issue-trackers.md
│ │ ├── brb-interactive.md
│ │ ├── triage-heuristics.md
│ │ ├── html-report-style-guide.md
│ │ ├── extending-the-skill.md
│ │ └── templates/ # bug、测试计划、运行报告、合并、BRB、
│ │ │ # qa-config 和 html-report/ + samples/
│ │ └── html-report/
│ └── scripts/
│ ├── scaffold-qa.sh # 创建 QA 文件夹布局
│ ├── bugs-needing-sync.sh # 列出缺少跟踪器 ID 的 bug
│ └── bugs-needing-pull.sh # 列出具有过时跟踪器同步的 bug
├── scripts/
│ └── validate-skill-metadata.py # 发布时的 Codex-元数据验证器
├── .github/workflows/release.yml # 在标签推送时构建 claude.ai 的 zip 文件
├── CHANGELOG.md
├── LICENSE
└── README.md
贡献
欢迎提交 Issue 和 PR。如果你在真实项目中使用过该技能文件,简短写下学到的经验是最有价值的贡献——一个拯救过你的会话卫生规则、一个揭示了新用户模式的 bug,或者一个操作方法。
相似文章
使用Cursor的Bugbot实现更快的代码审查(3分钟阅读)
Cursor的Bugbot代码审查工具现速度提升超过3倍,成本降低22%,发现错误数量增加10%,大多数审查运行在3分钟内完成。此次更新还新增了在推送前运行审查以及仅审查新更改等功能。
@ClaudeDevs:Claude Code 新增 /ultrareview(研究预览版),在云端部署一群捕虫特工,自动在合并关键变更前找出漏洞。
Claude Code 推出 /ultrareview,基于云端的 AI 特工集群,可在合并关键变更前自动猎杀漏洞。
@steipete: 编写了一个技能,循环运行codex /review直到没有错误为止。注意:它不会修复系统架构…
Peter (@steipete) 创建了一个技能,循环运行Codex的/review命令来修复代码问题,但指出它不会修复系统架构。相关的GitHub仓库'agent-scripts'包含共享的代理指令、技能和辅助脚本,用于本地工作空间。
我想看看一个小型DIY审查团队(bug猎手、守护者、清扫者)能有多接近成熟的审查产品。在一个包含50个真实PR的公开基准测试中,它击败了Cursor Bugbot和CodeRabbit,而诀窍并不在于角色本身。
一个使用角色(bug猎手、守护者、清扫者)的小型DIY审查团队在50个PR的基准测试中取得了比Cursor Bugbot和CodeRabbit更高的性能,证明了基于角色的审查策略的有效性。
Opus 与 Qwen 针对同一 bug 和同一仓库,但一个代理完成速度却快了 7 倍
Opus 和 Qwen AI 编程代理在相同 bug 和仓库上的对比显示,一个代理完成速度提升了 7 倍,引发了关于单提示 GitHub 问题解决技巧的讨论。