@Vtrivedy10: 好的,虽然现在还早,但 @mattpocockuk 的 grill-me 技能感觉像是在迭代构建评估/环境时的绝佳开发者体验…
摘要
一条推文讨论了为AI代理构建评估和环境的迭代过程,强调了人机协作以及数据和验证器设计的重要性。
查看缓存全文
缓存时间: 2026/07/15 03:43
嗯,虽然时间还早,但@mattpocockuk的“拷问式”技能感觉像是很好的开发者体验,能帮人类和智能体在循环中迭代构建评估/环境
理解一个仓库+追踪记录+成功标准几乎从来不是一次性的事情,而是人类和智能体之间多步骤的协作
我不知道如何衡量和改进每一个智能体,所以被拷问一下很有帮助
仅凭智能体定义和数据转储,根本无法知道团队想在哪一维度上生成评估来进行衡量和渐进式改进
这里细节很重要:
- 验证器设计(我们是否有某种形式的真相来源)
- 环境中哪些工具应该被模拟,哪些应该(半)实时运行
- 当前我们最关心哪些特性?成本、准确性等?
- 需要从何处获取或合成数据,才能构建出接近真实生产的环境?具体怎么操作?
数据是构建更好智能体的货币
人类分享专业知识/先验知识,并控制数据设计的循环,这在当下非常有帮助
这看起来很棒,谢谢指路!
是的!+ 环境/评估生成是人类可以投入时间的高杠杆领域之一,也确实应该如此。环境的质量决定了智能体的行为
在Codex和DeepAgents里对我来说运行良好
得去试试看!
相似文章
@BraceSproul: 我一直在思考很多关于通用AI代理中所需的两种不同的评估组,这些代理处理广泛的任务…
一条推文讨论了通用AI代理所需的两种不同的评估套件:轻量级基准评估用于快速迭代,以及全面的测试覆盖评估用于对各种用户路径进行彻底验证。
@mattpocockuk: Going live, doing a full feature build using: - /grill-with-docs - /handoff - /prototype
Matt Pocock live streams building a 'delivery calendar' feature for his course video manager using AI tools like Grill with Docs. He focuses on aligning terminology and data models with AI agents, and discusses the importance of coding standards for agent experience (AX).
@nurijanian: 我用AI编写需求最喜欢的方法 1. /grill-me by @mattpocockuk https://github.com/mattpocock/skills… 2.…
讨论用AI编写需求时最喜欢的工具和方法,重点介绍了Matt Pocock的/grill-me技能以及一个基于业务分析师文献的新技能,旨在改善对齐并减少AI编码代理的冗长性。
@shao__meng: AI 驱动开发的七阶段 1. Grill 2. Research 3. Prototype 4. PRD 5. Issues 6. Implement 7. Review 来自 Skills For Real Engineers 作者 @…
A Twitter thread shares the seven stages of AI-driven development from the Skills For Real Engineers project by @mattpocockuk, including alignment techniques like grill sessions and tooling for coding agents.
@mattpocockuk: 重新措辞 /grill-me,使其现在真正可以在任何地方使用——不仅仅是工程领域。"设计树" -> "决策树" "每…
Matt Pocock 更新了 /grill-me 技能,通过将 'design tree' 等术语重新措辞为 'decision tree',使其超越工程领域可用。技能仓库为 AI 编码代理提供可组合的技能,以提升对齐度并减少冗余。