@Vtrivedy10: 好的,虽然现在还早,但 @mattpocockuk 的 grill-me 技能感觉像是在迭代构建评估/环境时的绝佳开发者体验…

X AI KOLs Timeline 新闻

摘要

一条推文讨论了为AI代理构建评估和环境的迭代过程,强调了人机协作以及数据和验证器设计的重要性。

好的,虽然现在还早,但 @mattpocockuk 的 grill-me 技能感觉像是在迭代构建包含人类和代理在循环中的评估/环境时的绝佳开发者体验 理解一个代码库、追踪和成功定义几乎从来不是一次性的事情,而是人类和代理之间的多步骤协作 我不知道如何衡量和改进每个代理,所以被拷问很有帮助 从一个代理定义和数据转储中,不可能知道团队想要在哪些维度上生成评估来衡量和优化代理性能 具体细节很重要: - 验证器设计(我们是否有某种真实数据) - 环境中的哪些工具应该模拟运行还是(半)实时运行 - 目前我们最关心哪些特征?成本、准确性等? - 需要获取或合成生成哪些数据来产生一个逼真的类生产环境?我们该怎么做? 数据是构建更好代理的货币 今天,人类分享专业知识和先验知识并控制数据设计的循环非常有帮助
查看原文
查看缓存全文

缓存时间: 2026/07/15 03:43

嗯,虽然时间还早,但@mattpocockuk的“拷问式”技能感觉像是很好的开发者体验,能帮人类和智能体在循环中迭代构建评估/环境

理解一个仓库+追踪记录+成功标准几乎从来不是一次性的事情,而是人类和智能体之间多步骤的协作

我不知道如何衡量和改进每一个智能体,所以被拷问一下很有帮助

仅凭智能体定义和数据转储,根本无法知道团队想在哪一维度上生成评估来进行衡量和渐进式改进

这里细节很重要:

  • 验证器设计(我们是否有某种形式的真相来源)
  • 环境中哪些工具应该被模拟,哪些应该(半)实时运行
  • 当前我们最关心哪些特性?成本、准确性等?
  • 需要从何处获取或合成数据,才能构建出接近真实生产的环境?具体怎么操作?

数据是构建更好智能体的货币

人类分享专业知识/先验知识,并控制数据设计的循环,这在当下非常有帮助

这看起来很棒,谢谢指路!

是的!+ 环境/评估生成是人类可以投入时间的高杠杆领域之一,也确实应该如此。环境的质量决定了智能体的行为

在Codex和DeepAgents里对我来说运行良好

得去试试看!

相似文章