我正在测试一个OpenClaw插件,该插件旨在减少浪费的代理运行。寻找几位真实世界的测试者。

Reddit r/openclaw 工具

摘要

Xybernetex是一个实验性的OpenClaw插件,通过监控AI代理运行来减少浪费的令牌并提高任务成功率,采用重试和验证等干预措施,作者正在寻求真实世界的测试者。

我几周来一直在捣鼓一个研究项目,现在已演变成一个实际产品,我到了需要其他人运行它的阶段。它叫Xybernetex。这个想法很简单:我并不关心单个模型调用消耗多少令牌。我关心的是成功完成任务需要多少令牌。如果代理使用了少20%的令牌但失败并需要重新运行,我们什么也没优化。Xybernetex是一个OpenClaw插件,它监控运行过程中发生的情况,并试图判断代理何时需要帮助。我一直在实验诸如重试已终止的运行、在合适时添加验证步骤、检测循环/失败,并在潜在破坏性操作前加入人工批准。结果非常有趣,我认为是时候将其从实验室中拿出来了。到目前为止:重试已终止的运行恢复了54%的运行。在一次我的困难任务实验中,验证干预将任务成功率从67.0%提高到78.2%。有一个针对潜在破坏性操作的本地安全层。在开发过程中,我运行了数千次分级代理运行。我目前进行的实验更有趣:Xybernetex应该在何时干预?因为显然,对每个问题都抛出另一个模型调用是构建节省令牌产品却消耗更多令牌的绝佳方式。目标是了解哪些运行受益于干预,哪种干预有效,以及何时Xybernetex的最佳做法是让代理自行运行。我还特意设计它,使其不需要你的提示、文件或命令内容。插件在与Xybernetex API通信之前,会将本地看到的内容简化为关于运行的结构化信息。现在我需要真实的OpenClaw工作负载。我正在寻找少数使用OpenClaw进行实际工作并愿意安装插件、运行它并告诉我情况的人。特别是如果你有消耗大量令牌、偶尔卡住、失败或需要你照看的工作流程。这仍然是实验性的。我自己的测试结果很好,但我完全不打算假装这意味着它会神奇地推广到其他人的工作负载。找出这一点才是关键。如果你感兴趣,请给我发消息。我也很乐意分享系统的工作原理和实验结果。
查看原文

相似文章

找几个人来折腾我的AI测试工具

Reddit r/ArtificialInteligence

作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。

你的OpenClaw AI代理是不是在疯狂消耗代币?

Reddit r/AI_Agents

文章批评了当前浏览器AI代理的低效率,因为它们反复解析和推理相同的网站,并提出了一种模型,代理可以重用经过验证的交互路径,以减少代币消耗并提高速度。