【开源】我需要你们最糟糕的边界案例来压力测试GenOS,我新的AI智能体编排器。

Reddit r/ArtificialInteligence 工具

摘要

GenOS的开发者正在请求社区提供最糟糕的边界案例,以压力测试和改进这个使用Rust和Git worktrees的多智能体LLM编排开源框架。

大家好,我目前正在开发GenOS,一个用于多智能体LLM编排的开源框架。底层上,它使用隔离的Rust执行环境,并依赖于Git worktrees来实现干净的状态管理和安全的沙盒化。核心引擎运行良好,但在进一步推动之前,我需要让它暴露在现实世界用例的严酷现实中。我们都知道AI智能体(无论是单个还是群体)在演示中看起来很棒,但一旦将它们带出"Hello World"领域,它们往往会绊倒自己。这就是你们可以帮忙的地方:当构建或使用AI智能体时,你们遇到的真实、可测试的问题是什么?我在寻找具体、可重现的场景,以查看GenOS如何处理它们(或者如果它失败惨重,这将帮助我迭代)。我特别寻找的是:无限循环与脱轨:智能体开始幻觉化代码执行并且不停止的任务。状态与上下文管理:智能体A忘记传递关键信息给智能体B,或完全覆盖其工作的群体场景。隔离问题:智能体通过修改或删除错误文件而损坏其工作区的情况。复杂多步骤任务:智能体最终失去其初始目标的长工作流。分享你的用例,你对现有框架(如LangChain、AutoGen、CrewAI等)的最大挫折,甚至是一些总是破坏你设置的具体提示。我将选取最有趣的案例,将它们编码到GenOS中,看看Rust/Git架构是否提供更清晰的解决方案,并会报告结果!提前感谢反馈。你可以在这里查看:PISSARAW/GenOS:类Git分支、确定性重放和基于证据的评估,用于可重现的AI智能体。
查看原文

相似文章