【开源】我需要你们最糟糕的边界案例来压力测试GenOS,我新的AI智能体编排器。
摘要
GenOS的开发者正在请求社区提供最糟糕的边界案例,以压力测试和改进这个使用Rust和Git worktrees的多智能体LLM编排开源框架。
大家好,我目前正在开发GenOS,一个用于多智能体LLM编排的开源框架。底层上,它使用隔离的Rust执行环境,并依赖于Git worktrees来实现干净的状态管理和安全的沙盒化。核心引擎运行良好,但在进一步推动之前,我需要让它暴露在现实世界用例的严酷现实中。我们都知道AI智能体(无论是单个还是群体)在演示中看起来很棒,但一旦将它们带出"Hello World"领域,它们往往会绊倒自己。这就是你们可以帮忙的地方:当构建或使用AI智能体时,你们遇到的真实、可测试的问题是什么?我在寻找具体、可重现的场景,以查看GenOS如何处理它们(或者如果它失败惨重,这将帮助我迭代)。我特别寻找的是:无限循环与脱轨:智能体开始幻觉化代码执行并且不停止的任务。状态与上下文管理:智能体A忘记传递关键信息给智能体B,或完全覆盖其工作的群体场景。隔离问题:智能体通过修改或删除错误文件而损坏其工作区的情况。复杂多步骤任务:智能体最终失去其初始目标的长工作流。分享你的用例,你对现有框架(如LangChain、AutoGen、CrewAI等)的最大挫折,甚至是一些总是破坏你设置的具体提示。我将选取最有趣的案例,将它们编码到GenOS中,看看Rust/Git架构是否提供更清晰的解决方案,并会报告结果!提前感谢反馈。你可以在这里查看:PISSARAW/GenOS:类Git分支、确定性重放和基于证据的评估,用于可重现的AI智能体。
相似文章
我构建了一个自定义多智能体框架(GenOS)来自主演化算法。我将三种基本AI范式与一个NP难问题进行对决。以下是结果。
这篇文章描述了GenOS,一个自定义多智能体框架,它自主演化Rust算法来解决NP难的逆生命游戏问题,发现了三种优化范式,并证明了378/400的数学极限。
我为LLM智能体测试了我的GenOS:它解决了提示膨胀问题并替代了多智能体集群的延迟
作者测试了GenOS,这是一个使用版本化YAML基因组的LLM智能体工具,发现它通过减少令牌开销和借助涌现式TDD及智能体培育提升代码质量,其性能优于传统提示和多智能体集群。
我用AutoGen、CrewAI、LangGraph和MetaGPT与我的Agent OS进行了基准测试。“LLM-as-a-judge”范式完全失效。以下是本地数据。
本文对五种AI代理框架在严格的Rust编码任务上进行了基准测试,结果显示,使用LLM评委的框架经常失败或幻觉成功,而采用机械验证方法则产生更可靠的结果。
用Rust构建了一个开放的可定制代理循环的Agentic AI系统(TigrimOSR)
宣布TigrimOSR,一个用Rust构建的开源Agentic AI系统,具有可定制的代理循环。
OxDeAI:我为AI代理构建了一个确定性的预执行授权边界(默认拒绝、签名工件、适配LangGraph/CrewAI/AutoGen等),寻求反馈。
OxDeAI是一个开源协议,用于AI代理操作的确定性预执行授权,提供签名工件和守卫以在代理循环外部强制执行策略。它支持LangGraph、CrewAI和AutoGen等流行的代理框架,并正在寻求关键反馈。