标签
OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。
本文提出了Agentic Nesting,一种多智能体协作框架,将现有企业应用封装为分层嵌套结构中的AI智能体,实现自然语言交互和跨应用编排,作为传统ESB/API/RPA集成方法的替代方案。
一位开发者分享了一个Claude Code配置,其中三个结构良好的智能体胜过二十个,强调编排者的控制、范围明确的任务,以及使用廉价模型处理大量工作,同时将Opus保留给主导和审查角色。
本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。
介绍 GraphARC,一个 MIT 许可的开源工具,允许模型在运行时编写智能体图拓扑,并配备确定性的准入门以确保可审计的执行,基于 LangGraph 构建,可通过 ollama 在本地运行或对接云 API。
A technical blog post that walks through building a production-grade agentic harness around a basic LLM loop, covering typed tools, plan DAGs, tiered memory, verification hierarchies, budgets, and tracing.
作者介绍了 VITA,一个认知引擎,其编排逻辑用纯文本 Markdown 文件而非代码声明,从而实现动态工具加载、无框架锁定以及与提供商无关的执行。
作者分享了为企业级 agent 平台构建 human-in-the-loop 审批系统的经验,强调审批步骤必须是一个真正的阻塞暂停,参数可编辑,并且拒绝/编辑结果应是一等公民,同时询问其他人如何构建 agent 暂停机制。
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
一则推文重点介绍了Anthropic和Google工程师在斯坦福的讲座,内容涵盖自我改进的AI代理、代理循环模式以及生成器-验证器差距。
作者开源了 o8,这是一个采用 MIT 许可的编排器,用于在隔离的 git worktree 中管理多个编码智能体,具备合并门禁、审计追踪和移动审批功能。
Open-Kritt 是一个开源的安全研究平台,通过编排多个 AI 代理并行分析代码,自动化发现真实漏洞,并支持去重、验证和优先级排序。背后团队用它曾获高额赏金并赢得 Firedancer 审计竞赛。
作者将 AI 运营层定义为一个新的企业类别,用于在规模上编排、治理和监控 AI 代理,并正在寻找投资者将其生产 MVP 推进到试点部署阶段。
一个团队使用带有对抗验证的自主AI智能体集群,在两天内清理并迁移了400张遗留数据库表,将人工审阅减少到4%以下,避免了通常需要一个月的手动ETL过程。
英国AI云服务商Nscale以16.5亿美元收购软件初创公司Anyscale,通过增加工作负载管理和扩展能力来强化其AI计算堆栈。
一位Reddit用户分享了在小型本地LLM上测试成熟编排技术的结果,发现90%失败了,但幸存下来的10%在LFM 1.2B和Gemma 4 26B-A4B等模型上将任务完成率大约翻了一倍。
Anaconda 强调 Metaflow 的设计理念和核心功能,突出其简洁性、可组合性以及面向生产 ML/AI 工作流的企业级能力。