标签
FlowScout is a framework that automatically generates tool-integrated agentic workflows from historical task-solving records, using Monte Carlo tree search guided by execution feedback. Experiments show it improves tool invocation correctness and execution score over baselines.
Jerry Liu 分享了关于外派工程师(FDE)工作将如何转向定义目标、环境和评估,而自动化优化流程负责战术执行的想法。
Andrew Ng 在 2024 年的预测——即使用较弱模型的智能体工作流可以胜过较强的独立模型——已得到 Anthropic 的验证:一个协调更便宜子智能体的编排器以 90.2% 的优势击败了单个 Claude Opus。这篇文章强调了 Claude Code 子智能体作为实际实现。
一位实践者认为,自主AI智能体在生产环境中并不可靠,主张采用受限的智能体工作流,并在其中加入人工介入触发器,而非完全自主。
Not Diamond 宣布推出 Not Diamond Code,这是一款面向编码代理的智能模型路由器,可根据每个步骤选择最佳模型和推理工作量,声称可节省 20% 以上的成本,并在编码基准测试中实现帕累托最优性能。
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。
The Aspire team describes how they used GitHub Agentic Workflows to automatically generate cross-repo documentation pull requests for merged features, achieving 82/82 docs PRs merged at a median of 44.8 hours.
MCP 发布了新的规范版本 2026-07-28,从双向有状态协议转变为无状态的请求/响应核心,提升了可扩展性和可靠性。更新内容包括自描述请求、服务器发现、缓存提示和授权增强,并更新了 TypeScript、Python、Go 和 C# 的 SDK。
HeraSys是一个协同式LLM服务系统,通过消除跨工作流的计算冗余并采用负载感知的联合调度,优化并发工作流的端到端性能,实现了高达2.17倍的P99延迟降低和1.85倍的吞吐量提升。
AMD在x86服务器CPU领域实现了46%的营收份额,相较于2017年几乎为零的份额大幅增长,这得益于其新款Venice处理器,每核心性能是Nvidia同类芯片的2.2倍。这一转变凸显了在AI代理工作负载中,模块化CPU+GPU方案相对于Nvidia垂直整合机架的日益偏好。
一个关于使用LangGraph在Python中构建Agentic工作流的教程,涵盖状态、节点、边、工具集成和对话记忆。
Jerry Liu宣布举办一场直播网络研讨会,内容涉及使用LlamaIndex解析复杂金融文档,为代理工作流提供更清晰的结构化输出。
文章认为,企业AI的真正价值在于智能体工作流而非聊天机器人,这暗示了关注点的转变。
Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。
本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。
Levie认为,降低人工智能(token)成本是扩大智能体大规模采用的关键,并预测未来大多数信息工作将涉及智能体,同时提到开放和封闭模型均在创新。
字节跳动的Seed团队发布了Seed2.0模型卡,详细描述了一个旨在弥合实验室基准测试与现实世界软件工程之间差距的模型。该卡重点介绍了部署层级、性能比较,并坦诚承认了与前沿模型之间的差距。
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
介绍了PatchOptic,这是一种用于共享状态LLM工作流的接口,它采用投影读取和验证的结构化补丁来确保更新的有效性。通过PatchBench对46个案例进行了评估,结果显示在保持质量的同时减少了token成本和泄漏。