agentic-workflows

标签

Cards List
#agentic-workflows

FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

arXiv cs.LG · 5小时前 缓存

FlowScout is a framework that automatically generates tool-integrated agentic workflows from historical task-solving records, using Monte Carlo tree search guided by execution feedback. Experiments show it improves tool invocation correctness and execution score over baselines.

0 人收藏 0 人点赞
#agentic-workflows

@jerryjliu0:FDE工作的未来似乎与围绕评估/后训练/RL环境的所有工作密切相关。FDE实际上负责…

X AI KOLs Following · 3天前 缓存

Jerry Liu 分享了关于外派工程师(FDE)工作将如何转向定义目标、环境和评估,而自动化优化流程负责战术执行的想法。

0 人收藏 0 人点赞
#agentic-workflows

@PrajwalTomar_: Andrew Ng 在 2024 年就预测到了这一点,而它刚刚悄然成为 AI 中最重要的技能。他证明了一个弱……

X AI KOLs Timeline · 4天前 缓存

Andrew Ng 在 2024 年的预测——即使用较弱模型的智能体工作流可以胜过较强的独立模型——已得到 Anthropic 的验证:一个协调更便宜子智能体的编排器以 90.2% 的优势击败了单个 Claude Opus。这篇文章强调了 Claude Code 子智能体作为实际实现。

0 人收藏 0 人点赞
#agentic-workflows

AI能做的最具“智能体”特质的事,是知道何时停止。

Reddit r/AI_Agents · 5天前

一位实践者认为,自主AI智能体在生产环境中并不可靠,主张采用受限的智能体工作流,并在其中加入人工介入触发器,而非完全自主。

0 人收藏 0 人点赞
#agentic-workflows

@rohanpaul_ai:在他们的官方博客上阅读更多。

X AI KOLs Following · 2026-08-04 缓存

Not Diamond 宣布推出 Not Diamond Code,这是一款面向编码代理的智能模型路由器,可根据每个步骤选择最佳模型和推理工作量,声称可节省 20% 以上的成本,并在编码基准测试中实现帕累托最优性能。

0 人收藏 0 人点赞
#agentic-workflows

MetaRoute-Bench:评估智能体工作流路由的元决策策略

arXiv cs.LG · 2026-08-04 缓存

本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。

0 人收藏 0 人点赞
#agentic-workflows

学习智能体工作流的组合式元路由:一项可执行基准

arXiv cs.LG · 2026-08-04 缓存

本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。

0 人收藏 0 人点赞
#agentic-workflows

@github: Docs shouldn’t trail the code. The Aspire team used GitHub Agentic Workflows to turn merged features into cross-repo do…

X AI KOLs Following · 2026-08-03 缓存

The Aspire team describes how they used GitHub Agentic Workflows to automatically generate cross-repo documentation pull requests for merged features, achieving 82/82 docs PRs merged at a median of 44.8 hours.

0 人收藏 0 人点赞
#agentic-workflows

MCP 2026-07-28 规范:传输层变为无状态

Hacker News Top · 2026-07-28 缓存

MCP 发布了新的规范版本 2026-07-28,从双向有状态协议转变为无状态的请求/响应核心,提升了可扩展性和可靠性。更新内容包括自描述请求、服务器发现、缓存提示和授权增强,并更新了 TypeScript、Python、Go 和 C# 的 SDK。

0 人收藏 0 人点赞
#agentic-workflows

HeraSys:通过细粒度端到端优化实现多LLM工作流的协同服务

arXiv cs.AI · 2026-07-28 缓存

HeraSys是一个协同式LLM服务系统,通过消除跨工作流的计算冗余并采用负载感知的联合调度,优化并发工作流的端到端性能,实现了高达2.17倍的P99延迟降低和1.85倍的吞吐量提升。

0 人收藏 0 人点赞
#agentic-workflows

AMD服务器CPU营收占比达46%,他们回归了吗?

Reddit r/ArtificialInteligence · 2026-07-27

AMD在x86服务器CPU领域实现了46%的营收份额,相较于2017年几乎为零的份额大幅增长,这得益于其新款Venice处理器,每核心性能是Nvidia同类芯片的2.2倍。这一转变凸显了在AI代理工作负载中,模块化CPU+GPU方案相对于Nvidia垂直整合机架的日益偏好。

0 人收藏 0 人点赞
#agentic-workflows

@gp_pulipaka: 使用LangGraph在Python中构建Agentic工作流! #BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM…

X AI KOLs Timeline · 2026-07-26 缓存

一个关于使用LangGraph在Python中构建Agentic工作流的教程,涵盖状态、节点、边、工具集成和对话记忆。

0 人收藏 0 人点赞
#agentic-workflows

@jerryjliu0: 我们正在通过一场直播网络研讨会,将一些最复杂的金融文档解析为清晰、纯文本/结构化输出。…

X AI KOLs Following · 2026-07-22 缓存

Jerry Liu宣布举办一场直播网络研讨会,内容涉及使用LlamaIndex解析复杂金融文档,为代理工作流提供更清晰的结构化输出。

0 人收藏 0 人点赞
#agentic-workflows

企业AI的真正价值在于智能体工作流,聊天机器人甚至不值一提。

Reddit r/AI_Agents · 2026-07-21

文章认为,企业AI的真正价值在于智能体工作流而非聊天机器人,这暗示了关注点的转变。

0 人收藏 0 人点赞
#agentic-workflows

Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Hacker News Top · 2026-07-21 缓存

Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。

0 人收藏 0 人点赞
#agentic-workflows

探索用于生成高质量数学可视化辅助的智能体工作流

arXiv cs.AI · 2026-07-14 缓存

本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。

0 人收藏 0 人点赞
#agentic-workflows

@levie: 要继续获得大规模智能体采用,最佳方式是持续降低智能成本…

X AI KOLs Following · 2026-07-13 缓存

Levie认为,降低人工智能(token)成本是扩大智能体大规模采用的关键,并预测未来大多数信息工作将涉及智能体,同时提到开放和封闭模型均在创新。

0 人收藏 0 人点赞
#agentic-workflows

@gurtej__gill_: ByteDance的Seed团队刚刚发布了他们的Seed2.0模型卡。对于任何厌倦了观看人工智能模型在抽象数学竞赛中表现出色,却在现实软件工程中屡屡碰壁的人来说,这确实是一篇引人入胜的读物。

X AI KOLs Timeline · 2026-07-12 缓存

字节跳动的Seed团队发布了Seed2.0模型卡,详细描述了一个旨在弥合实验室基准测试与现实世界软件工程之间差距的模型。该卡重点介绍了部署层级、性能比较,并坦诚承认了与前沿模型之间的差距。

0 人收藏 0 人点赞
#agentic-workflows

CausalDS:在数据科学智能体中进行因果推理的基准测试

arXiv cs.AI · 2026-07-10 缓存

介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。

0 人收藏 0 人点赞
#agentic-workflows

PatchOptic:面向共享状态LLM工作流的投影视图与验证的结构化更新

arXiv cs.LG · 2026-07-08 缓存

介绍了PatchOptic,这是一种用于共享状态LLM工作流的接口,它采用投影读取和验证的结构化补丁来确保更新的有效性。通过PatchBench对46个案例进行了评估,结果显示在保持质量的同时减少了token成本和泄漏。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈