标签
OpenAI发布GPT-6 Astra,这是其最强大的AI模型,适用于高级推理、软件工程和智能体工作流,具备异步工具调用和中途引导功能,并制定了分阶段推出计划。
推出Spark-X2.5-4B和Spark-X2.5-1.7B,这两款紧凑型通用语言模型原生支持百万token上下文,具备强大的编码与智能体能力,并提供广泛的硬件兼容性。
这篇文章讨论了在沙盒环境中测试人工智能代理工作流与生产环境的挑战,强调了诸如静默失败、状态管理和当前测试方法不足等问题,并寻求社区关于最佳实践的建议。
这篇文章吐槽了GLM-5.3-flash模型在生产环境中的严重稳定性问题,如大请求静默失败和工作流中断,尽管模型能力不错。
Experiential是一个开源的网关和路由器,专为AI代理工作流设计,通过单一的兼容OpenAI的API实现基于使用数据的模型优化。
一场讨论,提出使用生产数据的 AI 代理应该采用数据分支——让代理写入克隆的数据库,然后审查最终的差异,而不是逐个批准每个操作。
一位开发者寻求实用策略,让审阅/批评AI代理发现真实缺陷,并在无需人工监督的情况下推动编码任务完成,涵盖提示、测试访问和代理分离等方面。
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
一篇技术文章讨论了在生产级AI代理工作中从代理循环到结构化图的转变,并引用了持久化执行引擎(Temporal、Restate)以及AFlow等研究——AFlow使用蒙特卡洛树搜索来优化工作流图。
Git-native代理工作流作为开发的实际标准正逐渐获得认可,不再仅仅被看作噱头。
作者讨论了使用付费工具的AI代理的实际失败模式,例如成本无意识、重复支付以及需要人工审批,并建议将代理支付视为一个独立的执行层。
本文探讨了AI代理工作流如何重新引入软件工程在可重复性、可审计性和状态管理方面的挑战,这些挑战此前已通过版本控制、CI/CD和静态代码实践得以解决,同时提到了GitHub的Agentic Workflows和git原生方法等新兴解决方案。
作者询问开发者如何对AI智能体工作流进行回归测试,指出了常见的故障模式,并分享了他们在Runme中添加评估支持的工作,用于记录任务、对轨迹进行评分以及与基准进行比较。
作者认为聊天优先的AI工具不足以构建自主代理工作流,并描述了替代原语,如定时触发器和子代理委派,主张从“带着工具聊天”转向“使用LLMs的自主流程”。
一位开发者创建了一个网关,从架构上防止智能体工作流中的提示注入,重点关注架构而非模型级别的修复。
Claude Code团队发布博客介绍/goal和/loop功能,文章分析了AI编程从一次对话到循环操作的范式转变,详细解释了四种循环类型(回合制、目标制、定时制、主动式)及其适用场景,并提出了Harness Engineering的执行层概念。
作者开源了一个名为'prompt-to-loop-engineer'的Codex技能,它能够将模糊的提示转化为结构化的、保留意图的执行循环,并带有防漂移检查,旨在让智能体在现实任务中更可靠。
作者指出了AI智能体系统在实际应用中的四个关键瓶颈:物理限制、对抗压力、制度权威和关系信任,并询问其他人认为智能体工作流会在哪里失败。