标签
OpenAI的GPT-6 Astra作为前沿AI模型,现已通过Microsoft Foundry在Azure上推出,面向企业用户,实现跨应用的代理工作与计算机操作。
文章认为,智能体工作流自动化的失败源于企业部署中不准确的流程图和缺乏上下文,而非AI模型限制,并建议使用如Celonis和Skan AI等流程智能工具作为关键解决方案。
本文评测了Kling 3.0、DomoAI、Higgsfield、HeyGen和Runway等AI视频生成工具在适合初学者的营销代理工作流中的适用性,重点关注每个工具如何融入特定的创意制作阶段。
汤森路透推出了下一代CoCounsel Legal,这是一款AI驱动的产品,整合了法律研究、起草和工作流,与Westlaw和Practical Law集成,包括Westlaw Brief Builder用于自动化起草,同时保持律师的控制权。
本文介绍了 CAi Copilot,一个面向专家的智能体,由三个相互关联的层次组成,可将分子设计意图转化为可执行、可追踪的工作流,在 45 项任务中取得了最强性能。
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
Open Deep Research 是一个开源 Next.js 应用,它将 Firecrawl Search 和 Extract 与推理模型结合,执行迭代式网络研究循环,包括搜索、提取、规划、来源追踪和综合。
一项跨Anthropic、OpenAI、Gemini和DeepSeek的详细测量研究发现,传统的30秒提示缓存保活频率过高8倍;4分钟间隔是最优的,并且只有在长时间空闲间隔下,Anthropic的缓存才能节省成本。
SciForge 是一个开源的、AI原生的多模态科学发现工作台,集成了搜索、推理、工作流执行和证据治理功能,通过八个端到端用例(包括基因发现和蛋白质设计)进行了展示。
一位开发者为Claude创建了一套包含42项技能的全面工具集,其组织方式类似于真实的公司组织结构图,涵盖了开发、营销、财务和法律等部门。每项技能都是开源的,可以从GitHub或Claude插件中安装。
介绍了ProofCouncil,一个基于LLM的智能体,采用作者-评论家架构,能够自主解决开放数学问题。它在FirstProof挑战中取得了最佳表现,正确解决了10个问题中的6个,并在更广泛的30个开放问题集上显示出潜力。
Noma Labs发现GitHub的Agentic Workflows中存在一个严重的提示注入漏洞,允许未经身份验证的攻击者通过在同一组织的公共仓库中发布精心构造的GitHub Issue,从私有仓库中窃取数据。
Plurality 是一个完全免费且开源的本地 AI 平台,它将代理工作流程与聊天机器人界面相结合,支持后台处理、沙盒化的 shell/文件访问,并与技能和 MCP 兼容。
Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。
一位开发者展示了使用CopilotKit将Attio CRM数据实时生成AI驱动的用户界面(UI)的概念验证集成,并在Codex原生应用中运行,以创建自适应工作流。
发布了一个自定义内核,进一步优化来自Lightricks的LTX-2.3,在GB10上实现了1.52倍加速,基于之前的torch.compile和cuDNN注意力优化。
Aflow是一个基于ACP的工作流原生Agent,帮助团队使用YAML工作流设计、运行、维护和改进持久的Agent流程,使会话易于共享和恢复。
PathoSage 提出了一个三阶段框架,用于病理学多模态推理,该框架将知识检索、证据收集和证据裁决分开,以减少幻觉并处理冲突证据,并包含一个无需训练的 Beta-Bernoulli 经验系统,用于建模工具可靠性。
Az8 Studio 是一个无限画布,带有互联节点,用于多模态 AI 视频管线,支持跨节点的上下文记忆、并行多模型编排以及持久化资产到智能体的工作流。它代表着从线性 AI 工具向空间智能体环境的转变。
讨论agentic workflow中常见的runtime问题(循环预算、工具权限、压缩状态丢失),推荐DenisSergeevitch的agents-best-practices资源,提供provider-neutral的参考,强调将权限、预算、观测作为显式机制。