标签
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
Open Deep Research 是一个开源 Next.js 应用,它将 Firecrawl Search 和 Extract 与推理模型结合,执行迭代式网络研究循环,包括搜索、提取、规划、来源追踪和综合。
一项跨Anthropic、OpenAI、Gemini和DeepSeek的详细测量研究发现,传统的30秒提示缓存保活频率过高8倍;4分钟间隔是最优的,并且只有在长时间空闲间隔下,Anthropic的缓存才能节省成本。
SciForge 是一个开源的、AI原生的多模态科学发现工作台,集成了搜索、推理、工作流执行和证据治理功能,通过八个端到端用例(包括基因发现和蛋白质设计)进行了展示。
一位开发者为Claude创建了一套包含42项技能的全面工具集,其组织方式类似于真实的公司组织结构图,涵盖了开发、营销、财务和法律等部门。每项技能都是开源的,可以从GitHub或Claude插件中安装。
介绍了ProofCouncil,一个基于LLM的智能体,采用作者-评论家架构,能够自主解决开放数学问题。它在FirstProof挑战中取得了最佳表现,正确解决了10个问题中的6个,并在更广泛的30个开放问题集上显示出潜力。
Noma Labs发现GitHub的Agentic Workflows中存在一个严重的提示注入漏洞,允许未经身份验证的攻击者通过在同一组织的公共仓库中发布精心构造的GitHub Issue,从私有仓库中窃取数据。
Plurality 是一个完全免费且开源的本地 AI 平台,它将代理工作流程与聊天机器人界面相结合,支持后台处理、沙盒化的 shell/文件访问,并与技能和 MCP 兼容。
Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。
一位开发者展示了使用CopilotKit将Attio CRM数据实时生成AI驱动的用户界面(UI)的概念验证集成,并在Codex原生应用中运行,以创建自适应工作流。
发布了一个自定义内核,进一步优化来自Lightricks的LTX-2.3,在GB10上实现了1.52倍加速,基于之前的torch.compile和cuDNN注意力优化。
Aflow是一个基于ACP的工作流原生Agent,帮助团队使用YAML工作流设计、运行、维护和改进持久的Agent流程,使会话易于共享和恢复。
PathoSage 提出了一个三阶段框架,用于病理学多模态推理,该框架将知识检索、证据收集和证据裁决分开,以减少幻觉并处理冲突证据,并包含一个无需训练的 Beta-Bernoulli 经验系统,用于建模工具可靠性。
Az8 Studio 是一个无限画布,带有互联节点,用于多模态 AI 视频管线,支持跨节点的上下文记忆、并行多模型编排以及持久化资产到智能体的工作流。它代表着从线性 AI 工具向空间智能体环境的转变。
讨论agentic workflow中常见的runtime问题(循环预算、工具权限、压缩状态丢失),推荐DenisSergeevitch的agents-best-practices资源,提供provider-neutral的参考,强调将权限、预算、观测作为显式机制。
Struct-Searcher 引入了一种基于信念修正理论的结构化主体工作流,用于多模态深度信息获取,相较于现有的视觉语言模型和深度研究智能体,实现了显著的准确率提升。
AIventure is an open-source dungeon crawler game from Google's Gemma team that integrates Gemma 4 to let players build web apps through NPC prompts, serving as a developer masterclass on agentic workflows and vibe-coding.
吴恩达推出AI Andrew,这是一个模仿其个性的AI伴侣,基于RAG和代理工作流构建,并邀请用户试用。
作者构建了一个代理系统,通过 cron 任务和 Web 服务自动生成并通过小票打印机为孩子们打印个性化的每日简报。
用户基准测试表明,Qwen 3.6 27B dense 模型(Q4 量化)能够在单张 RTX 3090 上通过单次提示自主生成一个完全可玩的多文件游戏,性能显著优于其前代版本,且无需任何人工干预。测试结果突显了在消费级硬件上本地代码生成和智能体能力方面的重大改进。