标签
一篇关于构建AgentForge的详细技术文章,AgentForge是一个基于Python的开源agent框架,涵盖了会话运行时、工具合约、审批层和持久化等组件,强调agent由其运行时定义,而不仅仅是模型。
讨论agentic workflow中常见的runtime问题(循环预算、工具权限、压缩状态丢失),推荐DenisSergeevitch的agents-best-practices资源,提供provider-neutral的参考,强调将权限、预算、观测作为显式机制。
Agent libOS 引入了一种受库操作系统启发的、用于大语言模型智能体的运行时基座,将智能体视为具有显式能力、生命周期管理、审计记录和人工审批队列的可调度进程。该设计将信任边界从工具调度移至运行时原语,使得长期运行的智能体能够安全地被调度、授权、恢复和审计。
MARGIN 是一种用于多智能体基础模型系统的运行时置信度校准方法,它在线学习每个智能体的校准因子,将硬基准上的成对分辨率从低于随机水平提升至70-89%,且无需保留数据或重新训练。
Spice是一个开源运行时,作为AI智能体之上的决策层,在执行前观察上下文、模拟选项并将任务分派给智能体。
Deno 2.8 发布,新增了子命令:deno audit fix、deno bump-version 以及用于 CI 工作流的 deno ci。
Node.js 26.0.0 已发布,默认启用 Temporal API,更新了 V8 14.6 和 Undici 8.0,并包含多项弃用和移除。
ARK是一个开源的Go运行时,它管理AI代理的决策,在交付前编译和测试生成的代码,具有6阶段验证管道和成本高效的模型路由。
继先前收购 Bun 之后,Anthropic 又收购了 Stainless——一个将 API 规范转化为 SDK 的工具。这些举措标志着 AI 开发栈垂直整合的战略,同时也引发了关于开发者被锁定的疑问。
作者描述了构建FlashRT的过程,这是一个以CUDA为核心的推理运行时,通过使用C++/CUDA内核重写模型推理路径,来解决小批量/实时工作负载中超出GEMM的瓶颈,在Jetson Thor和RTX 5090上实现了显著的延迟改进。文章讨论了关于精度的经验(FP8有帮助,FP4好坏参半)以及绕过通用运行时进行实时推理的必要性。
讨论AI代理安全作为一个超越提示注入的运行时供应链问题,强调来自不可信数据、工具和反馈循环的风险,并质疑开发者如何执行边界。
nicekate 在 Mac 上测试了多种 MLX 运行时以运行 Qwen3.6-27B,并得出结论 MTPLX 是最快的,在 4bit 量化下达到 43 tok/s。
Markokraemer 宣布了 SandboxAgent,这是一个基于 opencode 的运行时,运行在沙盒中,支持远程会话存储和 Git 原生版本控制,用于集中数据和隔离操作。
文章认为多智能体系统需要运行时基础设施层,而非更好的提示,引用了 MiniMax、OpenAI、Google 和 Anthropic 的发布。文章强调了工作者与验证者角色的分离以及多智能体设置的开销成本。