标签
AMD 的 ROCm/FastFlowLM 现已支持在 Ryzen AI XDNA2 NPU 上运行 Qwen 3.8 27B(以及其它 MoE、视觉、音频和嵌入模型),无需 GPU,最高支持 256k 上下文,运行时仅 17 MB 轻量级——不过 27B 模型的解码速度被指出仅为较慢的 1 token/s。
作者使用简单的MEMORY.md设置,将一家记忆初创公司的产品与他们的OpenClaw代理进行了测试,发现该初创公司的运行时无法处理时间数据,而基于markdown的方法却有效。他们开源了该设置并分享了代理内存管理的指南。
这篇文章探讨了为LLM设计专用工具的理由和好处,而不是让它们使用通用的人类工具,强调了LLM的独特需求和能力限制如何能增强其能力。
本文介绍了一种新颖的持久执行方法——Transparent Continuation Checkpointing(TCC),它通过对程序延续进行检查点来改善恢复延迟,相较于传统的历史重放方法,该方法基于原型评估。
Speakeasy 推出 Kit,一款编程智能体运行时,将终端客户端、Agent Client Protocol 服务器、A2A 端点和子智能体编排器整合为单一静态二进制文件,旨在实现更快、更低成本的 AI 编程工作流。
Aiki Alpha 3 发布,带来显著的性能改进,包括更低成本的运行时实现、自适应数表示、增强的性能分析和覆盖率,以及更严格的库约束。
ARK引入了一个用于AI代理的运行时系统,该系统监控并执行策略,跟踪决策成本,并正在被开发成一个SDK,以提高代理的可靠性并减少计算浪费。
文章探讨了AI智能体控制机制的关键缺口,介绍了VION协议作为运行时层,用于执行身份验证、权限管理、验证、审计和停止功能,以确保安全部署。
Pngine是一个用于WebGPU的声明式格式与运行时,它使用S表达式来简化WebGPU配置的声明与验证,支持跨平台共享,并能导出为HTML或嵌入运行时的PNG等格式。
Bryan Catanzaro,NVIDIA 的应用深度学习研究副总裁,将在 Runtime 演讲关于开放 AI 模型的未来,结合他在 Nemotron 团队的工作以及过去对 cuDNN、DLSS 和 Megatron 的贡献。
文章比较了 Grok Bot 和 Hermes Agent,突出了它们的架构差异:Grok Bot 为 AI 队友提供了一个管理型计算机环境,而 Hermes 为开发者提供了一个开放、可配置的代理运行时。
经过九次重构,Yohei Nakajima现在将BabyAGI的核心围绕事件日志展开,提供具有重放、回滚和分叉功能的运行时,并附带关于何时使用基于图的方法的指南。
SkillEffect 引入了一个用于 AI 代理工具的检查下降运行时,通过审计实现强制执行内存边界,从而显著降低峰值内存使用并提高内存受限条件下的完成率。
forkd是一个基于Firecracker和KVM的微虚拟机运行时,允许在约100毫秒内分叉出100个子VM,适用于AI Agent的并行探索场景。目前处于Alpha阶段,提供了快速的BRANCH功能,用于在运行中快照和分叉虚拟机。
作者宣布开源 Sentience Governor,一个面向 AI 智能体的开源治理运行时,它将声明的意图、记录的执行和事后的解释分离开来,并通过 MCP 将观察到的工具活动与声明的范围进行核对。
Jolt 是一种 Lisp/Scheme 语言,最近新增了两项功能:类似 Common Lisp 和 Smalltalk 风格的程序镜像,用于完整状态序列化与调试;以及一个与 Chez 运行时解耦的可移植 Scheme 后端,实现与架构无关的可移植性。