@TheTuringPost: 2026年AI Agent堆栈 OpenClaw → 本地代理作为个人控制平面 Hermes Agent → 具备自我改进能力的本地代理…
摘要
本文总结了2026年AI Agent的格局,重点介绍了像OpenClaw和Hermes这样的本地代理、自我改进循环、用于物理AI的VLA模型,以及可信代理系统基础设施日益增长的重要性。
查看缓存全文
缓存时间: 2026/06/28 20:15
2026年的AI Agent栈
- OpenClaw → 本地代理作为个人控制平面
- Hermes Agent → 具备自我改进技能的本地代理
- Gemma 4 → 适用于本地代理工作流的高效模型
- 技能工程 (Skill Engineering) → 可复用的代理能力
- VLA模型 → 物理AI的接口
- Nemotron 3 → 开放的AI基础设施与模块化生态系统
- 网络世界模型 (Web World Models) → 持久的代理环境
- 递归自我改进 (Recursive Self-Improvement) → AI改进AI
- 负责任AI (Responsible AI) → 将信任视为工程问题
这份回顾旨在串联关键点:为何这些组件现在至关重要,它们如何融入新的代理栈,以及我们对每个组件的深度解析。详情见 https://turingpost.com/p/ai-agents-in-2026-local-physical-responsible-ai…
2026年的AI代理:本地化、物理化、负责任的AI
来源:https://www.turingpost.com/p/ai-agents-in-2026-local-physical-responsible-ai **TL;DR:**2026年的AI代理正成为持久的系统,具备记忆、工具、技能、本地控制、物理行动和自我改进循环。本回顾梳理了从OpenClaw和Hermes到VLA模型、Web World Models、RSI和负责任AI基础设施的转变。
2026年上半年,AI代理成为核心焦点。我们拥有了具备记忆、工具、技能的持久化系统,能够在软件和物理环境中行动。本回顾从多个角度审视了这一转变——包括OpenClaw和Hermes等本地代理、Gemma 4等模型选择、技能工程、用于机器人的VLA模型等更先进的系统、Web World Models、近期兴起的递归自我改进热潮,以及面向能够实际执行任务的系统的负责任AI。
**基础设施变得与代理和模型本身同等重要。**新一代系统需要身份、记忆、技能、环境等功能。那么,让我们回顾一下2026年上半年发生了什么——先进的系统能够安全、可靠地做什么?
🎉图灵邮报 (Turing Post) 三岁了!为庆祝深度科技新闻三周年,我们提供7折优惠订阅年度会员。立即升级,解锁本回顾的剩余部分,并获得我们对代理基础设施深度解析的全部权限。加入Eric Schmidt和Marc Cuban的行列😉
1. OpenClaw解析及轻量级替代方案 (https://www.turingpost.com/p/openclaw)
事实上,回顾的起点只有一个,那就是OpenClaw。OpenClaw比2026年初的任何事物都更能代表本地代理的兴起。它将个人AI助手转变为基于文件的基础设施:
- 记忆存储在Markdown中
- 通过中央网关 (Gateway) 协调工具执行
许多人已不再满足于简单的聊天机器人——他们现在需要一个能够集成WhatsApp、Telegram、Discord和Slack等即时通讯工具的个人控制平面。基于这种新的本地助手理念,代理开始成为具备记忆、高级工具使用和身份的持久化系统。当然,最棒的是——这个基础设施层正在通过开源项目成型。
图片来源:OpenClaw DeepWiki
快速程序说明:
接下来的两周我将休假充电,这意味着我们每周例行的FOD将短暂暂停。但别担心——在此期间,我们将推出全面的半年回顾。这是一个很好的、轻松的机会,让大家在进入第四年之前,赶上我们所有的深度解析和基础设施解读。立即获取完全访问权限!(https://www.turingpost.com/upgrade?offer_id=f8b8d1ee-2b98-4f75-9e42-747d82d52bab)
2. Hermes Agent vs OpenClaw:本地AI代理对比 (https://www.turingpost.com/p/hermes)
本地AI代理之争成为2026年最引人入胜的软件故事之一。在OpenClaw之后,Nous Research推出了Hermes Agent——另一个可开发技能的本地代理。我们的文章对比了OpenClaw和Hermes Agent,因为它们基于截然不同的理念构建:
- OpenClaw专注于用户控制、基于文件的身份和人类编写的技能。
- Hermes的优势在于自我改进、程序化分层记忆以及从经验中生成的技能。代理用得越多,就越有用。运行时间越长,效果越好。
总体而言,本地代理开始记忆方法以及事实。但这两个代理在一个关键点上存在分歧:个人代理应该被控制还是允许自主学习?
3. Gemma 4与OpenClaw:架构、设置以及开发者为何转向它 (https://www.turingpost.com/p/gemma4)
Gemma 4仿佛是为本地代理时代量身定做。Google DeepMind对其进行了优化,追求每个参数都能产生更高智能:更小的活跃计算量、高效的注意力机制、多模态能力、结构化输出、函数调用,以及能够在设备上实际运行的模型。文章直接将其与OpenClaw关联,阐述了用户希望拥有强大的本地代理,而不必承担Claude级别的API账单。有趣的实际张力在于:Gemma 4看起来是值得首先尝试的新默认模型,但更复杂的代理工作流可能仍需微调或备用模型。在2026年,本地AI变得更加实用,不再那么理论化。
图片来源:Maarten Grootendorst的Gemma 4可视化指南
4. 什么是技能工程?从提示优化到技能优化 (https://www.turingpost.com/p/from-prompt-engineering-to-skill-engineering)
随着OpenClaw和Hermes Agent等个人代理成为2026年的前沿,技能工程成为继提示工程和上下文工程之后又一个非常重要的代理优化层面。这些代理更加依赖可复用技能,因此核心问题是:“我们如何训练、维护和优化这些技能本身?”有三种新颖方法:SkillOpt用于通过经过验证的编辑来改进单一技能,SkillOps用于清理和维护整个技能库,以及SkillMOO用于为编码代理寻找经济高效的技能组合。未来还会有更多类似方法出现。
图片来源:SkillOpt原始论文
5. VLA模型详解:架构、类型及向VLA+的飞跃 (https://www.turingpost.com/p/vlaplus)
视觉-语言-行动 (VLA) 模型正成为物理AI的核心接口:它们连接了机器人所见、人类所问以及机器人所执行的动作。这篇文章描绘了从Gemini Robotics和π0到SmolVLA、Helix、ChatVLA-2、ACoT-VLA、VLA-0以及微软新推出的Rho-alpha的全景图。Rho-alpha之所以特别,因为它展示了向VLA+的转变:增加了触觉、在线学习和实时人工修正的模型。VLA现在非常重要,因为它们影响着机器人技术的进步,使其从固定程序迈向能够感知、推理、适应并在部署后持续改进的系统。
图片来源:Helix:用于通用人形控制的视觉-语言-行动模型博客文章
6. Nemotron 3与令人惊讶的联盟:以开放方式构建新AI (https://www.turingpost.com/p/nemotroncoalition)
Nemotron 3是NVIDIA围绕共享基础设施构建开放AI生态系统的轰动性进展。技术层面,它提供了:混合Transformer-Mamba架构、LatentMoE路由、多令牌预测和NVFP4训练。但更有趣的是这些部分的构建者。NVIDIA召集了一个联盟,成员包括Mistral、Cursor、Perplexity、LangChain、Black Forest Labs等,贡献了模型、数据、评估、工具和专业领域知识。前沿AI开发可能比我们想象的更加模块化。也许AI生态系统和开发者协作将推动进步?
图片来源:NVIDIA
7. 什么是网络世界模型 (Web World Models)? (https://www.turingpost.com/p/wwm)
网络世界模型 (WWM) 提供了一种实用方法,利用标准网络基础设施为AI代理构建持久化的世界。WWM将系统一分为二:确定性代码处理规则、状态和“物理规则”,而语言模型则提供描述、叙事和高级内容。此外,世界可以通过使用类型化接口、哈希以及在模型响应慢或不可用时的优雅降级,在不存储所有信息的同时保持一致性。鉴于代理需要稳定的环境来行动、记忆、失败和学习,WWM是一个可选方案。
图片来源:Web World Models原始论文
8. 什么是递归自我改进 (Recursive Self-Improvement)? (https://www.turingpost.com/p/what-is-recursive-self-improvement)
近期一个热门话题是递归自我改进,它在2026年从科幻思想实验转变为真正的研究方向。简单地说,就是AI自己构建更好的AI。文章追踪了三条互补的路径:
- Sakana AI以AI驱动研究循环为目标的长期愿景
- Anthropic使用Claude自动化编码和工程工作
- Recursive用于运行、评估和组合AI生成实验的系统
结果非常非常有意思。Claude现在编写了Anthropic 80%以上的合并代码,而Recursive发现了足够多的小优化,能够自动减少训练时间并提高模型质量。
图片来源:图灵邮报
9. 负责任AI在代理时代如何变化 (https://www.turingpost.com/p/how-responsible-ai-changes-in-the-agent-era)
最后,负责任AI在代理时代变得更加具体。当AI系统从生成文本转向通过工具、API和工作流执行行动时,安全性不能再仅仅依赖输出审查。在本文中,我们讨论了微软和Google DeepMind如何通过运行时控制、策略即测试、带监控的人工监督等方式,将负责任AI转化为基础设施。现在更加明显的是,代理需要对其访问和操作的范围设置护栏。信任正成为一个工程问题。
图片来源:图灵邮报
相似文章
@rohit4verse: https://x.com/rohit4verse/status/2070861975358525500
本文解析了如Hermes和OpenClaw等个人AI代理的架构,解释了运行在个人硬件上的持久化、始终在线程序如何为用户过滤和总结信息,超越了聊天机器人的范式。
@Saboo_Shubham_: 我如何用19分钟解释构建了一个全天候运行的AI代理团队。OpenClaw是团队起点,Hermes是进化方向。
作者解释了如何使用OpenClaw和Hermes构建一个全天候运行的AI代理团队,通过Telegram即可访问。其功能包括定时调度、记忆、自我改进循环和升级机制,用于管理Awesome LLM Apps仓库并保持最新状态。
OpenClaw 与 Ollama 在智能体 AI 中的应用:迈向全自主且可扩展的 AI 智能体系统
本文提出了智能体 AI 的分层架构分析,以 OpenClaw 和 Ollama 作为全栈原型,展示了自主能力如何从系统集成中涌现,并讨论了运行挑战和未来方向。
我确定的2026年中AI Agent等级排行榜。来辩论吧。
一位开发者针对本地自主工作流提出了AI agent框架等级列表,将OpenClaw评为S级,Gemini Spark评为A级,同时批评云锁包装器需要过多的手动审批。
OpenAI Agent SDK vs Hermes vs Pi vs OpenClaw
比较OpenAI的Agent SDK与其他AI代理平台(如Hermes、Pi和OpenClaw),分析它们的特点和功能。