@ao_qu18465: https://x.com/ao_qu18465/status/2094867930081337730
摘要
Reef 是一个开源基础设施,它使 AI 代理能够通过从推理经验中学习来持续改进自身,专注于进化模型和工具。
查看缓存全文
缓存时间: 2026/09/02 09:54
你的推理服务器其实是个学习者:开源Reef实现持续自改进代理
Reef已完全开源:https://github.com/Human-Agent-Society/reef
1. 在“RSI“热潮成为现实之前
在围绕RSI(递归自我改进)的现有热情完全实现之前,我们选择开源Reef——这是我们为解决更广泛问题而构建的基础设施:使智能体(框架+模型)能够通过经验持续进化。
我们的目标是让开源社区更容易进行持续自改进实验,并为此提供生产级基础设施。这里我们采用持续自改进作为更广泛、更实用的表述框架,而RSI则代表这一理念更完整的递归形态。¹
2. 为何持续自改进需要新型基础设施?
[GIF动态图]
多数大语言模型基础设施基于相对简单的生命周期设计:训练模型→评估模型→部署模型→投入推理。对于持续自改进的智能体而言,这套模式背后的两个核心假设开始失效。
首先,推理不再是流程的终点。智能体在工作过程中会产生宝贵经验,包括轨迹、执行结果、用户反馈等可用于驱动后续改进的信号。推理时刻发生的事情不再是简单服务后即丢弃的内容,它本身已成为学习过程的一部分。
其次,模型不再是唯一进化的要素。智能体不仅包含模型,持续自改进也不应局限于模型权重。提示词、记忆、技能、工具和编排逻辑都有可能通过经验得到改进。更强大的模型能扩展智能体能力边界,而更优化的框架则能更有效地激发这些能力,并在复杂任务中更可靠地运用它们。
这些变化共同将原本基本线性的流程转变为持续进化循环:智能体交互→生成经验→优化自身不同模块→评估改进效果是否值得保留→以新版本系统重新投入服务。
这也正是我们不将Reef仅视为训练基础设施的原因。训练只是循环中的一个环节。我们认为持续自改进的基础设施必须从实时推理出发,支持整个智能体的进化。
[GIF动态图]
3. 这类基础设施需要什么?Reef如何实现?
Reef架构示意图
Reef架构示意图
持续自改进基础设施需要端到端掌控三大要素:经验、智能体和更新。这意味着:(1)从实时流量中学习;(2)同时更新模型与框架;(3)对更新进行妥善评估、版本控制和发布管理。
掌控经验——学习必须建立在实时服务之上
历史上,推理与训练始终处于分离状态。部分强化学习基础设施(如Slime、veRL)集成了用于数据生成的推理引擎,但这些系统本质上服务于模型训练而非模型服务。我们主张持续自改进基础设施首先应是推理基础设施,并围绕实时推理构建训练能力:系统需为真实应用提供服务,收集测试时经验,并让学习配方持续消费这些经验。这一理念促使我们重新思考诸多设计选择,包括训练信号生成和训练样本选择。
Reef原生支持推理能力。Reef提供标准化推理端点,便于集成至现有应用,使其转化为自进化系统。
python# client = xxx # 初始化指向Reef服务端点的httpx客户端
通过Reef进行标准化推理调用(采用Open-AI格式)
response = client.post( “/v1/chat/completions”, json={“model”: xxx, “messages”: xxx}, )
引用Reef存储的推理记录
receipt = response.headers[“x-reef-agent-record-id”]
应用还可通过以下方式上报奖励、评估器反馈或与特定推理调用相关的其他信号:
python# 为相应推理记录附加反馈 client.post( “/reef/report”, json={“feedback”: “wrong answer”, “references”: [receipt]}, )
与生命周期内保持静态的现有推理引擎不同,Reef提供有状态推理:将推理轨迹与反馈存储为结构化经验流,并处理策略外数据过期、会话合并与数据去重等问题。学习配方定义该数据流的处理方式、采用的算法,以及更新的评估与部署时机。这使得不同应用能在同一基础设施上运用各自的学习策略实现进化。
掌控整个智能体——模型与框架通过有状态推理共同进化
能够提供端到端结果的AI智能体不仅包含模型,还包含框架。模型提供解决问题所需的基础能力,而框架通过管理工具、上下文、记忆、反馈和编排逻辑,实现跨复杂长轨迹的可靠执行。二者紧密耦合:框架决定如何激发、固化和运用模型能力,模型则决定框架能可靠支持何种执行形式。任何一方的改进都可能改变另一方的最优设计。持续自改进基础设施应支持整个智能体栈的协同进化,包括不仅限于模型权重,还涵盖提示词、记忆、技能、工具和编排逻辑。
Reef支持同时更新模型与框架。
在框架层面,Reef使用Cordis作为“训练后端”。框架进化配方通常分析智能体轨迹与反馈,然后提出框架修改建议。此过程完全在Reef内部完成,每个进化后的框架版本将作为可安装更新发布给用户(假设Reef服务运行在localhost:8900):
bashcurl -fsS -H “Authorization: Bearer $REEF_TOKEN”
‘http://localhost:8900/reef/harness/install?adapter=pi’ | bash
上述命令将以典型编码智能体相似的方式,安装经过Reef封装的Pi框架。该框架配置为使用Reef的有状态推理端点,其推理流量将经过Reef处理。随着用户使用,Cordis根据配置的框架进化配方进化框架,并通过Reef提供新版本。下次用户打开框架时可能会看到:
在模型层面,学习配方消费Reef记录以更新模型权重。训练使用分布式训练后端(当前基于Slime改造)与实时服务异步运行,产生权重更新候选(如检查点或LoRA适配器)。
一旦候选方案通过评估并获准部署,Reef将其发布为该场景模型制品的新版本,并通过基于NCCL的权重同步进行热更新,无需重启服务。
掌控更新——进化版本需经过评估与版本控制
持续进化的智能体可能面临服务质量下降风险,尤其当进化无法保证性能提升时。因此每个进化候选方案在发布前都需经过评估。Reef将控制进化候选是否允许替换当前服务中的制品。若候选被拒绝,服务保持不变;否则Reef将其发布为新的、可审计的版本。
Reef可进化的所有内容(如模型检查点、LoRA适配器、框架树或路由策略)都以制品形式由版本控制器管理。Reef采用Git LFS管理制品,特别是占用大量磁盘空间的模型权重。发布路径如下:
每个场景采用仅追加的发布链。Reef通过比较并交换机制推进场景的发布头,防止过期发布者覆盖较新版本。发布流水线使Reef能高效追踪持续的版本变更与发布流程。
4. Reef中的持续自改进方法
上述基础设施提供了持续自改进的通用抽象。智能体实际如何改进的逻辑,通过模块化的学习配方实现。
我们目睹了日益增多的方法将测试时生成的信号转化为更优智能体:在线强化学习、测试时训练、技能进化、框架进化、自我博弈等。尽管名称与机制各异,它们共享相同基本模式:测试时生成的信号被转化为对生成下一轮交互系统的更新。
这些配方主要沿三个维度差异:
学习信号:何种形式的信号驱动改进?来源何处?
经验获取:学习经验如何生成?是智能体主动寻求,还是从外部任务或交互中被动产生?
进化目标:实际变化的是什么:模型、框架,还是两者兼有?
Reef已支持或即将支持的配方
Reef已支持或即将支持的配方
Reef的设计使这些方法大多可通过同一基础设施上的不同学习配方表达。使用配方非常简单:启动Reef服务时选择并配置即可。
yaml# serve.yaml reef: recipe: recipes.sao.recipe:SAORecipe # 嵌入进化配方 batch_size: 1 # 配方特定配置 max_staleness: 18
随后使用配置启动Reef:
bashreef serve -c recipes/sao/examples/sao/serve.yaml
以下展示两个示例:OpenClaw-RL和TTT-Discover,它们采用截然不同的进化策略,但均可通过Reef实现。
[GIF动态图] 演示OpenClaw-RL在Reef中的集成效果。用户与智能体交互时,其模型通过Reef异步持续进化且不中断用户操作。随着交互轮次累积,智能体逐渐学会正确理解用户偏好并给出满意答案。
该演示展示OpenClaw-RL在Reef中的集成效果。用户与智能体交互时,其模型通过Reef异步持续进化且不中断用户操作。随着交互轮次累积,智能体逐渐学会正确理解用户偏好并给出满意答案。
[GIF动态图] 演示TTT如何迭代改进Packing 32解决方案。随着优化进行,系统发现并保留更有效的解决方案,实现逐步提升的装箱分数。
该演示展示TTT如何迭代改进Packing 32解决方案。随着优化进行,系统发现并保留更有效的解决方案,实现逐步提升的装箱分数。
5. 结语
Reef是我们将持续自改进的广泛理念转化为具体系统问题的尝试。通过开源Reef,我们希望让该问题更易研究,并为社区提供构建不仅能提供服务、更能从经验中持续学习和进化的智能体的实践基础。
我们邀请您试用Reef、构建自己的学习配方,并将其集成到您的智能体中。可通过以下地址探索代码、文档和示例配方:https://github.com/Human-Agent-Society/reef。若觉得Reef有用,欢迎为仓库点亮星标。如果您希望与我们共同开发或更广泛地探讨持续自改进,欢迎加入Discord社区:https://discord.gg/5y8e5f937k。
- 我们采用持续自改进作为比RSI更广泛、更实用的表述框架。它涵盖那些通过经验反复改进的系统,无需满足RSI常关联的完全闭环——即AI自身参与构建并改进生成其下一版本的系统。Reef为此更广泛的问题设计,同时为在此基础上涌现更递归形态的自我改进预留空间。
持续增长的贡献者列表(按字母顺序排列): 蔡文浩 (@wenhaocha1)、丁双瑞 (@ShuangruiDing)、何昊、何浩泽、江崇和 (@JiangChonghe)、江南 (@nanjiangwill)、蒋璇、李晓晨 (@jacobli99)、梁Paul (@pliang279)、刘波 (@Benjamin_eecs)、龙博远、莽秋阳 (@MangQiuyang)、齐振霆 (@ZhentingQi)、曲奥 (@ao_qu18465)、曲明若、王昭凯、闫学知、于汉飞 (@yhfchitanda)、于浩飞 (@haofeiyu44)、俞Simon (@simon_ycl)、郑涵 (@hanzheng_7)、周凯晨 (@alex_kai2020)、周子健 (@BobbyZhouZijian)、朱嘉诚 (@JiachengZhu_ML)、庄鼎仪
¹ 我们采用持续自改进作为比RSI更广泛、更实用的框架。它涵盖那些通过经验反复改进的系统,无需满足RSI常关联的完全闭环——即AI自身参与构建并改进生成其下一版本的系统。Reef为此更广泛的问题设计,同时为在此基础上涌现更递归形态的自我改进预留空间。
相似文章
@svpino: 这是一个相当好的想法:你可以通过告诉你的代理如何表现来改进它的工作方式。
本文重点介绍了一种使用适配器改进AI代理的技术,Reef通过诸如/reefine之类的命令实现个性化演进,以添加新功能。
@EXM7777: https://x.com/EXM7777/status/2078476892127318295
一份关于使用Raft构建具有持久身份、记忆和共享工作空间的AI代理团队的指南,集成了Claude Code、Codex和Hermes等模型,用于自主业务功能。
@dair_ai: https://x.com/dair_ai/status/2083940505746853940
A weekly roundup of top AI papers covering NVIDIA's NOOA object-oriented agent framework, Microsoft Research's ReOPD on-policy distillation method, and a study on invisible reasoning chains in frontier models.
本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。
本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。
@leerob: https://x.com/leerob/status/2065469795529588940
Cursor AI 描述了其用于扩展 Composer 模型训练的递归代理系统,该系统使用一组自我管理的代理,在出现问题时向人类发出警报。该系统支持并行实验并加速研究,将研究人员的时间视为最稀缺的资源。