@ao_qu18465: https://x.com/ao_qu18465/status/2094867930081337730

X AI KOLs Timeline 工具

摘要

Reef 是一个开源基础设施,它使 AI 代理能够通过从推理经验中学习来持续改进自身,专注于进化模型和工具。

https://t.co/1T2jy03kth
查看原文
查看缓存全文

缓存时间: 2026/09/02 09:54

你的推理服务器其实是个学习者:开源Reef实现持续自改进代理

Reef已完全开源:https://github.com/Human-Agent-Society/reef

1. 在“RSI“热潮成为现实之前

在围绕RSI(递归自我改进)的现有热情完全实现之前,我们选择开源Reef——这是我们为解决更广泛问题而构建的基础设施:使智能体(框架+模型)能够通过经验持续进化。

我们的目标是让开源社区更容易进行持续自改进实验,并为此提供生产级基础设施。这里我们采用持续自改进作为更广泛、更实用的表述框架,而RSI则代表这一理念更完整的递归形态。¹

2. 为何持续自改进需要新型基础设施?

[GIF动态图]

多数大语言模型基础设施基于相对简单的生命周期设计:训练模型→评估模型→部署模型→投入推理。对于持续自改进的智能体而言,这套模式背后的两个核心假设开始失效。

首先,推理不再是流程的终点。智能体在工作过程中会产生宝贵经验,包括轨迹、执行结果、用户反馈等可用于驱动后续改进的信号。推理时刻发生的事情不再是简单服务后即丢弃的内容,它本身已成为学习过程的一部分。

其次,模型不再是唯一进化的要素。智能体不仅包含模型,持续自改进也不应局限于模型权重。提示词、记忆、技能、工具和编排逻辑都有可能通过经验得到改进。更强大的模型能扩展智能体能力边界,而更优化的框架则能更有效地激发这些能力,并在复杂任务中更可靠地运用它们。

这些变化共同将原本基本线性的流程转变为持续进化循环:智能体交互→生成经验→优化自身不同模块→评估改进效果是否值得保留→以新版本系统重新投入服务。

这也正是我们不将Reef仅视为训练基础设施的原因。训练只是循环中的一个环节。我们认为持续自改进的基础设施必须从实时推理出发,支持整个智能体的进化。

[GIF动态图]

3. 这类基础设施需要什么?Reef如何实现?

Reef架构示意图
Reef架构示意图

持续自改进基础设施需要端到端掌控三大要素:经验、智能体和更新。这意味着:(1)从实时流量中学习;(2)同时更新模型与框架;(3)对更新进行妥善评估、版本控制和发布管理。

掌控经验——学习必须建立在实时服务之上

历史上,推理与训练始终处于分离状态。部分强化学习基础设施(如Slime、veRL)集成了用于数据生成的推理引擎,但这些系统本质上服务于模型训练而非模型服务。我们主张持续自改进基础设施首先应是推理基础设施,并围绕实时推理构建训练能力:系统需为真实应用提供服务,收集测试时经验,并让学习配方持续消费这些经验。这一理念促使我们重新思考诸多设计选择,包括训练信号生成和训练样本选择。

Reef原生支持推理能力。Reef提供标准化推理端点,便于集成至现有应用,使其转化为自进化系统。

python# client = xxx # 初始化指向Reef服务端点的httpx客户端

通过Reef进行标准化推理调用(采用Open-AI格式)

response = client.post( “/v1/chat/completions”, json={“model”: xxx, “messages”: xxx}, )

引用Reef存储的推理记录

receipt = response.headers[“x-reef-agent-record-id”]

应用还可通过以下方式上报奖励、评估器反馈或与特定推理调用相关的其他信号:

python# 为相应推理记录附加反馈 client.post( “/reef/report”, json={“feedback”: “wrong answer”, “references”: [receipt]}, )

与生命周期内保持静态的现有推理引擎不同,Reef提供有状态推理:将推理轨迹与反馈存储为结构化经验流,并处理策略外数据过期、会话合并与数据去重等问题。学习配方定义该数据流的处理方式、采用的算法,以及更新的评估与部署时机。这使得不同应用能在同一基础设施上运用各自的学习策略实现进化。

掌控整个智能体——模型与框架通过有状态推理共同进化

能够提供端到端结果的AI智能体不仅包含模型,还包含框架。模型提供解决问题所需的基础能力,而框架通过管理工具、上下文、记忆、反馈和编排逻辑,实现跨复杂长轨迹的可靠执行。二者紧密耦合:框架决定如何激发、固化和运用模型能力,模型则决定框架能可靠支持何种执行形式。任何一方的改进都可能改变另一方的最优设计。持续自改进基础设施应支持整个智能体栈的协同进化,包括不仅限于模型权重,还涵盖提示词、记忆、技能、工具和编排逻辑。

Reef支持同时更新模型与框架。

在框架层面,Reef使用Cordis作为“训练后端”。框架进化配方通常分析智能体轨迹与反馈,然后提出框架修改建议。此过程完全在Reef内部完成,每个进化后的框架版本将作为可安装更新发布给用户(假设Reef服务运行在localhost:8900):

bashcurl -fsS -H “Authorization: Bearer $REEF_TOKEN”
‘http://localhost:8900/reef/harness/install?adapter=pi’ | bash

上述命令将以典型编码智能体相似的方式,安装经过Reef封装的Pi框架。该框架配置为使用Reef的有状态推理端点,其推理流量将经过Reef处理。随着用户使用,Cordis根据配置的框架进化配方进化框架,并通过Reef提供新版本。下次用户打开框架时可能会看到:

在模型层面,学习配方消费Reef记录以更新模型权重。训练使用分布式训练后端(当前基于Slime改造)与实时服务异步运行,产生权重更新候选(如检查点或LoRA适配器)。

一旦候选方案通过评估并获准部署,Reef将其发布为该场景模型制品的新版本,并通过基于NCCL的权重同步进行热更新,无需重启服务。

掌控更新——进化版本需经过评估与版本控制

持续进化的智能体可能面临服务质量下降风险,尤其当进化无法保证性能提升时。因此每个进化候选方案在发布前都需经过评估。Reef将控制进化候选是否允许替换当前服务中的制品。若候选被拒绝,服务保持不变;否则Reef将其发布为新的、可审计的版本。

Reef可进化的所有内容(如模型检查点、LoRA适配器、框架树或路由策略)都以制品形式由版本控制器管理。Reef采用Git LFS管理制品,特别是占用大量磁盘空间的模型权重。发布路径如下:

每个场景采用仅追加的发布链。Reef通过比较并交换机制推进场景的发布头,防止过期发布者覆盖较新版本。发布流水线使Reef能高效追踪持续的版本变更与发布流程。

4. Reef中的持续自改进方法

上述基础设施提供了持续自改进的通用抽象。智能体实际如何改进的逻辑,通过模块化的学习配方实现。

我们目睹了日益增多的方法将测试时生成的信号转化为更优智能体:在线强化学习、测试时训练、技能进化、框架进化、自我博弈等。尽管名称与机制各异,它们共享相同基本模式:测试时生成的信号被转化为对生成下一轮交互系统的更新。

这些配方主要沿三个维度差异:

学习信号:何种形式的信号驱动改进?来源何处?

经验获取:学习经验如何生成?是智能体主动寻求,还是从外部任务或交互中被动产生?

进化目标:实际变化的是什么:模型、框架,还是两者兼有?

Reef已支持或即将支持的配方
Reef已支持或即将支持的配方

Reef的设计使这些方法大多可通过同一基础设施上的不同学习配方表达。使用配方非常简单:启动Reef服务时选择并配置即可。

yaml# serve.yaml reef: recipe: recipes.sao.recipe:SAORecipe # 嵌入进化配方 batch_size: 1 # 配方特定配置 max_staleness: 18

随后使用配置启动Reef:

bashreef serve -c recipes/sao/examples/sao/serve.yaml

以下展示两个示例:OpenClaw-RL和TTT-Discover,它们采用截然不同的进化策略,但均可通过Reef实现。

[GIF动态图] 演示OpenClaw-RL在Reef中的集成效果。用户与智能体交互时,其模型通过Reef异步持续进化且不中断用户操作。随着交互轮次累积,智能体逐渐学会正确理解用户偏好并给出满意答案。

该演示展示OpenClaw-RL在Reef中的集成效果。用户与智能体交互时,其模型通过Reef异步持续进化且不中断用户操作。随着交互轮次累积,智能体逐渐学会正确理解用户偏好并给出满意答案。

[GIF动态图] 演示TTT如何迭代改进Packing 32解决方案。随着优化进行,系统发现并保留更有效的解决方案,实现逐步提升的装箱分数。

该演示展示TTT如何迭代改进Packing 32解决方案。随着优化进行,系统发现并保留更有效的解决方案,实现逐步提升的装箱分数。

5. 结语

Reef是我们将持续自改进的广泛理念转化为具体系统问题的尝试。通过开源Reef,我们希望让该问题更易研究,并为社区提供构建不仅能提供服务、更能从经验中持续学习和进化的智能体的实践基础。

我们邀请您试用Reef、构建自己的学习配方,并将其集成到您的智能体中。可通过以下地址探索代码、文档和示例配方:https://github.com/Human-Agent-Society/reef。若觉得Reef有用,欢迎为仓库点亮星标。如果您希望与我们共同开发或更广泛地探讨持续自改进,欢迎加入Discord社区:https://discord.gg/5y8e5f937k。

  • 我们采用持续自改进作为比RSI更广泛、更实用的表述框架。它涵盖那些通过经验反复改进的系统,无需满足RSI常关联的完全闭环——即AI自身参与构建并改进生成其下一版本的系统。Reef为此更广泛的问题设计,同时为在此基础上涌现更递归形态的自我改进预留空间。

持续增长的贡献者列表(按字母顺序排列): 蔡文浩 (@wenhaocha1)、丁双瑞 (@ShuangruiDing)、何昊、何浩泽、江崇和 (@JiangChonghe)、江南 (@nanjiangwill)、蒋璇、李晓晨 (@jacobli99)、梁Paul (@pliang279)、刘波 (@Benjamin_eecs)、龙博远、莽秋阳 (@MangQiuyang)、齐振霆 (@ZhentingQi)、曲奥 (@ao_qu18465)、曲明若、王昭凯、闫学知、于汉飞 (@yhfchitanda)、于浩飞 (@haofeiyu44)、俞Simon (@simon_ycl)、郑涵 (@hanzheng_7)、周凯晨 (@alex_kai2020)、周子健 (@BobbyZhouZijian)、朱嘉诚 (@JiachengZhu_ML)、庄鼎仪


¹ 我们采用持续自改进作为比RSI更广泛、更实用的框架。它涵盖那些通过经验反复改进的系统,无需满足RSI常关联的完全闭环——即AI自身参与构建并改进生成其下一版本的系统。Reef为此更广泛的问题设计,同时为在此基础上涌现更递归形态的自我改进预留空间。

相似文章

本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。

X AI KOLs

本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。

@leerob: https://x.com/leerob/status/2065469795529588940

X AI KOLs Following

Cursor AI 描述了其用于扩展 Composer 模型训练的递归代理系统,该系统使用一组自我管理的代理,在出现问题时向人类发出警报。该系统支持并行实验并加速研究,将研究人员的时间视为最稀缺的资源。