@huxlab: 生产级 Agent 持续学习怎么做?Replit 给出了最扎实的答案。 Replit AI 负责人 Michele Catasta(@pirroh)分享了一篇非常干的文章,讲他们在过去一年如何为 Replit Agent 构建持续学习系统…
摘要
Replit AI 负责人分享生产级 Agent 持续学习系统的工程实践,将改进拆分为 Model、Harness、Context 三层,并构建离线验证与在线 A/B 测试的闭环,使 Agent 能在不更新模型的情况下持续优化。
查看缓存全文
缓存时间: 2026/07/07 15:33
生产级 Agent 持续学习怎么做?Replit 给出了最扎实的答案。 Replit AI 负责人 Michele Catasta(@pirroh)分享了一篇非常干的文章,讲他们在过去一年如何为 Replit Agent 构建持续学习系统。 核心观点直击当前 Agent 开发的痛点: 大多数生产环境中的 Agent 都基于闭源前沿模型(Fable 5、GPT-5.6 等),无法进行权重级微调。这意味着传统意义上的 Continual Learning 对大多数团队来说是不可行的。 但 Agent 依然可以持续变好——关键在于把改进拆成三个层面: • Model 层:受限于闭源模型,空间有限 • Harness 层:通过生产 trace 持续优化代码、工具、指令(完全可控) • Context 层:在 agent / user / org 维度做个性化(每天都在变好) Replit 的做法是把评估和改进做成了一个闭环系统: • 离线用他们自研的 ViBench(针对「vibe coding」的端到端基准)验证 • 在线通过 A/B 测试和真实用户行为验证 • 用 Telescope 对生产 trace 进行聚类,发现隐藏的失败模式 • 最后让 Agent 自己参与改进循环(读 trace → 提假设 → 改代码 → 验证 → 建议是否上线) 这套系统让他们能把生产中的真实失败,快速转化为每天可上线的改进,而不是只依赖模型更新。 如果你正在构建生产级的 AI Agent、关心如何让系统在没有模型更新的情况下持续变好,这篇文章值得认真读。里面有很多可落地的工程细节和权衡。
相似文章
@vintcessun: 今晚翻到一个学习路线项目,重新理解了Agent该从哪开始学。以前总觉得Agent就是堆工具和框架,但它的核心是那个“观察-思考-执行”循环,以及harness工程对权限、状态、回溯的组织。它把学习拆成从0构建最小Agent loop到最终…
一个名为Agent-Learning-Hub的开源学习路线项目,将AI Agent学习拆分为8个阶段,从构建最小Agent loop到生产部署,提供可执行的todo list和推荐资源,由Datawhale社区成员维护。
@GitHub_Daily: 用 AI 处理长周期复杂任务,随着上下文越来越长,模型容易出现「忘事」,输出质量也直线下降。 LangChain 官方团队开源了一套教程:Deep Agents from Scratch,从零拆解主流 Agent 的核心设计模式,讲得很透…
LangChain 官方团队开源了教程 'Deep Agents from Scratch',从零拆解主流 Agent 的核心设计模式,涵盖任务规划、上下文卸载到文件系统以及子代理隔离等思路,共 5 个渐进式 Notebook,可上手搭建完整深度研究 Agent。
@teach_fireworks: AI Coding 现在开始进入一个很有意思的阶段。 过去大家讨论最多的是模型能力、上下文长度、Agent Loop、Tool Use、自动化编程,但真正把 Agent 长时间放进真实开发环境之后,很多团队发现问题已经不只是“能不能生成代…
介绍开源工具 re_gent,它为 AI 编程 Agent 提供运行时级别的版本控制和可观测性基础设施,解决 Agent 长时间运行后的代码溯源与审计问题。
@Xudong07452910: 开源项目推荐:Autocontext —— 让你的 AI Agent 递归自我进化 Autocontext 是一个递归自我改进的 harness,专为帮助你的 AI Agent(及其未来迭代)在任何任务上持续成功而设计。它通过迭代执行、真…
Autocontext 是一个开源递归自我改进 harness,帮助 AI Agent 通过迭代执行、评估和知识积累持续优化,生成可复用的 playbook、数据集甚至本地模型,适合构建生产级 Agent 工作流的开发者。
本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。
本文系统梳理了AI Agent架构与工程实践,涵盖控制流、上下文工程、工具设计、记忆、多Agent组织、评测、追踪和安全,基于OpenClaw实现展开,强调Harness(测试验证基础设施)对系统稳定性的关键作用。