Training Agents: Live tutorial on how to fine-tune a coding agent for continual learning
摘要
本直播教程展示了如何使用监督微调(SFT)在代理跟踪记录数据集上训练一个小型代码代理(Gemma 4 2B),并利用HF Jobs和Track IO自动化参数扫描与评估,体现“用代理训练代理”的理念。
暂无内容
查看缓存全文
缓存时间: 2026/06/28 08:59
# TL;DR
本课程第一讲演示如何用监督微调(SFT)在代理跟踪记录数据集上训练一个小型代码代理(Gemma 4 2B),使其学会生成工具调用和多轮对话,并利用HF Jobs和Track IO自动进行参数扫描与评估。
## 课程概述
课程名为“Training Agents”,聚焦于后训练(post-training)环节,尤其是长时间运行任务的挑战。系列计划至少三节:第一节(当前)讲SFT,第二节讲基础RL,第三节讲带环境的进阶RL。课程使用代理本身来训练——通过给CodeX等代理一个高级提示,让它自动规划、执行训练并评估结果,从而形成“元训练”闭环。
## 代理跟踪记录与数据集
### 为什么用跟踪记录
代理跟踪记录是代理执行任务时留下的日志,包含工具调用、多轮对话等完整交互。Ben展示了一个Hugging Face上渲染的跟踪记录,其格式标准,便于分析。
训练目标是小模型(Gemma 4 2B)从零学会代理语言——即生成正确的工具调用格式、遵循多轮对话。SFT直接在跟踪记录上模拟这些行为。
### 数据集来源
- 首选方案:从自己代理的跟踪记录收集真实世界数据,但收集过程耗时长。
- 本次采用Mario Zechner(Pie框架作者)公开的跟踪记录数据集,这些记录来自Claude Opus 4.5,但格式与框架无关,可转换用于任何模型。
## SFT训练过程
### 训练契约(约束)
代理被赋予如下高级指令(以CodeX提示为例):
- 在指定模型(Gemma 4 2B)和数据集上执行SFT。
- 使用多个HF Jobs进行参数扫描,并用Track IO跟踪每次运行的指标。
- 推送所有适配器到HF仓库,运行最终评估(保留集上的损失、HumanEval、MBPP)。
- 将评估分数、作业ID、Track IO链接等写入README。
代理需自主完成:解析模型ID、配置训练脚本、运行冒烟测试(权限检查、内存校验)、记录经验教训。
### 任务执行
Ben将提示输入到CodeX代理中,代理开始后台运行。由于任务耗时约2.5小时,直播中不等待完成,而是展示预期流程。
## 训练工作流详解
### 第一步:验证与计划
代理首先检查:
- 模型HF ID是否存在且可访问。
- 数据集形状是否适合训练。
- 推送权限、HF Jobs资源是否可用。
它还会阅读文档,确保使用正确的依赖与格式。
### 第二步:参数扫描与训练
- 代理为不同的超参数(学习率、批次大小等)生成多个HF Jobs。
- 每个Job对应一次训练运行,Track IO记录损失、梯度和评估指标。
- 代理自动从Track IO面板中挑选出最佳运行的指标(如最低验证损失)。
### 第三步:评估与记录
- 最佳模型的最终权重被推送到HF仓库。
- 运行两个基准评估(HumanEval和MBPP),生成代码生成准确率。
- 代理将评估结果、作业ID、Track IO链接整合到最终模型的README中,形成完整报告。
## 本课目标与后续
当前SFT仅让模型模仿跟踪记录中的行为,不涉及奖励函数或RL环境。后续课程将引入GRPO和RL环境,使代理能自主探索并优化策略。
## 总结
通过SFT在高质量跟踪记录上微调一个小型基础模型,可以快速得到一个能执行工具调用和多轮对话的代码代理。整个训练流程本身也交由另一个代理自动化执行,体现了“用代理训练代理”的核心理念。
**Source**: [YouTube - Training Agents: Live tutorial on how to fine-tune a coding agent for continual learning](https://www.youtube.com/watch?v=rNgUoH7Wbv8)
相似文章
@vintcessun: 今晚翻到一个学习路线项目,重新理解了Agent该从哪开始学。以前总觉得Agent就是堆工具和框架,但它的核心是那个“观察-思考-执行”循环,以及harness工程对权限、状态、回溯的组织。它把学习拆成从0构建最小Agent loop到最终…
一个名为Agent-Learning-Hub的开源学习路线项目,将AI Agent学习拆分为8个阶段,从构建最小Agent loop到生产部署,提供可执行的todo list和推荐资源,由Datawhale社区成员维护。
@teach_fireworks: AI Coding 现在开始进入一个很有意思的阶段。 过去大家讨论最多的是模型能力、上下文长度、Agent Loop、Tool Use、自动化编程,但真正把 Agent 长时间放进真实开发环境之后,很多团队发现问题已经不只是“能不能生成代…
介绍开源工具 re_gent,它为 AI 编程 Agent 提供运行时级别的版本控制和可观测性基础设施,解决 Agent 长时间运行后的代码溯源与审计问题。
一场直播的回顾,其中AI代理(Codex)自主运行整个SFT工作流,训练一个小型Gemma 2B模型来模仿编码代理(pi)。所有工件和代码均已开源。
一场直播的回顾,其中AI代理(Codex)自主运行整个SFT工作流,训练一个小型Gemma 2B模型来模仿编码代理(pi)。所有工件和代码均已开源。
围观智能体竞速:在单个A10G上加速Gemma 4 E4B推理的实时挑战
一项实时挑战正在进行,旨在在单个A10G GPU上加速Gemma 4 E4B模型的推理,Hugging Face上的仪表板跟踪智能体的提交情况。
@huxlab: 生产级 Agent 持续学习怎么做?Replit 给出了最扎实的答案。 Replit AI 负责人 Michele Catasta(@pirroh)分享了一篇非常干的文章,讲他们在过去一年如何为 Replit Agent 构建持续学习系统…
Replit AI 负责人分享生产级 Agent 持续学习系统的工程实践,将改进拆分为 Model、Harness、Context 三层,并构建离线验证与在线 A/B 测试的闭环,使 Agent 能在不更新模型的情况下持续优化。