通过将解决方案投影到评估环境来微调AI代理

Reddit r/AI_Agents 论文

摘要

一位研究人员描述了一种称为'投影'的方法,通过将可验证的正确解投影到代理可遍历的地图上,在有限训练数据下提高了网络安全任务的性能。

tl;dr: 如果你有一个可验证的正确解决方案用于AI应执行的任务,那么训练AI执行该任务及类似任务的一个有用方法是将这个解决方案*投影*到代理在推理时能够遍历的地图上。这允许研究人员创建更真实模拟AI在推理时行为的训练数据,而不是破碎的、瞬移的数据。我取得了令人惊讶的好结果,还有一个额外的意外对照案例,下面会详细说明,仅用了约50个训练任务。 --- 我最近尝试在我拥有的一个网络安全基准上微调一个小模型(Gemma-31B),以测试该基准是否不仅能够*评估*模型,还能*训练*模型使其在该基准上表现得更好。这或许是一个琐碎的测试问题。让我分享一下我解决它的方法。我的目标是避免使用:一个更大的模型来蒸馏;强化模型的解决方案;手动标注解决方案。仅仅是因为我想拿*任何*模型,并使其在它*目前无法做到*的事情上得到改进。我最终采用的方法是我称之为“投影”(projections)的方法。我相信这肯定有一个已知的技术术语,只是我不知道而已。简而言之,该基准由交互式的、存在漏洞的Web应用程序组成,旨在评估模型解决它们的能力。该基准还利用了一个代理,使得每次工具调用、文本输出和推理令牌都被记录并存储以供研究。对于每个实验环境,为了确保它们可以被利用,我还自动构建了一个*求解器*,它沿着实验环境采取确定性路径来遍历、检索标志并提交。从仅仅在SFT中使用这个求解器的失败尝试中吸取教训,我将它*投影*到了实验环境的站点地图上。也就是说,我爬取了现场应用,然后拿我的*求解器*构建了代理在通向目标的路径上可能实际采取的可行路径。结果成功了,还有一个意外的对照。在四种网络安全技术中的三种(每种技术约5个实验环境,每个运行20次),模型在解决保留实验环境(涵盖相同技术)的能力上显示出改进。在最后一种技术上,它显示出轻微的退化。研究导致退化的原因,我发现训练的种子不平衡,导致退化技术的训练示例仅占语料库的约3%。我将退化归因于这个原因。为了完全证明这一点,我需要再构建几个需要该技术的实验环境,并用它们进行训练。我还没有这样做,所以请对这个解释持保留态度。
查看原文

相似文章

如何提高AI代理的可靠性?

Reddit r/AI_Agents

讨论将AI代理从沙箱迁移到生产环境所面临的挑战,强调高敏感性导致大量噪声,并提出解决方案,如二级评估器、启发式方法和级联架构。同时向社区询问他们的过滤方法。

有没有其他人尝试过不进行微调来训练智能体网络?

Reddit r/AI_Agents

作者分享了一个确定性学习框架,它通过将成功的策略提升为持久化的剧本,让多智能体系统在不进行微调或提示词编辑的情况下跨回合改进。在 Mini Amusement Park 基准测试上,奖励从 12,121 提升到 483,019,达到了排行榜第一名。