Agentic ESOpt:以最小GPU需求微调长时程LLM代理

Hugging Face Daily Papers 论文

摘要

本文提出了Agentic ESOpt,一种使用进化策略的方法,能够在最小GPU内存需求下实现长时程LLM代理的可扩展全参数微调。

强化学习(RL)在单轮LLM微调中显示出前景。然而,长时程代理推理引入了日益增加的分支交互和稀疏奖励,暴露了RL的几个局限性:其基于反向传播的重训练架构使得微调更大的LLM不切实际,而更长的时程轨迹使得RL中的信用分配变得相当困难。本文认为,进化策略(ES)可以是微调长时程LLM代理的更好选择。与代理RL相比,ES提供了三个关键优势:1) 模型可扩展性:ES仅使用最小的、推理级的GPU内存实现全参数优化,使得微调大型LLM成为可能。2) 灵活性:其轻量级、黑盒反馈接口使得ES微调易于与提示空间进化(例如,技能优化与测试时计算)组合;以及3) 长时程可扩展性:ES执行轨迹级参数归因,无需跨时程分解奖励,随着时程长度增长,其可扩展性优于代理RL。基于此洞察,我们提出了Agentic ESOpt,一个针对灵活参数-上下文协同进化的全参数代理微调框架。在每一步,Agentic ESOpt围绕当前LLM参数采样扰动,使用奖励评估生成的代理,并应用在线奖励加权更新。为了改善探索-适应权衡,Agentic ESOpt进一步引入了扰动尺度σ的余弦衰减调度。在WebArena-Lite上,对Qwen-3.5-27B的全参数优化将无技能基线提高了6.69%。在测试时自动启发式设计中,Agentic ESOpt执行在线提示-参数协同进化,在36个设置中的28个改进了其匹配基线。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:58

论文页面 - Agentic ESOpt:以最小GPU需求微调长期LLM智能体

来源:https://huggingface.co/papers/2608.17310

摘要

Agentic ESOpt利用演化策略,通过轨迹级奖励加权更新与参数-上下文协同进化,实现可扩展的长期LLM智能体全参数微调。

强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning)(RL)在单轮LLM微调中前景广阔。然而,长期智能体推理(https://huggingface.co/papers?q=long-horizon%20agentic%20reasoning)引入了日益复杂的分支交互和稀疏奖励,暴露了RL的几项局限性:其重量级的反向传播训练栈使得微调大型LLM不切实际,更长的轨迹则使信用分配(https://huggingface.co/papers?q=credit%20assignment)在RL中变得极其困难。本文认为演化策略(https://huggingface.co/papers?q=evolution%20strategies)(ES)是微调长期LLM智能体的更佳选择。与智能体RL相比,ES具有三个关键优势:1)模型可扩展性:ES仅需最小的、推理级别的GPU内存即可实现全参数优化(https://huggingface.co/papers?q=full-parameter%20optimization),从而能够微调大型LLM。2)灵活性:其轻量级、黑盒反馈接口使得ES微调易于与提示空间进化(例如技能优化与测试时计算)组合;3)长期可扩展性:ES执行轨迹级参数归因,无需在各个时间步上分解奖励,因此随着时间步的增长,其可扩展性优于智能体RL。基于此洞见,我们提出了Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt),一个专为灵活参数-上下文协同进化设计的全参数智能体微调框架。每一步,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)围绕当前LLM参数采样扰动,用奖励评估生成的智能体,并应用在线奖励加权更新(https://huggingface.co/papers?q=reward-weighted%20update)。为了改善探索-适应权衡,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)进一步引入了扰动尺度σ的余弦衰减调度(https://huggingface.co/papers?q=cosine%20decay%20schedule)。在WebArena-Lite(https://huggingface.co/papers?q=WebArena-Lite)上,Qwen-3.5-27B的全参数优化(https://huggingface.co/papers?q=full-parameter%20optimization)将无技能基线提升了6.69%。在测试时自动启发式设计中,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)执行在线提示-参数协同进化,在36个设置中的28个上改进了其匹配的基线。

查看arXiv页面 (https://arxiv.org/abs/2608.17310)查看PDF (https://arxiv.org/pdf/2608.17310)项目页面 (https://zz1358m.github.io/Project-Agentic-ESOpt)GitHub3 (https://github.com/zz1358m/Agentic-ESOpt)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17310)

获取此论文到您的智能体中:

hf papers read 2608\.17310

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。

引用本文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。

引用本文的Spaces0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。

包含本文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop

arXiv cs.AI

This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体

Hugging Face Daily Papers

EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。