Agentic ESOpt:以最小GPU需求微调长时程LLM代理
摘要
本文提出了Agentic ESOpt,一种使用进化策略的方法,能够在最小GPU内存需求下实现长时程LLM代理的可扩展全参数微调。
查看缓存全文
缓存时间: 2026/08/19 03:58
论文页面 - Agentic ESOpt:以最小GPU需求微调长期LLM智能体
来源:https://huggingface.co/papers/2608.17310
摘要
Agentic ESOpt利用演化策略,通过轨迹级奖励加权更新与参数-上下文协同进化,实现可扩展的长期LLM智能体全参数微调。
强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning)(RL)在单轮LLM微调中前景广阔。然而,长期智能体推理(https://huggingface.co/papers?q=long-horizon%20agentic%20reasoning)引入了日益复杂的分支交互和稀疏奖励,暴露了RL的几项局限性:其重量级的反向传播训练栈使得微调大型LLM不切实际,更长的轨迹则使信用分配(https://huggingface.co/papers?q=credit%20assignment)在RL中变得极其困难。本文认为演化策略(https://huggingface.co/papers?q=evolution%20strategies)(ES)是微调长期LLM智能体的更佳选择。与智能体RL相比,ES具有三个关键优势:1)模型可扩展性:ES仅需最小的、推理级别的GPU内存即可实现全参数优化(https://huggingface.co/papers?q=full-parameter%20optimization),从而能够微调大型LLM。2)灵活性:其轻量级、黑盒反馈接口使得ES微调易于与提示空间进化(例如技能优化与测试时计算)组合;3)长期可扩展性:ES执行轨迹级参数归因,无需在各个时间步上分解奖励,因此随着时间步的增长,其可扩展性优于智能体RL。基于此洞见,我们提出了Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt),一个专为灵活参数-上下文协同进化设计的全参数智能体微调框架。每一步,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)围绕当前LLM参数采样扰动,用奖励评估生成的智能体,并应用在线奖励加权更新(https://huggingface.co/papers?q=reward-weighted%20update)。为了改善探索-适应权衡,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)进一步引入了扰动尺度σ的余弦衰减调度(https://huggingface.co/papers?q=cosine%20decay%20schedule)。在WebArena-Lite(https://huggingface.co/papers?q=WebArena-Lite)上,Qwen-3.5-27B的全参数优化(https://huggingface.co/papers?q=full-parameter%20optimization)将无技能基线提升了6.69%。在测试时自动启发式设计中,Agentic ESOpt(https://huggingface.co/papers?q=Agentic%20ESOpt)执行在线提示-参数协同进化,在36个设置中的28个上改进了其匹配的基线。
查看arXiv页面 (https://arxiv.org/abs/2608.17310)查看PDF (https://arxiv.org/pdf/2608.17310)项目页面 (https://zz1358m.github.io/Project-Agentic-ESOpt)GitHub3 (https://github.com/zz1358m/Agentic-ESOpt)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17310)
获取此论文到您的智能体中:
hf papers read 2608\.17310
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。
引用本文的Spaces0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.17310以从此页面链接它。
包含本文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.
EASy:迈向基于LLM的高效智能体系统
本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。
EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体
EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。
GenericAgent:一种通过上下文信息密度最大化实现高效自我演进的通用LLM智能体(V1.0)
本文介绍了 GenericAgent,这是一种旨在最大化上下文信息密度的自我演进式大语言模型智能体系统。它通过分层记忆、可复用的标准操作流程(SOP)以及高效压缩技术,解决了长周期任务的局限性,在与领先智能体的对比中,以更少的 Token 消耗实现了更优的性能表现。
EnergyLens: 面向多GPU大语言模型推理优化的预测性能耗感知探索
EnergyLens是一个端到端的框架,用于多GPU大语言模型推理的预测性能耗感知优化,在Llama3和Qwen3-MoE上验证,平均绝对百分比误差在9.25%至13.19%之间,并揭示了不同配置之间显著的能耗差异。