Bayesian-Agent:后验引导的LLM代理技能进化框架
摘要
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。
查看缓存全文
缓存时间: 2026/06/09 08:42
论文页面 - Bayesian-Agent:基于后验引导的智能体技能进化框架
来源:https://huggingface.co/papers/2606.08348
摘要
Bayesian-Agent 提出了一种框架,将可复用的技能和标准操作流程(SOP)视为模型成功的假设,利用贝叶斯推理引导智能体行为,并通过后验引导的框架优化来提升任务性能。
LLM 智能体越来越依赖外部推理条件:提示词、工具、记忆、SOP、技能以及框架反馈。这些资产可以在不改变模型权重的情况下改进任务执行,但它们通常通过启发式反思或重复使用观察到的成功与失败来修订,仿佛仅凭计数就能获得可靠信念。我们引入了 Bayesian-Agent(https://huggingface.co/papers?q=Bayesian-Agent),这是一个原生且跨框架的框架,它将可复用的技能和 SOP 视为关于一个冻结模型在特定提示词、上下文和框架环境下能否成功的假设。Bayesian-Agent 记录经过验证的轨迹证据,维护每个技能的特征条件分类后验,并将后验状态映射为可检查的动作,如修补、拆分、压缩、退役和探索。面向模型的提示词会获得可执行的防护措施和失败模式补丁,后验摘要则保留以供审计。使用 deepseek-v4-flash(https://huggingface.co/papers?q=deepseek-v4-flash),增量修复将 SOP-Bench(https://huggingface.co/papers?q=SOP-Bench)从 80% 提升至 95%,Lifelong AgentBench(https://huggingface.co/papers?q=Lifelong%20AgentBench)从 90% 提升至 100%,RealFin-Bench(https://huggingface.co/papers?q=RealFin-Bench)从 45% 提升至 65%。我们还评估了 Bayesian-Agent 的原生后端以及可选的 GenericAgent、mini-swe-agent 和 Claude Code 后端。结果涵盖了正面、负面、饱和及案例研究设置,表明智能体技能进化最好被视作后验引导的框架优化,而非未校准的提示词累积。源代码已发布于 https://github.com/DataArcTech/Bayesian-Agent。
查看 arXiv 页面(https://arxiv.org/abs/2606.08348)查看 PDF(https://arxiv.org/pdf/2606.08348)项目页面(https://dataarctech.github.io/Bayesian-Agent/)GitHub19(https://github.com/DataArcTech/Bayesian-Agent)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.08348)
在你的智能体中获取这篇论文:
hf papers read 2606\.08348
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.08348 以从该页面链接它。
引用该论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.08348 以从该页面链接它。
引用该论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.08348 以从该页面链接它。
包含此论文的收藏1
相似文章
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。