技能库漂移:诊断与修复自进化LLM技能库中的隐性故障模式
摘要
本文识别了'技能库漂移'作为自进化LLM技能库中的一种隐性故障模式,其中无限制的技能积累导致检索退化与性能停滞。它提供了踪迹级诊断及经过验证的治理方案,将MBPP+ hard-100上的pass@1从0.258提升至0.584。
arXiv:2605.19576v1 Announce Type: new
摘要:自进化技能库面临一种我们称之为\emph{技能库漂移}的隐性故障模式:无结果驱动的生命周期管理的无限制技能积累导致检索退化、假阳性注入和性能停滞。近期评估确认了该症状——LLM编写的技能带来+0.0pp增益,而人工整理的技能带来+16.2pp(SkillsBench)——然而其根本机制尚未被隔离。我们提供了(1) 可复现的触发条件:隔离漂移的消融实验——一种禁用技能注入(平底,+0.002),另一种施加提前退休(主动危害,$-0.019$);(2) 踪迹级诊断:一个仅追加的证据日志,包含每个技能的贡献分数、归因判定和路由器参与指标,使故障在到达端任务分数之前变得可见;以及(3) 经过验证的修复方案:一个最小治理方案(结果驱动的退休 + 有界活跃容量 + 元技能编写先验),在MBPP+ hard-100上经过100轮将保留的pass@1从0.258基线提升至晚期窗口均值0.584(滚动增益$+0.328$)。八组消融实验分解了哪些治理机制是承重的,哪些被取代,为诊断任何自进化智能体中的技能库漂移提供了具体操作手册。
相似文章
LLM智能体系统中技能的规模化定律
本文识别了LLM智能体系统中技能库的两个耦合规模化定律:路由准确率随库大小呈对数衰减,执行动态表现出救援效应。这些定律在15个模型和超过百万次决策中得到验证,且定律指导的优化显著提升了性能。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。
构建独立LLM漂移检测 - 分享方法论,寻求对方法的反馈
作者分享了一种构建外部LLM漂移检测系统的方法论,该系统持续探测模型行为(模式遵循、指令遵循、拒绝率等),以捕捉API性能的静默退化,并邀请对方法、定价和用例的反馈。
盲人策展人:有偏见的评委如何悄无声息地禁用自进化代理中的技能退出机制
本文研究有偏见的LLM评委如何悄无声息地禁用自进化代理中的技能退出机制,表明跨越尖锐阈值的假阳性偏差阻止了基于贡献的退出,且该失败跨领域普遍存在,只能通过缺陷注入审计检测到。