标签
论文引入了检索调用实际使用效果(RAE)来评估检索到的技能是否真正帮助LLM智能体,显示聚合指标可能会通过隐藏对特定任务的负面影响而产生误导。
本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。
SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。
提出SkillReranker,一个推理时重排序框架,通过分解任务和技能来构建有向无环执行图,并使用交叉编码器进行评分,从而提升智能体技能选择的任务性能和效率。
本文提出了 Group of Skills (GoSkills),这是一种检索方法,通过将原子技能组织为带有角色标签的执行上下文,从而在有限的上下文预算内提升智能体的性能。
本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。