SkillConsist:通过双向图对齐检测智能体技能中的不一致性

arXiv cs.LG 论文

摘要

本文介绍了SkillConsist,一种使用双向图对齐来检测LLM智能体技能中声明行为与实现行为之间不一致性的方法,在基线上取得了显著的F1提升。

arXiv:2608.07639v1 公告类型:新 摘要:智能体技能为LLM智能体提供可复用的能力。智能体技能的不一致性可能暴露未公开的危险行为或导致错误的技能选择。最近的智能体技能研究越来越关注智能体技能一致性检测。现有方法根据预定义类别或声明范围评估行为或安全属性图。最近,PL-HCL使用基于LLM的模型来学习元数据、指令和资源之间的一致性。然而,声明和实现行为可能混合在文本和代码中,而且简洁的声明可能对应多个相连的实现步骤。我们提出SkillConsist来应对这两个挑战。LLM将声明和实现内容分别分离为实现侧和声明侧的行为记录,而静态分析补充实现记录。这些记录分别构成声明行为图和实现行为图。从任一侧的行为记录开始,双向图对齐在另一张图中搜索候选子图,并沿着行为关系扩展,直到完全表达源侧行为。图差分识别对齐子图之间的冲突并输出检测结果。我们基于ClawHub的500个最常下载的公共技能和133个Skill-Inject包构建了一个包含633个技能的基准。该基准包含319个不一致和314个一致的技能,以及442个局部不一致标注。在该基准上,SkillConsist在包级检测上实现了86.85%的精确率、89.03%的召回率和87.93%的F1,F1比最佳基线提高了20.43个百分点。在定位方面,它实现了67.60%的精确率、58.14%的召回率和62.52%的F1。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:05

# SkillConsist:通过双向图对齐检测 Agent Skills 中的不一致性
Source:

相似文章

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。

SkillCAT:对比性评估与拓扑感知的LLM智能体技能自我进化

arXiv cs.CL

SkillCAT是一个无需训练的LLM智能体技能自我进化框架,通过三个阶段解决单轨迹偏差、未经验证的合并和全语料库加载等问题:对比因果提取、评估增强进化和拓扑感知任务执行,在基准测试上实现高达40.40%的提升。