使用Grounded Theory进行大规模智能体行为分析
摘要
AutoTraceGT自动化了在智能体轨迹上进行的扎根理论分析,以构建行为分类体系,有效恢复人类失败模式注释并改进下游预测任务。
查看缓存全文
缓存时间: 2026/09/04 11:57
论文页面 - 使用扎根理论进行大规模智能体行为分析
来源:https://huggingface.co/papers/2608.30391
摘要
AutoTraceGT 通过对智能体轨迹进行扎根理论编码自动化,构建针对特定任务的行为分类体系,从而恢复并扩展人类失败模式标注,以用于后续预测。
理解智能体行为需要能够扩展到数千条轨迹并揭示新模式的方法,尤其适用于长且常常不熟悉的任务,而预构建的分类器在此类任务中表现不佳。我们将扎根理论(https://huggingface.co/papers?q=grounded%20theory)引入智能体轨迹分析:这是一种源自社会科学、拥有六十年历史的定性方法,具有基于饱和度(https://huggingface.co/papers?q=saturation)的系统性标准,以及从数据到理论的可审计追溯路径。我们提出了AutoTraceGT(https://huggingface.co/papers?q=AutoTraceGT)(通过扎根理论进行自动轨迹分析),这是第一个在智能体轨迹上自动化扎根理论的多智能体流程。它迭代执行开放式编码、轴心编码和理论编码(https://huggingface.co/papers?q=theoretical%20coding),直到达到饱和度(https://huggingface.co/papers?q=saturation),从而为每个任务生成定制的行为分类体系(https://huggingface.co/papers?q=behavioral%20taxonomy)。在六个轨迹语料库上,AutoTraceGT(https://huggingface.co/papers?q=AutoTraceGT)生成的编码手册能够恢复人类标注分类体系中73%-91%的失败模式,并揭示这些分类体系遗漏的额外模式。其涌现的理论叙事与先前的专家论述一致。将其作为演绎性特征空间(https://huggingface.co/papers?q=deductive%20feature%20space)使用时,该编码手册在后续失败预测(https://huggingface.co/papers?q=failure%20prediction)任务上优于零样本和少样本的LLM基线。这些结果表明,扎根理论(https://huggingface.co/papers?q=Grounded%20Theory)为研究智能体实际行为的机器学习研究人员和智能体开发者提供了一个可扩展的分析工具。
查看arXiv页面 (https://arxiv.org/abs/2608.30391) | 查看PDF (https://arxiv.org/pdf/2608.30391) | 项目主页 (https://nan-jiang-group.github.io/AutoTraceGT/) | 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30391)
在你的智能体中获取此论文:
hf papers read 2608\.30391
没有最新的CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 (0)
暂无链接此论文的模型
在模型的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。
引用此论文的数据集 (0)
暂无链接此论文的数据集
在数据集的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。
引用此论文的Space (0)
暂无链接此论文的Space
在Space的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。
包含此论文的收藏夹 (0)
暂无包含此论文的收藏夹
将此论文添加到收藏夹(https://huggingface.co/new-collection)以从本页链接。
相似文章
TraceGraph:用于诊断和改进智能体轨迹的共享决策景观
TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。
@omarsar0: 新论文来自微软及其同事。大规模调试智能体轨迹具有挑战性。这是一个巧妙的方…
本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。
TrajGenAgent:一种用于人类移动轨迹生成的分层LLM智能体
TrajGenAgent提出了一种分层LLM智能体框架,将宏观活动规划与微观时空实例化解耦,用于无需微调即可生成逼真的人类移动轨迹。它还引入了一种基于异常检测的评估方法,用于行为保真度。
从噪声轨迹到根因:面向智能体优化的结构化轨迹分析与因果提取
介绍STRACE,一个通过结构化轨迹分析与因果提取来构建高信噪比优化上下文以改进长周期智能体的框架,在形式化验证任务上超越基线。
长期智能体轨迹归因:统一基准与细粒度标注框架
本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。