使用Grounded Theory进行大规模智能体行为分析

Hugging Face Daily Papers 论文

摘要

AutoTraceGT自动化了在智能体轨迹上进行的扎根理论分析,以构建行为分类体系,有效恢复人类失败模式注释并改进下游预测任务。

理解智能体行为需要能够扩展到数千条轨迹的方法,并在长期且常常不熟悉的任务中发现新模式,而预构建分类器在此不足。我们提议将扎根理论引入智能体轨迹分析:这是一种源自社会科学、已有六十年历史的定性方法,具有原则性的饱和标准和从数据到理论的可审计路径。我们提出AutoTraceGT(通过Grounded Theory的自动化轨迹分析),这是第一个自动化智能体轨迹上扎根理论分析的多智能体管道。它迭代执行开放式、轴心式和理论性编码直至饱和,产生针对每个任务定制的行为分类体系。在六个轨迹语料库上,AutoTraceGT生成的编码手册恢复了人类注释分类体系中73-91%的失败模式,并揭示了那些分类体系遗漏的额外模式。出现的理论叙述与先前的专家描述一致。作为演绎特征空间使用时,该编码手册在下游失败预测任务上优于零样本和少样本LLM基线。这些结果表明,Grounded Theory为研究智能体实际行为的机器学习研究者和智能体开发者提供了一个可扩展的分析工具。
查看原文
查看缓存全文

缓存时间: 2026/09/04 11:57

论文页面 - 使用扎根理论进行大规模智能体行为分析

来源:https://huggingface.co/papers/2608.30391

摘要

AutoTraceGT 通过对智能体轨迹进行扎根理论编码自动化,构建针对特定任务的行为分类体系,从而恢复并扩展人类失败模式标注,以用于后续预测。

理解智能体行为需要能够扩展到数千条轨迹并揭示新模式的方法,尤其适用于长且常常不熟悉的任务,而预构建的分类器在此类任务中表现不佳。我们将扎根理论(https://huggingface.co/papers?q=grounded%20theory)引入智能体轨迹分析:这是一种源自社会科学、拥有六十年历史的定性方法,具有基于饱和度(https://huggingface.co/papers?q=saturation)的系统性标准,以及从数据到理论的可审计追溯路径。我们提出了AutoTraceGT(https://huggingface.co/papers?q=AutoTraceGT)(通过扎根理论进行自动轨迹分析),这是第一个在智能体轨迹上自动化扎根理论的多智能体流程。它迭代执行开放式编码、轴心编码和理论编码(https://huggingface.co/papers?q=theoretical%20coding),直到达到饱和度(https://huggingface.co/papers?q=saturation),从而为每个任务生成定制的行为分类体系(https://huggingface.co/papers?q=behavioral%20taxonomy)。在六个轨迹语料库上,AutoTraceGT(https://huggingface.co/papers?q=AutoTraceGT)生成的编码手册能够恢复人类标注分类体系中73%-91%的失败模式,并揭示这些分类体系遗漏的额外模式。其涌现的理论叙事与先前的专家论述一致。将其作为演绎性特征空间(https://huggingface.co/papers?q=deductive%20feature%20space)使用时,该编码手册在后续失败预测(https://huggingface.co/papers?q=failure%20prediction)任务上优于零样本和少样本的LLM基线。这些结果表明,扎根理论(https://huggingface.co/papers?q=Grounded%20Theory)为研究智能体实际行为的机器学习研究人员和智能体开发者提供了一个可扩展的分析工具。

查看arXiv页面 (https://arxiv.org/abs/2608.30391) | 查看PDF (https://arxiv.org/pdf/2608.30391) | 项目主页 (https://nan-jiang-group.github.io/AutoTraceGT/) | 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30391)

在你的智能体中获取此论文:

hf papers read 2608\.30391

没有最新的CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 (0)

暂无链接此论文的模型

在模型的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。

引用此论文的数据集 (0)

暂无链接此论文的数据集

在数据集的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。

引用此论文的Space (0)

暂无链接此论文的Space

在Space的README.md中引用 arxiv.org/abs/2608.30391 以从本页链接。

包含此论文的收藏夹 (0)

暂无包含此论文的收藏夹

将此论文添加到收藏夹(https://huggingface.co/new-collection)以从本页链接。

相似文章

长期智能体轨迹归因:统一基准与细粒度标注框架

arXiv cs.AI

本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。