Principal Trait Analysis:迈向在人机协作中推导“技能”

arXiv cs.CL 论文

摘要

本文提出了主特质分析(Principal Trait Analysis, PTA),一种从人机协作编程对话中提取常见行为特征的数据驱动方法,并在教育性和专业性数据集上进行评估,以理解哪些技能有助于任务成功。

arXiv:2608.11460v1 公告类型:新 摘要:基于大语言模型的智能体日益通过人类与人工智能(AI)协作进入职场。在这个新的工作时代,理解哪些提示特质有助于任务成功至关重要。此外,我们需要揭示现代专业人员所需的关键技能,并告知教育工作者如何在学生中培养这些技能。现有的人机协作指南要么基于自上而下的理论,要么基于对人机交互的特定情境观察。然而,由于大语言模型的能力快速提升,理论可能无法解释新兴的交互模式,经验性指南也可能迅速过时。在这项工作中,我们探索了一种自动化的、数据驱动的方法来揭示与任务结果一致的有效人机交互模式,我们将其称为“特质”。我们提出了主特质分析(Principal Trait Analysis),一种受主成分分析启发的算法,用于从大语言模型对话模式中提取常见特质。该算法利用基于大语言模型的处理阶段来分析人机协作会话轨迹的语料库,从数据集中提取共同特质,并根据每个特质对人类协作者的使用风格进行评分。该方法还允许在特质发现过程中注入领域知识,并选择跨协作者方差最高的特质作为最具区分度的特质。我们在两个人机协作编程数据集上评估了PTA,分别来自教育场景(学生与AI导师合作)和专业场景(开发者与AI编程代理合作)。我们发现,PTA提取的特质在两种场景下都能显著解释协作者行为,并有助于预测任务结果。然而,这些特质是否称得上“技能”仍有待观察,因为在泛化性和用户特质随时间变化方面的结果尚无定论。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:26

# Principal Trait Analysis: 迈向在人机协作中提取“技能”

来源:https://arxiv.org/html/2608.11460

Kai Du
所属机构:OpenRefinery\.ai
邮箱:[kai@openrefinery\.ai](mailto:)

Andrew Lan
所属机构:University of Massachusetts Amherst
邮箱:[andrewlan@cs\.umass\.edu](mailto:)

###### 摘要

由大语言模型(\(LLM\))驱动的编程代理正越来越多地用于专业场景,通过人-人工智能(\(AI\))协作来更快地编写软件。在这个全新的工作时代,理解哪些人类行为特质有助于任务成功变得尤为重要。此外,我们需要揭示现代专业人员所需的关键技能,这可以为教育者提供参考,帮助他们知道如何培养学生这些技能。现有的人机协作指南要么基于自上而下的理论构建,要么基于经验性的、针对特定情境的人机交互观察。然而,由于 \(LLM\) 能力正在快速提升,理论可能无法解释新兴的交互模式,而经验性指南也可能很快过时。在这项工作中,我们探索了一种自动化、数据驱动的方法来揭示模式,我们称之为“特质”(traits),这些特质是与协作编程任务结果相一致的有效人机交互模式。我们提出了主特质分析(Principal Trait Analysis, \(PTA\)),一种受主成分分析启发的算法,用于从 \(LLM\) 对话的模式中提取常见特质。我们的算法通过一系列 \(LLM\) 提示阶段来分析大规模的人机协作会话轨迹语料库,提取数据集中的共同特质,并对每个人类协作者的使用风格与这些特质的契合程度进行评分。该方法虽然是无监督且数据驱动的,但也允许在特质发现过程中注入领域专业知识。我们选择那些在协作者之间方差最大的特质作为最具区分度的特质。我们在两个人类-AI 协作编程数据集上评估了 \(PTA\),包括一个教育场景(学生与 AI 导师协作)和一个专业场景(开发者与 AI 编程代理协作)。我们发现,\(PTA\) 派生出的特质在解释两个场景中的协作者行为方面具有显著性,并且有助于预测任务结果。然而,由于在泛化性和用户特质随时间演变方面结果尚不明确,这些特质是否可以被视为“技能”仍有待观察。1早期阶段,初步工作。本文的完整版本即将发布。

## 1 引言

\(LLM\) 编程助手越来越多地用于软件开发,并已融入计算机科学教育中,然而,在教育或专业场景中,有效使用和无效使用的区别仍然不清楚。同一个模型,交给两个不同的软件开发者,可能会根据每个开发者与模型的交互方式生成截然不同的代码,而编程助手带来的生产力提升在不同开发者之间差异巨大[15](https://arxiv.org/html/2608.11460#bib.bib15)。同样,两个学生可能会有截然不同的使用模式,从而导致不同的学习体验和后续结果[16](https://arxiv.org/html/2608.11460#bib.bib16)、[17](https://arxiv.org/html/2608.11460#bib.bib17)。揭示这些使用模式并将其与结果联系起来,将为开发者提供如何与编程代理协作的指南,也为教师提供如何向计算机科学学生教授“AI 使用技能”的指南。然而,由于相关行为特质的空间庞大且随着 \(LLM\) 能力的提升而迅速变化,揭示这些模式并建立通用指南十分困难。因此,从交互快照中手工推导出的规范性指南很快就会过时,并且可能无法在不同场景中泛化。为了跟上该领域的快速变化,应该探索更自动化和数据驱动的分析方法,这样随着人机协作进入新的场景和情境,可以重新提取新特质。

先前建立此类指南的方法在很大程度上是演绎式的。自上而下的工作从学习理论、人机协作或软件工程实践中引入框架,并将其作为固定评估标准应用[39](https://arxiv.org/html/2608.11460#bib.bib39)。这类评估标准具有可解释性和理论依据,但它们在设计时是固定的,当工具和场景发生变化时可能变得脆弱,尤其是在 AI 能力快速提升的情况下;测量它们所定义的能力或技能本身就是一个开放问题[13](https://arxiv.org/html/2608.11460#bib.bib13)。自下而上的工作则直接分析交互日志,通过定性编码工作流[44](https://arxiv.org/html/2608.11460#bib.bib44)或应用于辅导对话[41](https://arxiv.org/html/2608.11460#bib.bib41)、[43](https://arxiv.org/html/2608.11460#bib.bib43)、[42](https://arxiv.org/html/2608.11460#bib.bib42)以及学生-AI 对话[1](https://arxiv.org/html/2608.11460#bib.bib1)的对话行为分类体系,更近期的研究则使用 \(LLM\) 以开放式方式挖掘此类日志[45](https://arxiv.org/html/2608.11460#bib.bib45)。这些分析贴近观察到的行为,但其标注方案在构建和维护上劳动密集,而且由此得到的行为类别有时与可测量的结果相关联。因此,它们也无法可靠地被表征为技能:在教育研究关于知识成分的文献中,技能应当随着练习沿着学习曲线提高,并且能够在任务之间泛化[18](https://arxiv.org/html/2608.11460#bib.bib18)。在这条研究路线中,候选技能分解的验证方式是其对学习曲线的拟合程度[19](https://arxiv.org/html/2608.11460#bib.bib19)。

图 1:\(PTA\) 分阶段可视化。我们的方法首先从对话语料库中提取大量观察结果,然后通过迭代精炼成一组较小的候选特质。语料库中的每个会话都根据这些特质进行评分,随后用于派生一组更小且彼此不同的主特质。

### 1.1 贡献

在这项工作中,我们提出了一种数据驱动算法,用于从人机协作编程会话中提取信息丰富的特质,并使用该方法分析了两个真实世界的对话数据集。我们的方法——主特质分析(\(PTA\))——是一个受主成分分析(\(PCA\))启发的流程,它从原始对话中提取行为观察结果,通过聚类得到可解释的特质维度,为每个人类协作者在每个特质上评分,并选择最具区分度的特质。我们通过一系列无监督阶段提取这些特质,采用基于 \(LLM\) 的提示和基于文本嵌入的聚类步骤,以揭示能够解释常见协作者行为模式的特质。这个过程直观地反映了 \(PCA\) 如何提取能够解释数据集中最大方差的主成分向量。随后,我们进行与结果对齐的评估,衡量提取出的特质是否能解释并预测下游结果。我们在两个人类-AI 协作编程数据集上进行了实验:一个是学生-AI 导师对话语料库(StudyChat),另一个是专业程序员-AI 编程代理交互会话轨迹语料库(SWE-Chat),展示了有效 \(LLM\) 使用中的共性结构和场景特有结构。我们发现,我们的方法得到的特质在解释结果时通常具有显著性。然而,我们提醒这些特质可能不完全符合技能的定义,因为它们在跨协作场景中的泛化能力有限。

## 2 相关工作

### 2.1 使用 \(LLM\) 进行主题建模和聚类

\(LLM\) 已被广泛应用于从文本语料库中提取可解释结构,并已直接与诸如 LDA[22](https://arxiv.org/html/2608.11460#bib.bib22)这样的经典主题模型进行比较。基于提示的主题建模流程可以生成和精炼自然语言主题标签[25](https://arxiv.org/html/2608.11460#bib.bib25)、[36](https://arxiv.org/html/2608.11460#bib.bib36),而目标条件变体则能发现与既定分析目的相关的结构[26](https://arxiv.org/html/2608.11460#bib.bib26)、[29](https://arxiv.org/html/2608.11460#bib.bib29)。更接近我们派生阶段的是,其他工作使用 \(LLM\) 反馈来引导聚类本身,既包括解决模糊分配问题,也包括选择合适的粒度[23](https://arxiv.org/html/2608.11460#bib.bib23),或者在归纳式地从数据中生成标签后,再将其层级聚类为更高层次的主题[24](https://arxiv.org/html/2608.11460#bib.bib24)。相关工作还提出了将这些派生结构可视化到仪表盘中的方法,用于对文本语料库进行监控和人工分析[31](https://arxiv.org/html/2608.11460#bib.bib31)、[28](https://arxiv.org/html/2608.11460#bib.bib28)。特别是大规模的聊天数据集已成为日益增长的研究领域,因为 \(LLM\) 协作工作流正被用于更广泛的任务类型,并且大规模 \(LLM\) 对话数据集已被公开提供[2](https://arxiv.org/html/2608.11460#bib.bib2)、[12](https://arxiv.org/html/2608.11460#bib.bib12)。因此,类似的分析流程现在也被应用于从聊天数据集中挖掘洞见[30](https://arxiv.org/html/2608.11460#bib.bib30)、[31](https://arxiv.org/html/2608.11460#bib.bib31)。\(PTA\) 的特质派生阶段建立在这些机制之上,使用 \(LLM\) 从聊天数据集中提取观察结果,并以协作上下文和可选的理论视角为条件。

### 2.2 使用 \(LLM\) 判定特征进行结果预测

越来越多的研究使用 \(LLM\) 评分的特征作为下游预测任务的输入,这建立在先前使用基于嵌入的方法来预测关键领域(如心理咨询结果)结果的工作之上[40](https://arxiv.org/html/2608.11460#bib.bib40)。相关示例包括由 \(LLM\) 回答临床笔记查询以预测诊断[33](https://arxiv.org/html/2608.11460#bib.bib33)、[36](https://arxiv.org/html/2608.11460#bib.bib36);利用患者报告预测干预结果[27](https://arxiv.org/html/2608.11460#bib.bib27);利用商业评论预测评分[35](https://arxiv.org/html/2608.11460#bib.bib35);以及利用二元问卷项目预测 fMRI 响应[34](https://arxiv.org/html/2608.11460#bib.bib34)。具体到对话语料,已有研究使用 \(LLM\) 派生特征来对用户满意度进行评分和预测[32](https://arxiv.org/html/2608.11460#bib.bib32)。然而,尽管基于 \(LLM\) 的特征提取和评分非常方便,但如果不直接对任务结果进行回归,就很难判断哪些特征比其他特征更具信息量。在我们的工作中,我们探索了一种方法,将特征提取为下游预测特征,基于这些特征对对话进行评分,并在结果回归之前确定最具信息量的特征。这种方法实现了主特质的无监督提取,提取过程独立于结果变量,但仍能有效解释下游结果的方差。

### 2.3 辅导对话与教育中的 \(LLM\)

对话行为与学习结果之间的关系在教育研究中有着悠久的历史。先前的工作将人工编码的对话行为与辅导对话中的学习收益相关联[41](https://arxiv.org/html/2608.11460#bib.bib41)、[43](https://arxiv.org/html/2608.11460#bib.bib43),对智能辅导系统中的求助行为进行了建模[21](https://arxiv.org/html/2608.11460#bib.bib21),并在已标注的行为序列上发现了潜在的对话模式[42](https://arxiv.org/html/2608.11460#bib.bib42)。最近,\(LLM\) 已被探索用于教育任务,例如自动评分和内容生成。在这条研究路线中,相关研究已对预先定义的心理建构(如坚持性[39](https://arxiv.org/html/2608.11460#bib.bib39))进行对话评分,并从学生-AI 聊天日志中挖掘知识缺口[45](https://arxiv.org/html/2608.11460#bib.bib45)。与此同时,教育者现在也开始关注如何教授有效使用 AI 工具的技能,由此产生了越来越多的“AI 素养”框架,这些框架为在学习和专业目标下有效使用 AI 确立了原则[8](https://arxiv.org/html/2608.11460#bib.bib8)。其中许多框架基于已有的学习和辅导框架,如自我调节学习[9](https://arxiv.org/html/2608.11460#bib.bib9)以及用于认知参与的 ICAP(交互式、建构式、主动式、被动式)框架[10](https://arxiv.org/html/2608.11460#bib.bib10)。然而,由于 AI 与人类导师之间的交流风格不同,人们正在开发新的框架来表征这些风格及相关能力[11](https://arxiv.org/html/2608.11460#bib.bib11)。评估这些能力本身就是一个开放问题:近期研究发现,自我报告与客观测量两种 AI 素养指标之间存在显著不一致[13](https://arxiv.org/html/2608.11460#bib.bib13)。然而,这些工作大多依赖于对对话数据的人工编码和检查,难以大规模扩展,尤其是在 \(LLM\) 系统快速发展的情况下。

## 3 方法论

\(PTA\) 是一种受主成分分析(\(PCA\))启发的方法,它从人机协作会话语料库中生成一组具有代表性的文本描述,我们称之为*主特质*。每个特质详细描述了语料库中存在的一种行为模式,类似于从 \(PCA\) 中导出的主成分向量。此外,\(PTA\) 还为每个会话生成“特质评分”,从而支持会话级别和协作者级别的行为分析。在图1(https://arxiv.org/html/2608.11460#S1.F1)中,我们展示了 \(PTA\) 的 4 个阶段:i)行为观察提取,ii)观察聚类,iii)特质评分,以及 iv)主特质提取。在本节中,我们详细介绍我们的方法,并将 \(PTA\) 的每个阶段与 \(PCA\) 对应起来。

\(PTA\) 的前两个阶段,即提取和聚类,与计算主成分向量有一定相似性。由于协作者-AI 交互数据是文本形式的,我们无法像幂迭代等方法中那样用随机向量初始化来寻找矩阵的主特征向量[46](https://arxiv.org/html/2608.11460#bib.bib46)。相反,我们首先通过 \(LLM\) 提示建立一个大规模的观察池,然后通过聚类将其缩小为更具代表性的观察集。第三阶段,特质评分,类似于 \(PCA\) 中为每个主成分推导每样本载荷。我们使用 \(LLM\)-as-a-judge 来评定每个协作者-AI 交互会话在多大程度上表现出每个特质所描述的质量。最后一个阶段,特质选择,类似于选择能够解释数据中最多方差的主成分。由于文本数据之间的正交性尚未定义,我们贪心地选择那些 i)在协作者间评分方差最大,同时 ii)与已选特质在评分上相关性低、且在文本上也有差异的特质。

#### 记号。 我们首先定义各阶段共享的记号。我们考虑一个包含 \(M\) 个会话的语料库 \(S=\{s_1,\ldots,s_M\}\),每个会话由协作者 \(u(s_i)\in\mathcal{U}\) 创作,其中 \(s_i\) 表示协作者-AI 会话的文本交互轨迹。从 \(S\) 中,\(PTA\) 生成一组 \(K\) 个主特质 \(C^*=\{c_1^*,\ldots,c_K^*\}\) 以及一个特质评分矩阵 \(Z\in\{1,....

相似文章

不完全合作的人-AI交互:模拟与用户研究中人类和AI属性影响的比较

arXiv cs.CL

本研究论文调查了人类个性特征和AI设计特性在不完全合作场景中对人-AI交互的联合影响,采用模拟数据集(2000次模拟)和人类受试者实验(290名参与者)两种方法。研究发现模拟与真实交互之间存在显著差异,其中AI透明度在实际人-AI交互中成为关键因素。

@op7418: https://x.com/op7418/status/2065232309310427565

X AI KOLs Timeline

This article discusses the concept of Skills in the AI agent ecosystem, arguing that Skills are more than prompts—they are packaged capabilities that externalize human expertise into reusable workflow units. The author shares design principles and case studies from building popular Skills.