DigitalCoach:人机与自主计算机使用辅导中的沟通与基础差距
摘要
介绍了DigitalCoach,一个包含72场人类专家-新手计算机使用辅导课程的多模态数据集,并评估了最先进模型教授软件技能的能力。模型倾向于直接给出指令而不提供解释或视觉基础,而人类教练则提供更具适应性的指导。
查看缓存全文
缓存时间: 2026/07/02 05:41
# 人机计算机使用辅导中的沟通与基础差距 来源:https://arxiv.org/html/2606.31980 Meng Chen1, Anya Ji1, Tsung-Han Wu1, Tobias Maringgele2, David M. Chan1, Alane Suhr1, Amy Pavel12†† 1加州大学伯克利分校 2慕尼黑工业大学 ###### 摘要 Agent 日益能够自动化软件任务,但它们能否教人类自己使用软件?我们提出了 **DigitalCoach**,一个多模态数据集,包含 72 场人类专家-新手计算机使用辅导会话,共 22,752 个对话轮次,基于 5 个软件应用的 28.1 小时屏幕和输入事件记录。然后我们使用 DigitalCoach 来评估最先进的模型能否教人类如何使用计算机。我们的自动评估显示,模型在辅导方式上与人类不同:模型提供更直接的指令,但更少的解释、错误诊断和知识检查问题。当我们固定辅导方法时,模型生成的语句与人类参考相似,但在视觉上下文中的基础较差。我们的交互评估证实,模型辅导者导致学习者被动地遵循指令,缺乏更深入的参与,并且在视觉基础方面存在不足。DigitalCoach 为协作性和主动性的计算机使用辅导 Agent 奠定了基础。数据和代码可在 https://project-digital-coach.vercel.app/ 获取。 DigitalCoach:人机计算机使用辅导中的沟通与基础差距 Meng Chen1, Anya Ji1, Tsung-Han Wu1, Tobias Maringgele2††感谢:在 UC Berkeley 作为访问学生完成的工作。, David M. Chan1, Alane Suhr1††平等监督。, Amy Pavel1 1加州大学伯克利分校 2慕尼黑工业大学 参见标题 图 1:DigitalCoach 中的一个示例。人类辅导者提供基于用户屏幕的指导并带有解释,而模型辅导者则给出指令而不解释如何或为什么。 ## 1 引言 专业的创意(例如 Blender)、工程(例如 OnShape)和分析(例如 Excel)软件功能强大但难以学习。Agent 现在让新手可以使用自然语言指令轻松地端到端执行创意、工程和分析任务,而无需使用软件的图形用户界面(GUI)(Wang et al. (2024);Yin et al. (2026);Gao et al. (2024b))。然而,GUI 对专业人员仍然很重要,因为它们提供了自然语言无法实现的表达力、精确性和速度。例如,熟练的 Blender 用户可以使用热键 "G" 然后拖动对象来定位它,而不是使用自然语言描述要移动哪个对象以及移动到哪里。对于希望培养此类软件专业知识的新手来说,Agent 提供的自动化绕过了学习过程。因此,我们探索 Agent 的一个新角色:教新手有效使用这些界面所需的技能。 新手传统上通过网页或视频教程中的专家演示来学习,但这些材料是一刀切的,要求学习者手动将自己的进度与教程对齐。为了解决这个问题,人机交互(HCI)研究已经原型化了系统(Gmeiner et al. (2025);Huh et al. (2025)),将教程转变为任务助手。但是当前的模型能否生成适应性的、有基础的指导,以支持超越任务完成的技能获取? 我们提出了 DigitalCoach,一个用于 (1) 表征人类专家-新手计算机使用辅导期间基于多模态语言的交互,以及 (2) 分析模型在多大程度上模仿人类专家辅导的数据集。DigitalCoach 包含 40 名参与者的 72 场计算机使用辅导会话,涵盖创意、工程和生产力领域。DigitalCoach 拥有 22,752 轮对话,基于 28.1 小时的屏幕录制、39,609 个输入事件和 36,724 个文件快照。为了捕捉语言使用的沟通和教学功能,我们用对话行为和辅导方法对语句进行注释。然后我们使用 DigitalCoach 评估 6 个最先进的模型作为计算机使用辅导 Agent。 结果表明,模型语句在分布上与人类语句不同,且词汇和语义多样性较低。与人类辅导者相比,模型主要使用直接指令(所有模型 >45% 的轮次 vs. 人类的 30%)。它们对屏幕状态的反馈较少,提问也更少。最好的模型(Gemini-3.1-Pro)在知道辅导方法的情况下可以生成与人类参考相似的可信的局部指导(CLAIR = 41.4)。然而,当前所有模型都更依赖于文本历史而非学习者的屏幕状态,因为模型在没有视觉上下文的情况下表现相似,但没有对话上下文时它们的分数大幅下降。在实时交互中,由模型辅导的学习者完成了更少的里程碑并保留了更少的技能。我们表明,模型仍然难以提供基于不断变化的屏幕状态的指导,并且很少提供可重复使用的知识,以帮助学习者在未来独立完成类似任务。 这些发现表明,有效的计算机使用辅导 Agent 需要适应性地结合基于学习者不断进步和可转移技能发展机会的指令和反馈。总之,我们贡献了: - • **DigitalCoach**,一个 28.1 小时的人类专家-新手 GUI 基础对话数据集,带有对话行为和辅导方法的细粒度注释。 - • 区分人类和模型辅导的定量和定性特征。 - • 专家评分和交互式人工评估,揭示了实时模型辅导中的沟通和基础差距。 ## 2 相关工作 | 数据集 | 领域 | 来源 | 设置 | 时长 | # 轮次 | 数据 | # 人员 | 关系 | 文本 | 音频 | 视频 | 动作 | 文件 | |--------|------|------|------|------|--------|------|--------|------|------|------|------|------|------| | Portal Dialogue Corpus | 游戏 | 真实 | 2 位合作者 | 11.5h | 24.5k | ✓ | ✓ | ✓ | ✗ | ✓ | | | MathDial | 教育 | 半合成 | 1 专家-新手 | – | 28.3k | ✓ | ✗ | ✗ | ✗ | ✗ | | | VideoCAD | 专业 | 合成 | 0 – | 2.1kh | – | ✗ | ✗ | ✓ | ✓ | ✗ | | | AssistGUI | 专业 | 真实 | 1 – | <8.3h | – | ✗ | ✗ | ✓ | ✓ | ✗ | | | RealWebAssist | 日常 | 真实 | 1 – | <6h | – | ✓ | ✓ | ✓ | ✗ | ✗ | | | GUIDE | 专业 | 真实 | 1 – | 67.5h | – | ✓ | ✓ | ✓ | ✗ | ✗ | | | MixAssist | 专业 | 真实 | 2 专家-新手 | 7h | 431 | ✓ | ✓ | ✗ | ✗ | ✗ | | | **DigitalCoach** | 专业 | 真实 | 2 专家-新手 | **28.1h** | **22.7k** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | 表 1:与相关数据集(Tomlin et al. (2025); Macina et al. (2023); Man et al. (2025); Gao et al. (2024a); Ye et al. (2025); Yang et al. (2026); Clemens and Marasović (2025))相比,DigitalCoach 捕捉了真实的人-人计算机使用辅导,并具有更丰富的多模态数据。 ##### 情境化协作中的语言使用。先前的工作研究了 Agent 如何在部分可观察性和不同任务知识下通过语言进行基础和协调(Allen et al. (1995); Allen and Ferguson (2002); Lin et al. (2024a); Shaikh et al. (2024); Suhr et al. (2019); Bara et al. (2021); Udagawa and Aizawa (2020))。最近的工作转向更丰富的设置,如视频游戏、家庭任务和协作绘图(Zhang et al. (2025); Tomlin et al. (2025); Padmakumar et al. (2022); Aggarwal et al. (2025); Bhattacharyya et al. (2025); Kim et al. (2019))。然而,没有现有的协作对话数据集是基于 GUI 工作流的,其中人们通过多模态沟通(*例如*,空间指代)寻求和提供帮助。我们的数据集通过捕捉 GUI 任务期间专家-新手多模态沟通来填补这一空白。 ##### 教学和指导性对话。与专注于任务完成和意图跟踪的交易性对话系统(如预订(Gašić et al. (2013))或工具使用(Yao et al. (2024)))不同,教学对话强调系统如何通过反馈、提问和支架式教学来支持学习(Collins and Kapur (2022))。先前的数据集如 MathDial(Macina et al. (2023))、MathTutorBench(Macina et al. (2025))和 ConvoLearn(Sharma et al. (2026))评估了数学和地理等领域的辅导质量,而 MixAssist 捕捉了音乐制作工作流中的专家-业余爱好者协作(Clemens and Marasović (2025))。然而,这些数据集要么基于文本,要么基于静态内容,没有一个捕捉到基于动态视觉环境的指导。DigitalCoach 通过基于实时 GUI 状态和用户操作的多模态专家-新手交互填补了这一空白。 ##### 协作式 GUI Agent。GUI Agent 研究主要研究 Agent 能否解释界面状态并执行动作来完成用户目标。像 WebArena 和 OSWorld 这样的基准使用截图、自然语言目标和界面操作来评估 Agent 在网页和桌面任务上的表现(Zhou et al. (2024); Xie et al. (2024))。最近的工作扩展到随时间捕捉软件交互的屏幕录制(Man et al. (2025); Lin et al. (2024b); Jang et al. (2024))。然而,现有的 GUI Agent 基准主要关注自主任务完成,而不是在用户代理重要的分析和创意工作流中与用户协作(Shen et al. (2025))。最近的工作探索了更主动的助手,它们在决策点暂停或推理用户意图(Peng et al. (2025); Huq et al. (2025); Yang et al. (2026)),但协作交互的语言和动态仍未被充分探索。DigitalCoach 通过表征人类和模型辅导来填补这一空白。 ## 3 DigitalCoach 数据集 我们研究计算机使用辅导的协作任务,其中专家和学习者合作,在复杂的软件应用程序中教授学习者关键技能,以便学习者在离开交互时能够在软件中扩展创造性代理。在设计我们的研究时,我们遵循两个主要设计考虑:我们旨在捕捉和表征 (a) 多模态对话,语言使用基于状态(文件快照)、观察(屏幕录制)和动作(输入事件)进行基础,以及 (b) 学习成果,使用前后任务测量学习者是否保留/迁移所学技能。 DigitalCoach 包含 72 场人类专家-学习者辅导会话中的 22,752 条语句(表1)。除了对话,DigitalCoach 还捕捉了丰富的多模态活动轨迹,包括 28.1 小时的屏幕录制、39,609 个输入事件和 36,724 个文件快照,以支持关于语言在动作和感知中的基础的研究。附录 A 包含更多细节。 参见标题 图 2:采集设置,以 CAD 软件 Onshape 为例。新手学习者操作软件,专家辅导者提供实时的口头指令和屏幕注释。 ### 3.1 数据采集与构建 ##### 任务。我们选择了 5 个软件应用,涵盖 3 个领域:生产力(Excel)、创意(FL Studio, Blender, Figma)和工程(Onshape)。我们从官方和流行的在线教程中获取了 18 个任务(*例如*,图 2 展示了在 OnShape 中制作马鞍支架),涵盖了不同的长度、难度和模态(文本、音频、图像和 3D 模型,见附录 C)。 ##### 参与者。我们通过专业网络和 Upwork¹¹招募了总共 20 名英语母语软件特定专家和 20 名英语母语新手,组成总共 20 对(每对 4 对×5 个应用)。新手平均在目标软件上的经验不到一年(μ=0.25, σ=0.44),但对目标软件有浓厚兴趣;专家至少有 5 年软件经验(μ=9.25, σ=5.39)和 6 个月的辅导经验²²。 ##### 采集设置。每次会话将一名专家与一名新手配对,持续约 3 小时,涵盖单个软件应用中的 3-4 个任务。会话通过 Zoom 进行,学习者共享屏幕,专家通过口头指令、屏幕注释或远程控制进行辅导(图 2)。在每个教程任务前后,学习者还独立完成匹配的前后任务,这些任务针对教程中相同的软件技能但有所变化(*例如*,Blender 教程中制作甜甜圈 vs 前后任务中制作焦糖苹果)。学习者独立完成这些任务(每个任务最多 15 分钟,附录 B 描述了完整的研究协议)。 ## 4 对话行为与辅导方法 ##### 对话行为。为了表征计算机使用辅导中语言使用的沟通功能,我们基于多层对话行为标记(DAMSL; Core and Allen, 1997; Stolcke et al., 2000)开发了一个对话行为模式。我们通过合并相似类别(*例如*,命令和建议)并移除不太相关的行为(*例如*,感叹)来调整 DAMSL。最终模式包括信息寻求行为(信息请求)、信息提供行为(回答、告知、意见)、面向操作的行为(行动指令)以及在面向任务的多模态辅导对话中常见的基础行为(反馈信号)。 ##### 辅导方法。我们进一步对每个辅导者语句进行注释,以捕捉传递的指导类型,基于先前关于认知学徒制理论(Collins and Kapur (2022); Ahn et al. (2026))和视频教程指导(Yang et al. (2023))的工作。我们的模式将程序性指导(直接指令、计划)、知识(解释、提示)、反馈(确认、否定)分类。
相似文章
自动化演讲辅导综述:系统、方法与开放挑战
一篇关于自动化演讲辅导系统的综述,回顾现有系统,引入一个涵盖发音、重音、韵律、节奏和内容忠实度的五维任务分类法,并指出了标注稀缺、口音公平性和低延迟反馈等开放挑战。
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.
# 数字学徒:人类主导的智能体AI开发框架
本文介绍了"数字学徒"(Digital Apprentice)框架——一个可扩展且安全的智能体 AI 体系,其中自主权通过观察学习、人工授权和持续对齐校正的方式逐步获得。本文还介绍了 ADAPT,一种推理时控制平面,用于将渐进式自主权等级付诸实践,并将人工校正转化为可复用的偏好数据。
SkillCoach:自演化评分标准用于评估与增强智能体技能使用
SkillCoach提出了一种自演化评分标准框架,通过分析技能选择、遵循、组合和反思来评估并增强LLM智能体技能使用,提供了超越仅结果指标的过程级监督。
COLLEAGUE.SKILL:通过专家知识蒸馏实现自动化AI技能生成
本文介绍COLLEAGUE.SKILL,一个开源系统,能够从异构轨迹中自动提炼基于人的AI技能,形成可检查、可纠正、可移植的技能包,使LLM代理能够携带有限的人类专业知识和交互风格表征。