PolyInterview:基于LLM的沉浸式模拟面试平台,提供全面的多模态评估

arXiv cs.CL 论文

摘要

本文介绍了PolyInterview,一个基于LLM的平台,通过唇形同步的数字人进行沉浸式模拟面试,并对回答内容、声音表达和非语言行为提供全面的多模态评估。该系统生成针对角色的定制问题,并利用与KSA和STAR框架相关的13个行为特征对考生进行评估。

arXiv:2607.10310v1 公告类型:新提交 摘要:为理想职位做准备离不开求职面试训练,但获得真实的练习机会仍然困难:真实面试机会稀少,专家模拟辅导成本高昂,而自我练习既缺乏自适应对话也没有结构化评估。现有系统通常只能通过固定问题序列、有限沟通渠道或缺少证据支持的反馈来满足部分需求。我们提出了PolyInterview,一个基于LLM的沉浸式模拟面试平台,提供全面的多模态评估。PolyInterview利用目标职位描述和简历生成针对角色和候选人的定制问题,与唇形同步的数字面试官进行多轮语音面试(该数字面试官会提出基于回答的追问),并评估回答内容、声音表达和非语言行为。四个并行评估器产生13个行为特征,这些特征被聚合为10个评估维度以及两个能力轨道。在KSA和STAR框架的指导下,报告将每个分数与行为证据和可操作建议联系起来。PolyInterview现已公开访问。其当前所有账户的快照包含101个账户、1,564次面试会话、7,665个生成的问题以及1,422个五阶段问题集。在93.7%的会话中,生成的问题与其匹配的职位描述的相关性高于跨角色职位描述。十位专家的评估显示其问题计划强且反馈可操作。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:21

# 基于LLM的沉浸式模拟面试练习平台与全面多模态评估
来源: https://arxiv.org/html/2607.10310
Zhiyuan Wen1, Jiannong Cao1, Zijian Wang1, Chen Chen1, Xiaoyun Liu1, Jianing Yin1, Zhuo Li2 1香港理工大学计算学系, 香港, 中国 2重庆邮电大学人工智能学院, 中国 \{zyuanwen, jiannong\.cao, zi\-jian\.wang\}@polyu\.edu\.hk \{chen03\.chen, xiaoyun\.liu, jianing\-laetitia\.yin\}@connect\.polyu\.hk cliff\.zhuo\.li@gmail\.com

###### 摘要

为求职面试做好准备对于获得理想职位至关重要,然而真实的练习仍然难以实现:真实面试机会稀少,专家模拟辅导成本高昂,而自我练习既缺乏自适应对话也缺少结构化评估。现有系统通常仅通过固定问题序列、有限的沟通渠道或缺乏支持证据的反馈来满足部分需求。我们提出了PolyInterview,一个基于LLM的沉浸式模拟面试练习平台,提供全面的多模态评估。PolyInterview利用目标职位描述和简历生成针对角色和候选人定制的问题,进行多轮语音面试,与唇形同步的数字人类面试官互动,该面试官能根据回答提出后续问题,并评估回答内容、语音表达和非语言行为。四个并行评估器产生13个行为级特征,这些特征被聚合为10个评估方面和两个能力轨道。在KSA和STAR框架的指导下,报告将每个分数与行为证据和可操作建议相关联。PolyInterview已公开访问¹ (https://dannywang1922.github.io/polyinterview)。其当前全账户快照包含101个账户、1,564个面试会话、7,665个生成的问题,以及1,422个五阶段问题集。在93.7%的会话中,生成的问题与匹配的职位描述比对跨角色职位描述更紧密对齐。十位专家的评估发现强烈的问题计划和可操作反馈。

PolyInterview: 基于LLM的沉浸式模拟面试练习平台与全面多模态评估

Zhiyuan Wen1, Jiannong Cao1, Zijian Wang1, Chen Chen1, Xiaoyun Liu1, Jianing Yin1, Zhuo Li21香港理工大学计算学系, 香港, 中国2重庆邮电大学人工智能学院, 中国
\{zyuanwen, jiannong\.cao, zi\-jian\.wang\}@polyu\.edu\.hk
\{chen03\.chen, xiaoyun\.liu, jianing\-laetitia\.yin\}@connect\.polyu\.hk
cliff\.zhuo\.li@gmail\.com

参见标题 图1: PolyInterview的工作流程,从个性化设置和沉浸式面试到多模态评估和全面报告与反馈。## 1 引言

有效的求职面试准备对于获得理想职位至关重要。在面试中,候选人既要展示与职位相关的知识和技能,也要展示清晰沟通经验和推理的能力。尽管面试准备很重要,但真实的练习仍然难以实现:真实面试机会稀少,专家模拟辅导成本高昂,而自我练习既缺乏自适应对话也缺少结构化评估。这些限制促使我们需要一个能够模拟多轮面试互动并提供全面评估和反馈的可访问平台。

商业产品和研究原型扩展了面试练习的可及性,然而,如表1 (https://arxiv.org/html/2607.10310#S1.T1)总结,它们并没有在集成练习环境中共同支持基于角色的多阶段提问、基于回答的追问以及理论基础的文本、语音和非语言行为评估。对于商业工具,诸如Google Interview Warmup、Yoodli和Big Interview等产品支持问题演练或自动反馈,但通常依赖于固定问题序列,仅评估选定的沟通渠道,或在反馈推导方式上透明度有限。对于研究原型,虚拟面试代理探索了对话真实性 (Hoque et al.,2013 (https://arxiv.org/html/2607.10310#bib.bib7); Anderson et al.,2013 (https://arxiv.org/html/2607.10310#bib.bib1); Smith et al.,2014 (https://arxiv.org/html/2607.10310#bib.bib17)); 基于LLM的模拟面试官支持灵活的问题生成 (Li et al.,2023 (https://arxiv.org/html/2607.10310#bib.bib11); Sun et al.,2025 (https://arxiv.org/html/2607.10310#bib.bib18); Daryanto et al.,2025 (https://arxiv.org/html/2607.10310#bib.bib4)); 自动视频面试系统分析非语言行为 (Naim et al.,2018 (https://arxiv.org/html/2607.10310#bib.bib13); Hemamou et al.,2019 (https://arxiv.org/html/2607.10310#bib.bib5))。

为了解决这些局限性,我们提出了PolyInterview,一个基于LLM的沉浸式模拟面试练习平台,提供全面的多模态评估 (图1 (https://arxiv.org/html/2607.10310#S0.F1))。PolyInterview通过使用目标职位描述 (JD) 和候选人的简历来生成定制问题,从而个性化每次模拟面试。唇形同步的数字人类面试官创造了沉浸式面试环境,而基于LLM的代理维持多轮互动并生成基于回答的后续问题。为了全面评估,我们结合了基于LLM的响应内容分析、语音分析以及基于视觉语言模型 (VLM) 的非语言行为分析。在知识、技能和能力 (KSA) 框架 (Peterson et al.,2001 (https://arxiv.org/html/2607.10310#bib.bib15)) 和用于在模式化行为描述面试中组织证据的情境-任务-行动-结果 (STAR) 结构 (Janz,1982 (https://arxiv.org/html/2607.10310#bib.bib9))的指导下,评估捕捉了面试表现的两个互补维度:候选人展示与目标角色相关的知识、技能和经验的程度,以及他们如何清晰有效地进行沟通。由此产生的13个行为级特征被聚合为10个评估方面和两个能力轨道,每个分数都与行为证据和可操作反馈相关联。

PolyInterview当前全账户快照包含101个账户和1,564个面试会话。它包括覆盖83个职位头衔的7,665个生成问题,其中1,422个会话问题集覆盖了完整的五阶段面试结构。进一步的词汇对齐分析显示,在93.7%的会话中,生成的问题集与其匹配的JD比对跨角色JD更紧密对齐,并且在82.4%的会话中,匹配的JD排名第一。十位人类专家的评估进一步发现了高质量的问题计划和可操作的建议,同时指出后续追问的诊断深度和响应忠实度是需改进的领域。总结来说,我们的贡献有三方面:

1. 1.**沉浸式、个性化的面试模拟**。我们开发了一个端到端的工作流程,该流程根据JD和CV构建多阶段面试,根据候选人回答调整后续问题,并通过可配置、唇形同步的数字人类面试官 (第2.1节 (https://arxiv.org/html/2607.10310#S2.SS1)–2.2节 (https://arxiv.org/html/2607.10310#S2.SS2)) 进行交互。
2. 2.**全面的多模态评估**。我们引入了一个基于KSA和STAR的管道,通过四个评估器分析文本、语音和视觉行为,将13个特征映射到10个方面和两个能力轨道,并保留从每个分数到可操作反馈的可追溯路径 (第2.3节 (https://arxiv.org/html/2607.10310#S2.SS3))。
3. 3.**部署与专家评估**。我们描述了包含101个账户和1,564个会话的全账户快照,分析了工作流程覆盖率和角色对齐,并请十位人类专家评估了问题计划、后续追问和反馈报告 (第4节 (https://arxiv.org/html/2607.10310#S4)和第5节 (https://arxiv.org/html/2607.10310#S5))。

表1: 与代表性商业和研究面试系统的比较 (✓ 完整,∼ 部分,× 缺失)。
## 2 系统概述与设计

参见标题 图2: PolyInterview用于个性化提问、基于回答的追问、多模态评估和全面反馈的管道。一个PolyInterview会话包括四个阶段 (图2 (https://arxiv.org/html/2607.10310#S2.F2)):*个性化设置*、*沉浸式面试*、*多模态评估* 和 *全面报告与反馈*。候选人配置个性化会话,通过多轮语音对话与数字人类面试官互动,并查看每个问题和整个面试的反馈。我们首先描述界面和用户工作流程 (第2.1节 (https://arxiv.org/html/2607.10310#S2.SS1)),然后是自适应面试机制 (第2.2节 (https://arxiv.org/html/2607.10310#S2.SS2)) 和全面多模态评估 (第2.3节 (https://arxiv.org/html/2607.10310#S2.SS3))。

### 2.1 用户界面与工作流程

参见标题
(a) 个性化设置。
参见标题
(b) 沉浸式数字人类面试。
参见标题
(c) 总体评估摘要。
参见标题
(d) 行为级特征档案。
参见标题
(e) KSA对齐的评估方面档案。
参见标题
(f) 每个问题的诊断和改进建议。

图3: PolyInterview的界面,包括个性化设置、沉浸式面试和多级评估结果。#### 面试设置。

设置界面将个性化所需的所有输入整合到一个屏幕上 (图3(a) (https://arxiv.org/html/2607.10310#S2.F3.sf1))。候选人选择一个采访者角色(共三种),指定目标公司、职位和JD,上传PDF格式的简历,并选择8、15或30分钟的会话时长。这些输入同时决定了面试的内容和长度。JD和CV提供用于根据角色和候选人定制面试的证据,而选定的时长决定了问题预算。

#### 沉浸式实时面试。

唇形同步的数字人类面试官会大声读出每个问题,流式语音识别支持口语回答。界面将面试官和候选人视频并排显示,并显示连接状态、会话进度和回答控制 (图3(b) (https://arxiv.org/html/2607.10310#S2.F3.sf2))。对于每个问题,系统记录回答的文字转录、音频和视频,从而支持后续对回答内容、语音表达和非语言行为的评估。

#### 全面评估结果。

面试后,界面从摘要到细节呈现评估结果和反馈。总体报告呈现总体评估、两个能力轨道分数、优势和改进优先事项 (图3(c) (https://arxiv.org/html/2607.10310#S2.F3.sf3))。然后候选人可以检查10个KSA对齐的评估方面 (图3(e) (https://arxiv.org/html/2607.10310#S2.F3.sf5)),并深入到由四个评估器产生的13个行为级特征 (图3(d) (https://arxiv.org/html/2607.10310#S2.F3.sf4))。最后,每个问题的视图将每个提示和回答与针对该回答的诊断和改进建议配对,包括STAR引导的措辞,将候选人经验转化为结构化叙述 (图3(f) (https://arxiv.org/html/2607.10310#S2.F3.sf6))。这种层级结构将第2.3节 (https://arxiv.org/html/2607.10310#S2.SS3)中的评估框架与具体的练习指导联系起来。完整的报告也可以导出为PDF。

### 2.2 自适应面试

个性化在面试前和面试期间都进行:面试计划代理结合目标JD中的角色要求与候选人CV中的相关技能、项目和经验,生成针对角色和候选人定制的问题;而面试官代理则生成有边界的、基于回答的后续追问。附录C (https://arxiv.org/html/2607.10310#A3)提供了详细的问题计划和后续追问工作流程。

### 2.3 全面多模态评估

参见标题 图4: 三层多模态评估从13个行为级特征到10个方面和两个能力轨道。图4 (https://arxiv.org/html/2607.10310#S2.F4)展示了三层评估架构。四个评估器并行分析每个回答,它们的输出从行为级特征逐步聚合到评估方面和能力轨道。

#### 第1层:行为级特征。

两个基于LLM的文本评估器分析回答内容和表达。*专业表现*评估器评估概念准确性、术语使用和问题解决逻辑;而*表达方式*评估器评估结构清晰度、连贯性和用词。一个基于VLM的*非语言行为*评估器从录制的视频中分析眼神接触、面部表情、身体姿势和手势。一个基于语音的*口头表达*评估器分析发音准确性、韵律和流畅度。这些评估器共同产生13个特征分数,范围从0到10分。

#### 第2层:评估方面。

一个聚合代理将13个特征映射到10个KSA对齐的方面,分为三组:*认知*(通用智力、应用心智技能和创造力)、*背景*(工作知识和技能、教育与培训、经验与工作历史)以及*社交*(沟通、人际交往能力、领导力和说服力)。社交组借鉴了大五人格理论 (McCrae和Costa,1987 (https://arxiv.org/html/2607.10310#bib.bib12)),但未推断或报告人格特质。每个方面以70/30的权重结合主要和次要特征。问题类别门控将评估限制在当前问题能够合理引发评估的方面。例如,行为类问题激活人际交往能力、应用心智技能和领导力;而技能QA问题激活工作知识、通用智力和教育。附录E (https://arxiv.org/html/2607.10310#A5)详细说明了映射和门控规则。

#### 第3层:能力轨道。

认知和背景方面被聚合成*专业能力*轨道,而社交方面形成*沟通能力*轨道。总体分数是这两个轨道的平均值。最后一步,根据CV调整建议,使其与候选人的经验和目标角色相适应。

#### 理论基础与可追溯性。

KSA框架规定了专业能力轨道所代表的与工作相关的能力 (Peterson et al.,2001 (https://arxiv.org/html/2607.10310#bib.bib15));而STAR则构建了行为类回答中预期的证据结构 (Janz,1982 (https://arxiv.org/html/2607.10310#bib.bib9))。例如,省略的“结果”可以转化为针对性的建议,要求陈述结果及其意义。每个能力分数可以通过其贡献方面追溯到产生它的行为级特征和模态,从而将理论标准与可检查的证据联系起来。附录D (https://arxiv.org/html/2607.10310#A4)详细说明了KSA、STAR和大五人格如何融入评估管道。

## 3 实现与部署

#### 实时管道。

数字人类面试官由唇形同步生成驱动 (Prajwal et al.,2020 (https

相似文章

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。