PhoenixNent-Video:基于证据的多模态代理框架,用于自动化视频面试评估
摘要
PhoenixNent-Video 提出了一种基于证据的多模态代理框架,用于自动化视频面试评估,通过使用结构化视频图和强化学习,在基准测试中达到了91.50%的等级准确率。
arXiv:2609.02231v1 公告类型:新
摘要:面试评估需要基于行为证据的逐项标准判断,但申请人数的激增使得纯人工评估成本高昂且不一致,而现有的AI方法产生的分数不透明且缺乏可追溯的理由。我们提出PhoenixNent-Video,一种基于证据的多模态代理框架,用于自动化视频面试评估。它构建语义视频图作为结构化工作记忆,执行基于准则的检索,并对视觉、音频和文本流进行跨模态验证,生成基于候选人材料的各标准分数。通过基于准则的强化学习训练的评分器,使用针对准则对齐和分数级别区分的双重奖励,内化了多级准则的区分结构。PhoenixNent-Video在VInterview-2025上达到了91.50\%的等级准确率,显著优于更大的专有模型。因此,一个紧凑、基于准则的代理评分与专家组更加一致,相比直接提示更大的模型,并为人类审查揭示每个分数背后的证据。
查看缓存全文
缓存时间: 2026/09/03 06:03
# PhoenixNest-Video:基于证据的多模态智能体框架,用于自动化视频面试评估 来源:https://arxiv.org/html/2609.02231 作者:黄妙君、张海梅、吴景深、刘浩 所属机构:香港科技大学(广州) ###### 摘要 面试评估需要基于行为证据对每项标准进行判断,但申请者数量的激增使得纯人工评估成本高昂且不一致,而现有人工智能方法则产生不透明的分数且缺乏可追溯的依据。我们推出PhoenixNest-Video,一个基于证据的多模态智能体框架,用于自动化视频面试评估。它构建一个语义视频图作为结构化工作记忆,在视觉、音频和文本流中进行基于评分标准的检索和跨模态验证,并生成与候选人材料锚定的每项标准分数。通过基于评分标准的强化学习训练的评分器,利用针对评分标准一致性和分数等级区分度的双重奖励,内化多层级评分标准的判别结构。PhoenixNest-Video在VInterview-2025基准上达到了91.50%的等级准确率,其表现显著优于规模大得多的专有模型。因此,一个紧凑的、基于评分标准的智能体在评分上与专家小组的共识度高于直接对更大模型进行提示的方法,并且能暴露每个分数背后供人工审查的证据。 ## 1 引言 长期以来,面试一直是研究生录取和职业招聘中选拔候选人的核心步骤。为了达成公平且可辩护的决策,机构要求评估者根据多个标准对每位候选人进行评分,为每个分数提供依据,并引用面试中的具体时刻和材料作为支持证据。然而,近年来申请数量急剧增加,Common Application的提交量在2021年至2025年间增长了超过37%,达到760多万份,这给这种基于证据的流程带来了前所未有的压力。在此规模下,仅依靠人类专家维持如此严格的逐人评估变得日益不切实际。一方面,在成千上万的申请者中招募、培训和补偿合格面试官会带来巨大的人力成本,且专家人手的增长并未跟上需求。另一方面,即使有足够数量的评分者,长期大规模评估也会放大已充分记录的人类局限性,如疲劳、锚定效应和不一致的标准权重分配,从而侵蚀高风险决策所依赖的一致性。自动化助手直接解决此问题:它对大量候选人池统一应用一套评分标准,并使每个分数背后的证据可被检查。 如图1所示,面试评估已历经三种范式。人工评估小组在准确性方面仍是黄金标准,但无法扩展到当前的申请者规模。基于机器学习的方法在面试数据上训练监督模型并获得了可扩展性,但它们产生的是没有可解释依据的不透明数值分数,限制了其在高风险决策中的效用。多模态大语言模型通过在统一架构中处理视觉、音频和文本流,提供了更强大的基础能力,然而直接将其应用于面试评估则暴露了标准训练未能解决的结构性挑战。 将多模态大语言模型应用于标准级别的评估性判断,暴露了三个根本性限制。首先,标准评分需要分解并行的视觉、语音和语言流,并根据每个标准关注不同的信号,然而多模态大语言模型将视频视为未分化的流,无法跨模态和时间组织与标准相关的证据。其次,如图2所示,通用多模态大语言模型表现出系统性的评分偏差,一些模型分数压缩在狭窄的低分段,另一些则偏向高分;它们为流畅生成和安全对齐的中立性而优化,未能根据评分标准定义的维度区分候选人。第三,可辩护的评估要求每个判断都可追溯到具体的行为观察,但多模态大语言模型生成的评估文本缺乏这种锚定,并且缺乏时间记忆来交叉验证候选人的言、行、表,使其输出无法审计。细微的视觉差异也可能触发幻觉,而既未被保留也未被言语化的视觉事实在后续交互中可能变得不可访问。 为应对这些挑战,我们提出PhoenixNest-Video,一个基于证据的多模态智能体框架,用于自动化视频面试评估。PhoenixNest-Video构建一个语义视频图作为结构化工作记忆,执行基于评分标准的检索和跨模态验证以定位和验证与标准相关的证据,并生成与候选人材料锚定的每项标准分数。一个通过基于评分标准的强化学习过程训练的评分模块,该过程使用针对评分标准一致性和分数等级区分度的双重奖励信号,使模型内化多层级评分标准的判别结构。基于Qwen3-VL-8B主干构建,PhoenixNest-Video在VInterview-2025上达到了91.50%的等级准确率,并在所有基线中获得了最低的总分平均绝对误差和沃瑟斯坦距离,其表现显著优于规模大得多的专有模型,并且在RecruitView数据集上重新训练后,其12个回归目标的宏平均排名相关性和一致性得分最佳。 本文的贡献总结如下: - 我们提出了PhoenixNest-Video,一个基于证据的多模态智能体框架,能产生带有可验证视频证据的标准级别分数,实现透明且可审计的自动化面试评估。 - 我们引入了基于评分标准的强化学习,使用针对评分标准一致性和分数等级区分度的双重奖励信号,使多模态大语言模型能够克服评分偏差并产生符合评分标准的面试评估。 - 我们在VInterview-2025和RecruitView上评估了PhoenixNest-Video,它达到了91.50%的等级准确率,并产生了与人类专家高度对齐的分数分布,证明了紧凑的、基于证据的多模态智能体用于自动化面试评估的可行性。 ## 2 相关工作 自动化视频面试评估。自动化面试评估已经从在模拟面试上手工制作韵律和面部特征,发展到在短片段上进行双模态人格预测,再到用于异步筛选的分层神经模型。近期的工作已扩展到视听人格基准、基于姿态的分析、多模态绩效评估、自然面试数据集、公平性审计、心理测量验证以及多智能体评估框架。这些工作主要输出整体或特质层面的分数,没有评分标准锚定或证据可追溯性。PhoenixNest-Video通过使每个分数都以评分为依据,并将其锚定到已验证的候选人材料上,来解决这一差距。 用于视频理解的多模态大语言模型。多模态大语言模型通常通过指令微调将视觉编码器与大语言模型连接起来,后续的工作通过时间感知查询、双速率视觉流和块级压缩来改进时间建模和长形式处理。通过强化学习进行的面向推理的后训练进一步改善了时空推理。在视频之外,特定领域的多模态大语言模型使用多维推理奖励和迭代视觉工具来改善结构化推理,而多模态智能体则将工具使用与基于知识的检索相结合。最近的基准也开始测试多模态大语言模型在表面识别之外缺失的能力,包括意图级的视听理解、跨模态歧义消解以及在判断而非事实检索至关重要的社会科学和人文学科领域的能力。多智能体协调为结构化推理提供了另一条途径,既包括视频领域,也包括法律判决预测等高风险决策领域,尽管如Neptune等基准表明长程时间推理仍然是一个瓶颈。与这些通用系统相比,PhoenixNest-Video针对的是结构化面试评估中基于证据的评估和可追溯的推理。 ## 3 任务形式化 视频面试评估被广泛应用于教育、职业和组织背景中,通过结构化多模态互动评估候选人。在一个典型的流程中,候选人向一个小组进行展示,有时随后还有问答环节。然后,每位小组成员根据一组预定义的标准独立对候选人进行评分,并提交单独的分数向量,最终结果通过对个人分数进行聚合得出。 我们的目标是开发一个模拟这种多标准评估过程的评估系统。我们将评估函数定义为将候选人的视频、可选的补充材料、一组N个标准及其评分标准(为序数量表上的每个分数等级s提供文本描述)映射到每项标准的分数、将每个判断链接到候选人材料特定元素的证据引用,以及文本反馈。 公式:S,E,F←F(V,M,C,R)。(1) 此形式化是通用的。标准的数量N、分数尺度和评分标准内容R是应用环境提供的参数。我们在两个具有不同配置的基准上进行评估,详见第5节。 ## 4 方法论 PhoenixNest-Video框架概览。多模态预处理将面试转化为对齐的视觉、音频/转录本和幻灯片流,而评分标准分解将每个分数描述扩展为行为指标。图构建器构建一个剪辑级别的语义索引;检索器选择与标准相关的候选人剪辑;验证器跨模态检查候选内容;经过训练的评分器产生标准级别的分数、证据引用和反馈。评分器通过监督微调和基于评分标准的强化学习(包含对齐奖励)进行优化。
相似文章
InternVideo3: 使用多模态上下文推理将基础模型智能体化
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
迈向可验证的多模态深度研究:一种用于交错报告生成的多智能体框架
本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。
VideoGAIA: 通用AI助手智能视频理解基准
VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。