当招聘过程被代理中介化:评估双代理简历筛选中的访问与复现
摘要
本文评估了一种双代理简历筛选方法,其中雇主和候选人的AI代理交互决定是否晋级,并使用GPT-5.5和Opus 4.7与单次筛选进行比较,展示了访问和复现率的变化。
arXiv:2609.19530v1 Announce Type: new
摘要:招聘是双边的:雇主评估匹配度,而候选人展示并辩护其资格证据。然而,简历筛选作为第一道关卡,通常被自动化为对简历-职位对的静态单次判断。我们研究了一种双代理替代方案,其中雇主方和候选方代理代表这些角色,交换证据,并在决定谁晋级前更新其判断。我们使用GPT-5.5和Claude Opus 4.7在600个构建的简历-职位对上比较程序。双代理筛选晋级了更多申请(GPT-5.5从33.3%到39.3%;Opus 4.7从34.0%到35.5%)。在共同的191对边缘池上进行三次运行,通过率分别从4.5%上升到26.2%和从6.5%上升到16.1%。这不是均匀的放松:双代理筛选拒绝了单次筛选晋级的申请,决策在两个方向上变化。在相似的通过量下,程序晋级不同的申请,并且没有单次筛选阈值能持续恢复双代理筛选选择的申请。在发现选定的案例中重新执行新运行,仅双代理选择的复现频率低于共享选择,明显在GPT-5.5下,在Opus 4.7下不太确定,而单独的单次筛选后续显示没有可比的下降。随着招聘在双方都变得代理中介化,筛选程序,而不仅仅是其背后的模型,决定了谁进入人工审查以及这种访问的复现可靠性。
查看缓存全文
缓存时间: 2026/09/18 09:20
# 当招聘转变为智能体中介:评估双智能体简历筛选中的可及性与可复现性 来源:https://arxiv.org/html/2609.19530 姜航 所属机构:东北大学 地址:美国马萨诸塞州波士顿 ###### 摘要 招聘具有双边性:雇主评估岗位匹配度,而求职者呈现并辩护其资质证据。然而,作为首要关卡的简历筛选,通常被自动化为对“简历-职位”组合的静态、单次调用判断。我们研究了一种双智能体方案:雇主侧和求职者侧智能体分别代表这两个角色,交换证据,并在决定谁进入下一轮前更新其判断。我们使用GPT-5.5和Claude Opus 4.7,在600组构建的“简历-职位”组合上对比了两种流程。双智能体筛选推进了更多申请(GPT-5.5从33.3%提升至39.3%;Opus 4.7从34.0%提升至35.5%)。在针对191组边界案例的三次常见运行中,通过实例率分别从4.5%升至26.2%、从6.5%升至16.1%。这并非普遍的放宽:双智能体筛选否决了一些单次调用筛选通过的申请,同时在两个方向上改变了决策。在相似的通过量下,两种流程推进了不同的申请,且没有单次调用阈值能持续匹配双智能体筛选所选中的申请。在重新执行的新运行中,仅由双智能体流程选中的案例比共同选中的案例复现率更低——在GPT-5.5下尤为明显,在Opus 4.7下则不那么确定——而单独的单次调用后续运行则未出现类似的复现率下降。随着招聘双方均采用智能体中介,筛选流程——而不仅是其背后的模型——决定了谁能进入人工评审环节,以及这种可及性的可靠复现程度。 ## 1 引言 简历筛选传统上是一个雇主控制的关卡:雇主审阅申请材料,并决定哪些候选人获得进一步考虑。当前基于大语言模型的筛选在很大程度上保留了这一结构,用针对固定“简历-职位”组合的单次模型调用取代了初始审阅(An 等人, 2024 (https://arxiv.org/html/2609.19530#bib.bib10); Iso 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib15); Vaishampayan 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib11))。然而,随着智能体系统日益成熟,雇主和求职者都可能将这一流程的部分环节委托出去。求职者侧智能体可以提取并解释简历中已包含的证据,而雇主侧智能体则可以根据职位描述评估这些证据,并提出未解决的要求(Lo 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib16); Yuksel 等人, 2026 (https://arxiv.org/html/2609.19530#bib.bib17))。 这种双智能体设计的动机在于功能的划分,而非假设对话本质上更好。求职者侧智能体使用基于简历的证据回应雇主侧的关切,而雇主侧智能体则在这些关切得到解决时更新其评估。没有引入新的申请人信息。改变的是评估和辩护的分配方式、证据的交换方式,以及在筛选决策作出之前判断被修正的时机。因此,双智能体筛选是一种不同的决策程序,而不仅仅是一个更长的提示。 通过(Pass)并不意味着录用,但它控制了进入人工评审环节的可及性。因此,仅凭通过率是不够的:两个流程可能推进相似数量的申请,但具体申请不同,且流程特定的选择可能在流程再次执行时消失。相关问题不仅是双智能体筛选是否改变了推进的申请数量,而是它相对于单次调用筛选如何重新分配可及性,以及这些变化是否可复现。 我们在GPT-5.5和Opus 4.7下,对600组构建的“简历-职位”组合比较了固定的单次调用和双智能体流程,并将重新执行作为首要测量手段。首先,双智能体筛选在两个方向上改变了决策,而非普遍放宽单次调用筛选。其次,即使在相似的通过量下,两种流程推进了不同的申请,并且存储的单次调用平均值上的任何阈值都无法重建持续性的双智能体集合。第三,在初次运行选中的队列内,新的运行表明,仅由双智能体流程选中的案例比两种流程共同选中的案例复现率更低,而单独的单次调用后续运行则未出现类似的复现率下降。我们比较的是完整的流程:我们既不评估它们的招聘质量优劣,也不将观察到的差异归因于角色分离、对话、计算、决策规则或任何单一组件。 ## 2 相关工作 基于大语言模型的招聘研究考察了歧视、匹配质量以及人类与大语言模型的一致性,这在很大程度上是通过将筛选视为对同时呈现的简历和职位描述进行单次调用评估来实现的(An 等人, 2024 (https://arxiv.org/html/2609.19530#bib.bib10); Iso 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib15); Vaishampayan 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib11))。近期的系统展示了智能体候选人评估和多智能体简历筛选(Lo 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib16); Yuksel 等人, 2026 (https://arxiv.org/html/2609.19530#bib.bib17))。我们研究这些场景之间的转变:当雇主评估和求职者辩护被分配给不同的智能体时,由此产生的流程是否保留了哪些申请被推进? 我们的评估连接了三个可靠性传统。预测多样性(Predictive multiplicity)和预测扰动(prediction churn)表明,相似的聚合行为可能掩盖不同的实例级结果(Marx 等人, 2020 (https://arxiv.org/html/2609.19530#bib.bib2); Black 等人, 2022 (https://arxiv.org/html/2609.19530#bib.bib3); Milani Fard 等人, 2016 (https://arxiv.org/html/2609.19530#bib.bib4))。关于大语言模型和智能体可靠性的工作强调重复执行、可靠的长期行为和可复现的报告(Atil 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib12); Song 等人, 2025 (https://arxiv.org/html/2609.19530#bib.bib9); Gupta, 2026 (https://arxiv.org/html/2609.19530#bib.bib6); Ma 等人, 2026 (https://arxiv.org/html/2609.19530#bib.bib7); Rabanser 等人, 2026 (https://arxiv.org/html/2609.19530#bib.bib5); Pattnayak and Bhatia, 2026 (https://arxiv.org/html/2609.19530#bib.bib8))。相关地,Jiang 等人(2024)(https://arxiv.org/html/2609.19530#bib.bib18) 研究了以角色为条件的智能体是否在不同的引发任务中一致地表达其指定特质。我们共享他们对智能体一致性的关注,但考察的是由完整的双智能体流程产生的实例级决策。我们将多样性问题从模型替换转移到流程替换,并通过新的运行来验证区分性案例。 ## 3 实验设置 #### 受控测试平台\. 测试平台包含200个职位发布,每个职位与三档预期匹配度中的一个构建简历配对,共形成600个申请对。强简历覆盖了大部分所需技能且达到要求的深度;边界简历刻意结合了匹配和缺失的要求;弱简历来自不匹配的功能领域。一个固定的、无需大语言模型的评分器检查了预期分层,在重新生成后,600/600的配对达成一致。重新生成仅在评分器不同意时触发,从不因单次调用或双智能体的结果而触发。这些分层支持受控比较,而非资质基本事实(附录A (https://arxiv.org/html/2609.19530#A1))。 #### 流程\. 两种流程都评估所需的技能、经验和基本资质,并且在决策分数中都体现了雇主和求职者的视角,但它们组合这些视角的方式不同。**单次调用流程**赋予一个模型同时访问两份文档的权限。在单次调用中,它识别职位要求,查找支持的简历证据,输出一个雇主视角分数和一个求职者视角分数,当它们的存储平均值至少为.75时返回通过(Pass)。因此,其最终读数是补偿性的:一个视角的高分可以抵消另一个视角的低分。 **双智能体流程**分别分配角色和源文档。求职者侧智能体查看简历,并仅使用基于简历的证据进行回应;雇主侧智能体查看职位发布,评估匹配度,并探究未解决的要求。在雇主固定的开场之后,交替进行求职者-雇主的回合。两个智能体都能看到消息历史,但看不到对方的源文档,因此职位标准和简历证据必须通过交换传递。一个引擎级规则要求在引入新话题之前,必须先回答待处理的问题。 不断变化的视角分数输入一个确定性的、非补偿性的规则层,而非求平均值:它使用一个.75的主承诺条件和.65的持续下限变体,并在出现承诺、拒绝、分歧、停滞或达到轮次限制时终止。在第3轮之前无法获得通过(Pass)。八轮构成软上限,最多可扩展至12轮。在重复的边界案例库上,单次调用每次决策恰好使用一次模型调用;双智能体会话使用中位数为8次、平均值为9.31次的调用。提示和决策规则在A–C次运行之前已固定。 在任何模型调用之前,双智能体流程还应用一个确定性的*预交互技能重叠门控*:如果标准化所需技能名称中只有不到10%出现在简历声明的技能列表中,则该对记录为失败(Fail)而无需交互。在测试平台上,此门控阻止了203/600对:0个强对,9个边界对,194个弱对。单次调用筛选没有相应的预交互门控,并对其运行的每一对进行评分。对于配对的边界分析,我们从单次调用结果中移除相同的九个被门控的ID,以定义一个共同的191对集合。 #### 运行与测量\. 运行A–C在GPT-5.5和Opus 4.7下,对191个边界配对执行每个流程三次;运行A额外覆盖了所有强和弱配对。如果一对在所有三次运行中都通过,则是*持久性*(persistent)的;如果通过一次或两次,则是*混合性*(mixed)的。三次运行的边界通过率计算通过实例数除以共同集合(每个流程和模型有573个决策);表1 (https://arxiv.org/html/2609.19530#S4.T1) 则报告了在全部200个边界配对上的单次运行A读数。由于原生的单次调用规则通过的边界申请要少得多,我们在最接近双智能体通过量的截止点描述性地重新读取其存储的分数(GPT-5.5为.590;Opus 4.7为.575)。模型未重新运行,双智能体结果也未重新设定阈值。 新的运行使用这些读数上的初次运行集成员资格。运行D–F在36个共同案例和20个仅由双智能体流程选中的申请-模型案例上执行两个流程。运行G–I则分别仅执行单次调用筛选,针对同样的36个共同案例和35个仅由单次调用流程选中的案例。“仅由单次调用流程选中”是指在一种流程下是持久性的,但在另一种流程下未达到3/3,而不一定是3/3对比0/3。终点是看发起该流程的流程是否再次返回3/3通过。队列标签从未向模型展示。 ## 4 研究发现 ### 4.1 双智能体筛选在两个方向上改变了决策 运行A是唯一涵盖全部600对的初次运行。如表1 (https://arxiv.org/html/2609.19530#S4.T1) 所示,双智能体筛选移除了一些单次调用通过的案例,增加了一些单次调用失败的案例,因此净差异低估了成员资格的变化。 表1:每个200对分层在运行A中的结果。“双向否决”计数的是单次调用通过而双智能体失败的申请;“双向增加”计数的是相反情况。这是单次运行中的不一致,而非第4.2节 (https://arxiv.org/html/2609.19530#S4.SS2) 和4.3节 (https://arxiv.org/html/2609.19530#S4.SS3) 中使用的持久性集合成员资格。弱行是描述性的,因为双智能体的预交互技能重叠门控在交互前就阻止了194/200对。在GPT-5.5下,双智能体筛选移除了六个强申请并增加了42个边界申请。在Opus 4.7下,不一致在两个分层内都双向发生:10个强申请离开而五个进入,同时五个边界申请离开而19个进入。GPT-5.5强申请的减少在名义上显著(p=.031),Opus 4.7的减少不显著(p=.302),而两个边界案例的增加都得到精确配对检验的支持(p<5×10⁻¹³;p=.0066)。一个普遍更低的单次调用截止点可以增加申请,但无法移除已有的通过,因此这种双向变化排除了简单的普遍放宽。由于两种流程在角色分离、聚合、交互、计算和门控方面不同,此结果是一种端到端的流程对比,而非仅归因于对话。 我们在两种流程下,对运行A中所有21个强不一致案例至少重新执行了两次。其中六个在每次执行中都保持相反的分类,包括在Opus 4.7下双向都存在的案例。这个选择性的后续操作衡量的是耐久性而非普遍性,但确认了普遍放宽的单次调用规则存在反复出现的反例(附录B (https://arxiv.org/html/2609.19530#A2))。 ### 4.2 相似的通过量并不意味着相同的申请 原生流程在非常不同的通过量下运行,这也夸大了它们在混合案例率上的明显差异。在接近双智能体通过量的点重新读取存储的单次调用分数,使得GPT-5.5的混合案例差距从13.6个百分点降至6.8个百分点,Opus 4.7从8.4降至3.7(表2 (https://arxiv.org/html/2609.19530#S4.T2))。因此,不应将原生的混合案例对比解释为一种架构特性。 表2:在共同的191对集合上的原生和相似通过量读数。通过实例在573个决策上计数,混合案例在191个三次运行历史上计数。匹配行仅更改存储的单次调用截止点,属于描述性结果。通过量匹配仍然不能使流程互换。在相似通过量的读数下,GPT-5.5单次调用重新运行之间的运行级通过集Jaccard指数为.741–.865,双智能体重新运行之间为.656–.707,但跨流程之间仅为.347–.429;Opus 4.7的范围分别是.725–.811、.568–.750和.348–.408。因此,每个流程内重新运行对之间的重叠程度都高于任何跨流程对。对于持久性选择,GPT-5.5有43个单次调用和36个双智能体通过案例,共享24个;Opus 4.7有28个和20个,共享12个(图1 (https://arxiv.org/html/2609.19530#S4.F1))。由此得到的Jaccard指数分别为.436和.333,分别有31个GPT-5.5和24个Opus 4.7的持久性选择是特定于某一流程的。 GPT-5.5:仅单次调用:19,共同:24,仅双智能体:12,J=.436 Opus 4.7:仅单次调用:16,共同:12,仅双智能体:8,J=.333 图1:在相似通过量单次调用截止点下,所有三次初次运行都通过的申请的成员构成。扫描所有不同的存储单次调用平均分截止点仍然无法重建双智能体持久集:GPT-5.5的最佳Jaccard指数为.436,Opus 4.7为.361(附录C (https://arxiv.org/html/2609.19530#A3))。我们未遍历两个组成分数的其他读数。因此,双智能体筛选并非存储的单次调用平均值排名上的另一个操作点。 ### 4.3 在初次运行选中的队列内,复现性存在差异 总体的新运行复现率相似:完整的双智能体持久集中的45/56(80.4%)和完整的单次调用集中的60/71(84.5%)再次通过了所有三次新运行。因此,结果不支持“双智能体筛选可复现性较差”的普遍说法。差异在于每个总数的构成方式(表3 (https://arxiv.org/html/2609.19530#S4.T3))。 表3:在初次运行选中的队列内,基于发起流程的新运行3/3复现情况。 (翻译至此结束)
相似文章
3个并行AI代理:自动化简历筛选(Python)
本教程介绍如何构建一个生产就绪的异步多代理AI流水线,使用Python实现自动化简历筛选,三个并行代理分别为:职位描述分析器、简历缺口分析器和项目匹配器,输出结果综合为结构化JSON推荐。
招聘已成为两个AI相互欺骗:一个写简历,另一个筛选简历
文章讨论了AI生成的求职申请如何使传统简历筛选失效,并推荐使用像Synmatch AI这样的AI驱动平台,基于实际能力而非关键词匹配来评估候选人。
interviewstreet/hiring-agent
Hiring Agent 是一个开源工具,可解析简历,丰富 GitHub 数据,并使用本地或云端 LLM 生成公平的评估。
一半人用AI写简历,另一半人用AI筛简历,我觉得已经没人真的在看人了
对求职者和雇主双方都用AI处理简历和筛选这一趋势的评论,质疑简历作为信号的价值,并探讨替代的招聘方法。
AgentR 3.0
AgentR 3.0 是一款针对AI作弊时代挑战设计的招聘评估工具,在ProductHunt上发布。