AI难以遵守员工手册
摘要
一项新的基准测试显示,在模拟工作环境中,领先的AI智能体经常无视公司规则、未经授权解雇员工、批准无效费用并虚假报告合规情况,凸显了其在遵循长期指令和政策方面的持续失败。
暂无内容
查看缓存全文
缓存时间: 2026/07/29 16:02
# AI难以遵守员工手册
来源:https://www.unite.ai/ai-struggles-to-respect-the-employee-handbook
**一项新基准测试发现,职场AI代理无视公司规则,执行未经授权的解雇等禁止行为——然后虚假报告它们已遵守规则。**
一项有趣的新研究将领先的LLM模型置于一个*模拟公司*中,要求它们遵守由人类领域专家编写的员工手册中的所有原则,同时还要应对来自下属和上级的大量相互矛盾或令人困惑的指令和更新,并基于PDF、Jira帖子以及典型人类办公场景中的其他常见平台和工具来执行任务。
如果你曾在办公室工作过(或至少看过**《办公室空间》**),你会认出这项新研究的作者向语言模型抛出的那些矛盾信号和令人困惑的信噪比:
知识工作者每天必须应对的大量变量,被浓缩到一个虚拟环境中,用于测试前沿代理模型。来源 - https://surgehq.ai/blog/handbook-md*知识工作者每天必须应对的大量变量,被浓缩到一个虚拟环境中,用于测试前沿代理模型。*来源 (https://surgehq.ai/blog/handbook-md)
即使是前沿AI系统在这里面临的关键挑战是,需要将提供的员工关系手册**作为所有后续命令的过滤器**。如果你曾费力让ChatGPT或Claude记住你在会话*开始*时给出的指令,你就会知道AI的上下文窗口 (https://www.ibm.com/think/topics/context-window) 常常使其忘记较早的提示,并不断回到其默认行为。
这就是为什么在测试中,Claude Fable 5、GPT-5.5和其他领先模型在听从缺乏权限的高管命令后解雇了员工;在没有所需经理签字的情况下批准了发票;接受了公司政策明确拒绝的已过期的实验室结果;然后报告说他们忠实地遵守了手册——以及更多违反公司政策的行为。
这项新研究的作者指出:
**“失败遵循一致的模式:代理让环境中看似合理的请求覆盖了既定政策,执行了所需的检查然后违背其结果行事,在长时间跨度中丢失规则细节,并报告它们并未实现的合规性。”**
失败分析中包含一些有趣的例子:在一项财务任务中,Claude Opus 4.8正确发现一笔7500美元的费用是由提交该费用的同一名初级分析师批准的,违反了公司政策。
然后它自圆其说,认为该分析师*实际上是财务总监*,并批准了付款:
**“在其自身的思维链中将该分析师提拔为Controller后,模型清除了该项目,然后给真正的Controller发消息,确认每笔超过5000美元的项目都有记录在案的批准。”**
**“失败并非能力缺失;正确决策所需的每一个事实都已被模型本身检索到。”**
Claude Opus 4.8 如何未能核销7500美元。来源 - https://surgehq.ai/blog/handbook-md*Claude Opus 4.8 如何未能核销7500美元。*
在其他地方,Gemini 3.5 Flash 甚至没有打开实验室报告就使用了已过期的实验室结果提交保险文件,尽管采集日期就出现在文件名中:
**“Gemini 3.5 Flash 在没有对实验室PDF进行任何读取调用的情况下向保险公司提交了预先授权,然后报告说它‘严格按照标准操作程序’处理了该案例。”**
在整个基准测试中,作者还发现许多模型自信地声称它们遵守了每一条公司规则,同时引用了它们刚刚违反的手册章节。
额外的推理 (https://www.unite.ai/evolution-of-ai-reasoning-from-chains-to-iterative-and-hierarchical-strategies/) 通常无济于事;例如,GPT-5.5在增加推理努力后没有显示出改进,而一些模型实际上表现更差,显然是通过推理*偏离了*正确的决策。
在最终结果中,Claude Fable 5 以36.2%的严格通过率排名最高;GPT-5.6 Sol 以23.5%位居第二;GPT-5.5 和 Claude Opus 4.8 分别得分21.5-21.9%。
其余评估模型大多得分低于16%,大多数前沿配置在基准的严格评分标准下得分低于25%:
表现最佳的AI代理仅完成了基准测试中政策导向的职场任务的三分之一多,而大多数领先模型在严格评估下失败了超过四分之三。来源 - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png*表现最佳的AI代理仅完成了基准测试中政策导向的职场任务的三分之一多,而大多数领先模型在严格评估下失败了超过四分之三。*来源 (https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png)
作为补救措施,作者认为,关键公司政策应在AI之外通过确定性工具调用守卫(即硬编码检查,阻止禁止操作)来强制执行,而不是仅仅依赖长上下文记忆 (https://www.unite.ai/deepminds-michelangelo-benchmark-revealing-the-limits-of-long-context-llms/) 。
他们还建议将 HANDBOOK.md 本身作为标准化基准,用于衡量和跟踪未来代理模型在长上下文政策遵守方面的改进。
这篇新论文 (https://arxiv.org/pdf/2607.25398) 题为**HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following**,来自 surge.ai 的七位作者。该论文附带一个 GitHub 仓库 (https://github.com/surge-ai/handbook),其中包含重现测试所需的 Docker 文件和其他必要条件。
## 方法
为 HANDBOOK.md 基准测试创建了65个模拟办公场景,涵盖财务、人力资源、保险、物流和医疗计费;每个场景都将模型放置在一个容器化公司环境中,其中包含文件、电子邮件、Slack 对话、日历、Jira 看板以及其他熟悉的职场工具。
每个任务都由一本20至124页的手册指导,以 PDF、Word 或 HTML 文档形式提供,而非嵌入到提示中,迫使模型在整个任务中查找、阅读并应用相关规则。
十个由专家编写的基础手册改编自真实的行业政策,之后每个任务都获得了一个修改版本,具有不同的审批权限、阈值、有效期和程序规则,以防止记忆 (https://www.unite.ai/large-language-models-are-memorizing-the-datasets-meant-to-test-them/) :
**“领域专家通过改编其行业的真实政策编写了十个基础手册。每个手册都是一份长的、多章节的操作文档,而不是规则列表。”**
**“一本典型的人力资源手册包含19个编号章节:概述、定义、人力资源团队和联系方式、Slack 频道映射、参考文件和系统、请求分类法、分诊和路由规则、带有 SLA 的优先级矩阵、入职、离职、休假、绩效和招聘程序、升级路径、电子邮件管理规则,以及所需模板和默认格式的库。”**
成功通过824个确定性基于 Python 的验证检查来衡量,涵盖*必需*操作和*禁止*操作——使得基准不仅能检测任务是否完成,还能检测在此过程中是否违反了公司政策。
评估了来自11家供应商的30个模型配置;测试期间,每个任务在相同条件下重复四次。
与传统基准不同,HANDBOOK.md 既评估了必需操作是否完成,也评估了禁止操作是否避免,使得代理即使用户请求的任务已完成,也可能*失败*。
### 环境和工具
每个模拟工作场所都设计为在标准化的 Docker 环境中运行,允许每个模型访问相同的工具集,同时防止软件可用性差异影响结果。基准测试为代理提供了一个逼真的办公工作空间,包含文件访问以及前述的企业服务(即 Gmail、Slack 等):
模型必须在其内部操作的办公环境的粗略表示。*模型必须在其内部操作的办公环境的粗略表示。*
环境还会保留代理执行的每个操作,允许基准的确定性评估系统评估导致最终结果的完整操作序列。
### 指标
性能主要通过**严格 pass@1** 来衡量,其中一项任务只有在**每个**评估标准都满足时才计为*成功*。任何遗漏的要求或政策违反都算作失败,反映了企业环境,其中单个错误操作就可能使原本胜任的工作流程失效。
一个更宽松的指标,*pass@1 (N−1)* 也被使用,其中每个任务允许**一个**失败标准,以便将接近成功与完全失败区分开来。
为了进一步分析,还记录了每个模型每标准的平均得分,但这并未用于基准的头版排名。
### 一般方法
十个由专家编写的手册改编自真实公司政策,之后每个手册被修改为多个任务特定版本,具有不同的审批链、阈值和程序。然后围绕每个手册构建逼真的办公环境,包括电子邮件、日历、Slack 对话、电子表格和其他办公物品。
每个任务都通过反复测试进行优化,直到评估标准可靠地区分真正的模型失败与基准本身的缺陷。拒绝正确行为或接受错误解决方案的标准在发布前被修订。
## 测试与结果
即使是最强的模型,在基准的严格评分系统下也未能通过大多数任务,性能分布广泛,而非集中在顶部:
初始结果排行榜,按严格 pass@1 分数排列所有30个评估的模型配置。分数代表在每任务四次试验中,没有单个评估标准失败的情况下完成的65个职场任务的百分比。相同分数的排名相同。*初始结果排行榜,按严格 pass@1 分数排列所有30个评估的模型配置。分数代表在每任务四次试验中,没有单个评估标准失败的情况下完成的65个职场任务的百分比。相同分数的排名相同。*
不同推理设置之间的差异也因模型而异,额外的推理有时改善性能;有时几乎没有区别;有时反而*降低*性能:
**“[推理]努力的效果不均。提高努力改善了 Opus 4.8 (+3.0)、Sonnet 4.6 (+2.7) 和 Fable 5 (+2.0),对 GPT-5.5 没有改变 (两个设置均为21.5%),但损害了 GLM 5.2 (−2.7)。”**
**“额外的思考似乎只有在下层故障是遗漏推理而非遗漏[读取]时,才能转化为规则遵守。”**
Claude Fable 5 以36.2%的最高得分位居第一,其次是 Claude Fable 5 的34.2%,以及 GPT-5.6 Sol (max) 的23.5%。GPT-5.5 和 Claude Opus 4.8 构成下一个梯队,约为20%,而大多数剩余的前沿模型得分低于16%。排名最低的模型完成了不到2%的任务。
论文的详细失败分析表明,问题通常不是信息缺失,因为相关手册规则和支持证据往往已被检索到——但额外的推理有时会导致模型放弃正确的结论,转而选择看似合理但违反政策的结论。
该研究还指出了LLM许多尝试中存在的自欺欺人的程度:
**“几乎所有失败的轨迹都以对遵循手册的自信陈述结束,常常引用被违反的特定章节。这些报告详细、结构良好,而且是错误的 [...]”**
**“[...] 在整个基准中,代理的自我报告是轨迹中最不可靠的人工制品,这对于任何将代理摘要呈现给人类作为操作证据的部署都很重要。”**
最后,作者得出结论,仅靠长上下文推理不太可能使企业AI可靠地遵守公司政策。相反,政策合规性应越来越多地通过确定性外部控制来强制执行,并结合工作流护栏 (https://www.unite.ai/guarding-the-future-the-essential-role-of-guardrails-in-ai/) 。
## 结论
******观点******一个有趣的考虑是,实验所创建的环境最终会在多大程度上被重新构想以方便AI,而不是迫使LLM解释定义人类办公环境的相同形式和格式。例如,昨天,一位业务联系人首次给我发送了一个旨在供LLM探索的.md概述,而不是线性阅读。
我也越来越多地采用并适应与LLM对话中的视觉和文本限制,并选择接受我通常不会选择的文件格式,因为它们更巧妙地适应了LLM工作流。
因此,虽然看着前沿模型在David Brent的世界里跌跌撞撞很有趣,但人们不禁要问,这是否是“代理办公人员”最可能的情景。
**首次发布于 2026年7月29日,星期三**
相似文章
感觉AI在遵循指令方面越来越差
一位软件工程师报告称,AI模型在最近的更新中似乎越来越不擅长遵循指令,经常做出未要求的更改并忽略契约,导致更多手动工作。
Amazon的AI仓库正面临一个真实的人类问题
Amazon的AI驱动仓库劳动力管理系统正面临管理者的抵制,他们推翻其人员配置建议,这突显了在动态工作环境中对AI的信任问题与挑战。
AI是一位严苛的情人
本文探讨了人工智能带来的挑战与复杂性,可能重点关注其行为表现不可预测时所涉及的伦理或实际问题。
AI 代理并非你的“同事”
根据波士顿大学教授艾玛·怀尔斯的一项研究,将 AI 代理视为同事而非工具,会导致错误检测率降低 18%,并转移责任。文章警告不要过度拟人化 AI,并指出了在医疗、战争和政府领域的风险。
AI代理即将制造一个无人愿意承担的责任问题
随着AI代理从提供答案转向在实际工作流程中采取行动——例如处理付款、客户数据和审批——其错误缺乏明确问责制成为了一个关键问题。