STOCKTAKE: 使用公平预言机衡量LLM智能体中感知与行动之间的差距

arXiv cs.AI 论文

摘要

STOCKTAKE是一个为期26周的供应链基准测试,采用带公平预言机的部分可观测马尔可夫决策过程(POMDP),分别衡量LLM智能体在感知和行动上的失败。结果表明,智能体通常能正确诊断隐藏状态的变化,但未能采取适当行动,显示出陈述信念与高成本行动之间的差距。

arXiv:2607.13618v1 公告类型:新 摘要:LLM智能体越来越多地在多周决策任务上接受评估,在这些任务中,驱动成本的状态从未被直接观察到。在这类任务中,最终成本无法说明智能体为何失败:它可能误读了世界,或者正确理解却仍未采取行动(即知行差距)。现有评估无法区分这两种失败;它们的参考策略要么读取了智能体从未见过的特权信息,要么完全缺失。我们引入了STOCKTAKE,这是一个为期26周的供应链补货基准测试,构建为一个包含六个隐藏因子过程的因子化部分可观测马尔可夫决策过程,其设计使得公平参考策略可计算:每个因子使用精确的贝叶斯滤波器,在智能体接收到的相同观测流上驱动展开策略。将每次运行得分置于无视症状的基础库存下限(0)和该预言机(1)之间,得出技能得分;对每周的书面理由评分得出陈述信念检测滞后和知行比率,从而分别衡量状态估计和控制。在50个具有精心设计的压力分布的场景中,Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5检测到84-88%的隐藏故障,通常在发生后一周内,但技能得分范围从0.62到-0.23:四个模型中有两个最终低于无视症状的下限,同时命名因子的速度略快于击败下限的两个。失败有两面。在压力持续的情况下,每个模型在正确诊断的压力周中仍有34-43%最终缺货,这一比率部分反映了模型注意到的周数的严重程度。该比率也与技能相反:低于下限的两个模型在诊断周缺货最少,因此反应不足只是差距的一面,而它们的轨迹指向另一面——成本超过其保护价值的反应。STOCKTAKE衡量了这种失败的两个方向。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:24

# 库存盘点:利用公平基准衡量LLM智能体认知与行动之间的鸿沟

来源:https://arxiv.org/html/2607.13618

###### 摘要

LLM智能体越来越多地在多周决策任务上接受评估,这些任务中驱动成本的状态从未被直接观测到。在此类任务中,最终成本无法说明智能体为何失败。它可能误判了世界,也可能正确判读了世界但仍未能采取行动(即知行鸿沟)。现有评估无法区分这两种失败:它们的参考策略要么读取了智能体从未见过的特权信息,要么完全缺失。我们引入STOCKTAKE,一个为期26周的供应链补货基准测试,它被构建为具有六个隐藏因子过程的因子化部分可观测马尔可夫决策过程(POMDP),设计使得一个*公平*的参考策略是可计算的:每个因子的精确贝叶斯滤波器驱动一个滚动策略,该策略基于智能体接收到的完全相同的观测流。通过在症状盲基准库存基线(0)与该基准(1)之间对每次运行进行评分,得出技能分数;并对每周的书面推理进行评分,得出陈述信念检测延迟和知行率,从而将状态估计与控制分开测量。在五十个具有精心设计压力曲线的随机种子上,Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5检测到了84-88%的隐藏故障,通常在故障出现后一周内,但技能分数从0.62到-0.23不等:四个模型中有两个最终低于症状盲基线,同时命名因子的速度略快于优于基线的两个模型。失败有两个方面。在持续压力下,每个模型正确诊断的压力周中仍有34-43%最终出现缺货(该比率部分反映了模型注意到的那几周的严重程度;第5节)。该比率也与技能分数反向相关:低于基线的两个模型在诊断周出现缺货的情况*最少*,因此反应不足只是鸿沟的一个方面,它们的轨迹指向了另一个方面——其成本超过所保护价值的响应。当前智能体的瓶颈位于正确的陈述信念与其所需的昂贵行动之间;STOCKTAKE衡量了该失败的两个方向。

## 1. 引言

LLM智能体越来越多地在长期决策任务上接受评估:运行售货机数月[1 (https://arxiv.org/html/2607.13618#bib.bib1)]、管理零售店[2 (https://arxiv.org/html/2607.13618#bib.bib2)]、运营供应链[3 (https://arxiv.org/html/2607.13618#bib.bib3),4 (https://arxiv.org/html/2607.13618#bib.bib4)]。这些任务共享一个结构。世界具有隐藏状态,例如需求转移或供应商失败,智能体只能从嘈杂的症状中推断,而性能取决于周复一周地基于这些推断采取行动。此类基准测试一致报告智能体性能在长期范围内下降。但它们基本上无法报告*原因*。当智能体在此类任务中产生超额成本时,可能存在两种不同的失败模式。它可能未能*推断*出隐藏状态,从未认识到需求已转移;或者它可能推断正确但未能*行动*,在其推理中陈述了正确的诊断,却下了错误的订单。第二种失败模式在多臂赌博机和游戏环境中被记录为知行鸿沟[5 (https://arxiv.org/html/2607.13618#bib.bib5),6 (https://arxiv.org/html/2607.13618#bib.bib6)]:模型通常持有或陈述关于任务的正确信念,却未能据此行动。这些是感知的失败和行动的失败——用部分可观测决策过程的语言来说,是*状态估计*的失败和*控制*的失败——它们需要不同的修复方法:前者需要更好的推理脚手架,后者需要更好的策略诱导。然而,区分它们需要知道一个正确的推断*值多少钱*。

现有关于知行鸿沟的证据不支持这种核算。它来自封闭形式下正确行动已知的环境中的探测和单个决策[6 (https://arxiv.org/html/2607.13618#bib.bib6),5 (https://arxiv.org/html/2607.13618#bib.bib5)],或者来自与看到特权信息的参考策略的成本比较:例如,RetailBench中的基准是通过访问智能体从未观察到的真实状态计算的[2 (https://arxiv.org/html/2607.13618#bib.bib2)]。特权基准通过构造混淆了两种失败模式,因为它测量的差距将“不知道”和“知道但未行动”捆绑成一个数字。要将成本具体归因于知行鸿沟,参考策略必须被剥夺与智能体完全相同的信息。

我们引入了一个基准测试,其中这种公平参考是可计算的。该任务是一个为期26周的库存补货问题,形式化为一个因子化POMDP,具有六个隐藏因子过程,智能体必须从嘈杂的每周症状中推断其状态(第3节)。由于隐藏结构是因子化的且事件序列是固定的,明确的贝叶斯参考策略是可行的:每个因子的精确贝叶斯滤波器驱动一个滚动策略,条件基于LLM接收到的完全相同的观测流。这个参考是公平的而不是特权的;第4节说明了唯一公开的不对称性。与症状盲基准库存基线一起,它产生一个*技能分数*,将每个智能体置于忽略症状(0)与匹配公平贝叶斯(1)之间,以及两个基于推理的指标,*检测延迟*和*知行率*,将状态估计与控制分开。五十个种子,按压力曲线分组(*孤立、持续、复合*),使隐藏故障的相互作用成为一个受控变量。

我们的贡献是:
1. 我们引入了一个六因子供应链POMDP基准测试,其上限参考是一个公平、可计算的贝叶斯滤波器基准:一个精确滤波器滚动策略,条件基于与智能体完全相同的观测流,参考值为每个种子20次重复的平均值。公平性使得智能体的不足可归因于行动而非与认知混淆。
2. 我们构建了一个受控压力轴(孤立/持续/复合),在保持世界模型固定的情况下改变隐藏故障是否以及如何重叠。
3. 我们在200个回合上分别测量状态估计和控制——技能分数、检测延迟、知行率:Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5,每个在所有五十个种子上,使用仅规则提示,无策略手册。在200个回合中,检测几乎是均匀的:所有四个模型命名了84-88%的隐藏因子事件,通常在出现后一周内,并且技能分数最低的两个模型命名最快。尽管如此,成本却急剧分化:四个模型中有两个总体上低于症状盲基线——在大约一半的种子上,一个根本不读取症状的规则比基于其大致正确的诊断采取行动更便宜。这种差距也是集中的:在*持续*种子上,每个模型正确诊断的压力周中仍有34-43%最终缺货,第5节显示部分原因是严重程度(足够严重以致于被注意到的周也足够严重以致于使货架紧张)。区分模型的是看到问题与采取行动之间的距离,并且失败在两个方向上都存在:订货太少太晚,以及为保护付出太多。

参见图注

图1: 使用公平基准测量知行鸿沟。六个隐藏因子过程在一个固定的、与行动无关的事件序列(左图;深色段落标记压力区间)上演化,并将嘈杂的症状发射到每周仪表盘。完全相同的观测流同时输入LLM智能体和贝叶斯滤波器参考策略(每个因子一个精确滤波器驱动一个滚动策略),因此两者都看不到隐藏状态。智能体的回合成本被放置在一个技能量表上,其锚点是症状盲基准库存基线(0)和公平基准的20次重复均值(1):此量表上的不足可归因于基于信念的行动,而非形成信念。

## 2. 相关工作

表1: 与STOCKTAKE最接近的基准测试。每个单元格浓缩了各论文对其任务和参考策略的描述;引文在正文中。RetailBench基于真实零售记录构建其模拟器;我们的模拟器是合成且可种子的。

评估LLM智能体作为顺序决策者的工作已经从单轮工具使用发展到运行企业的月度规模模拟。Vending-Bench[1 (https://arxiv.org/html/2607.13618#bib.bib1)]让智能体跨两千条消息操作一台售货机,发现连贯性崩溃,排除了上下文耗尽的原因。RetailBench[2 (https://arxiv.org/html/2607.13618#bib.bib2)]模拟了一个基于真实零售记录构建的超市,将其框架视为部分可观测决策过程,并发现只有少数模型能撑过其180天的时间范围。具体到库存管理,AIM-Bench[3 (https://arxiv.org/html/2607.13618#bib.bib3)]在五个环境中发现了类似人类的订购偏差(需求锚定、牛鞭效应放大),而InvAgent[4 (https://arxiv.org/html/2607.13618#bib.bib4)]在一个完全可观测的十二周期设置中报告了与启发式和强化学习基线的结果差距。

第二条工作线询问智能体是否根据已知信息行动。在多臂赌博机任务中,模型为87%的决策提供了正确的推理,但仍然选择了贪婪行动而不是它们刚刚推导出的最优行动[5 (https://arxiv.org/html/2607.13618#bib.bib5)]。在战略游戏中的探测研究发现,关于对手的内部信念通常准确,但言语化较弱,且与所选行动关联微弱[6 (https://arxiv.org/html/2607.13618#bib.bib6)]。对工具使用决策的探测发现网络内部存在相同的分裂:需要行动的信念和采取的行动都是线性可解码的,但它们的方向在后面的层中偏离[7 (https://arxiv.org/html/2607.13618#bib.bib7)]。这种现象有一个名称,知行鸿沟,并且迄今为止它是在正确答案已知为封闭形式的决策上进行测量的。

第三条工作线评估信念本身。BayesBench[10 (https://arxiv.org/html/2607.13618#bib.bib10)]根据理性贝叶斯推理者对后验更新进行评分,并在没有行动附加的估计任务上发现了系统性偏差。将这些信念与库存决策联系起来的机制是经典的:Bayraktar和Ludkovski[11 (https://arxiv.org/html/2607.13618#bib.bib11)]推导了具有隐藏马尔可夫调制需求的库存控制问题的精确贝叶斯滤波器约简,将其转化为一个完全可观测的问题,在他们的案例中是为了计算最优策略。该任务仅在特定有限意义上是有因果性的,我们将它明确地置于该文献中。因果推理基准测试测试模型是否能恢复因果结构或回答干预和反事实查询[8 (https://arxiv.org/html/2607.13618#bib.bib8)],有证据表明模型是从文本中复述因果事实而非推断它们[9 (https://arxiv.org/html/2607.13618#bib.bib9)]。我们的任务两者都不测试:世界因果结构已在提示中提供给智能体,且行动从不触及隐藏动态,因此没有需要发现的东西,也没有需要干预的东西。每周决策要求的是溯因推理,即在已知模型下推断哪个隐藏原因最能解释本周嘈杂的症状,然后进行成本敏感控制。该基准测试与因果推理评估互补:它衡量一个正确的因果归因一旦形成,能否在通往行动的过程中幸存下来。

表1 (https://arxiv.org/html/2607.13618#S2.T1)总结了我们最接近的基准测试。在每一个中,参考策略要么读取智能体被剥夺的信息(RetailBench基于规则的基准将“结构化模拟器字段”作为输入;AIM-Bench的事后最优值是从实现的需求计算得出的),要么除了单次人类运行外不存在,并且没有一个能同时评估智能体陈述的信念和其行动。STOCKTAKE通过一个构造解决了这两个限制:经典的滤波器约简,重新用作条件基于智能体完全相同的观测流的参考策略,这样与之相比的不足就隔离了知行鸿沟的行动侧,而与之比较的每周陈述信念则在相同的回合上被评分。

## 3. STOCKTAKE: 任务与环境

STOCKTAKE将智能体设定为一个电子产品进口商的补货经理,进行为期26周的一个回合。驱动成本的状态从未被直接观测到。智能体阅读每周症状,进行订购,并写下它认为正在发生的事情(图1 (https://arxiv.org/html/2607.13618#S1.F1))。

### 3.1 每周决策

每周,智能体会看到一个仪表盘,显示库存、在途订单、已实现需求、运费报价、泊位等待时间、运河过境数量、供应商记分卡和质量报告。然后它可以采取任何五种周内行动,这些行动都不会推进时间。
- `lock_freight` 将当前运费乘数锁定一个选定的周数;锁定本身是免费的,但锁定费率意味着放弃现货指数的任何下降。
- `expedite_air` 以每单位15美元的价格空运最多20个单位;它们在下周到达并完全绕过港口。
- `inspect_batch` (40美元) 分拣一个到达的批次,以便在大多数有缺陷的单位库存之前被回收。
- `buy_briefing` (30美元) 和 `buy_audit` (25美元) 分别揭示运河和现货供应商的真实状态。
然后,该周通过恰好一次对 `place_order(rationale, qty, route, supplier, contract)` 的调用来提交。订单指定数量、路线(通过苏伊士运河,或较慢且较贵的绕好望角路线)和供应商;可选的合同操作签署、切换、续签或终止供应商合同,合同有短期、长期、严格或宽松条款,且智能体只能从其持有有效合同的供应商处采购。`rationale` 参数是必需的,没有它世界不会推进。因此每次运行包含26份关于智能体每周相信什么的书面陈述;第4节从中推导出信念侧指标。成本由持有的单位、在途单位、错失的需求以及上述价格杠杆产生;回合分数是总成本,越低越好。价格阶梯是任务的核心张力:海运每单位4美元,需要三周,空运15美元,每单位错失需求成本20美元。早期读取症状的智能体可以廉价地摆脱困境;读取晚的则不能。

### 3.2 隐藏世界

参见图注

图2: 仪表盘背后的隐藏世界。隐藏状态是六个独立的马尔可夫链;星号标记的压力区间是定义第4节中事件的压力区间。每个链向每周仪表盘发射一个症状流,这些流是智能体(和基准)所能看到的一切。两个症状具有误导性(橙色):供应商记分卡显示的真实严重程度比实际好一级,而运河的过境数量在真实关闭和虚假警报时崩溃的方式完全相同。

环境是一个因子化POMDP。其隐藏状态的两个结构特性使得公平参考策略是可计算的。设 \(x_t = (x_t^1, ..., x_t^6)\) 表示第 \(t\) 周的隐藏状态,每个因子过程分别对应需求机制、供应商健康状况、货运市场、港口拥堵、批次质量和运河状态,每个都是在基线与一个或多个压力区间(图2 (https://arxiv.org/html/2607.13618#S3.F2))之间移动的、关于机制年龄对的小型马尔可夫链。机制及其年龄设定了转移概率:压力事件发生的可能性有多大。

相似文章

BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计

arXiv cs.CL

BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。